塔斯娱乐资讯网

DMXAPI的Wan 3.0 Video 把台词、BGM、音效都放进了生成环节

Wan 3.0 Video 双模型上架 DMXAPI:最长 30 秒有声视频、最多 20 个参考素材做一条 30 秒的产
Wan 3.0 Video 双模型上架 DMXAPI:最长 30 秒有声视频、最多 20 个参考素材做一条 30 秒的产品短视频,过去往往要拆成三步:先生成画面,再录台词配 BGM,最后进剪辑软件合成。中间任何一环不满意,都得回头返工。
现在这个流程可以压缩到一次生成里。Wan 3.0 Video 的两个模型——wan3.0-video 与 wan3.0-video-prime——已上架 DMXAPI,画面与声音在生成阶段直接一并产出。
核心能力与规格
这次上线的模型走的是 All-in-One 路线:文生视频、图生视频、参考生视频,三种生成方式在同一个模型内完成,不需要在多个工具之间切换。
参考生视频支持最多 20 个素材输入。实际使用中,可以同时喂入角色图、产品图、场景图、风格图等多类素材,用于控制画面里的主体外观和整体一致性。20 个是上限,不是建议值,日常任务按需精简即可。

音频是这次的重点能力之一。台词、BGM、音效都属于原生生成,不用再单独走配音和混音环节。对带口播的短视频来说,这意味着省掉一道后期工序。
时长最长支持 30 秒,输出规格覆盖 480P 至 1080P。30 秒正好是一条信息流广告、一段口播或一个产品展示片段的常见时长,规格梯度也给不同用途留了选择空间。
两个版本怎么选
wan3.0-video 是标准版,wan3.0-video-prime 在保持能力一致的前提下提升了生成速度。
简单判断:如果是批量产出、需要快速迭代试错的场景,Prime 版的等待成本更低;如果是单条精修、时间不紧迫的任务,标准版同样能出相同规格的结果。两版的具体计费差异,以 DMXAPI 平台官方说明为准。
哪些团队和任务受益
短视频与自媒体团队:30 秒上限加原生配音,口播类、剧情类内容的生成到成片可以一气呵成,试错节奏快了很多。
电商运营:用产品实拍图做参考素材生成展示视频,再让模型生成解说台词,商品外观可控,省去拍摄和配音两个环节。
品牌与创意团队:多条视频共用同一组参考素材时,角色形象、品牌元素的一致性更容易保持,这对系列化内容比较关键。
动画与广告从业者:台词、音效随画面直接产出,小样阶段的验证周期明显缩短。
使用前注意几点
第一,素材数量与生成效果不是正相关。20 个素材是能力上限,素材越多,主体之间的协调难度越高,建议从 2-5 个核心素材开始验证。
第二,30 秒、1080P 属于上限规格,对应的资源消耗也会更高。测试阶段建议先用低分辨率短时长跑通流程,确认效果后再上高规格。
第三,原生有声生成的台词节奏、音画匹配度,建议先用小样验证,尤其是口型要求较高的口播类内容。
下一步建议
如果你已有明确的视频生产需求,可以从一个 10-15 秒、2-3 个参考素材的小任务开始,重点验证三件事:参考素材的一致性、台词与画面的匹配度、不同分辨率的实际输出质量。
采购侧可以做一个对比测试:同一任务分别提交标准版与 Prime 版,记录排队时长与出片速度,作为批量生产时的选型依据
做一条 30 秒的产品短视频,过去往往要拆成三步:先生成画面,再录台词配 BGM,最后进剪辑软件合成。中间任何一环不满意,都得回头返工。
现在这个流程可以压缩到一次生成里。Wan 3.0 Video 的两个模型——wan3.0-video 与 wan3.0-video-prime——已上架 DMXAPI,画面与声音在生成阶段直接一并产出。
核心能力与规格
这次上线的模型走的是 All-in-One 路线:文生视频、图生视频、参考生视频,三种生成方式在同一个模型内完成,不需要在多个工具之间切换。
参考生视频支持最多 20 个素材输入。实际使用中,可以同时喂入角色图、产品图、场景图、风格图等多类素材,用于控制画面里的主体外观和整体一致性。20 个是上限,不是建议值,日常任务按需精简即可。
音频是这次的重点能力之一。台词、BGM、音效都属于原生生成,不用再单独走配音和混音环节。对带口播的短视频来说,这意味着省掉一道后期工序。
时长最长支持 30 秒,输出规格覆盖 480P 至 1080P。30 秒正好是一条信息流广告、一段口播或一个产品展示片段的常见时长,规格梯度也给不同用途留了选择空间。
两个版本怎么选
wan3.0-video 是标准版,wan3.0-video-prime 在保持能力一致的前提下提升了生成速度。
简单判断:如果是批量产出、需要快速迭代试错的场景,Prime 版的等待成本更低;如果是单条精修、时间不紧迫的任务,标准版同样能出相同规格的结果。两版的具体计费差异,以 DMXAPI 平台官方说明为准。
哪些团队和任务受益
短视频与自媒体团队:30 秒上限加原生配音,口播类、剧情类内容的生成到成片可以一气呵成,试错节奏快了很多。
电商运营:用产品实拍图做参考素材生成展示视频,再让模型生成解说台词,商品外观可控,省去拍摄和配音两个环节。
品牌与创意团队:多条视频共用同一组参考素材时,角色形象、品牌元素的一致性更容易保持,这对系列化内容比较关键。
动画与广告从业者:台词、音效随画面直接产出,小样阶段的验证周期明显缩短。
使用前注意几点
第一,素材数量与生成效果不是正相关。20 个素材是能力上限,素材越多,主体之间的协调难度越高,建议从 2-5 个核心素材开始验证。
第二,30 秒、1080P 属于上限规格,对应的资源消耗也会更高。测试阶段建议先用低分辨率短时长跑通流程,确认效果后再上高规格。
第三,原生有声生成的台词节奏、音画匹配度,建议先用小样验证,尤其是口型要求较高的口播类内容。
下一步建议
如果你已有明确的视频生产需求,可以从一个 10-15 秒、2-3 个参考素材的小任务开始,重点验证三件事:参考素材的一致性、台词与画面的匹配度、不同分辨率的实际输出质量。
采购侧可以做一个对比测试:同一任务分别提交标准版与 Prime 版,记录排队时长与出片速度,作为批量生产时的选型依据
发布于 2026-09-04 16:01・陕西・包含 AI 辅助创作 作者对内容负责