音频参考玩法:定制音色、旋律与氛围声的三种挂法
Seedance 2.0 原生生成音画同步的视频,而音频参考让你进一步控制"声音长什么样"。可用的声源有两类:独立的音频文件(最多 3 段 MP3)和参考视频自带的音轨。
声源一:音频文件
官方提示词指南给音频参考定义了三种可继承的核心信息:音色、音乐旋律、对话内容。
常用写法:
- 当背景音乐:"全程使用音频1作为背景音乐。"
- 提取音色:"从音频1提取音色,应用到画面中的旁白。"
- 定节奏氛围:"用一段音频表达预期的节奏和氛围,配乐卡点与动作对齐。"
第三种来自官方对多模态输入的价值描述:用户可以用几秒音频带起节奏,"提示词不再局限于文字"。
声源二:视频的音轨
没有现成音频文件时,视频素材里的声音可以直接借用:
"全程使用视频1中的环境音""参考视频1的背景音乐与节奏"
这是官方使用指南明确支持的特殊用法——一段参考视频可以同时出画面参考和声音参考,省一个音频名额。
音频参考与原生音效的分工
- 原生音效:模型按画面自动生成音效、环境声与配乐,双声道立体声,音画时序严格对齐——大多数场景开箱即用。
- 音频参考:当你要"这段广告必须用指定 BGM""旁白必须是这个人的声线"时才上。
- 两者可以共存:BGM 用参考音频,环境音效交给模型自动生成。
实操要点
- 音频总时长上限 15 秒,与视频共享"总长不超 15 秒"的约束。
- 需要人声解说时,可以直接在提示词里写台词与音色要求(深沉平静的男声等),不一定需要音频参考,见台词字幕。
- 中文方言、戏曲与演唱场景的指令响应是 2.0 明显强化的方向,值得一试。
下一步
音频能力描述整理自官方发布博客、火山引擎提示词指南与即梦官方使用指南,以官方最新版为准。