Seedance 2.0 音频参考
定义
Seedance 2.0 音频参考 是 Seedance 2.0 的多模态参考能力之一:将上传的音频作为生成依据,并在提示词中说明要参考的音频和生成内容,以控制视频中的声音表现。它既可以参考某段音频的音色,也可以直接使用音频内容安排对话、台词或背景音乐。
该能力属于 Seedance 2.0 提示词指南 所述的多模态参考控制方式,应与文本描述共同使用;模型会结合参考对象的特征和文字指令生成结果。
在提示词指南中的语境
在 Seedance 2.0 提示词结构 中,音频是可选的进阶指令维度,可与主体、运动、环境、运镜或切镜、美学描述组合,用于实现画面与声音协同。音频参考则进一步把“声音”从一般氛围描述扩展为可被明确引用的输入素材。
与 Seedance 2.0 图片参考、视频参考一样,关键不只是上传素材,还要在提示词中清楚说明引用对象及其用途。对于音频,应写明生成的是哪位角色、哪句台词或哪段声音,以及该声音应在何时出现。
使用前提与编号规则
-
不能仅上传音频:音频参考不支持只提供音频输入,必须结合其他生成输入使用,例如图片中的人物或场景、视频素材及相应的文字指令。
-
按顺序上传:若存在多个音频且顺序有要求,应按预期顺序上传。
-
按编号明确指代:在提示词中使用“音频1”“音频2”至“音频n”引用相应素材,避免仅写“参考上传音频”而无法区分对象。
-
同时写清参考对象与生成内容:除了编号,还应说明该音频用于音色、台词、对话、口型或背景音乐,并描述角色、内容和出现时机。
音色参考
音色参考用于让生成的角色台词或画外音采用指定音频的声音特征,而不是直接要求复用该音频的全部内容。常用句式为:角色说:“台词”,音色参考音频n。
可用于画外音。例如,可先描述图片人物、镜头和场景转换,再指定“女声旁白采用音频1音色”,并写出旁白台词,使旁白的声音风格参考音频1。
也可用于角色对话。例如,描述图片中的两人聊天时,可分别指定女性的台词“音色参考音频1”、男性回应“音色参考音频2”。这样不仅要交代谁先说话和说什么,还要把每位角色对应到正确的音频编号。
音频内容参考
音频内容参考用于按指定时机接入某段音频本身的内容,可用于补全台词、安排对话或添加背景音乐(BGM)。其基本写法是:理想出现时机 + 音频n。
-
对话或台词补全:可以写明“图片1中的2人按照音频1展开对话”,并同时补充画面动作,例如说话时男人把手中的文件递给女人。音频内容负责对话和口型依据,文字负责人物关系、动作与画面。
-
添加背景音乐:可以在延长视频等生成任务中写明镜头动作和接入时机,例如“镜头上摇,出现音频1”。这使音频1在指定镜头段落作为声音内容出现。
-
口型驱动:音频内容可驱动角色口型。因此提示词不能只写“使用音频1”,还应明确哪位角色在何时说话、音频何时进入,以及需要生成的画面与动作;角色说话过程应与所引用音频内容对应。
编写要点
-
先提供不能独立成片的其他生成依据,如图片中的角色、场景描述或视频输入。
-
按需要的引用顺序上传音频,并在提示词中以“音频1”“音频2”等编号对应。
-
需要迁移声音特征时,写明角色、台词与“音色参考音频n”。
-
需要使用声音内容时,写明音频n出现的具体时机、用途,以及人物对话、动作、镜头或BGM安排。
-
需要口型驱动时,尤其要明确发声角色、说话时间和生成内容,避免音频与画面角色或时机不对应。
细节与边界
-
音色参考和音频内容参考用途不同:前者侧重声音特征,后者侧重接入音频中的实际台词、对话或音乐内容。
-
多段对话应分别绑定角色和音频编号;例如女性与男性分别参考不同音频时,应逐一注明,不能只在段末笼统写“参考音频”。
-
音频的出现时机是内容参考和口型驱动的必要控制信息;镜头、动作、人物状态等视觉内容仍需通过文字或其他多模态输入补充。
-
音频参考是 Seedance 2.0 多模态参考控制 的具体应用,依赖明确指代和文本约束,不能把上传素材本身视为完整指令。