Seedance 2.0 多模态参考控制
定义
Seedance 2.0 多模态参考控制 是 Seedance 2.0 提示词指南 中的一组通用方法,用来把外部参考素材与文本提示词结合起来,精确控制视频生成结果。它的适用对象不是单一模态,而是三类参考素材:图像、音频、视频。
其核心并不只是“可以上传素材”,而是两步:
- 明确指代:在提示词中直接点名具体参考对象,例如“画面参考图片1的构图”“音色参考音频2”“动作参考视频1”。
- 精准迁移:模型会从被点名的参考中提取核心特征,再与文本描述一起生成内容,从而在保留创作空间的同时,提高结果的确定性与还原度。
因此,多模态参考控制本质上是一种“编号引用 + 特征说明 + 文本约束”的写法。
在本文档中的语境
在 Seedance 2.0 提示词指南 的结构里,文本提示词仍然是主干,基础公式是“主体+运动+环境(非必须)+运镜/切镜(非必须)+美学描述(非必须)+音频(非必须)”。多模态参考控制则是附着在这个主干上的强化机制。
也就是说,参考素材不是替代文本,而是与文本配合:
- 文本负责说明最终想生成什么。
- 参考素材负责给出更稳定的标准态,例如主体长相、商品外观、logo、服装、场景、分镜构图、动作细节、运镜方式、特效轨迹或音色。
- 最佳效果来自两者结合,而不是只上传素材不写清目标。
核心机制
1. 明确指代
提示词必须能让模型知道“你在说哪一个参考”。文档给出的典型形式包括:
- 图片1、图片2……图片n
- 音频1、音频2……音频n
- 视频1、视频2……视频n
如果同类素材上传了多份,但提示词没有明确编号,控制精度就会下降。
2. 精准迁移
明确对象后,还要写清楚要迁移的是什么,不能只说“参考一下”。可迁移内容包括但不限于:
- 图片中的主体形象、商品外观、材质细节
- 图片中的服装、logo、场景、分镜构图
- 音频中的音色或音频内容本身
- 视频中的动作、运镜、特效
推荐句式通常是:
- 参考/提取/结合 + 参考对象 + 被提取元素 + 生成目标 + 保持一致的特征
- 例如:参考视频1的运镜,生成某个科技园区概念视频,保持第一视角俯冲方式一致。
3. 上传顺序与编号绑定
文档明确要求:如果对素材顺序有要求,应按顺序上传,再在提示词中使用对应编号。
这意味着:
- “图片1”“音频2”“视频1”不是抽象标签,而是和上传顺序直接对应。
- 一旦顺序错了,后续提示词里的指代也会跟着错位。
- 在需要多图、多音频、多视频协同时,先整理上传顺序,再写提示词,是提高稳定性的关键步骤。
图片参考
Seedance 2.0 多模态参考控制 中,图片参考既支持主体多视角锁定,也支持多图组合控制。
主体多视角参考
这种用法适合在不同角度、不同局部信息中锁定同一主体,使模型在新画面里保持主体一致。文档给出的通用写法是:
- 参考/提取/结合“图片n”中的“主体”,生成“画面描述”,保持“主体”特征一致。
适用对象包括商品和角色。
商品多视角
文档示例中,可以同时提取多张图里的同一商品,再生成新的展示镜头。例如:
- 提取图1、图2、图3的相机,把背景换成白色,相机放在白色桌子上,镜头以特写聚焦相机,再围绕相机缓慢旋转,清晰展示正面、侧面和背面。
- 在暖调居家场景中呈现参考图1中的保温杯,镜头平稳推近到近景,再由一只手自然入镜拿起杯子,跟拍手部轻微旋转,同时展示参考图2里杯身的细腻质感。
这里不仅锁定“是什么物体”,还可以拆分迁移不同图片提供的不同信息,例如整体外观来自一张图,材质细节来自另一张图。
角色多视角
角色也可通过多图保持统一形象。文档示例为:
- 参考图片1、图片2、图片3中的女子形象,生成她在一家咖啡店吃蛋糕的画面。
这说明多视角参考的目的,不只是简单复现某一张照片,而是在新场景中延续同一角色特征。
多图参考
多图参考比主体多视角更宽,可以把多张图片里的不同元素组合到一条提示词中。文档给出的通用写法是:
- 参考/提取/结合/按照/生成“图片n”中的“被参考元素描述”,生成“画面描述”,保持“被参考元素”特征一致。
文档明确列出的能力包括:
- logo参考
- 多主体参考
- 多元素参考
- 多宫格分镜图参考
- 分镜图参考
组合多个元素
多图参考可以把不同来源元素拼接到同一个生成目标里,例如:
- 参考图片2中的女孩,在霓虹闪烁的未来都市空中廊道中,先展示女孩放飞带有全息投影的银色悬浮灯,再镜头拉远展现满天悬浮灯,画面逐渐模糊后出现图片1的 logo,整体为 3D 赛博朋克科幻动画风格。
- 场景设定在图片4中的餐厅内,图片1里的女孩穿着图片2中的服装,图片3中的男孩作为顾客上前搭话,图片5中的标识始终显示在画面右下角。
这种写法可以同时控制角色、服装、场景和标识位置,体现的是“多元素精确装配”而不是单点参考。
多主体参考
文档还给出跨主体组合的例子:
- 参考图片中的猫猫和狗狗,在温馨公寓里,狗狗趴着吃狗粮,猫猫走近并碰它,随后依偎在它身边,整体暖色调。
这类提示词要求模型分别识别并迁移多个主体,再放入同一叙事动作中。
分镜构图参考
图片参考不只控制对象,还能控制画面结构和镜头顺序。文档示例包括:
- 参考图片1中的分镜图,生成激烈打斗场面,并让图片1中的各个分镜构图按顺序出现,之后二人激烈打斗。
- 参考图片3中的分镜构图,女孩形象参考图片1;再横摇切换到图片4的画面和构图,爸爸形象参考图片2;随后再切回女儿和父亲的面部特写,按指定台词推进。
这说明图片参考可以承担“静态 storyboard”作用,不只告诉模型“长什么样”,还告诉模型“镜头怎么排”。
音频参考
音频参考是 Seedance 2.0 多模态参考控制 的重要部分,但有明确边界。文档直接说明:
- 支持音频参考。
- 不支持仅上传音频。
- 必须结合视觉输入使用。
这意味着音频不能单独作为唯一输入源,至少要与图像或视频语境一起使用。
同时,如果对多个音频的顺序有要求,也应按顺序上传,并在提示词中使用“音频1”“音频2”进行准确指代。
音色参考
第一类音频参考是音色参考,即迁移说话声音的风格,而不一定照搬原音频内容。常见句式为:
- “角色”说:“台词”,音色参考“音频n”。
文档示例表明,这种方式既可用于旁白,也可用于角色对话: