Seedance 2.0 提示词结构
定义
Seedance 2.0 提示词结构,是 Seedance 2.0 提示词指南 在“文本指令的基础公式”中给出的基础写法,用来组织视频生成提示词中的主要信息层次。
该公式写作:
- 主体 + 运动 + 环境(非必须) + 运镜/切镜(非必须) + 美学描述(非必须) + 音频(非必须)
它不是要求每次都把所有字段写满的固定模板,而是一种可按目标灵活增删的自然语言结构。其成立前提是 Seedance 2.0 具备较强的自然语言逻辑遵循能力,能够“深度遵循自然语言逻辑”,并尽可能还原提示词中提供的具体信息。
在本文档中的语境
在原指南中,这一结构被放在“基础撰写技法”之下,作为编写文本指令的起点。文档先强调 Seedance 2.0 拥有较强的语义理解与多模态交互能力,然后给出这套基础公式,说明用户可以围绕若干信息维度来组织提示词,以提升生成结果的确定性与还原度。
这一结构不仅适用于纯文本描述,也构成了 Seedance 2.0 多模态参考指代控制 的文本骨架:当用户再叠加图片、音频、视频等参考素材时,仍然需要用清晰的自然语言说明“参考什么”以及“最终要生成什么”。
关键组成与作用分工
主体 + 运动:生成逻辑的基石
文档明确指出,“主体 + 运动”是生成的逻辑基石,用于明确“谁”正在进行“什么动作”。
也就是说,提示词最基本、最不能缺失的,通常是:
- 主体:画面中的核心对象是谁,例如人物、动物、商品、器物等。
- 运动:这个主体正在做什么,例如走路、说话、奔跑、拿起物品、转身、吃东西、对话等。
如果没有这两部分,模型就很难稳定判断画面主角与核心事件,生成目标也会变得模糊。正因如此,这一结构中虽然很多部分都标注为“非必须”,但“主体 + 运动”被单独点出为基础中的基础。
环境 + 美学:定义空间、光影与整体格调
文档将“环境 + 美学”作为另一组关键描述维度,用于定义画面的整体格调。
其中包括但不限于:
- 空间背景:主体处于什么场所或场景中,如咖啡店、草原、未来都市、山野、餐厅、办公室等。
- 光影细节:例如暖色调、夜晚过渡到黎明、浅景深、霓虹闪烁、光线氛围等。
- 视觉风格:例如手绘漫画风格、3D赛博朋克科幻动画风格,或“美观高级”这类整体审美要求。
这部分并不直接说明“谁在做什么”,而是补足“在哪里、以什么视觉状态发生”,因此主要影响空间感、氛围感、质感与风格一致性。
运镜 + 音频:进阶控制层
文档把“运镜 + 音频”明确归为进阶指令。
它们的作用分别是:
- 运镜/切镜:描述镜头如何调度,例如推近、拉远、横摇、固定镜头、切到近景、切回中近景、转场、定格等。
- 音频:描述声音层面的内容,例如对白、旁白、氛围声效、背景音乐、字幕与音频节奏同步等。
原文强调,加入这类进阶信息后,可以实现镜头调度或氛围声效控制,从而达到“视听高度协同”的沉浸式产出。换言之,如果只写主体和动作,模型能生成事件;如果进一步补充运镜和音频,就能更细致地控制观看体验。
结构的使用方式
这套结构的关键不是机械套公式,而是按照需求组合元素。
文档明确说,用户可以“根据需求灵活组合以下元素”。这意味着:
- 可以只写主体 + 运动,先把核心事件说清楚。
- 可以在此基础上追加环境,限定场景空间。
- 可以再加入美学描述,限定画面格调、光影与风格。
- 对镜头语言要求更高时,再补充运镜或切镜。
- 对声音、对白、旁白、背景音乐有要求时,再加入音频信息。
因此,这不是“六项都要写”的清单,而是“以主体和运动为中心,按目标复杂度逐步增加控制维度”的结构。
细节与边界
并非所有元素都必须出现
原公式中,环境、运镜/切镜、美学描述、音频都被明确标注为“非必须”。这说明该结构允许简写,不要求每次生成都提供完整的场景、镜头、美学和声音信息。
边界在于:可省略的是扩展控制项,不代表提示词可以没有清晰主干。文档单独强调“主体 + 运动”的基础地位,意味着即便精简,也应优先把主体与动作说清楚。
自然语言逻辑优先,而非固定标签语法
文档使用的是自然语言表达方式,而不是参数表或强制字段名。它强调的是 Seedance 2.0 对自然语言逻辑的深度遵循能力,因此用户可以用自然句子组织内容,只要逻辑清楚、指向明确即可。
这也是为什么该结构既能用于纯文本,也能无缝延伸到多模态提示:用户不必改用特殊语法,只需继续在自然语言中补充参考对象与控制要求。
可作为多模态参考的基础骨架
在同一文档中,“文本指令的基础公式”之后紧接着就是“多模态参考的指代控制”。这表明多模态不是对文本结构的替代,而是在其基础上进一步增强。
例如,当加入图片、音频、视频参考时,仍然需要围绕以下问题来表述:
- 主体是谁,参考的是哪一个对象。
- 动作是什么,动作是否需要对齐参考素材。
- 场景和风格是什么,哪些部分来自参考,哪些部分由文本新增。
- 是否需要指定镜头语言或音频协同。
因此,Seedance 2.0 提示词结构可以理解为所有提示编写方式的底层骨架,而多模态输入是建立在这套骨架上的增强控制层。
在实际编写中的理解方式
可把这套结构理解为从“事件”到“视听成片”的逐层扩写:
- 先用“主体 + 运动”定义事件核心,即谁在做什么。
- 再用“环境 + 美学”定义事件发生的空间条件与视觉格调。
- 最后用“运镜 + 音频”定义镜头如何展示、声音如何配合。
这样组织后,提示词通常会比只堆砌关键词更稳定,因为它符合模型更擅长理解的自然语言逻辑顺序。
相关条目
- Seedance 2.0 提示词指南:本结构的直接来源。
- Seedance 2.0 多模态参考指代控制:说明在图片、音频、视频参考场景下如何清晰指代参考对象。