SOURCE
Seedance 2.0 提示词指南 摘要
文档概览
- 本指南面向 Seedance 2.0 的视频生成、Seedance 2.0 多模态参考控制 与视频编辑提示词编写。
- 原文结构分为三部分:基础撰写技法、Seedance 2.0 亮点技法、数据与素材声明。
- 基础部分说明文本提示词的组成与多模态素材的引用方式;亮点技法依次覆盖文字生成、图片参考、音频参考、视频参考与视频编辑。
- 文档的核心目标不是只描述画面,而是把主体、动作、环境、镜头、音频,以及上传素材中的具体可迁移特征,写成可被模型明确定位的约束。
关键事实
- 基础文本公式为:
主体 + 运动 + 环境(非必须)+ 运镜/切镜(非必须)+ 美学描述(非必须)+ 音频(非必须)。 - “主体 + 运动”用于确定谁在做什么,是生成逻辑的基础;环境与美学定义空间、光影和整体格调;运镜与音频用于加强视听协同。详见 Seedance 2.0 提示词结构。
- 图片、音频和视频均按上传顺序编号。在提示词中应使用“图片1”“音频2”“视频3”等明确指代,而不要仅笼统地说“参考素材”。
- 指代后还应说明需要参考的元素,例如构图、人物形象、服装、动作、镜头语言、音色、音频内容或特效轨迹;模型会结合文本描述提取核心特征。
- 图像支持主体多视角图、场景图、分镜图等多图参考;可用于商品、角色、logo、多主体、多元素和按顺序出现的多宫格分镜。
- 音频支持音色参考和音频内容参考,但不支持仅上传音频;音频需与其他可用输入结合使用。
- 视频支持动作、运镜和特效参考;视频编辑支持元素增删改、向前或向后延长,以及多段视频轨道补齐。
文字生成
- Seedance 2.0 文字生成能力 适用于 T2V、I2V、R2V、V2V 等场景,不限于某一种输入模式。
- 模型可按情境自动匹配文字风格与颜色,也可手动指定文字颜色、风格、出现方式、出现时机和位置。
- 应优先使用常用字,避免生僻字与特殊符号,以获得更稳定的呈现效果。
- Slogan 常用公式为:
“文字内容” + 出现时机 + 出现位置 + 出现方式,文字特征(颜色、风格)。当品牌标识或文字外观要求严格时,可借助多图中的 logo 参考进一步约束。 - 字幕应明确写出位置、台词内容和同步要求。例如可要求“画面底部出现字幕,字幕需与音频节奏完全同步”。
- 气泡台词可写为:
角色说:“台词”,角色说话时周围出现气泡,气泡里写着台词;气泡应与当前说话角色及对应台词绑定。
图片、音频与视频参考
- 图片主体参考的常用句式为:
参考/提取/结合图片n中的主体,生成画面描述,保持主体特征一致。可将多张相机图的外观合并后展示正、侧、背面,也可分别参考杯身与质感。 - 多图参考可把不同图片分别指定为人物、服装、场景、另一角色或固定角标。例如可要求餐厅参考图片4、女孩形象参考图片1、服装参考图片2、顾客参考图片3,并让图片5中的标识始终位于右下角。
- 分镜参考必须说明构图顺序;原文示例要求图片中的各个分镜构图按顺序出现,随后再进入打斗。
- 音色参考常用句式为:
角色说:“台词”,音色参考音频n;对话可分别指定男女角色对应的音频编号。 - 音频内容参考可指定理想出现时机和音频编号,例如按音频1展开对话,或在延长视频时“镜头上摇,出现音频1”。
- 视频动作参考应说明“参考视频n的动作描述”,并要求动作细节一致;运镜参考和特效参考同样应分别写清要迁移的镜头运动或视觉特效。
视频编辑的重要细节
- 元素增加应同时说明目标视频、时间位置、空间位置和新增元素,例如“在视频n的某时间位置、某空间位置增加某元素”。
- 删除元素应明确被删除对象,并要求其他内容保持不变。
- 修改元素应明确将视频中的哪个对象替换为哪个对象;原文示例要求把香水替换为图片1中的面霜,同时保持动作和运镜不变。
- 视频延长可写为“向前/向后延长视频n + 延长内容描述”,也可写为“生成视频n之前/之后的内容 + 延长内容描述”。
- 延长时模型会自动截取衔接部分进行合成;输入视频的原有片段不会被完整重复生成。
- 轨道补齐可按“视频1 + 过渡画面描述 + 视频2 + 过渡画面描述 + 视频3”的顺序组织。
- 轨道补齐最多支持 3 段视频输入,且输入视频总时长不得超过 15 秒。
- 轨道补齐同样会自动截取衔接部分合成,因此不应期待所有输入原片段逐帧完整复现。详见 Seedance 2.0 视频编辑能力。
数据与素材声明
- 指南声明:其中呈现的全部视觉素材(图片、视频)和音频素材,均由 Seedance/Seedream 系列视觉生成模型自主生成。
- 该声明说明文内案例素材的生成来源,不等同于对用户上传素材来源或版权状态的说明。