Seedance 2.0 文字生成能力
定义
Seedance 2.0 文字生成能力是 Seedance 2.0 提示词指南 在“亮点技法”中给出的一组画面内文字生成方法,用于让 Seedance 2.0 在视频中直接生成可读文字。
这不是单一生成模式专属能力,而是明确适用于 T2V、I2V、R2V、V2V 等场景。也就是说,无论是纯文本生成视频,还是基于图像、参考素材或已有视频进行生成与改写,只要任务需要在画面中加入文字,都可使用同一类提示方法。
其覆盖的典型文字形态至少包括三类:
- Slogan:偏宣传语、标题字、片尾字、品牌露出字。
- 字幕:通常用于画外音或角色对白的同步文字。
- 气泡台词:让角色说话时,在角色周边出现带文字的对话气泡。
在本文档中的语境
在 Seedance 2.0 提示词指南 摘要 的整体框架中,文字生成属于“Seedance2.0亮点技法”的一部分,和图片参考、音频参考、视频参考、视频编辑并列。
. 相比 Seedance 2.0 提示词结构 中“主体+运动+环境+运镜/切镜+美学+音频”的基础公式,文字生成能力是在已有视频语义基础上,继续控制画面中文字层的内容与表现形式。换言之,主体、动作、场景、镜头决定“视频本身是什么”,而文字生成决定“视频里出现什么字、以什么方式出现”。
可控维度
文档明确指出,模型一方面能够根据情境自动匹配合适的文字风格与颜色,另一方面也支持在提示词中手动指定多个维度。可控维度包括:
- 文字内容:写什么字。
- 颜色:例如白色、金色、手写风格常配白字等。
- 风格:如美观高级、手写风格等。
- 出现方式:如直接出现、渐显、伴随角色说话时出现、作为气泡出现等。
- 出现时机:何时进入画面,例如片尾、某句台词说到时、某个镜头结束后。
- 出现位置:如画面中部、画面底部、角色周边、右下角等。
这些维度可以一起写进提示词,而不必只写文字内容本身。
核心机制
自动匹配与手动约束并存
该能力的一个核心特点是:模型能根据情境自动匹配合适的文字风格与颜色。
这意味着,当提示词已经描述了画面主题、氛围和用途时,即使没有精确写明字体样式,模型也会尝试生成与场景协调的文字表现。例如宣传类画面可能更偏高级标题字,轻松对话类画面则可能更贴近日常字幕或气泡表现。
但文档同时强调,如果对文字表现效果要求较为严格,不能只依赖自动匹配。此时应结合多图参考思路,对 logo 或特定样式进行更强约束。也就是说:
- 一般需求:可让模型按情境自动决定风格与颜色。
- 严格需求:应通过多图参考进一步控制 logo、样式或外观一致性。
这与 Seedance 2.0 多模态参考控制 的思路一致:先明确参考对象,再要求模型迁移对应特征。对于文字来说,严格控制通常不是只写“要一个 logo”,而是要给出参考并清楚指代。
稳定性边界:优先常用字
文档对文字可读性提出了明确边界:编写时应优先使用常用字,避免生僻字与特殊符号,以确保最佳呈现效果。
这不是风格建议,而是稳定性要求。换言之:
- 常用字更利于稳定生成和可读呈现。
- 生僻字可能降低生成稳定性。
- 特殊符号同样可能影响最终显示效果。
因此,若追求稳定出字,应尽量避免把复杂字符集、罕见字符或过多特殊符号作为核心要求。
三种典型形式
Slogan
Slogan 是最典型的宣传型文字生成形式,适用于片头字、片尾字、品牌口号、产品宣传语等。
文档给出的通用公式为:
- 「文字内容」+「出现时机」+「出现位置」+「出现方式」+「文字特征(颜色、风格)」
这一公式对应了文字生成中最关键的五类信息:写什么、什么时候出现、出现在哪、怎么出现、长什么样。
其中,“文字特征”明确包括颜色与风格;而“出现方式”则可与镜头变化、虚化、渐变等视觉过程结合。
文档还特别说明:Seedance 2.0 能根据情境匹配合适的风格外观;如果对文字表现效果要求严格,可进一步结合多图参考做 logo 参考或样式控制。
示例体现出的写法要点包括:
- 先描述整体画面,例如手绘漫画风格、人物状态、情绪氛围。
- 再交代文字出现的阶段,例如“后画面逐渐模糊”之后。
- 明确文字位置,例如“画面中部文字”。
- 写出具体文字内容,例如“快乐尽在Seedance”。
- 补充文字审美要求,例如“文字美观高级”。
这说明 Slogan 不是孤立的一行字,而是与叙事节奏和构图位置绑定的视觉元素。
字幕
字幕是与音频强关联的文字形式,主要用于画外音和角色对话。
文档给出的核心要求有两点:
- 通常出现在画面底部。
- 字幕需与音频节奏完全同步。
这里的“完全同步”非常关键,意味着字幕不是静态贴字,而是要按照台词实际发生的时间与节奏逐句、逐段地对应出现。
字幕可用于两类常见场景:
- 旁白或画外音:例如一个男声旁白讲述宇宙、黎明、生命等内容,画面底部要按照台词出现字幕。
- 角色对话:例如两人在办公室聊天,女性先说、男性再回应,底部出现对应台词字幕。
从示例可以看出,字幕提示词通常要同时交代:
- 谁在说话,或是否为画外音。
- 具体台词内容。
- 场景变化或镜头内容。
- 字幕出现在画面底部。
- 字幕与音频节奏完全同步。
因此,字幕能力本质上是视觉文字与音频时间轴的对齐控制。若只写“加字幕”而不说明台词、说话人和同步要求,通常不如完整描述稳定。
气泡台词
气泡台词是更具角色感和漫画感的表达方式。其基本技法是:
- 「角色」说:“......”,角色话说时周围出现气泡,气泡里写着台词。
与底部字幕不同,气泡台词的文字承载位置不在统一底栏,而是在说话角色周边,以气泡形式呈现。
文档中的示例体现了几个关键点:
- 可以用于多人轮流对话。
- 可以配合切镜,例如先女孩说话,再切到男孩近景回答,再切回女孩。
- 气泡内容通常就是对应角色正在说的台词。
- 气泡出现时机应与角色说话动作同步。
例如,在操场跑步的男女对话示例中,女孩说“We can definitely do it!”,男孩回答“Are you sure?”,女孩再说“Yes!”;要求是说话角色周边出现气泡,气泡里面是对应台词。
另一例中,女孩在草莓园摘果并吃了一口后说“This is the real deal!”,同样要求女孩周围出现气泡,气泡里面写着该台词。
这说明气泡台词特别适合:
- 明确说话主体的场景。
- 需要更强视觉叙事或漫画感的场景。