W
AI-Wiki
ENTITY

Seedance 2.0

定义与身份

Seedance 2.0 是一款面向视频生成与视频编辑的模型。根据 Seedance 2.0 提示词指南 摘要,它被描述为具备较强的语义理解与多模态交互能力,不仅能依据自然语言生成视频,也能把图片、音频、视频作为参考输入,对主体、动作、环境、镜头、美学和音频等信息进行联合控制。

它的定位不只是“文本生成视频”模型,还覆盖了从纯文本生成到多模态参考生成、再到已有视频二次编辑的一整套能力链路。

角色职责

作为视频模型,Seedance 2.0 的主要职责包括:

  • 根据文本指令生成视频。
  • 在生成时深度参考图片、音频、视频素材。
  • 在 T2V、I2V、R2V、V2V 等场景中生成常用文字。
  • 对已有视频执行元素增删改、前后延长和多段轨道补齐。

这些能力共同构成了它在创作流程中的双重角色:既是生成模型,也是编辑模型。相关细化可参见 Seedance 2.0 提示词结构Seedance 2.0 视频编辑能力Seedance 2.0 多模态参考控制Seedance 2.0 文字生成能力

关键信息

文本生成基础

Seedance 2.0 可以深度遵循自然语言逻辑,常见的文本指令组织公式为:

  • 主体 + 运动 + 环境(非必须)+ 运镜/切镜(非必须)+ 美学描述(非必须)+ 音频(非必须)

其中:

  • “主体 + 运动”是生成逻辑基石,用于明确谁在做什么。
  • “环境 + 美学”用于定义空间背景、光影细节和整体视觉风格。
  • “运镜 + 音频”属于进阶控制,可进一步指定镜头调度、氛围声效或视听配合方式。

多模态深度参考

除文本描述外,Seedance 2.0 还支持图片、音频、视频的深度参考。使用时需要在提示词中明确指代参考对象,例如指定“参考图片1的构图”或“动作参考视频2”。模型会自动提取参考对象中的核心特征,并结合文本描述生成结果,以提高确定性和还原度。

文字生成能力

Seedance 2.0 支持在 T2V、I2V、R2V、V2V 等场景下生成常用文字。

已明确支持的文字表现包括:

  • Slogan。
  • 字幕。
  • 气泡台词。

模型可以根据情境自动匹配合适的文字风格与颜色,也支持在提示词中显式指定以下属性:

  • 文字颜色。
  • 文字风格。
  • 出现方式。
  • 出现时机。
  • 出现位置。

其文字生成还有一个明确边界:应优先使用常用字,避免生僻字与特殊符号,以保证更好的呈现效果。

细节与边界

图片参考边界

Seedance 2.0 支持图片深度参考,既支持主体多视角参考,也支持多图参考。

图片参考可覆盖的典型对象包括:

  • 主体多视角形象。
  • 场景图。
  • 分镜图。
  • logo。
  • 多主体。
  • 多元素组合。

如果对图片顺序有要求,需要按顺序上传,并在提示词中使用“图片1、图片2……图片n”进行准确指代。

音频参考边界

Seedance 2.0 支持音频参考,但有明确限制:不支持仅上传音频。这意味着音频能力需要与视频生成或其他画面输入场景结合使用,而不是单独把音频作为唯一输入来完成任务。

其音频能力已明确覆盖:

  • 音色参考。
  • 音频内容参考。
  • 音频驱动口型。

其中:

  • 音色参考可用于指定角色说话时的声音风格。
  • 音频内容参考可用于按参考音频展开对话、补全台词或在指定时机加入音频内容。
  • 口型驱动表示可用音频去驱动人物说话时的口部同步表现。

如果对音频顺序有要求,同样需要按顺序上传,并使用“音频1、音频2……音频n”进行准确指代。

视频参考边界

Seedance 2.0 支持视频参考,且已明确覆盖三类能力:

  • 动作参考。
  • 运镜参考。
  • 特效参考。

具体来说:

  • 动作参考用于迁移参考视频中的动作细节。
  • 运镜参考用于保持参考视频中的镜头运动方式一致。
  • 特效参考用于迁移粒子、翅膀生成轨迹等特效表现。

如果对视频顺序有要求,需要按顺序上传,并用“视频1、视频2……视频n”做明确指代。

视频编辑能力边界

Seedance 2.0 还支持视频编辑,已明确支持以下三大类操作:

  • 元素增删改。
  • 向前延长或向后延长。
  • 轨道补齐。

元素增删改

可执行的编辑类型包括:

  • 增加元素:在指定视频的指定时间位置和空间位置增加目标元素。
  • 删除元素:删除指定视频中的某个元素,其他内容保持不变。
  • 修改元素:将视频中的某个元素替换为另一元素,同时保持原动作和运镜等条件不变。

这说明其编辑并非笼统重生成,而是允许针对时间位置、空间位置和目标对象做较细粒度控制。

视频延长

支持对现有视频向前延长或向后延长。

可用表达包括:

  • 向前/向后延长“视频n”并描述需延长的内容。
  • 生成“视频n”之前或之后的内容,并描述衔接后的画面。

这里有一个关键机制边界:模型会自动截取衔接部分进行合成,输入视频的原有片段不会全部重复生成。这意味着延长的重点是补出前后内容并完成衔接,而不是完整重做原片段。

轨道补齐

轨道补齐用于把多段视频通过过渡画面连接成连续结果,基本模式为:

  • 视频1 + 过渡画面描述 + 接视频2 + 过渡画面描述 + 接视频3

其操作约束非常明确:

  • 最多支持 3 段视频输入。
  • 输入视频总时长不得超过 15 秒。

同时它和视频延长一样,都会由模型自动截取衔接部分进行合成,输入视频原有片段不会被全部重复生成。

使用要点

  • 进行多模态控制时,应在提示词中明确写出参考对象及用途,如构图参考、动作参考、运镜参考、特效参考或音色参考。
  • 涉及多张图片、多段音频或多段视频时,如顺序重要,应按顺序上传并在指令中使用编号指代。
  • 生成文字时,优先使用常用字,避免生僻字和特殊符号。
  • 使用音频能力时,要注意其不能作为唯一上传输入单独使用。
  • 使用轨道补齐时,要提前控制输入段数与总时长,超过 3 段或超过 15 秒都不在已知支持范围内。

相关条目