W
AI-Wiki
SOURCE

Doubao Seedance 2.5 提示词指南--火山方舟-火山引擎 摘要

文档概览

  • Doubao Seedance 2.5 支持文本、图片、视频、音频等多模态输入的灵活组合;单段视频可直出 30 秒,单次最多输入 50 个图像/音频/视频参考素材。
  • 文档将其能力概括为“长叙事 × 强参考 × 准编辑 × 多语言”:支持专业级视频编辑与延长,原生支持生成 10 余种语言,并强调真实感、光影、表演执行和镜头运动更接近真实拍摄。
  • 官方强烈建议使用 Seedance 2.5 skill 调优提示词:安装后,在 AI 对话框输入 /sd25-pe 加提示词内容进行调试。
  • 推荐将模型视作视觉内容生产者,以导演思维书写结构化 Prompt,而非只提供零散关键词。

关键事实

锁定与非锁定任务

  • Seedance 2.5 按输入素材是否锁定输出属性区分任务类型;该区分在 Seedance 2.0 中没有。
  • “有锁定”表示输入素材会严格成为输出视频时间轴上的一段,模型需要适应素材,因此输出宽高比、甚至时长会被锁定。
  • “无锁定”仅将素材作为语义参考,用户仍可指定输出视频的宽高比和时长。
  • 编辑、首尾帧和延长会根据输入素材自动锁定部分生成参数,用户不能自行定义这些被锁定的参数;参考类任务通常不受输入素材对宽高比与时长的锁定。

结构化提示词

  • 推荐结构为:先写一句话概述,再按镜头或时间轴描述具体情节,最后补充贯穿全片的机位、运镜、环境、声音和氛围。
  • 一句话概述可包含“主体 + 地点 + 事件 + 题材/风格 + 特殊运镜”。
  • 具体情节可按时间戳或“镜头 N”切分,逐段写画面、运镜、动作、台词和音效,优先采用正向描述。
  • 支持反向描述,例如“不要字幕”“不要 bgm”;音频还可分别进行音效、背景音乐和对白的负向控制。

素材编号与绑定

  • 多素材场景必须按上传顺序明确编号及用途,例如谁提供形象、音色、动作、场景或镜头参考。
  • 多主体应逐一列出映射关系;人数多时使用清单。示例包括“图 1—2 是人物 1,对应音频 1;图 3—4 是人物 2,对应音频 2”。
  • 不建议仅在图片上写人物名称、再在提示词中直接称呼该名称;这容易造成多人混淆或角色重复。
  • 每份素材要说明“参考什么”;若仅部分参考,应明确参考哪一部分。若素材本身已经足够精确,可只做指代并减少重复复述。
  • 对视频 1 的动作和视频 2 的环绕运镜可分别绑定;若要求严格沿用素材,可写明“严格参考视频 1 的动作与运镜,顺序与视频保持一致”。

时间轴、镜头与动作

  • 时间戳以 1 秒为基本单位。时间段内内容太少时模型会自由发挥;内容过多时可能过度剪切或遗漏剧情,应为每段安排合理时长。
  • 时间轴需连续,例如 0-3 秒、3-7 秒、7-15 秒;避免出现 0-3 秒 后直接跳到 5-6 秒 的表述。
  • 不建议以时间戳控制高频次数,例如“一秒摇头 3 次”。可使用“3 秒后”或“定格 1 秒”等叙事性时间要求。
  • 可直接使用大全景、全景、中景、近景、特写,以及推、拉、摇、移、跟、环绕、俯冲、后拉、上摇、手持晃动等通识镜头语言。
  • 一镜到底、希区柯克变焦、航拍、FPV、子弹时间和回弹变速等常见运镜可直接写;小众专业术语应写成“名词 + 描述性解释”。
  • 转场需要写清触发点、发生时间和方式,例如第 5 秒快速向左横移,并结合向左擦除与自然叠化。
  • 动作优先概括描述,只把少数记忆点动作写细,避免反复描述同一动作;表情宜用直观描述,例如将“津津有味地吃饭”改写为“脸上带着满足的笑容,大口地吃饭”。

重要细节

白模视频渲染

  • 白模视频 可提供运动、运镜、动线和光照等动态/时序信息;还可叠加人物、场景、道具参考图控制渲染结果。
  • 对由简单几何体拼接的人物、物体或动物,当前版本的参考效果较好。
  • 白模主体建议仅保留躯体,避免四肢、翅膀等精细运动元素;若已包含这些元素,提示词需补全动作序列,以减少渲染后出现四肢僵化。
  • 白模可以包含切镜、运镜和光照信息。若只需参考运镜和运动,应明确不参考光影;若需要光影,也应明确要求参考其光影变化。
  • 白模上色/重渲染应尽量提供完整、清晰且细粒度的白模视频,并避免轨迹线、坐标线、相机 cone 等干扰信息,否则它们可能泄露到输出画面。
  • 即使输入白模视频,也建议详细描述希望生成的内容,且文本要与白模运动相吻合;未叠加参考图或视频的白模主体,补充外表和特征通常更有利。
  • 白模案例要求把视频 1 作为整支片唯一的运镜、节奏、景别、主体轨迹与镜头调度参考,保持镜头顺序、机位、运动方式和节奏,不新增镜头、不改变主体运动逻辑;画面内容和角色外观则由分阶段关键帧图及文本控制。

分镜与关键帧

  • 多宫格分镜更适合 15 个以下分镜;单次输入过多,例如 18 宫格,可能导致静止或顺序错乱,并会限制模型发挥。
  • 不推荐使用过度锐化、杂乱的 AI 直出分镜图,也不建议在分镜图中堆叠大量文字。
  • 分镜图不会严格逐格对齐,模型仍会发挥;若必须严格遵循分镜,建议改用多关键帧参考。
  • 推荐相对简约的火柴人或线稿分镜,并在提示词中完整补齐分镜未呈现的信息;可结合时间戳梳理剧情逻辑。
  • 概念分镜或仅用于关键帧设计时,可以简写为“按照分镜图顺序构建完整故事剧情,运镜合理连贯”。
  • 使用关键帧严格控制时,需在提示词第一句明确“以图片 x 至图片 x 的顺序作为关键帧”,并按顺序独立传入分镜图片。

风格与排除项

  • 文档的写实电影案例明确要求排除单色、灰度、去色,以及手绘、素描、线稿、插画、漫画和动画等风格。
  • 同一案例还明确排除分镜稿、故事板、草图,以及移轴微缩、玩偶感、塑料 CG、油腻过曝 CG 等效果或质感。
  • 这类“严格排除”描述用于避免参考素材或生成过程偏离目标的真人实拍彩色电影质感;它不是对所有视频任务都必须排除上述风格的通用规则。

编辑、首尾帧与延长

  • 编辑任务应明确修改范围和内容,必要时以时间戳限定,并描述从 A 到 B 的变化过程;例如仅改台词、仅改 4—6 秒动作、或将视频中的特定人物替换为参考图人物,其余保持不变。
  • 图片作为首尾帧时,优先通过参数将 role 设为 first_framelast_frame;该方式会锁定输出宽高比,并严格对齐输入视频的首帧图。
  • 也可将图片 role 设为 reference_image,再在 Prompt 中指定哪张是首帧和尾帧;此方式不会锁定输出宽高比,但结果只会与参考图相近,不完全匹配。
  • 延长任务中,生成片段的音量可能与输入视频略有差异;若延长的是 Seedance 2.5 本身生成的视频,音量变化相对更小、无缝衔接更好。
  • 文档建议在延长/编辑场景选择 MOV 输出,以更好保持颜色与亮度一致性及声画一致性。

图片成片与多视频衔接

  • 多图一键成片可以由模型自由安排图片顺序,但若要求原图高度一致、仅产生轻微动态,应明确写出“不要改变原图”。
  • 两段视频衔接需要说明视频间的运动、转场变化和“不要改变上传的两个视频”等保留约束;案例以视角飞至顶端、折返俯冲,并让麻将牌变为高楼完成转场。

像素武侠案例

  • 像素武侠竖版案例一次引用 6 张图片,分别指导水墨风格 logo、男性角色脸部、蓝色像素书、角色站姿、角色奔跑姿态和最终 UI。
  • 该案例要求全片统一浅蓝色背景与统一像素风格,画面干净通透;角色动作、连续位移和跟随镜头需要自然衔接,且文字与 UI 应清晰稳定、无卡顿和闪烁。
  • 该案例说明当多个素材分别承担 logo、角色、道具、动作 pose 与 UI 时,提示词要逐镜标明对应图片及其在转场中的变化关系。

与 Seedance 2.0 的差异

  • Seedance 2.0 不响应时间戳、只响应镜头序号;Seedance 2.5 可响应整数秒时间戳。
  • Seedance 2.0 不建议使用多视图作为主体参考;Seedance 2.5 支持多视图主体参考。
  • Seedance 2.0 的输出宽高比只有固定 6 档;Seedance 2.5 可通过控制输入素材,在 0.4 至 2.5 的范围内输出任意宽高比。
  • Seedance 2.5 支持 MOV 输出,并在延长和编辑任务中更有利于保持颜色、亮度和声画一致性。
  • 文档将 2.5 定位为在 2.0 核心生成能力基础上的生产化补强:更长视频、更多参考素材、更稳定的编辑与续写,以及更好的可控性和工作流适配。

相关条目