
Seedance 2.5 能传 50 个参考素材,为什么你最好别传满
参考生成、视频编辑、视频延长三类能力怎么区分,参考素材该配多少个、每段多长,以及官方手册里那些会让你踩坑的隐藏规则。
Seedance 2.5 最抢眼的数字是 50——单次生成 50 个参考素材,30 张图 + 10 段视频 + 10 段音频。
我第一反应是:那就传满。素材越多,控制力越强,对吧?
错了,而且是字节自己在手册里说的。2.3 节有一条几乎没人引用的建议:主体素材建议不超过 5 个。
不是 50,是 5。
这篇文章给你什么: 先分清三类容易混用的能力,再拿走官方给出的素材配比数字,最后避开三条会让你返工的隐藏规则。
一、先分清三件事,否则提示词全白写
手册里字节主动承认:参考、编辑、延长这三类能力「常被混用,导致 Prompt 错位、素材引用方式失当,最终影响生成结果的可控性与稳定性」。
官方主动提示的坑,说明它真的很常见。
三者的判断标准其实只有一个问题:你手上有没有成片?
| 手上有成片吗 | 你要做什么 | 提示词公式 | |
|---|---|---|---|
| 参考生成 | 没有 | 从 0 生成一段新视频 | 生成要求 + @视频N @图片N @音频N |
| 视频编辑 | 有 | 改其中局部 | 修改要求 + @视频1(原片)+ 可选素材 |
| 视频延长 | 有 | 往前或往后接 | 修改要求 + @视频1(原片)+ 可选素材 |
参考生成:八种子能力
没有成片时用这类。手册列了八种:
| 子能力 | 参考什么 |
|---|---|
| 主体参考 | 人 / 物 / 场景 / 虚拟角色的外观 ID 或声音 |
| 运动参考 | 动作、表情、运镜、创意、特效 |
| 白模参考 / 渲染 | 白模视频的动态信息,再做渲染 |
| 风格参考 | 图或视频的整体风格 |
| 音频参考 | 音乐 / 旋律 / 台词 / 音色 |
| 宫格分镜 / 故事板 | 分镜图的主体、动作、剧情 |
| 关键帧参考 | 首帧、首尾帧、多关键帧 |
| 一键成片 | 多段素材串联成短片 |
视频编辑:五种子能力
已有成片、只改局部时用这类:
| 子能力 | 能做什么 |
|---|---|
| 视频指令编辑 | 用文字改,支持时间戳指定生效时段 |
| 参考图编辑 | 用「文字 + 参考图」改,比如换指定的衣服 |
| 新增主体 | 补进人物、道具或特效元素 |
| 删除主体 | 移除水印、穿帮或指定对象,自动补全 |
| 音频编辑 | 换 BGM、补音效、改人声 |
视频延长:三种子能力
| 子能力 | 能做什么 |
|---|---|
| 向后延长 | 以尾帧为起点往后续写 |
| 向前延长 | 以首帧为终点往前补前情 |
| 视频无缝转场 | 输入两段视频,补全中间的过渡 |
选错的代价:你想改一段成片里的服装,却按「参考生成」的写法写提示词——模型会理解成"参考这段视频重新做一条",结果整个画面都变了。素材没白传,但方向完全错了。
二、编辑写法三步,缺一步就翻车
手册给了一个非常简洁的框架:
① 用 @视频1 指入待编辑的原片 ② 圈定要改动的对象与目标——替换主体可配 @图片N 提供参考形象,增删元素直接描述对象与位置 ③ 用「其余保持不变」锁定未改动区域,避免模型连带改动
第三步是最容易漏、也是最要命的。少了它,模型会"顺手"把别的地方也改了。
看一个正例。这条同时换了场景和两个人的服装,但动作一帧没变:
将两人武打素版视频 @视频1 替换为冷兵器对决前的空手试探风。
场景替换为中世纪石堡平台、古老庭院平地、山间堡垒外平台或简洁石砖决斗场,
背景为古堡墙体、风、雾、远处山线,地面平整石质 @图片1。
视频中深色衣服的男子的服饰替换为 @图片2,视频中浅色衣服的男子替换为 @图片3。
动作仍然保持不变,不改变原始节奏。这条里藏着一个细节值得学:它用衣服颜色来区分两个人(「深色衣服的男子」「浅色衣服的男子」),而不是「左边那个」。镜头一动,左右就变了,颜色不会变。
锁定要点名,别只说「其余不变」
「其余保持不变」有效,但点名更可靠。手册里那条家居装修的提示词,逐项点名了 14 样不能动的东西:
Everything else must remain unchanged: the window, curtains, walls, wall art,
TV, TV console, plants, rug, coffee table, books, radiator, shelves, doorframe,
lighting, shadows, camera motion, and overall warm interior atmosphere.局部编辑最怕的就是模型"帮你"改了别的。写得越具体,它越不敢动。
三、素材配比:官方给的数字
现在回到开头那个反直觉的结论。
主体素材的数量上限
| 素材类型 | 建议 | 上限尝试 |
|---|---|---|
| 主体是音视频 | ≤ 5 个 | 6–10 个 |
| 主体是图片 | ≤ 8 个 | 9–12 个 |
单段时长的最佳区间
视频和音频,单段建议 5–10 秒。
手册给的理由很直白:
- 过短(如 2 秒)——信息量不足、特征不完整,难以被稳定识别与参考
- 过长(如 30 秒)——关键特征被稀释、噪声增多
也就是说,你传一段 30 秒的参考视频,模型未必比传 8 秒的效果好,反而可能更差。
素材超载时的取舍优先级
核心角色 > 关键产品 / 道具 > 场景环境 > 整体风格
砍素材时从右往左砍。风格最容易用文字描述补回来,核心角色最不能省。
多主体的图片怎么传
还有一条容易忽略的细节:
- 主体图 ≤ 5 张时,「单视图」「多视图」都可以
- 超过 5 个主体时,「单视图」效果更稳定——如果需要多视角,拆分成多张不同视图分别输入,而不是把多个视角拼在一张图里
什么算「主体」
手册专门解释了这个概念,因为它直接决定你该数几个:
主体 = 画面里希望模型稳定还原、贯穿全片的核心元素,包括人物角色、关键产品 / 道具、场景环境、整体风格。
举例:
- 单主体——口播视频里,出镜的模特就是唯一主体。一般传模特的多视图(5 张内)即可
- 多主体——「一个人在森林里拉弓射中一只兔子」,主人公、弓箭、兔子各算一个主体,都需要稳定还原
所以"我只传了 3 张图"不等于"只有 3 个主体"。数的是元素,不是文件数。
四、七种模态组合,别忘了新增的那个
2.5 支持 7 种参考组合:
单模态:只参考图片 · 只参考视频 · 【新增】只参考音频 双模态:图片 + 视频 · 音频 + 视频 · 图片 + 音频 三模态:音频 + 图片 + 视频
「只参考音频」是这一代新加的。可以直接用一段 BGM、人声或音效来驱动画面节奏、卡点与口型对齐。
三模态同时参考时,还支持指定其中某张参考图用作首帧或尾帧。
用 @ 引用素材时的铁律
每引用一个素材,就紧跟一句使用声明。
有多个人物或多段视频时,必须写明对应关系,否则模型会混淆。避免「参考 @图片1」这种无头无尾的写法——它没告诉模型这张图提供的是脸、是衣服、还是背景。
正确的写法长这样:
@图片1用于陶艺师的五官、发型和深绿色围裙,不采用图片背景。
@图片2用于陶艺工作室的木质工作台、窗户位置和晨间光线,不采用图中人物。
@视频1用于双手拉坯、托起陶杯和放置陶杯的动作节奏,不采用视频中的人物身份、服装和场景。注意每句后面的「不采用」。素材里那些容易被误带入的东西,要主动排除掉。
同一物体的多个视角
如果几张图是同一件东西的不同角度,必须说清楚,否则模型可能生成好几个:
@图片1定义同一盏折叠台灯的正面外观。
@图片2定义同一盏折叠台灯的左侧结构。
@图片3定义同一盏折叠台灯的右侧结构。
@图片4定义同一盏折叠台灯的背面结构。
四张图片共同定义同一盏折叠台灯,成片中始终只有一盏折叠台灯。最后那句总结是关键。
五、三条会让你返工的隐藏规则
手册里明确写了:使用视频编辑 / 延长、首尾帧能力时,模型会依据参考素材自动锁定部分生成参数,不支持自定义。
具体是这三条:
1. 编辑和延长的画面比例,严格对齐原片,改不了。
你上传一条竖屏原片,就别指望输出横屏。这个在做多平台分发时特别容易踩——想着"一条片子改改比例就能同时投抖音和 YouTube",实际做不到。
2. 编辑后的时长只是"基本对齐"原片。
手册原话:「由于模型对输入的处理机制,时长可能出现轻微差异」。视频主体内容会保持完整不变,但如果你的交付要求卡死在 15.0 秒,必须留一个检查环节。
延长片段的时长倒是可以自定义,用提示词明确指定即可。
3. 首尾帧画幅不一致会被拉伸变形。
用两张图做首帧和尾帧时:
- 输出画幅对齐首帧
- 尾帧如果画幅不同,会被强行拉伸对齐
所以首尾帧一定要用同样的画幅,否则尾部画面会变形。
The Bottom Line
- 先判断「手上有没有成片」,再决定用哪类能力。 没有就用参考生成,有就用编辑或延长。这一步选错,后面写得再细也是白费。
- 50 是上限不是目标。 主体素材音视频 ≤ 5 个、图片 ≤ 8 个,单段 5–10 秒。素材过多会稀释关键特征,效果反而变差。
- 编辑类提示词的重点是锁定。 先说清什么不能变——而且点名比笼统说「其余不变」可靠得多——再说改什么。
素材配比这件事,没有放之四海的标准答案,但官方给的这几个数字是大量评测跑出来的起点。从 5 个主体、每段 8 秒开始试,比一上来就传满 50 个高效得多。
想直接看这些规则怎么落到具体提示词里?51 条官方提示词里每条都标了它为什么这么写。或者先看完全指南了解 2.5 的整体变化。
常见问题
参考生成、视频编辑、视频延长有什么区别?
参考生成是手上没有成片、从零生成;视频编辑是已有成片、改其中一部分;视频延长是已有成片、往前或往后接新片段。三者的提示词公式不同,混用会导致提示词错位、素材引用失当。
Seedance 2.5 一次该上传多少个参考素材?
上限是 50 个,但官方建议主体素材为音视频时控制在 5 个以内,为图片时控制在 8 个以内。素材过多会稀释关键特征,反而降低稳定性。
参考视频每段多长最合适?
官方建议单段控制在 5 到 10 秒,这是识别度与稳定性的最佳区间。过短(如 2 秒)信息量不足、特征不完整;过长(如 30 秒)关键特征被稀释、噪声增多。
素材太多该怎么取舍?
官方给出的优先级是:核心角色优先于关键产品和道具,关键产品和道具优先于场景环境,场景环境优先于整体风格。
视频编辑的提示词怎么写?
三步:第一步用 @视频1 指入待编辑的原片;第二步圈定要改动的对象与目标,替换主体可配参考图;第三步用「其余保持不变」锁定未改动区域,避免模型连带改动。
多张图是同一个物体的不同视角,怎么写才不会生成多个?
需要明确写出它们定义的是同一个物体,例如逐张说明正面、左侧、右侧、背面结构,最后补一句四张图片共同定义同一件物品,成片中始终只有一件。



