Seedance 提示词实战心得——一份来自高频使用的四要素写法
posts posts 2026-07-12T01:15:29+08:00字节跳动 Seedance 用户@海辛Hyacinth 的提示词实战心得反写:四要素写法、抽卡策略与五条纠正营销号认知。视频精读Seedance, AI视频, 提示词四个字段,一张角色表,720p 出片,Topaz 放大。Seedance 提示词没有营销号说的那么玄。
1. 为什么大多数"网红提示词"都没用
“Seedance 提示词"相关的帖子在 X 和小红书上反复刷屏。包装一个花哨的故事板(带镜头运动曲线、配乐标注、镜头表格),再附上几条"电影感"样本,就能拿到几千转发。
丢进 Seedance 跑几次就会发现一个尴尬的事实:大部分不好用,还浪费大量时间。
@海辛Hyacinth 在长微博里说得直白:
这些被包装得华丽无比的提示词小作文只验证了一个事情:Seedance 是真不挑食。
顺着这句话往下推一步:一个对提示词"什么都吃"的模型,写法和能不能跑出好结果之间往往没有强相关。提示词工程在 Seedance 上的实际杠杆,比想象中小得多。
Seedance 是字节跳动 Seed 团队的视频生成模型。截至本文写作,Seedance 2.0 已经发布:官方介绍它是统一的多模态音视频联合生成架构,接受文字、图片、音频、视频四种模态输入,音画同步是原生能力,表演、光影、运镜都可以调度。本文的实战心得来自 1.0 Pro 时期,但四要素结构和对营销号技巧的纠正,放到 2.0 依然成立——会变的只是各档位参数,方法论跟版本号关系不大。
所以到底怎么写?填好四个部分就够了。
2. 四要素写法:提示词只需要这四个字段
团队几乎测遍了过去半年所有网红提示词,最后沉淀下来的结构只有四个字段:【主体】、【场景】、【音乐】、【镜头】。
这四类不是"四段文字”,而是"四类参考输入",每类都有自己推荐的承载形式。
2.1 【主体】:先做角色表,反复 @ 复用
主要人物的处理方式:先在即梦里出一张简单的角色表(即梦是字节跳动旗下脸萌科技的 AI 创作平台,支持文生图,编辑图像时也能保留人物的形象特征),然后在 Seedance 里直接新建主体,后期每条 prompt 都 @ 这个主体。
这样做的收益有两层:
- 一次建立,跨条复用,省掉每次重新描述长相、衣着、年龄段的工作量。
- 角色一致性是 AI 视频最头疼的问题之一,主体库相当于在模型外预先做了"特征锁定",后续生成时一致性会显著提升。
2.2 【场景】:上传场景图,把主角一起放进去
场景参考图的传法很简单:上传一张场景图。
有个容易被忽视的细节——场景图里最好带上你的主角。目的不是好看,而是交代角色和场景之间的相对大小关系。
Seedance 文本提示词里写"前景一个小孩,背景一座三层楼"是失效的——模型对这种描述的尺度感很弱,往往生成出"和房子一样高的孩子"或者"和小孩一样大的城堡"。把主角放进场景参考图,相当于用视觉而不是文字告诉模型"这个人比那栋楼小得多",绕开了文字描述的精度天花板。
2.3 【音乐】:不要 BGM,只要音效
这一条是四个要素里最反直觉的。
海辛和团队明确说:
为了方便剪辑和后期配乐,不要生成任何 BGM,只需要生成对应的音效即可,这一点非常重要!!!!!
四个感叹号是原微博强调的。
理由是工程化的:视频生成模型自己"作曲"质量参差,且 BGM 会把整段素材的情绪锁死,导致后期剪辑和混音时无法重新配乐。但音效——脚步、风声、门响、金属碰撞——是"事件信号",后期可以无成本叠加或替换。
BGM 留到剪辑环节再定,换曲的成本几乎为零;生成阶段一旦把 BGM 固定进素材,后期想换就没有退路了。
2.4 【镜头】:说清楚景别和发生了什么
镜头描述的最低要求是:说清楚景别,以及每个 Shot 里发生了什么。
镜头运动曲线(推/拉/摇/移/跟/升/降这类专业术语)对模型收益很低;情绪渲染(“压抑、孤独、世纪末的寒意”)模型基本不响应;比喻句(“像一把生锈的钥匙在空气中划过一道弧线”)也一样。
如果一段提示词连自己都读不完,说明你对故事要发生什么根本不关心。一个简单的判断标准:镜头描述能在一行内写完。
2.5 一条可复制的模板
四要素落到实操就是一张固定的填空表。下面这条模板可以直接复制、逐字段替换——注意【主体】和【场景】通常是"参考图 + 一句话",不是纯文字:
【主体】@角色A(即梦角色表已建:18 岁少年,灰色连帽卫衣)
【场景】上传参考图:雨夜便利店门口(图里已放入@角色A,交代身高比例)
【音乐】只要音效:雨声、自动门"叮"、塑料袋摩擦声;不要 BGM
【镜头】Shot1 中景:少年推门进店,抖落伞上的水(约 3s)
Shot2 近景:他盯着货架上最后一个饭团(约 3s)
Shot3 特写:手伸过去,和另一只手碰到一起(约 3s)
Shot4 近景:两人对视,脸上同时露出微妙的表情(约 3s)
Shot5 中景:两人各自拿了一个饭团,在收银台前并排站着(约 3s)把这条模板套进 Seedance,一次直出 15 秒大致就是 5 个 Shot;剩下的事情交给"抽卡"——同一份提示词反复生成多次,再从结果里挑最好的。
3. 抽卡策略:2~3 秒一个 Shot,直出 15s 就够
要不要抽卡?要。但不是盲目抽。海辛给出的建议:
个人建议 2~3s 一个 Shot,这样每次直出 15s 你就能至少得到 5 个连贯且一致性极强的镜头,抽卡 3 次,就相当于有 15 个可选的素材,对一场戏来说,绰绰有余。
这段话里有三个关键参数:
- 单 Shot 时长 2~3 秒——镜头内一致性的舒适区。时长越长,动作、光影、构图的变量越多,崩的概率越大。
- 直出 15 秒——这是海辛实测的直出时长。不同入口、不同版本的时长档位并不统一,以你所用平台实际提供的档位为准。
- 抽卡 3 次——按"一条 5 个 Shot × 3 次"算,一场戏手里就有 15 个可选素材。单次生成有随机性,能不能挑出可用镜头,靠的是采样次数撑起来的余量。
4. 五条纠正:营销号最爱宣传的技巧,都是反模式
下面这五条传播最广,几乎每个 Seedance 教程都会提到。海辛和团队都一一踩过,最后确认它们要么没用,要么反作用。
先给一张速查表,排查提示词时快速对照——如果你正在做左列里的任何一件事,大概率就是在浪费抽卡次数:
| 常见做法(反模式) | 实际效果 | 应该怎么做 |
|---|---|---|
| 塞进华丽分镜故事板 | 错漏百出(噪声干扰) | 分镜留给剪辑,别喂模型 |
| 提示词写得又长又美 | 冗余,收益递减 | 交代清楚故事就停 |
| 每个 Shot 标时间戳 | 模型基本不按时间戳走 | 用 Shot 数量控制节奏 |
| 一律选 1080p | 不稳,要反复抽卡 | 先用 720p 出片 |
| 生成阶段死磕 4K | 又慢又贵 | 720p 生成 + Topaz 后期放大 |
4.1 不要往 Seedance 里放分镜故事板
这是营销号最爱包装的东西:在推上下载某个所谓"大佬的 skill",花十几分钟生成一张华丽无比的故事板(带镜头运动曲线、带各种 highlight 和表格),然后丢进 Seedance。
结果?错漏百出。
直到有一次作者忘了上传分镜图,生成的结果流畅无比——这才回过头来验证:问题不在提示词不够详细,而在提示词太详细。
Seedance 对提示词的响应有自己读得懂的东西:景别、主体、动作;它读不懂精心排版的表格和曲线。故事板里那些"镜头运动曲线"和"highlight 标注"在模型看来是无结构噪声,反而干扰主体识别和动作规划。
更深一层:营销号故事板的真正作用是给观众看的"专业感证明",不是给模型用的约束条件。一个反面证据是,那些故事板本身是从 AI 工具(GPT/Claude/Gemini)生成的——它对原微博作者来说是"专业包装",对模型来说是"二次幻觉叠加"。两层噪声叠在一起,再叠加 Seedance 自己的扩散采样不确定性,错漏百出是必然。
结论:分镜是给剪辑师看的工作文档,不是给模型看的约束条件。
4.2 提示词不是越长越好
很多 AI 生成的提示词塞满比喻和情绪渲染,认真交代清楚故事就够了。主体参考和场景参考已经传了图,再用文字把同样的信息啰嗦一遍,纯属冗余。
单独列这一条,是因为它是营销号最普遍的诱导:用"专业感"包装冗余信息。
4.3 不需要每个 Shot 带时间戳
很多教程教你在每个 Shot 后面加 [00:00-00:03] 这种时间戳。但 Seedance 的体感是:它并不真的按照时间戳分配时长。
对每个 Shot 时长影响最大的,反而是Shot 的数量——把一条 15 秒的生成切成 5 个 Shot,每个 Shot 大致就是 3 秒。这比写时间戳有效得多。
结论:时间戳是安慰剂,不是约束条件。
4.4 不要盲目追求 1080p,目前响应最好的是 720p
这条是整篇心得里最有量化价值的一条。
最开始海辛团队也想"一劳永逸",每次抽卡都选 1080p,效果始终不理想——他们一直以为是参考图没做好,或者提示词没写好。直到好友"时辰"建议切回 720p——立竿见影的进步,而且又快又便宜。
为什么会这样?官方没有公布训练分布,一个说得通的解释是 720p 处在训练数据最稠密的分辨率档位上,模型在这一档见过最多的样本;1080p 也能跑,只是输出质量更依赖采样运气,需要更多次抽卡才稳定。这个解释只能算推测,实测摆在那里的只有一件事:切回 720p,进步立竿见影,生成又快又便宜。
4.5 清晰度问题用 Topaz 后期解决
生成阶段用 720p,最后怎么输出 4K?
答案是用 Topaz Video AI 在后期放大到 4K。Topaz 专门为 Seedance 的输出做了放大入口:把 720p/1080p 提到 4K,提供 Creative 和 Precision 两种模式——前者可以重塑细节、调节创意程度,后者只提分辨率不动内容——另有帧插值(最高补到 60 fps)、细节锐化和压缩伪影清理,全程云端处理,不挑本地显卡。
分工就很清楚:
| 阶段 | 分辨率目标 | 工具 | 关注点 |
|---|---|---|---|
| 生成 | 720p | Seedance | 一致性、动作流畅度、抽卡成功率 |
| 定稿后处理 | 4K | Topaz Video AI | 清晰度、画面锐化、降噪 |
生成阶段只回答"能不能跑出可用素材",定稿之后才轮到"输出能不能商用"。两个问题分开解决,各自都简单得多。
5. 把省出来的时间都用来构思分镜和故事
这是海辛长微博的最后一句话,也是整篇心得的核心主张:
请把省出来的时间都用来构思分镜和故事吧。
落到 AI 视频工作流里,时间的流向正好反过来:营销号教程把大块时间花在生成故事板、雕琢提示词上,抽卡全凭运气;海辛的工作流里,提示词压缩成一张填空表,省下的时间全部转投分镜设计和抽卡筛选——前者决定一场戏讲什么,后者决定手里有多少素材可选。后期剪辑、调色、Topaz 放大是固定成本,压缩不动。
成片质量的变量里,故事和分镜的权重远大于提示词的写法。这也是这条长微博的价值所在:它没有教多少新技巧,否定掉的一堆反模式,省下的都是实打实的生成成本。
写好一段 Seedance 视频提示词,真的比你想象中要简单得多。
6. 自测清单:动手前先过一遍
把这几条当成发起生成前的 checklist,能帮你省下大量抽卡成本:
- 主体是否已经在即梦里出好角色表,并在 Seedance 里建成可 @ 的主体?
- 场景参考图里是否放进了主角,交代了人和物的相对大小?
- 是否只保留了音效、去掉了 BGM?
- 每个 Shot 的镜头描述是否都能一行写完?
- 单 Shot 是否控制在 2~3 秒、准备抽卡 3 次以上?
- 分辨率是否先选 720p、把 4K 交给后期?
只要有一条打不了勾,先别急着点生成——回到对应小节再对一遍。
7. 把方法论迁移到别的视频模型
四要素写法不是 Seedance 独有的。它的内核是用参考图承载视觉约束、用短句承载事件、把音乐和清晰度交给后期,迁移到 Sora、Veo、Kling 等模型同样成立,动手前确认三件事就行:模型接不接受参考图,决定【主体】【场景】怎么落地;单次生成多长,决定 Shot 怎么切;音频是原生生成还是要自己铺,决定【音乐】一栏怎么填。各家参数不同,判断方法不变。
谁需要去看原文:本文已经把可操作的部分全部展开——四要素模板、抽卡参数、五条反模式。想直接看海辛贴的生成实例和她的原始表述,或者想追她后续更新,再去翻那条长微博;只想知道提示词怎么写,读到这里就够了。
8. 参考资料
- @海辛Hyacinth 的 Seedance 提示词实战长微博(微博平台,本文基于其公开分享反写整理;作者为知名 AI 创作者)
- 字节跳动 Seed — Seedance 2.0:官方模型页
- 字节跳动 Seed 团队官网:模型与研究总览
- 即梦 Jimeng:文中用于出角色表 / 场景图的图像生成产品
- Topaz Video AI:后期放大到 4K 的工具(Topaz 甚至提供了专门的 Seedance 放大入口)
说明:本文是对@海辛Hyacinth 公开长微博的工程化转述与结构化整理,补充了模板、速查表与自测清单等便于上手的内容;核心观点与量化参数(2~3 秒/Shot、720p、抽卡 3 次等)均来自原作者。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。