图生视频提示词专题
基于 video-generation-skills 的 prompt-director 模块,详细讲清图生视频提示词怎么写,怎样避免动作混乱、运镜冲突和 AI 味过重。
为什么图生视频最容易写废
很多失败案例都不是模型能力不够,而是提示词职责混乱。用户把静态图阶段的风格词、渲染词、 画质词重新抄进视频提示词里,结果模型一边想保留首帧,一边又被要求重做风格,最后动作和镜头都会漂。
三条硬规则
i2v-rulestext
图生视频三条硬规则:
1. 首帧已定风格,提示词只写运动和变化
2. 一条提示词只保留一种主导逻辑
3. 多动作必须写成时间线,不要一锅炖对比一下最典型的错误写法和更稳的写法:
bad-i2v-exampletext
错误写法:
电影级光影,8K,超写实,女孩站在雪地里慢慢转身看向镜头,
同时镜头高速环绕,头发随风飞舞,天空乌云翻滚,氛围非常高级梦幻good-i2v-exampletext
更稳的写法:
0-2s:女孩站在雪地里,肩膀轻微起伏,目光仍然看向远处
2-4s:她缓缓转身,视线自然落向镜头,寒风扬起发丝和衣角
4-5s:镜头轻微推近,停在半身近景时间线写法
当一个镜头里出现两个以上动作时,就不要继续写自然语言长句,而应该切成时间线。 时间线的目的不是显得专业,而是让模型知道动作顺序。
action-templatetext
写法骨架:
[主导动作]
[运镜方式]
[从 0 到 n 秒的状态变化]
例如:
主角缓慢抬头,先停顿,再向前迈出一步。
固定机位,轻微推近。
0-2s 低头静止,2-4s 抬头呼吸,4-5s 迈步。什么时候必须改写成时间线
只要镜头里既有主体动作,又有镜头变化,再加上一个次级动作,就已经该拆时间线了。
- 人物从静止到转头,再到迈步,这已经是三个状态。
- 镜头先固定、后推进,也属于时间顺序变化。
- 如果还有风、衣角、头发、视线变化,就更不能继续写成长句。
- 如果角色只需要轻微转头、抬手、呼吸变化,3 到 5 秒就够了。
- 如果一个镜头需要奔跑、回头、停步、开门,通常应该拆成两个镜头。
- 时间线里尽量只保留肉眼可见的变化,不要写抽象情绪判断。
动作锚点法
video-generation-skills 里一个很实用的思路是锚点动作。复杂动作时,不要让全身部位同时成为主语, 而是先确定一个主动作,再让其他细节跟随。
anchor-templatetext
动作锚点法:
Anchor:躯干或重心主动作
Satellite:手部、头部、衣角、表情跟随变化
例如:
Anchor:人物向前迈步并转身
Satellite:发丝被风扬起,手指轻微收紧,眼神随后转向镜头- 奔跑、跳跃、转身、坐下、起身,通常由躯干和重心作为锚点。
- 头发、衣角、手指、眼神和表情更适合做从属变化。
- 如果主次不分,模型容易把每个部位都做成“各玩各的”。
案例拆解
下面这个例子基本覆盖了最常见的图生视频错误。问题不在模型,而在于用户同时要求“改风格、改镜头、改动作、改情绪”。
i2v-case-breakdowntext
案例:校园少女回头镜头
首帧:少女站在教室窗边,逆光暖色,半身构图
错误写法:
少女突然转身看向镜头,镜头快速环绕,头发飞舞,阳光更强,情绪梦幻,电影级
正确拆法:
0-2s:少女维持原站姿,肩膀轻微起伏,视线还在窗外
2-4s:她缓缓转头,目光自然移向镜头,发丝被微风带起
4-5s:镜头轻微推近,停在面部和肩线之间单镜头模板
i2v-shot-templatetext
单镜头输出模板:
## 首帧职责
- 锁定人物、场景、光线、色调
## 视频提示词
- 主导动作:
- 运镜方式:
- 时间线:
## 生成约束
- 不改首帧风格
- 不加额外人物
- 不重做背景结构i2v-error-maptext
问题 -> 处理方式
人物动作像抽搐 -> 删掉多余动词,只保留一个主动作
镜头很乱 -> 只留一种运镜,不要再写环绕 + 推进 + 手持
表情假 -> 改成呼吸、停顿、视线转移、肩膀起伏
背景变了 -> 删除风格词和环境词,只保留动作变化
片段太空 -> 给动作加前后状态,而不是堆形容词最常见的错误
- 把“8K、电影级、超写实、梦幻氛围”继续塞进视频提示词。
- 同时要求强手持、平滑推进、360 环绕,运镜逻辑互相冲突。
- 一条提示词里要求角色跑、跳、摔倒、抬头、说话、转身。
- 首帧是日系自然光,视频提示词却强行改成赛博朋克高对比。
推荐工作流
i2v-workflowtext
推荐执行顺序:
1. 先确认首帧静态图已经稳定
2. 先写 1 个主动作,不先写情绪判断
3. 如果动作超过 2 个,改成时间线
4. 如果涉及全身联动,先写锚点动作
5. 每镜只生成 3 到 5 秒
6. 不稳定就回到首帧修,不要一直追加视频提示词更稳的流程通常是:先做关键帧,确认角色和场景,再写单镜头动作提示词。如果你还没把静态图锁稳, 先回到 prompt-director 总教程或 场景一致性专题。