AI 视频分镜与提示词教程

把分镜脚本、人物设定、场景氛围和情绪节奏整理成可直接用于 AI 视频生成的工作流,适合短视频剧情片、情绪片和口播叙事片。

This page is accessible in English navigation, but the full body has not been translated yet. The original Chinese content is kept below for accuracy.

先理解 AI 视频到底在生成什么

AI 视频模型最擅长的不是长篇叙事,而是单个镜头里的空间、人物、动作和情绪表达。 所以文档、提示词和分镜设计的核心任务,不是写文学作品,而是把每个镜头压缩成 “一个场景、一个人物状态、一个动作、一句台词、一个明确的画面风格”。

你给的这份分镜 PDF 很典型:它不是先讲复杂剧情,而是先用校园、办公室、出租车、夜市、厨房这些场景, 把“梦想”和“现实”做出反差。这种结构非常适合 AI 视频生成,因为每个镜头都足够独立。

推荐工作流

ai-video-workflowtext
1. 先定主题:你想讲的不是“画面”,而是“情绪变化”
2. 再拆人物:学生时代是谁,成年后是谁,现在的状态是什么
3. 再拆场景:教室、办公室、出租车、夜市、厨房、小摊
4. 每个场景只保留一个核心动作和一句核心台词
5. 统一画风参数:比例、光线、写实程度、镜头节奏、色调
6. 先出静态关键帧,再补视频动作提示词
7. 确认人物一致性后,再批量生成整条短片镜头
8. 最后才做配音、BGM、字幕和转场

分镜提示词公式

一个可复用的视频镜头提示词,不要只写“一个女生在教室里说梦想”。那样太短, 模型不知道空间层次、人物状态和镜头节奏。更稳的写法是下面这种五段式:

prompt-formulatext
场景氛围:
时间、地点、空间结构、光线、颜色、时代感、环境细节

人物设定:
年龄、发型、衣着、面部特征、神态、情绪、身份状态

动作镜头:
站 / 坐 / 走 / 抬头 / 回头 / 开车 / 打包 / 对话

台词旁白:
一句话就够,尽量短,必须能推动情绪变化

画面参数:
写实 / 电影感 / 竖屏 9:16 / 景深 / 暖色调 / 慢节奏 / 胶片感

如何拆分镜头

拆解项你要写什么错误写法
场景教室、办公室、出租车、夜市、厨房这类空间 + 光线 + 时代感只写“一个室内场景”
人物发型、衣着、年龄状态、神态、微表情只写“一个女生”
动作抬头、开车、打包、接电话、托腮、握方向盘动作写成一长串,模型抓不住重点
台词一句话推动情绪变化整段口播或长段旁白
风格参数写实、电影暖色、纪实、景深、竖屏 9:16参数前后互相打架,例如既要纪实又要夸张动漫

案例拆解:少年梦情绪短片

这类题材最适合做“三段式结构”:第一段是青春时的梦想,第二段是成年后的现实, 第三段是对现实的重新理解。你给的 PDF 基本就是这个结构。

shot-templatetext
镜头 01
场景:阳光洒满老旧高中教室,浅绿色墙面,白色窗框,课桌整齐,黑板干净,校园暖光
人物:双马尾少女,蓝白校服,眼神清澈,带一点青涩笑意
动作:站在窗边,轻轻抬头看向远方,缓慢开口
台词:我以后的梦想就是去大城市闯荡,然后环游世界
参数:写实人像,暖色电影感,竖屏 9:16,细腻光影,青春胶片质感

镜头 02
场景:灰白色办公室,桌面电脑、文件、绿植,室内冷调柔光
人物:成年女性,低马尾,灰色职业装,略带疲惫
动作:拿起手机贴耳通话,低头轻叹气
台词:喂,妈,回来吃饭
参数:电影写实,冷白柔光,生活化纪实镜头,人物面部自然

如果你要直接喂给视频模型,可以先把镜头写成下面这种单镜头视频提示词:

video-prompt-exampletext
生成一条 9:16 写实短视频镜头:
老旧高中教室,午后阳光穿过白色窗框洒在课桌和黑板上,空气里有轻微粉笔灰,
青春怀旧暖色调。一个双高马尾少女穿着宽松蓝白校服,站在教室窗边,
眼神清澈,脸上带一点对未来的憧憬,轻轻抬头看向窗外远方,缓慢开口说话。
镜头轻微推近,人物动作自然,面部细节清晰,背景柔和虚化,
整体电影感、写实人像、细腻光影、慢节奏情绪片。

模型与工具选择

任务推荐入口说明
看可用视频模型模型导航在 Video 分类下看模型、能力和接口路径。
先做人物关键帧Agent 图片工作台先把主角长相、服装和氛围打样固定。
做程序化接入/v1/videos/generations适合把单镜头生成流程接进自己的产品或脚本。
先做图片再做视频图片生成 API先锁住角色、场景和构图,再转视频。

当前站内模型导航已经把视频模型单独归类,你可以先去 模型导航 的 Video 分类查看,再决定是先出关键帧,还是直接走视频生成接口。

人物与镜头一致性

consistency-rulestext
人物一致性规则:
1. 先确定一个“学生时代主角”参考图
2. 成年镜头只允许改发型、衣着、年龄状态,不要改五官骨相
3. 不同场景反复强调“面部五官一致”
4. 用“同一人物成年版 / 中年版”而不是“另一个女人”
5. 静态图确认一致后,再生成视频镜头

镜头一致性规则:
1. 同一段故事统一 9:16
2. 同一人物段落尽量统一色温和镜头语言
3. 每个镜头只保留一个主要动作
4. 台词不要过长,否则口型和节奏容易失真
5. 转场靠情绪对比,不靠复杂特效

从单镜头到成片

AI 视频最稳的生产链路通常不是“一个模型包办所有环节”,而是图像模型、视频模型和剪辑工具分工合作。

editing-flowtext
成片建议流程:
1. 用图像模型先做每个镜头关键帧
2. 从关键帧里筛出人物最稳定的一组
3. 再用视频模型生成单镜头动作片段
4. 把校园段、成年段、夜市场景段分别导出
5. 剪映 / PR / CapCut 里补字幕、BGM、环境音
6. 用“梦想 - 现实 - 再理解人生”三段式完成剪辑
7. 最后统一调色和片尾字幕

最常见的失败原因

问题原因解决方式
人物越做越不像同一个人每个镜头都重新描述了一个“新人物”先固定主角关键帧,反复强调五官一致。
动作很假或很乱一个镜头里塞了太多动作每个镜头只保留一个核心动作。
情绪不连贯台词、镜头和场景反差没有被设计用梦想 - 现实 - 和解三段式重新排。
画面好看但成不了片只会做单图,不会做镜头顺序先写镜头表,再做单镜头生成。
成本过高直接高分辨率批量生成先低成本验证关键帧和单镜头。