用 Codex 和 HyperFrames 自动生成视频:从文章到口播、分镜与成片的完整教程
很多人想做视频,真正卡住的并不是没有选题,而是从文章到成片之间有太多零散工作:写口播、找声音、剪辑、做字幕、安排画面、调时间轴,最后还要检查成片是否真的能看。
这篇教程整理自 Miles Ma 在 X 发布的《Codex 实战系列|零剪辑自动生成爆款视频》,并将原帖中的实践步骤重新组织成一套可以复用的工作流。原帖展示的是作者的工具组合和经验,不代表所有账号、模型、Skill、声音服务或视频平台都能获得相同效果。具体安装方式、模型能力、API 价格、服务条款和平台限制,应以当前官方文档和本地运行结果为准。
先看结论:不要从剪辑开始
这套流程的关键不是让 Codex “直接做一条视频”,而是把视频拆成几个有明确输入和输出的阶段:
文章或主题
→ 口播稿
→ 最终声音
→ 字幕与真实时间轴
→ 分镜
→ HyperFrames / Remotion
→ 预览、修改、渲染
→ 成片验收
最重要的顺序是:先把内容和最终声音定下来,再让画面跟着声音走。
如果先做动效,后面只要口播改一句,字幕时间、镜头长度、图片停留时间和转场都可能需要返工。声音是视频的真实时间尺,画面应该服从它,而不是反过来。
这套教程适合谁?
它适合以下几类人:
- 有文章、笔记或工具测评,想转成短视频的人;
- 想做不出镜知识视频、产品介绍或教程视频的人;
- 不熟悉剪辑软件,但能描述自己想要什么的人;
- 想把一个固定主题持续做成系列内容的人;
- 已经有真人口播素材,希望减少整理、字幕和补画面工作的人。
它不适合一开始就追求电影级广告片、复杂三维场景或完全无人审核的批量生产。第一目标应该是跑通一条可播放、可复查、能继续修改的视频。
开始前的准备
建议的项目目录
先创建一个独立项目目录,例如 codex-video,把原始文章、配图和生成结果集中放在一起:
codex-video/
├── article.md # 原始文章,可选
├── assets/ # 原始图片、截图、图表
├── narration.md # 最终口播稿
├── reference.wav # 声音复刻时使用的参考录音,可选
├── reference.txt # 参考录音逐字文本,可选
├── final.wav # 最终配音
├── subtitles.json # 字幕及时间轴
├── storyboard.md # 分镜说明
├── project/ # HyperFrames 或 Remotion 项目
└── final.mp4 # 最终成片
文件名不是硬性规定,但要让 Codex 能够明确区分原始材料、中间产物和最终产物。不要把多个版本都叫 final.mp4,否则很难知道当前预览对应哪一次修改。
Skill 的作用
Skill 可以理解为给 Codex 的一份工作说明书。它告诉 Codex:
- 这类任务应该调用哪些工具;
- 工具之间应该怎样衔接;
- 输入文件放在哪里;
- 生成什么中间产物;
- 完成后检查哪些问题。
原帖提到的 Skill 组合包括:
| Skill 或工具 | 适合处理的环节 |
|---|---|
/faceless-explainer | 把文章或主题整理成不出镜讲解视频 |
/hyperframes-creative | 口播节奏、画面结构和分镜创意 |
/media-use | 图片、声音、字幕等媒体素材管理 |
/hyperframes-animation | 画面变化和动效 |
vox-explainer | 拼贴式知识视频参考 |
p5-paint-animation | 手写、绘制或逐步出现效果 |
video-shotcraft | 产品介绍、界面演示和宣传片镜头参考 |
video-use | 真人口播素材的转写、筛选和剪辑 |
| Remotion Agent Skills | 固定栏目模板与可重复渲染 |
第一次不需要全部安装。建议先用最少的工具完成一条不出镜视频,等内容结构稳定后再扩展样式和自动化能力。
最短成功路径:先做一条不出镜视频
第一步:确定视频边界
在让 Codex 写稿前,先给出四个约束:
目标观众:[谁会看]
要解决的问题:[观众现在卡在哪里]
视频长度:[例如 30 秒、60 秒或 3 分钟]
看完后的动作:[观众应该尝试什么]
还要提前确定:
- 横版还是竖版;
- 发布到什么平台;
- 是否需要出镜;
- 是解释一个观点、展示一个工具,还是带观众完成一个操作;
- 哪些内容必须保留,哪些内容可以删掉。
“做一条 AI 视频”太宽泛,Codex 很难判断重点。相比之下,“把一篇 3000 字的工具测评改成 60 秒竖版新手教程”就已经包含了对象、长度、形式和目标。
第二步:把文章或主题变成口播稿
有三种入口。
方案一:只有主题,直接写稿
如果还没有文章,可以让 Codex 根据主题生成口播稿。指令至少包括:受众、问题、时长和行动目标。
一个实用的口播结构是:
钩子:先说结果、冲突或具体问题
问题:说明观众为什么会卡住
方法:用两到三步讲清解决路径
下一步:给一个看完就能执行的动作
例如:
装好 Codex 之后不知道做什么?你可以先用它做一条视频。
给它一篇文章,它可以继续处理口播、声音、字幕和画面。
今天先跑通最短的一条流程,不需要先学会剪辑。
方案二:已有文章,改写成能说出口的话
把文章保存为 article.md,连同文章中的图片一起放入项目目录,然后让 Codex:
读取 article.md,把它改写成适合 60 秒竖版视频的中文口播稿。
保留事实、判断和结论,删除重复背景。
每句话要能自然说出口,避免翻译腔和书面排比。
输出到 narration.md,并标出每一段的目的。
生成后一定要自己读一遍。眼睛读起来顺,不代表嘴巴说起来顺。真实朗读会暴露过长句子、连续术语、数字读法和不自然停顿。
方案三:让 /faceless-explainer 处理第一版
如果手上只有材料,还没有决定口播和画面,可以让 /faceless-explainer 从文章、主题或笔记开始,继续整理讲解方向、旁白和分镜。
这条路径适合快速得到第一版。若你已经有明确观点,前两种方案更容易控制内容,不会让工具替你改变文章的重点。
第三步:选择普通 TTS 或声音复刻
口播定稿后,再决定由谁来念。
最省事:普通 TTS
普通 TTS 的流程是:输入文字,得到 MP3 或 WAV。它适合第一条视频,因为速度快、成本低、调试简单。
建议先生成十几秒试听片段,检查:
- 声音是否适合主题;
- 语速是否太快;
- 句子之间有没有自然停顿;
- 英文、数字和专有名词是否读对;
- 声音是否有明显的机械感。
确认后再生成全文,不要每次都从头生成整段音频。
想使用自己的声音:CosyVoice
原帖将 CosyVoice 作为声音复刻路线。声音复刻至少要区分三个文件:
reference.wav # 本人或获得授权的参考录音
reference.txt # 参考录音实际说出的逐字文本
narration.md # 本次视频要生成的新口播
reference.txt 必须和 reference.wav 中的内容完全一致。临时换了一个词,文本也要同步修改。背景音乐、回声、严重降噪和环境噪声都会影响参考质量,尽量使用安静环境下清晰、自然的录音。
声音复刻需要本地环境、模型文件和更多运行时间。不要因为工具能够生成声音,就默认结果可以直接发布。必须亲自试听,检查声音是否像、咬字是否自然,以及是否出现奇怪的情绪或停顿。
如果只是验证内容和画面流程,可以先跳过声音复刻。HyperFrames 和 Remotion 只需要最终音频文件,并不要求它来自哪一种 TTS。
第四步:用最终音频生成真实时间轴
现在应该至少有两个定稿文件:
narration.md
final.wav
从这一步开始,final.wav 才是视频的真实时间尺。让 Codex 转写最终音频,取得每句话的开始和结束时间,再生成字幕时间轴。
口播稿决定:字幕写什么
最终音频决定:字幕什么时候出现
不要按字数平均分配时间。同样是十个字,有的半秒就能说完,有的中间会停两次。字幕、关键词、图片和镜头都应该跟随真实声音出现。
可以这样交代任务:
读取 final.wav,并根据实际语音生成字幕时间轴。
不要按字数平均切分。
每段字幕保持易读,避免遮挡主体。
输出 subtitles.json,同时列出无法确定的词和时间点。
第五步:把口播拆成分镜
分镜不需要先学会复杂术语。把口播切成 4 到 8 段,每段只回答一个问题:
观众听到这句话时,画面上最需要看到什么?
优先使用文章里已有的截图、照片、图表或角色卡。先让观众看清全貌,再放大正在讲的部分。没有现成图片的段落,可以用:
- 关键词和标题卡;
- 步骤卡;
- 前后对比;
- 时间线;
- 简单信息图;
- 产品界面局部演示。
分镜文件可以采用下面的格式:
## Scene 01|问题
- 时间:00:00 - 00:06
- 旁白:观众现在遇到的具体问题
- 画面:标题卡 + 一张代表性截图
- 重点:标题必须在前两秒可读
## Scene 02|方法
- 时间:00:06 - 00:18
- 旁白:方法的第一步和第二步
- 画面:步骤卡,按旁白顺序高亮
- 重点:不要让动效盖住操作区域
如果不知道动效怎么做,可以把 HyperFrames Launches 当作完整项目参考,把 video-shotcraft 当作镜头配方参考。但参考库是可选项,不是第一条视频的必装依赖。
第六步:用 HyperFrames 生成第一版
当口播、最终声音、字幕时间和分镜都准备好后,再把它们交给 HyperFrames:
读取 narration.md、final.wav、subtitles.json、storyboard.md 和 assets/。
使用 HyperFrames 制作一条竖版知识视频。
先实现前 15 秒,保证字幕、声音和画面时间对齐。
打开本地预览,输出预览地址和项目目录。
先看前 15 秒,可以尽早发现三个问题:
- 开头是否太慢;
- 字幕是否看得清;
- 画面是否真的解释了口播,而不是只做装饰。
如果方向正确,再继续全片。修改时不要只说“高级一点”或“更好看一点”,而要指出对象和位置:
- 第 6 秒的标题太小;
- 这张截图至少停留 3 秒;
- 字幕挡住了人物;
- 第一个镜头进入太慢;
- 关键词应该在说到时出现,而不是提前出现。
最后再让 Codex 渲染:
把当前确认的版本渲染成 final.mp4。
渲染完成后检查文件是否存在、能否正常播放、声音是否完整、字幕是否错位。
预览页面能打开,只说明项目可以运行;真正完成的标志是 final.mp4 已经生成,并且你从头到尾看过一遍。
HyperFrames 和 Remotion 怎么选?
两者都可以把文字、声音、图片和时间轴做成视频,但工作方式不同:
| 工具 | 更适合 | 主要特点 |
|---|---|---|
| HyperFrames | 内容驱动的视频、第一版、每期结构不同 | 让 Codex 根据本期内容组织画面 |
| Remotion | 固定栏目、批量更新、模板化生产 | 先做模板,再填入每期内容 |
建议第一条视频先用 HyperFrames 跑通。连续做了几期,发现镜头结构、字幕样式和片头已经稳定,再让 Codex 把它整理成 Remotion 固定栏目。
Remotion 路线通常会使用:
/remotion-create # 创建视频项目
/remotion-studio # 打开预览
/remotion-render # 渲染视频
上游的 narration.md、final.wav、字幕、时间轴和图片仍然可以复用,不需要重新制作一套素材。
真人口播:加入 video-use
前面的流程可以完全不出镜。等你愿意面对镜头时,可以把 narration.md 放在相机旁边,按段拍摄。说错后停一下,从当前句子重新说,不必每次从头开始。
video-use 处理的是已经拍好的素材。它的合理顺序是:
真人拍摄
→ 转写视频
→ 找出每段说了什么
→ 确认保留与删除内容
→ 整理有效片段
→ 字幕和补充画面
→ 成片
拍摄完成后,把原视频放进单独文件夹,再让 Codex 读取。不要让原始素材和渲染结果混在一起,否则后续很容易误删或覆盖。
真人口播和 HyperFrames 可以组合使用:video-use 先把真人素材剪顺,HyperFrames 再制作标题、步骤卡、截图演示和片头片尾。一个处理真人素材,一个处理信息画面,职责更清楚。
需要注意的是,视频转写服务、FFmpeg、模型文件和第三方 API 可能有额外依赖。安装前先确认环境要求;不要把 API key 写进文章、代码仓库或视频项目。任何声音复刻、真人素材处理和第三方上传,都要确认你拥有相应授权。
把一次制作变成可复用的内容系统
一条视频只能验证一次流程。更有价值的是把同一类问题持续做下去。
原帖使用“图书拆解”作为内容对象:一本书、一个值得讲的观点、一条短视频,然后继续用同样结构讲下一本书。你也可以选择:
- 每周拆解一个 AI 工具;
- 每次解决一个办公问题;
- 每期解释一个行业案例;
- 把一篇长文拆成一组短视频;
- 记录一个产品从问题到交付的过程。
一个可复用的内容循环是:
选择固定主题
→ 建立文章或资料模板
→ 固定口播结构
→ 固定声音与字幕规范
→ 固定分镜文件格式
→ 固定渲染项目
→ 发布并记录反馈
→ 迭代下一期
获客钩子也应该落在具体结果上。“我用 AI 做了一条视频”只说明你会使用工具;“我把一篇 3000 字的工具测评做成一条 60 秒新手教程”才会让真正需要这件事的人停下来。
不要一开始就搭建庞大的自动化系统。先选一个你能连续讲十期的主题,跑通第一条;第二条复用文件结构;第三条开始保留固定片头和字幕样式。这样 Codex 才会从“帮你做过一条视频”,逐步变成“陪你持续生产一类内容”。
质量验收清单
内容
- 开头几秒说明了结果、问题或冲突;
- 口播内容没有明显重复和空泛背景;
- 事实、数字、专有名词已人工核对;
- 每段只承担一个清晰目的;
- 结尾给出了下一步动作。
声音
- 声音来源合法且获得必要授权;
- 语速、停顿和情绪适合内容;
- 英文、数字和专有名词读法正确;
- 没有截断、爆音、明显噪声或不自然重复;
- 使用声音复刻时,参考录音和参考文本完全一致。
画面
- 画面跟随真实音频时间轴;
- 字幕在手机尺寸下仍然清晰;
- 字幕没有遮挡人物、界面或关键数据;
- 画面解释了口播,而不是只增加装饰;
- 截图、图片和图表没有被错误裁切;
- 动效没有让观众错过操作步骤。
交付
-
final.mp4已生成; - 能从头到尾播放;
- 音频、字幕和画面没有明显错位;
- 项目文件、中间产物和最终文件已分开保存;
- 预览和渲染使用的是同一版本素材。
常见问题与恢复方法
口播听起来像文章
缩短句子,减少连续名词和书面排比。让 Codex 只做语言口语化,不要同时改动事实、结构和观点。修改后重新朗读一遍。
配音和字幕对不上
不要继续手动平均切分字幕。以最终音频为准重新转写,再检查难识别的专有名词和数字。只要音频改过,就应重新生成时间轴。
动效很多,但视频讲不清楚
先删掉装饰性动效,只保留能说明关系、顺序、位置或变化的画面。每个镜头都要回答“它帮助观众理解了哪句话”。
预览能打开,但成片不能交付
检查 final.mp4 是否真的生成、文件大小是否合理、播放器能否从头播放,以及渲染时使用的音频路径和字体是否存在。预览成功不等于导出成功。
工具安装失败
不要只复制最后一行错误。把完整日志留在 Codex 对话里,先确认 Node、Python、FFmpeg、模型文件和环境变量,再逐项修复。安装工具和开始做视频是两个不同问题,应分开验证。
一个可复用的总指令模板
我要把一篇文章或一个主题做成一条 [时长] 的 [横版/竖版] 视频。
目标观众:[描述观众]
发布平台:[平台]
视频目标:[观众看完后要做什么]
风格:[不出镜知识讲解/产品演示/真人口播]
请按以下阶段执行,并在每个阶段输出中间产物:
1. 读取 article.md 或主题,生成 narration.md;
2. 检查口播是否自然、事实是否需要核对;
3. 生成或读取 final.wav,不要在最终音频确定前做分镜;
4. 根据 final.wav 生成 subtitles.json,按真实语音切分;
5. 根据口播和字幕生成 storyboard.md;
6. 使用 HyperFrames 先实现前 15 秒并打开本地预览;
7. 根据具体反馈修改标题、字幕、截图和镜头节奏;
8. 我确认后渲染 final.mp4;
9. 检查视频能否完整播放、声音是否截断、字幕是否错位、素材是否裁切。
任何无法确认的事实、权限、依赖或失败原因,都单独列出,不要自行假设。
总结
Codex 视频工作流的核心不是“让 AI 一次生成完美视频”,而是把内容生产拆成可以观察和验收的阶段:口播先定稿,声音再定稿,时间轴跟随真实音频,分镜服务于口播,最后才进入渲染。
第一条视频应当追求可验证:有输入、有中间文件、有预览、有最终 mp4,并且从头到尾人工看过。等连续几期的内容结构稳定后,再考虑把 HyperFrames 迁移到 Remotion 模板,或加入真人口播、批量生产和固定栏目。
真正可持续的部分不是某个工具的按钮,而是你能否持续选择一个明确主题,把观点写清楚,把声音和画面对齐,用验收标准检查结果,再把成功的一期沉淀成下一期可以复用的结构。
来源说明
本文整理自 Miles Ma 的 X 帖子《Codex 实战系列|零剪辑自动生成爆款视频》,原帖页面显示发布时间为 2026 年 9 月 8 日。本文保留了原帖的工具链和实践顺序,并进行了结构化改写、补充验收标准与故障排查;其中工具能力、安装方式、服务可用性和第三方条款应以当前官方资料和实际环境为准。
Further Reading
相关指南
Codex CLI 文档