返回博客

用 Codex 和 HyperFrames 自动生成视频:从文章到口播、分镜与成片的完整教程

AI工具指南2026-09-09约 18 分钟CodexHyperFramesAI视频视频生产TTSCosyVoiceRemotionvideo-use内容获客

很多人想做视频,真正卡住的并不是没有选题,而是从文章到成片之间有太多零散工作:写口播、找声音、剪辑、做字幕、安排画面、调时间轴,最后还要检查成片是否真的能看。

这篇教程整理自 Miles Ma 在 X 发布的《Codex 实战系列|零剪辑自动生成爆款视频》,并将原帖中的实践步骤重新组织成一套可以复用的工作流。原帖展示的是作者的工具组合和经验,不代表所有账号、模型、Skill、声音服务或视频平台都能获得相同效果。具体安装方式、模型能力、API 价格、服务条款和平台限制,应以当前官方文档和本地运行结果为准。

先看结论:不要从剪辑开始

这套流程的关键不是让 Codex “直接做一条视频”,而是把视频拆成几个有明确输入和输出的阶段:

文章或主题
  → 口播稿
  → 最终声音
  → 字幕与真实时间轴
  → 分镜
  → HyperFrames / Remotion
  → 预览、修改、渲染
  → 成片验收

最重要的顺序是:先把内容和最终声音定下来,再让画面跟着声音走。

如果先做动效,后面只要口播改一句,字幕时间、镜头长度、图片停留时间和转场都可能需要返工。声音是视频的真实时间尺,画面应该服从它,而不是反过来。

这套教程适合谁?

它适合以下几类人:

  • 有文章、笔记或工具测评,想转成短视频的人;
  • 想做不出镜知识视频、产品介绍或教程视频的人;
  • 不熟悉剪辑软件,但能描述自己想要什么的人;
  • 想把一个固定主题持续做成系列内容的人;
  • 已经有真人口播素材,希望减少整理、字幕和补画面工作的人。

它不适合一开始就追求电影级广告片、复杂三维场景或完全无人审核的批量生产。第一目标应该是跑通一条可播放、可复查、能继续修改的视频。

开始前的准备

建议的项目目录

先创建一个独立项目目录,例如 codex-video,把原始文章、配图和生成结果集中放在一起:

codex-video/
├── article.md          # 原始文章,可选
├── assets/             # 原始图片、截图、图表
├── narration.md        # 最终口播稿
├── reference.wav       # 声音复刻时使用的参考录音,可选
├── reference.txt       # 参考录音逐字文本,可选
├── final.wav           # 最终配音
├── subtitles.json      # 字幕及时间轴
├── storyboard.md       # 分镜说明
├── project/            # HyperFrames 或 Remotion 项目
└── final.mp4           # 最终成片

文件名不是硬性规定,但要让 Codex 能够明确区分原始材料、中间产物和最终产物。不要把多个版本都叫 final.mp4,否则很难知道当前预览对应哪一次修改。

Skill 的作用

Skill 可以理解为给 Codex 的一份工作说明书。它告诉 Codex:

  • 这类任务应该调用哪些工具;
  • 工具之间应该怎样衔接;
  • 输入文件放在哪里;
  • 生成什么中间产物;
  • 完成后检查哪些问题。

原帖提到的 Skill 组合包括:

Skill 或工具适合处理的环节
/faceless-explainer把文章或主题整理成不出镜讲解视频
/hyperframes-creative口播节奏、画面结构和分镜创意
/media-use图片、声音、字幕等媒体素材管理
/hyperframes-animation画面变化和动效
vox-explainer拼贴式知识视频参考
p5-paint-animation手写、绘制或逐步出现效果
video-shotcraft产品介绍、界面演示和宣传片镜头参考
video-use真人口播素材的转写、筛选和剪辑
Remotion Agent Skills固定栏目模板与可重复渲染

第一次不需要全部安装。建议先用最少的工具完成一条不出镜视频,等内容结构稳定后再扩展样式和自动化能力。

最短成功路径:先做一条不出镜视频

第一步:确定视频边界

在让 Codex 写稿前,先给出四个约束:

目标观众:[谁会看]
要解决的问题:[观众现在卡在哪里]
视频长度:[例如 30 秒、60 秒或 3 分钟]
看完后的动作:[观众应该尝试什么]

还要提前确定:

  • 横版还是竖版;
  • 发布到什么平台;
  • 是否需要出镜;
  • 是解释一个观点、展示一个工具,还是带观众完成一个操作;
  • 哪些内容必须保留,哪些内容可以删掉。

“做一条 AI 视频”太宽泛,Codex 很难判断重点。相比之下,“把一篇 3000 字的工具测评改成 60 秒竖版新手教程”就已经包含了对象、长度、形式和目标。

第二步:把文章或主题变成口播稿

有三种入口。

方案一:只有主题,直接写稿

如果还没有文章,可以让 Codex 根据主题生成口播稿。指令至少包括:受众、问题、时长和行动目标。

一个实用的口播结构是:

钩子:先说结果、冲突或具体问题
问题:说明观众为什么会卡住
方法:用两到三步讲清解决路径
下一步:给一个看完就能执行的动作

例如:

装好 Codex 之后不知道做什么?你可以先用它做一条视频。
给它一篇文章,它可以继续处理口播、声音、字幕和画面。
今天先跑通最短的一条流程,不需要先学会剪辑。

方案二:已有文章,改写成能说出口的话

把文章保存为 article.md,连同文章中的图片一起放入项目目录,然后让 Codex:

读取 article.md,把它改写成适合 60 秒竖版视频的中文口播稿。
保留事实、判断和结论,删除重复背景。
每句话要能自然说出口,避免翻译腔和书面排比。
输出到 narration.md,并标出每一段的目的。

生成后一定要自己读一遍。眼睛读起来顺,不代表嘴巴说起来顺。真实朗读会暴露过长句子、连续术语、数字读法和不自然停顿。

方案三:让 /faceless-explainer 处理第一版

如果手上只有材料,还没有决定口播和画面,可以让 /faceless-explainer 从文章、主题或笔记开始,继续整理讲解方向、旁白和分镜。

这条路径适合快速得到第一版。若你已经有明确观点,前两种方案更容易控制内容,不会让工具替你改变文章的重点。

第三步:选择普通 TTS 或声音复刻

口播定稿后,再决定由谁来念。

最省事:普通 TTS

普通 TTS 的流程是:输入文字,得到 MP3 或 WAV。它适合第一条视频,因为速度快、成本低、调试简单。

建议先生成十几秒试听片段,检查:

  • 声音是否适合主题;
  • 语速是否太快;
  • 句子之间有没有自然停顿;
  • 英文、数字和专有名词是否读对;
  • 声音是否有明显的机械感。

确认后再生成全文,不要每次都从头生成整段音频。

想使用自己的声音:CosyVoice

原帖将 CosyVoice 作为声音复刻路线。声音复刻至少要区分三个文件:

reference.wav   # 本人或获得授权的参考录音
reference.txt   # 参考录音实际说出的逐字文本
narration.md    # 本次视频要生成的新口播

reference.txt 必须和 reference.wav 中的内容完全一致。临时换了一个词,文本也要同步修改。背景音乐、回声、严重降噪和环境噪声都会影响参考质量,尽量使用安静环境下清晰、自然的录音。

声音复刻需要本地环境、模型文件和更多运行时间。不要因为工具能够生成声音,就默认结果可以直接发布。必须亲自试听,检查声音是否像、咬字是否自然,以及是否出现奇怪的情绪或停顿。

如果只是验证内容和画面流程,可以先跳过声音复刻。HyperFrames 和 Remotion 只需要最终音频文件,并不要求它来自哪一种 TTS。

第四步:用最终音频生成真实时间轴

现在应该至少有两个定稿文件:

narration.md
final.wav

从这一步开始,final.wav 才是视频的真实时间尺。让 Codex 转写最终音频,取得每句话的开始和结束时间,再生成字幕时间轴。

口播稿决定:字幕写什么
最终音频决定:字幕什么时候出现

不要按字数平均分配时间。同样是十个字,有的半秒就能说完,有的中间会停两次。字幕、关键词、图片和镜头都应该跟随真实声音出现。

可以这样交代任务:

读取 final.wav,并根据实际语音生成字幕时间轴。
不要按字数平均切分。
每段字幕保持易读,避免遮挡主体。
输出 subtitles.json,同时列出无法确定的词和时间点。

第五步:把口播拆成分镜

分镜不需要先学会复杂术语。把口播切成 4 到 8 段,每段只回答一个问题:

观众听到这句话时,画面上最需要看到什么?

优先使用文章里已有的截图、照片、图表或角色卡。先让观众看清全貌,再放大正在讲的部分。没有现成图片的段落,可以用:

  • 关键词和标题卡;
  • 步骤卡;
  • 前后对比;
  • 时间线;
  • 简单信息图;
  • 产品界面局部演示。

分镜文件可以采用下面的格式:

## Scene 01|问题
- 时间:00:00 - 00:06
- 旁白:观众现在遇到的具体问题
- 画面:标题卡 + 一张代表性截图
- 重点:标题必须在前两秒可读

## Scene 02|方法
- 时间:00:06 - 00:18
- 旁白:方法的第一步和第二步
- 画面:步骤卡,按旁白顺序高亮
- 重点:不要让动效盖住操作区域

如果不知道动效怎么做,可以把 HyperFrames Launches 当作完整项目参考,把 video-shotcraft 当作镜头配方参考。但参考库是可选项,不是第一条视频的必装依赖。

第六步:用 HyperFrames 生成第一版

当口播、最终声音、字幕时间和分镜都准备好后,再把它们交给 HyperFrames:

读取 narration.md、final.wav、subtitles.json、storyboard.md 和 assets/。
使用 HyperFrames 制作一条竖版知识视频。
先实现前 15 秒,保证字幕、声音和画面时间对齐。
打开本地预览,输出预览地址和项目目录。

先看前 15 秒,可以尽早发现三个问题:

  1. 开头是否太慢;
  2. 字幕是否看得清;
  3. 画面是否真的解释了口播,而不是只做装饰。

如果方向正确,再继续全片。修改时不要只说“高级一点”或“更好看一点”,而要指出对象和位置:

  • 第 6 秒的标题太小;
  • 这张截图至少停留 3 秒;
  • 字幕挡住了人物;
  • 第一个镜头进入太慢;
  • 关键词应该在说到时出现,而不是提前出现。

最后再让 Codex 渲染:

把当前确认的版本渲染成 final.mp4。
渲染完成后检查文件是否存在、能否正常播放、声音是否完整、字幕是否错位。

预览页面能打开,只说明项目可以运行;真正完成的标志是 final.mp4 已经生成,并且你从头到尾看过一遍。

HyperFrames 和 Remotion 怎么选?

两者都可以把文字、声音、图片和时间轴做成视频,但工作方式不同:

工具更适合主要特点
HyperFrames内容驱动的视频、第一版、每期结构不同让 Codex 根据本期内容组织画面
Remotion固定栏目、批量更新、模板化生产先做模板,再填入每期内容

建议第一条视频先用 HyperFrames 跑通。连续做了几期,发现镜头结构、字幕样式和片头已经稳定,再让 Codex 把它整理成 Remotion 固定栏目。

Remotion 路线通常会使用:

/remotion-create   # 创建视频项目
/remotion-studio   # 打开预览
/remotion-render   # 渲染视频

上游的 narration.md、final.wav、字幕、时间轴和图片仍然可以复用,不需要重新制作一套素材。

真人口播:加入 video-use

前面的流程可以完全不出镜。等你愿意面对镜头时,可以把 narration.md 放在相机旁边,按段拍摄。说错后停一下,从当前句子重新说,不必每次从头开始。

video-use 处理的是已经拍好的素材。它的合理顺序是:

真人拍摄
  → 转写视频
  → 找出每段说了什么
  → 确认保留与删除内容
  → 整理有效片段
  → 字幕和补充画面
  → 成片

拍摄完成后,把原视频放进单独文件夹,再让 Codex 读取。不要让原始素材和渲染结果混在一起,否则后续很容易误删或覆盖。

真人口播和 HyperFrames 可以组合使用:video-use 先把真人素材剪顺,HyperFrames 再制作标题、步骤卡、截图演示和片头片尾。一个处理真人素材,一个处理信息画面,职责更清楚。

需要注意的是,视频转写服务、FFmpeg、模型文件和第三方 API 可能有额外依赖。安装前先确认环境要求;不要把 API key 写进文章、代码仓库或视频项目。任何声音复刻、真人素材处理和第三方上传,都要确认你拥有相应授权。

把一次制作变成可复用的内容系统

一条视频只能验证一次流程。更有价值的是把同一类问题持续做下去。

原帖使用“图书拆解”作为内容对象:一本书、一个值得讲的观点、一条短视频,然后继续用同样结构讲下一本书。你也可以选择:

  • 每周拆解一个 AI 工具;
  • 每次解决一个办公问题;
  • 每期解释一个行业案例;
  • 把一篇长文拆成一组短视频;
  • 记录一个产品从问题到交付的过程。

一个可复用的内容循环是:

选择固定主题
  → 建立文章或资料模板
  → 固定口播结构
  → 固定声音与字幕规范
  → 固定分镜文件格式
  → 固定渲染项目
  → 发布并记录反馈
  → 迭代下一期

获客钩子也应该落在具体结果上。“我用 AI 做了一条视频”只说明你会使用工具;“我把一篇 3000 字的工具测评做成一条 60 秒新手教程”才会让真正需要这件事的人停下来。

不要一开始就搭建庞大的自动化系统。先选一个你能连续讲十期的主题,跑通第一条;第二条复用文件结构;第三条开始保留固定片头和字幕样式。这样 Codex 才会从“帮你做过一条视频”,逐步变成“陪你持续生产一类内容”。

质量验收清单

内容

  • 开头几秒说明了结果、问题或冲突;
  • 口播内容没有明显重复和空泛背景;
  • 事实、数字、专有名词已人工核对;
  • 每段只承担一个清晰目的;
  • 结尾给出了下一步动作。

声音

  • 声音来源合法且获得必要授权;
  • 语速、停顿和情绪适合内容;
  • 英文、数字和专有名词读法正确;
  • 没有截断、爆音、明显噪声或不自然重复;
  • 使用声音复刻时,参考录音和参考文本完全一致。

画面

  • 画面跟随真实音频时间轴;
  • 字幕在手机尺寸下仍然清晰;
  • 字幕没有遮挡人物、界面或关键数据;
  • 画面解释了口播,而不是只增加装饰;
  • 截图、图片和图表没有被错误裁切;
  • 动效没有让观众错过操作步骤。

交付

  • final.mp4 已生成;
  • 能从头到尾播放;
  • 音频、字幕和画面没有明显错位;
  • 项目文件、中间产物和最终文件已分开保存;
  • 预览和渲染使用的是同一版本素材。

常见问题与恢复方法

口播听起来像文章

缩短句子,减少连续名词和书面排比。让 Codex 只做语言口语化,不要同时改动事实、结构和观点。修改后重新朗读一遍。

配音和字幕对不上

不要继续手动平均切分字幕。以最终音频为准重新转写,再检查难识别的专有名词和数字。只要音频改过,就应重新生成时间轴。

动效很多,但视频讲不清楚

先删掉装饰性动效,只保留能说明关系、顺序、位置或变化的画面。每个镜头都要回答“它帮助观众理解了哪句话”。

预览能打开,但成片不能交付

检查 final.mp4 是否真的生成、文件大小是否合理、播放器能否从头播放,以及渲染时使用的音频路径和字体是否存在。预览成功不等于导出成功。

工具安装失败

不要只复制最后一行错误。把完整日志留在 Codex 对话里,先确认 Node、Python、FFmpeg、模型文件和环境变量,再逐项修复。安装工具和开始做视频是两个不同问题,应分开验证。

一个可复用的总指令模板

我要把一篇文章或一个主题做成一条 [时长] 的 [横版/竖版] 视频。

目标观众:[描述观众]
发布平台:[平台]
视频目标:[观众看完后要做什么]
风格:[不出镜知识讲解/产品演示/真人口播]

请按以下阶段执行,并在每个阶段输出中间产物:
1. 读取 article.md 或主题,生成 narration.md;
2. 检查口播是否自然、事实是否需要核对;
3. 生成或读取 final.wav,不要在最终音频确定前做分镜;
4. 根据 final.wav 生成 subtitles.json,按真实语音切分;
5. 根据口播和字幕生成 storyboard.md;
6. 使用 HyperFrames 先实现前 15 秒并打开本地预览;
7. 根据具体反馈修改标题、字幕、截图和镜头节奏;
8. 我确认后渲染 final.mp4;
9. 检查视频能否完整播放、声音是否截断、字幕是否错位、素材是否裁切。

任何无法确认的事实、权限、依赖或失败原因,都单独列出,不要自行假设。

总结

Codex 视频工作流的核心不是“让 AI 一次生成完美视频”,而是把内容生产拆成可以观察和验收的阶段:口播先定稿,声音再定稿,时间轴跟随真实音频,分镜服务于口播,最后才进入渲染。

第一条视频应当追求可验证:有输入、有中间文件、有预览、有最终 mp4,并且从头到尾人工看过。等连续几期的内容结构稳定后,再考虑把 HyperFrames 迁移到 Remotion 模板,或加入真人口播、批量生产和固定栏目。

真正可持续的部分不是某个工具的按钮,而是你能否持续选择一个明确主题,把观点写清楚,把声音和画面对齐,用验收标准检查结果,再把成功的一期沉淀成下一期可以复用的结构。

来源说明

本文整理自 Miles Ma 的 X 帖子《Codex 实战系列|零剪辑自动生成爆款视频》,原帖页面显示发布时间为 2026 年 9 月 8 日。本文保留了原帖的工具链和实践顺序,并进行了结构化改写、补充验收标准与故障排查;其中工具能力、安装方式、服务可用性和第三方条款应以当前官方资料和实际环境为准。

Further Reading

相关指南

Codex CLI 文档