Codex 自动剪辑知识类视频:从 A/B-roll 到视觉编排表的完整工作流
本文根据 xilo 在 X 发布的长文《Codex剪辑第三弹:2条视频接下近四位数商单,知识类视频剪辑方法全公开》整理改写,原帖发布于 2026 年 8 月 22 日,后续有修改。文中配图来自原帖公开文章,并按原始顺序保留在站内。原作者分享的播放量、商单数量、工具体验和收益属于个人案例,不是 GPT88 或本文对结果的保证。
AI 视频剪辑最容易被误解成“把文案丢给 Agent,自动生成一条视频”。真正决定成片质量的,往往不是某一个模型,而是有没有提前把内容、声音、视觉类型、素材、时间轴和验收拆清楚。
xilo 的这篇长文提供了一套很有代表性的知识类视频方法:用 A-roll 承担人物表达和情绪,用 B-roll 承担知识解释和信息增量;先完成文案与配音,再生成毫秒级时间轴和视觉编排表,最后让 Codex 按镜头制作并渲染成片。
本文把这套方法整理成一份可以复用的工作流,并将其中的工具调用替换为 GPT88 可接入的模型/API 路线。重点不是复刻作者的账号结果,而是把“AI 自动剪辑”变成一个可以检查、修改和复用的生产系统。

一、为什么知识类视频适合做成 A-roll + B-roll
知识类视频同时有两种需求:观众需要感受到“有人在讲”,也需要看见抽象知识如何被解释。如果从头到尾只使用人物画面,信息密度不够;如果从头到尾只有图表、截图和文字,观看体验又容易变成一份会动的文档。
因此可以把画面分成两条并行轨道:
| 画面类型 | 主要任务 | 常见内容 |
|---|---|---|
| A-roll | 让观众感受到人物、语气和情绪 | 开场、过渡、观点、反应、场景化表达 |
| B-roll | 解释事实、概念和操作步骤 | 截图、录屏、流程图、对比表、纯文字金句 |
一个简单判断是:不包含具体知识增量、但必须说出来的内容,优先使用 A-roll;涉及步骤、概念、数字、工具界面或结构关系的内容,优先使用 B-roll。
两种画面交替还有一个工程价值:AI 不需要每一秒都从零设计镜头,只需要先判断当前段落属于 A-roll 还是 B-roll,再从对应模板和素材规则中生成。视觉决策空间变小,自动化的稳定性反而更高。

二、先确认内容目标,再谈商单和流量
原作者把“为什么能接到商单”放在文章前面,给出的核心判断是:知识类教程既能通过视觉差异化吸引观看,也能自然承载工具产品。用户为了完成教程里的动作,通常会实际使用被介绍的工具,因此内容和转化之间存在比较直接的联系。
这条经验可以转成一个更稳妥的内容判断表:
| 判断项 | 需要回答的问题 |
|---|---|
| 视觉差异 | 观众为什么愿意停留,而不是划走? |
| 内容价值 | 看完后,观众能完成什么具体动作? |
| 产品关系 | 产品是否真的出现在完成任务的关键路径上? |
| 交付边界 | 哪些是演示,哪些是可复现的真实能力? |
| 证据 | 播放量、转化、商单和成本是否有记录? |
不要把“AI 生成视频”本身当成内容价值。工具只解决生产效率,观众仍然需要一个明确问题、可理解的解释和能够复现的步骤。品牌植入也应该服务于教程,不要把未验证的模型能力、价格或收益写成广告承诺。
三、完整流程:从文案到成片
推荐把整个任务拆成四个阶段:
文案与配音
→ 音频分析与时间轴
→ 视觉编排表
→ A/B-roll 逐镜头制作与验收
每个阶段都要留下中间产物。这样当最终视频出现错位、节奏拖沓或角色漂移时,可以定位是文案、语音、编排还是渲染环节的问题,而不是反复重做整条视频。
四、第一步:准备文案与整段配音
文案不一定由 Codex 生成。可以先用适合写作的模型完成资料整理、结构设计和事实核验,再将定稿文案交给剪辑 Agent。对 GPT88 用户来说,文案模型可以按任务从当前模型目录中选择,但不要把某个固定模型名写死在生产脚本里;先调用 GET /v1/models 确认当前可用 ID。
配音阶段有一个很实用的规则:整段合成,而不是每句话单独合成后再拼接。逐句合成容易产生音量、音色、停顿和语气不一致,后续音画对齐也会变得复杂。
输入给配音工具的任务应包含:
- 完整定稿文案;
- 角色或声音设定;
- 语速和情绪;
- 专有名词的读法;
- 是否需要保留段落停顿;
- 输出格式和采样率。
如果要使用 GPT88 的语音或多模态路线,先确认当前 API 是否提供对应模型和接口,不要因为某个 ChatGPT 或第三方客户端有语音入口,就推断 GPT88 API 一定支持同样的参数。
五、第二步:生成毫秒级音频时间轴
配音文件只是声音产物,自动剪辑还需要知道每一段话在什么时候发生。将音频重新解析后,生成类似下面的时间轴:
[0000ms-1249ms] 今天我们来聊聊 AI 自动剪辑
[1249ms-3580ms] 知识类视频最重要的不是镜头数量
[3580ms-6120ms] 而是让声音、画面和信息结构对齐
这份时间轴是后续所有视觉决策的共同时间基准:镜头从哪里开始、持续多久、字幕何时出现、B-roll 何时切入,都应从它计算,而不是靠肉眼猜测。
至少要检查:
- 首句是否从 0ms 附近开始;
- 段落之间的停顿是否被保留;
- 时间戳是否单调递增且没有重叠;
- 末段时间是否覆盖完整音频;
- 数字、英文模型名和专有名词是否被正确识别。
音频时间轴可以保存为 JSON,方便后续脚本读取:
{
"audio": "narration.wav",
"segments": [
{ "startMs": 0, "endMs": 1249, "text": "今天我们来聊聊 AI 自动剪辑" },
{ "startMs": 1249, "endMs": 3580, "text": "知识类视频最重要的不是镜头数量" }
]
}
六、第三步:视觉编排表就是剧本 + 分镜
视觉编排表不要只写“这里放一张图”。它应该让剪辑 Agent 能够回答:这个片段使用 A-roll 还是 B-roll?画面里有什么?从哪张素材开始?字幕如何出现?和前一个镜头怎么衔接?
一个可执行的字段集合如下:
| 字段 | 示例 |
|---|---|
segment | s03 |
startMs / endMs | 3580 / 6120 |
roll | A 或 B |
visualType | host, screenshot, diagram, quote |
visualBrief | 三步流程图,突出 API、模型和日志 |
asset | 本地截图路径或生成任务 ID |
motion | 左侧进入、节点依次亮起 |
caption | 画面中必须出现的准确文字 |
transition | cut / dissolve / match |
acceptance | 文字无错、时长覆盖、颜色符合品牌 |
视觉编排完成后,不要直接开始全片渲染。先做一次人工审查,主要看两个问题:A-roll 和 B-roll 是否自然交替;同一种 A-roll/B-roll 是否连续重复太久。节奏检查越早做,返工成本越低。

七、A-roll:角色一致性和表达视角
A-roll 的作用是场景化表达。它可以是一个 IP 小人、虚拟主持人、真人头像或产品角色,重点是让观众感觉“有人在和我说话”。
1. 角色参考包不要只有一张图
单张参考图不能稳定约束角色的体型、五官、年龄、笔触和服装。更可靠的参考包至少包括:
- 三视图:正面、侧面、背面或多个角度;
- 局部细节图:线条粗细、上色方式、纹理和材质;
- 场景图:背景、空间和整体画面风格;
- 品牌规范:主色、字体、禁用元素和 Logo 使用方式。

提示词里还要写出必须保持的条件,例如角色身高比例、头身比、发型、服装颜色和画面风格。每次生成后都要做角色验收,不能因为某一张看起来“差不多”就默认后续镜头会一致。
2. 用多种表达视角防止视觉疲劳
A-roll 不应从头到尾都是角色站在画面中央讲话。可以轮换:
- 主持人视角:正对镜头,用于开场、章节和总结;
- 主角视角:角色在场景中做动作、表达情绪或操作工具;
- 配角视角:从旁观者或另一个角色的角度补充信息;
- 第一人称视角:直接展示角色所看到的屏幕或环境。
视角变化不等于无意义地切镜头。每次变化都应服务于语气、信息或情绪,否则只是增加渲染成本。

八、B-roll:按素材类型决定制作方式
B-roll 可以进一步分成三类:
- 有素材型:已有产品截图、后台录屏、聊天记录或真实照片;
- 无素材型:没有现成素材,需要用图形、流程、卡片和动效表达;
- 纯文字型:章节标题、关键句、结论或短提示。
有素材型首先要注意授权、隐私和脱敏,尤其是客户后台、订单、邮箱、API Key 和用户数据。无素材型要让图形表达真实关系,不要用漂亮但含义不清的装饰。纯文字型则应控制字数、层级和停留时间,保证观众读得完。

九、素材库:把重复工作变成可复用资产
知识类视频里有很多结构会重复出现:三步流程、方案对比、时间线、清单、标签卡、指标卡和章节过渡。不要每次让 Agent 从零设计,建议先建立本地素材库。
每种常用结构准备两到三个模板就够了。模板应把以下内容参数化:
- 画布尺寸和安全区;
- 品牌颜色和字体;
- 标题、正文和标签的最大字数;
- 元素间距与对齐方式;
- 动画时长和入场方向;
- 可替换的图标、截图和数据字段。
本地模板的优势是风格一致、修改快、可回滚。开源素材库的优势是探索成本低,但使用前必须核对许可证、署名要求、字体授权和是否允许商业用途。不要只因为代码公开就默认所有素材都可以直接商用。
十、HyperFrames 与 Remotion:选择适合的渲染层
原帖以 HyperFrames 为主要动效工具,也提到 Remotion。可以这样理解两者的取舍:
| 工具方向 | 更适合 | 注意事项 |
|---|---|---|
| HyperFrames | 追求设计感、快速组合镜头、让 Agent 生成复杂动效 | 需要验证插件版本、素材路径和渲染结果 |
| Remotion | 需要帧级控制、React 组件化和成熟模板 | 需要更明确的工程结构和时间计算 |
两者都不是“自动保证成片质量”的按钮。无论用哪个渲染层,都要先生成一小段样片,检查文字、动画、音画、字体、图片路径和导出格式,再扩展到全片。

十一、GPT88 在这套流程中适合放在哪里
GPT88 更适合承担模型接入和任务调度的一层,而不是替代所有剪辑软件。一个稳妥的分工是:
GPT88 API
├─ 文案改写、标题和镜头摘要
├─ 图像/视觉素材生成
├─ 时间轴和视觉编排结构化
└─ 质检清单与失败重试建议
本地工作流
├─ 语音合成与音频分析
├─ HyperFrames / Remotion 渲染
├─ 字幕烧录与音视频合并
└─ 最终文件检查
如果要让 Codex 或其他 Agent 通过 GPT88 调用模型,优先使用 OpenAI 兼容接口,且把凭据放在环境变量里:
export GPT88_API_KEY='在本机安全环境中设置'
curl https://api.gpt88.cc/v1/models \
-H "Authorization: Bearer $GPT88_API_KEY"
模型目录是动态的。脚本应先获取可用模型,再根据任务选择文本、图片或其他能力;不要把不存在的模型 ID、固定价格或某个账号的权限写死。对批量生成还要增加预算上限、请求 ID、重试次数、超时和失败日志。
十二、样片优先:先做 1 分钟,再做完整视频
完整视频最贵的不是第一次生成,而是发现方向不对之后的整片返工。建议先制作约 1 分钟样片,覆盖至少:
- 一个开场 A-roll;
- 一个知识解释 B-roll;
- 一次画面切换;
- 一段字幕和关键文字;
- 一个角色动作或视角变化;
- 一段背景音乐或音效;
- 一个完整的结尾。
样片验收表:
| 检查项 | 通过条件 |
|---|---|
| 音画同步 | 说到关键词时画面和字幕同步进入 |
| 节奏 | 不连续堆叠同一种镜头,停顿自然 |
| 角色一致 | 体型、五官、笔触、服装和颜色稳定 |
| 文字准确 | 模型名、价格、日期和品牌名逐字正确 |
| 信息可读 | 手机尺寸下能读清标题、标签和流程 |
| 品牌一致 | 颜色、字体、Logo 和语气统一 |
| 文件可交付 | 分辨率、帧率、音频、码率和封装正确 |
样片通过后,再让 Agent 按相同规则制作全片。每次只修改一个变量,并保留版本号和渲染日志,方便回退。

十三、声音、BGM 和音效是最后一层完成度
当画面和配音完成后,视频仍可能显得单调。可以加入适配内容的 BGM 和少量音效,但要控制数量和音量:
- BGM 不应盖住人声;
- 节奏应配合 A/B-roll 的变化,而不是强行追求热闹;
- 关键转场、按钮点击、卡片出现可以使用短音效;
- 不要每个动作都加声音,否则信息层级会被噪声打散;
- 使用音乐前确认版权和商业使用许可。
AI 生成音乐或音效也要保留来源、授权条款和生成记录。平台能否识别、客户能否商用,不能只根据“AI 生成”四个字判断。
十四、适合做成 Skill 的部分
如果这套工作流要反复使用,可以把稳定规则封装成 Skill,但不要把全部知识塞进一个超长提示词。入口只需要说明触发条件、输入输出和关键边界,具体模板、参考图、脚本和验收表按需加载。
建议的目录结构:
skills/video-editing/
├── SKILL.md
├── references/
│ ├── a-roll-b-roll.md
│ ├── visual-plan-schema.md
│ └── quality-checklist.md
├── templates/
│ ├── timeline.json
│ └── storyboard.md
└── scripts/
├── validate-timeline.mjs
└── render-preview.mjs
SKILL.md 应明确:什么时候使用;需要哪些输入;会产出哪些文件;如果音频、素材或权限不完整,何时停止;不应执行哪些外部发布和高风险操作。确定性动作交给脚本,视觉判断和内容取舍保留给 Agent 与人工审核。
十五、从剪辑效率到商业交付
原帖提到作者通过少量视频获得平台收益、商单和创作邀约。这类案例更值得学习的部分,不是某个确定金额,而是内容生产和商业交付之间的连接:
- 先建立清晰的视觉识别,而不是只追热点;
- 用教程解决具体问题,让产品植入有真实使用场景;
- 用素材库和模板控制交付成本;
- 用样片和验收表减少客户反复修改;
- 记录每条视频的脚本、模型、渲染时间、人工时间和实际成本。
客户购买的是按时交付、风格一致、信息准确的视频,不是“调用了哪个模型”。因此报价时应按脚本长度、镜头数量、素材准备、配音、修改轮次、交付格式和授权范围拆分,而不是只报一个“AI 剪辑价格”。
十六、常见失败与排查顺序
| 问题 | 优先检查 |
|---|---|
| 声音和画面错位 | 时间轴起止、采样率、音频时长和帧率换算 |
| 角色每个镜头都不一样 | 参考包、角色约束、固定种子/参数能力和人工筛选 |
| B-roll 看起来漂亮但说不清 | 是否表达了真实信息关系,是否只是装饰 |
| 字幕错字或模型名错误 | 原始文案锁定、字幕导出后逐字核对 |
| 渲染中断 | 资源路径、依赖版本、内存、超时和单镜头重跑 |
| GPT88 请求失败 | GET /v1/models、Base URL、Key、模型 ID、请求 ID |
| 成本不可控 | 单镜头预算、最大重试、批量上限和失败计费记录 |
| 客户不断改方向 | 先做样片确认视觉系统,再进行全片制作 |
写在最后
Codex 自动剪辑真正可复用的核心,不是“一键生成视频”,而是把视频拆成可验证的中间产物:定稿文案、整段配音、毫秒级时间轴、视觉编排表、A/B-roll 素材和 1 分钟样片。
当这些中间产物清楚之后,Agent 才能稳定执行;当每一步都有验收条件之后,自动化才不会变成“生成一条看起来很像视频的文件”。GPT88 可以作为其中的模型接入层,负责文本、视觉素材和结构化任务,但真实交付仍需要本地渲染、版权核验、人工质检和版本管理。
原帖配图
以下图片按原帖公开文章顺序保留。图片版权和原始配图归原作者及相应权利人所有,本文仅用于来源整理与上下文参考。
