返回博客

Codex 自动剪辑知识类视频:从 A/B-roll 到视觉编排表的完整工作流

开发工具2026-09-15约 20 分钟CodexAI视频剪辑A-rollB-rollHyperFramesRemotionGPT88内容创作

本文根据 xilo 在 X 发布的长文《Codex剪辑第三弹:2条视频接下近四位数商单,知识类视频剪辑方法全公开》整理改写,原帖发布于 2026 年 8 月 22 日,后续有修改。文中配图来自原帖公开文章,并按原始顺序保留在站内。原作者分享的播放量、商单数量、工具体验和收益属于个人案例,不是 GPT88 或本文对结果的保证。

AI 视频剪辑最容易被误解成“把文案丢给 Agent,自动生成一条视频”。真正决定成片质量的,往往不是某一个模型,而是有没有提前把内容、声音、视觉类型、素材、时间轴和验收拆清楚。

xilo 的这篇长文提供了一套很有代表性的知识类视频方法:用 A-roll 承担人物表达和情绪,用 B-roll 承担知识解释和信息增量;先完成文案与配音,再生成毫秒级时间轴和视觉编排表,最后让 Codex 按镜头制作并渲染成片。

本文把这套方法整理成一份可以复用的工作流,并将其中的工具调用替换为 GPT88 可接入的模型/API 路线。重点不是复刻作者的账号结果,而是把“AI 自动剪辑”变成一个可以检查、修改和复用的生产系统。

原帖封面:Codex 剪辑第三弹

一、为什么知识类视频适合做成 A-roll + B-roll

知识类视频同时有两种需求:观众需要感受到“有人在讲”,也需要看见抽象知识如何被解释。如果从头到尾只使用人物画面,信息密度不够;如果从头到尾只有图表、截图和文字,观看体验又容易变成一份会动的文档。

因此可以把画面分成两条并行轨道:

画面类型主要任务常见内容
A-roll让观众感受到人物、语气和情绪开场、过渡、观点、反应、场景化表达
B-roll解释事实、概念和操作步骤截图、录屏、流程图、对比表、纯文字金句

一个简单判断是:不包含具体知识增量、但必须说出来的内容,优先使用 A-roll;涉及步骤、概念、数字、工具界面或结构关系的内容,优先使用 B-roll。

两种画面交替还有一个工程价值:AI 不需要每一秒都从零设计镜头,只需要先判断当前段落属于 A-roll 还是 B-roll,再从对应模板和素材规则中生成。视觉决策空间变小,自动化的稳定性反而更高。

A-roll 与 B-roll 的画面拆分示例

二、先确认内容目标,再谈商单和流量

原作者把“为什么能接到商单”放在文章前面,给出的核心判断是:知识类教程既能通过视觉差异化吸引观看,也能自然承载工具产品。用户为了完成教程里的动作,通常会实际使用被介绍的工具,因此内容和转化之间存在比较直接的联系。

这条经验可以转成一个更稳妥的内容判断表:

判断项需要回答的问题
视觉差异观众为什么愿意停留,而不是划走?
内容价值看完后,观众能完成什么具体动作?
产品关系产品是否真的出现在完成任务的关键路径上?
交付边界哪些是演示,哪些是可复现的真实能力?
证据播放量、转化、商单和成本是否有记录?

不要把“AI 生成视频”本身当成内容价值。工具只解决生产效率,观众仍然需要一个明确问题、可理解的解释和能够复现的步骤。品牌植入也应该服务于教程,不要把未验证的模型能力、价格或收益写成广告承诺。

三、完整流程:从文案到成片

推荐把整个任务拆成四个阶段:

文案与配音
  → 音频分析与时间轴
  → 视觉编排表
  → A/B-roll 逐镜头制作与验收

每个阶段都要留下中间产物。这样当最终视频出现错位、节奏拖沓或角色漂移时,可以定位是文案、语音、编排还是渲染环节的问题,而不是反复重做整条视频。

四、第一步:准备文案与整段配音

文案不一定由 Codex 生成。可以先用适合写作的模型完成资料整理、结构设计和事实核验,再将定稿文案交给剪辑 Agent。对 GPT88 用户来说,文案模型可以按任务从当前模型目录中选择,但不要把某个固定模型名写死在生产脚本里;先调用 GET /v1/models 确认当前可用 ID。

配音阶段有一个很实用的规则:整段合成,而不是每句话单独合成后再拼接。逐句合成容易产生音量、音色、停顿和语气不一致,后续音画对齐也会变得复杂。

输入给配音工具的任务应包含:

  • 完整定稿文案;
  • 角色或声音设定;
  • 语速和情绪;
  • 专有名词的读法;
  • 是否需要保留段落停顿;
  • 输出格式和采样率。

如果要使用 GPT88 的语音或多模态路线,先确认当前 API 是否提供对应模型和接口,不要因为某个 ChatGPT 或第三方客户端有语音入口,就推断 GPT88 API 一定支持同样的参数。

五、第二步:生成毫秒级音频时间轴

配音文件只是声音产物,自动剪辑还需要知道每一段话在什么时候发生。将音频重新解析后,生成类似下面的时间轴:

[0000ms-1249ms] 今天我们来聊聊 AI 自动剪辑
[1249ms-3580ms] 知识类视频最重要的不是镜头数量
[3580ms-6120ms] 而是让声音、画面和信息结构对齐

这份时间轴是后续所有视觉决策的共同时间基准:镜头从哪里开始、持续多久、字幕何时出现、B-roll 何时切入,都应从它计算,而不是靠肉眼猜测。

至少要检查:

  1. 首句是否从 0ms 附近开始;
  2. 段落之间的停顿是否被保留;
  3. 时间戳是否单调递增且没有重叠;
  4. 末段时间是否覆盖完整音频;
  5. 数字、英文模型名和专有名词是否被正确识别。

音频时间轴可以保存为 JSON,方便后续脚本读取:

{
  "audio": "narration.wav",
  "segments": [
    { "startMs": 0, "endMs": 1249, "text": "今天我们来聊聊 AI 自动剪辑" },
    { "startMs": 1249, "endMs": 3580, "text": "知识类视频最重要的不是镜头数量" }
  ]
}

六、第三步:视觉编排表就是剧本 + 分镜

视觉编排表不要只写“这里放一张图”。它应该让剪辑 Agent 能够回答:这个片段使用 A-roll 还是 B-roll?画面里有什么?从哪张素材开始?字幕如何出现?和前一个镜头怎么衔接?

一个可执行的字段集合如下:

字段示例
segments03
startMs / endMs3580 / 6120
rollA 或 B
visualTypehost, screenshot, diagram, quote
visualBrief三步流程图,突出 API、模型和日志
asset本地截图路径或生成任务 ID
motion左侧进入、节点依次亮起
caption画面中必须出现的准确文字
transitioncut / dissolve / match
acceptance文字无错、时长覆盖、颜色符合品牌

视觉编排完成后,不要直接开始全片渲染。先做一次人工审查,主要看两个问题:A-roll 和 B-roll 是否自然交替;同一种 A-roll/B-roll 是否连续重复太久。节奏检查越早做,返工成本越低。

视觉编排与镜头拆分示例

七、A-roll:角色一致性和表达视角

A-roll 的作用是场景化表达。它可以是一个 IP 小人、虚拟主持人、真人头像或产品角色,重点是让观众感觉“有人在和我说话”。

1. 角色参考包不要只有一张图

单张参考图不能稳定约束角色的体型、五官、年龄、笔触和服装。更可靠的参考包至少包括:

  • 三视图:正面、侧面、背面或多个角度;
  • 局部细节图:线条粗细、上色方式、纹理和材质;
  • 场景图:背景、空间和整体画面风格;
  • 品牌规范:主色、字体、禁用元素和 Logo 使用方式。

角色三视图和细节参考

提示词里还要写出必须保持的条件,例如角色身高比例、头身比、发型、服装颜色和画面风格。每次生成后都要做角色验收,不能因为某一张看起来“差不多”就默认后续镜头会一致。

2. 用多种表达视角防止视觉疲劳

A-roll 不应从头到尾都是角色站在画面中央讲话。可以轮换:

  • 主持人视角:正对镜头,用于开场、章节和总结;
  • 主角视角:角色在场景中做动作、表达情绪或操作工具;
  • 配角视角:从旁观者或另一个角色的角度补充信息;
  • 第一人称视角:直接展示角色所看到的屏幕或环境。

视角变化不等于无意义地切镜头。每次变化都应服务于语气、信息或情绪,否则只是增加渲染成本。

A-roll 多视角镜头示例

八、B-roll:按素材类型决定制作方式

B-roll 可以进一步分成三类:

  1. 有素材型:已有产品截图、后台录屏、聊天记录或真实照片;
  2. 无素材型:没有现成素材,需要用图形、流程、卡片和动效表达;
  3. 纯文字型:章节标题、关键句、结论或短提示。

有素材型首先要注意授权、隐私和脱敏,尤其是客户后台、订单、邮箱、API Key 和用户数据。无素材型要让图形表达真实关系,不要用漂亮但含义不清的装饰。纯文字型则应控制字数、层级和停留时间,保证观众读得完。

B-roll 素材类型和画面示例

九、素材库:把重复工作变成可复用资产

知识类视频里有很多结构会重复出现:三步流程、方案对比、时间线、清单、标签卡、指标卡和章节过渡。不要每次让 Agent 从零设计,建议先建立本地素材库。

每种常用结构准备两到三个模板就够了。模板应把以下内容参数化:

  • 画布尺寸和安全区;
  • 品牌颜色和字体;
  • 标题、正文和标签的最大字数;
  • 元素间距与对齐方式;
  • 动画时长和入场方向;
  • 可替换的图标、截图和数据字段。

本地模板的优势是风格一致、修改快、可回滚。开源素材库的优势是探索成本低,但使用前必须核对许可证、署名要求、字体授权和是否允许商业用途。不要只因为代码公开就默认所有素材都可以直接商用。

十、HyperFrames 与 Remotion:选择适合的渲染层

原帖以 HyperFrames 为主要动效工具,也提到 Remotion。可以这样理解两者的取舍:

工具方向更适合注意事项
HyperFrames追求设计感、快速组合镜头、让 Agent 生成复杂动效需要验证插件版本、素材路径和渲染结果
Remotion需要帧级控制、React 组件化和成熟模板需要更明确的工程结构和时间计算

两者都不是“自动保证成片质量”的按钮。无论用哪个渲染层,都要先生成一小段样片,检查文字、动画、音画、字体、图片路径和导出格式,再扩展到全片。

动效模板和镜头结构示例

十一、GPT88 在这套流程中适合放在哪里

GPT88 更适合承担模型接入和任务调度的一层,而不是替代所有剪辑软件。一个稳妥的分工是:

GPT88 API
  ├─ 文案改写、标题和镜头摘要
  ├─ 图像/视觉素材生成
  ├─ 时间轴和视觉编排结构化
  └─ 质检清单与失败重试建议

本地工作流
  ├─ 语音合成与音频分析
  ├─ HyperFrames / Remotion 渲染
  ├─ 字幕烧录与音视频合并
  └─ 最终文件检查

如果要让 Codex 或其他 Agent 通过 GPT88 调用模型,优先使用 OpenAI 兼容接口,且把凭据放在环境变量里:

export GPT88_API_KEY='在本机安全环境中设置'
curl https://api.gpt88.cc/v1/models \
  -H "Authorization: Bearer $GPT88_API_KEY"

模型目录是动态的。脚本应先获取可用模型,再根据任务选择文本、图片或其他能力;不要把不存在的模型 ID、固定价格或某个账号的权限写死。对批量生成还要增加预算上限、请求 ID、重试次数、超时和失败日志。

十二、样片优先:先做 1 分钟,再做完整视频

完整视频最贵的不是第一次生成,而是发现方向不对之后的整片返工。建议先制作约 1 分钟样片,覆盖至少:

  • 一个开场 A-roll;
  • 一个知识解释 B-roll;
  • 一次画面切换;
  • 一段字幕和关键文字;
  • 一个角色动作或视角变化;
  • 一段背景音乐或音效;
  • 一个完整的结尾。

样片验收表:

检查项通过条件
音画同步说到关键词时画面和字幕同步进入
节奏不连续堆叠同一种镜头,停顿自然
角色一致体型、五官、笔触、服装和颜色稳定
文字准确模型名、价格、日期和品牌名逐字正确
信息可读手机尺寸下能读清标题、标签和流程
品牌一致颜色、字体、Logo 和语气统一
文件可交付分辨率、帧率、音频、码率和封装正确

样片通过后,再让 Agent 按相同规则制作全片。每次只修改一个变量,并保留版本号和渲染日志,方便回退。

样片到成片的验收流程示例

十三、声音、BGM 和音效是最后一层完成度

当画面和配音完成后,视频仍可能显得单调。可以加入适配内容的 BGM 和少量音效,但要控制数量和音量:

  • BGM 不应盖住人声;
  • 节奏应配合 A/B-roll 的变化,而不是强行追求热闹;
  • 关键转场、按钮点击、卡片出现可以使用短音效;
  • 不要每个动作都加声音,否则信息层级会被噪声打散;
  • 使用音乐前确认版权和商业使用许可。

AI 生成音乐或音效也要保留来源、授权条款和生成记录。平台能否识别、客户能否商用,不能只根据“AI 生成”四个字判断。

十四、适合做成 Skill 的部分

如果这套工作流要反复使用,可以把稳定规则封装成 Skill,但不要把全部知识塞进一个超长提示词。入口只需要说明触发条件、输入输出和关键边界,具体模板、参考图、脚本和验收表按需加载。

建议的目录结构:

skills/video-editing/
├── SKILL.md
├── references/
│   ├── a-roll-b-roll.md
│   ├── visual-plan-schema.md
│   └── quality-checklist.md
├── templates/
│   ├── timeline.json
│   └── storyboard.md
└── scripts/
    ├── validate-timeline.mjs
    └── render-preview.mjs

SKILL.md 应明确:什么时候使用;需要哪些输入;会产出哪些文件;如果音频、素材或权限不完整,何时停止;不应执行哪些外部发布和高风险操作。确定性动作交给脚本,视觉判断和内容取舍保留给 Agent 与人工审核。

十五、从剪辑效率到商业交付

原帖提到作者通过少量视频获得平台收益、商单和创作邀约。这类案例更值得学习的部分,不是某个确定金额,而是内容生产和商业交付之间的连接:

  1. 先建立清晰的视觉识别,而不是只追热点;
  2. 用教程解决具体问题,让产品植入有真实使用场景;
  3. 用素材库和模板控制交付成本;
  4. 用样片和验收表减少客户反复修改;
  5. 记录每条视频的脚本、模型、渲染时间、人工时间和实际成本。

客户购买的是按时交付、风格一致、信息准确的视频,不是“调用了哪个模型”。因此报价时应按脚本长度、镜头数量、素材准备、配音、修改轮次、交付格式和授权范围拆分,而不是只报一个“AI 剪辑价格”。

十六、常见失败与排查顺序

问题优先检查
声音和画面错位时间轴起止、采样率、音频时长和帧率换算
角色每个镜头都不一样参考包、角色约束、固定种子/参数能力和人工筛选
B-roll 看起来漂亮但说不清是否表达了真实信息关系,是否只是装饰
字幕错字或模型名错误原始文案锁定、字幕导出后逐字核对
渲染中断资源路径、依赖版本、内存、超时和单镜头重跑
GPT88 请求失败GET /v1/models、Base URL、Key、模型 ID、请求 ID
成本不可控单镜头预算、最大重试、批量上限和失败计费记录
客户不断改方向先做样片确认视觉系统,再进行全片制作

写在最后

Codex 自动剪辑真正可复用的核心,不是“一键生成视频”,而是把视频拆成可验证的中间产物:定稿文案、整段配音、毫秒级时间轴、视觉编排表、A/B-roll 素材和 1 分钟样片。

当这些中间产物清楚之后,Agent 才能稳定执行;当每一步都有验收条件之后,自动化才不会变成“生成一条看起来很像视频的文件”。GPT88 可以作为其中的模型接入层,负责文本、视觉素材和结构化任务,但真实交付仍需要本地渲染、版权核验、人工质检和版本管理。

来源:X 原帖 · 作者主页

原帖配图

以下图片按原帖公开文章顺序保留。图片版权和原始配图归原作者及相应权利人所有,本文仅用于来源整理与上下文参考。

原帖配图 1 原帖配图 2 原帖配图 3 原帖配图 4 原帖配图 5 原帖配图 6 原帖配图 7 原帖配图 8 原帖配图 9 原帖配图 10 原帖配图 11 原帖配图 12 原帖配图 13 原帖配图 14 原帖配图 15 原帖配图 16