---
title: "用 Codex 做视频：从脚本到成片的 7 步开源工作流"
slug: "codex-ai-video-workflow"
kind: "runbook"
version: "1.0"
status: "reviewed"
compatibility: "Codex；Node.js 22+；FFmpeg；HyperFrames；VideoSpec；SmartSub（Windows、macOS 或 Linux）。"
risk_level: "medium"
requires_approval: true
updated_at: "2026-09-12T17:07:52.499Z"
verified_at: ""
source: "https://blog.atlankj.com/posts/codex-ai-video-workflow"
---

# 目标

使用 Codex、VideoSpec、HyperFrames 和 SmartSub，将一个明确的视频主题制作成带配音和字幕的 16:9 MP4 教程视频。

# 前置条件

- Codex 可用。
- Node.js 22+ 与 FFmpeg。
- 已安装 HyperFrames 技能，并在项目中初始化 VideoSpec。
- 已安装 SmartSub。
- 用户已经给出主题、受众、时长、画面比例和必须包含的信息。

# 输入

- 视频主题、受众、时长与比例。
- 已批准的 brief、script、storyboard 和 materials。
- 最终配音文件 voice.mp3。
- 已校对字幕 captions.srt。

# 约束

- brief、storyboard 和最终预览必须由用户明确批准。
- 未获批准前不渲染最终成片，不执行对外发布。
- API Key 只能从环境变量读取，不得出现在代码、日志、截图或视频中。
- 只使用已确认授权的素材、音乐、字体和 TTS 音色。
- 标签、卡片、示意图和素材不得早于对应口播或字幕出现。

# 操作步骤

## 1. 初始化

~~~bash
npx hyperframes skills update
npx videospec-workflow@latest init
~~~

## 2. 建立制作方案

使用 VideoSpec 生成 proposal、brief、script、storyboard、materials 和 tasks，展示给用户并等待批准。

## 3. 生成配音

将批准后的 script 整理为纯 TTS 文本。若使用云端服务，只从环境变量读取凭据。输出 voice.mp3，并检查发音、语速和停顿。

## 4. 生成字幕

在 SmartSub 中导入 voice.mp3，完成转写、逐句校对和时间轴检查，导出 captions.srt。

## 5. 制作视频

使用 HyperFrames 按 storyboard 创建场景，加入 voice.mp3 和 captions.srt。运行 lint 与 check，全部通过后打开预览。

## 6. 修改与验证

根据用户提供的具体时间点反馈修改画面和节奏。逐场检查口播、字幕、标签、卡片与素材的同步关系。

## 7. 渲染与交付

只有用户批准预览后才渲染最终 MP4。检查分辨率、时长、编码、音轨和字幕，并生成标题、简介、封面文案与发布检查清单。

# 输出结果

- VideoSpec 制作文件与审批记录。
- HyperFrames 可复现工程。
- voice.mp3、captions.srt 和最终 MP4。
- 标题、简介、封面文案和发布检查清单。

# 验证方法

- VideoSpec 结构检查通过且审批有效。
- HyperFrames lint 与 check 通过。
- 完整播放成片并核对字幕、声音、画面和动画时序。
- 人工检查事实、版权、隐私、TTS 授权和平台规范。

# 异常处理

- TTS 发音错误：修改朗读文本，只重做受影响片段。
- 字幕错误：在 SmartSub 校对后重新导出。
- 画面错位：更新时间线后重新预览和验证。
- 检查失败：修复全部 lint/check 错误后再渲染。

# 回滚方式

- 保留已批准的 VideoSpec 文件和上一个可用渲染版本。
- 新预览使用版本号，不覆盖已确认的成片。
- 新版本异常时恢复上一版工程和素材引用，再重新验证。
