把中文文案、旁白或 SRT 字幕,转换成可实际制作的 VOX 风格解释型视频方案。
vox-video-creator 是一个面向 Codex 和兼容 Agent Skills 运行时的创作技能。它负责从叙事逻辑出发,建立视觉命题、纸张拼贴分镜、静帧提示词、Google Flow 图生视频提示词和连续性检查。
它不是一个“套滤镜”的视频模板,也不会把旁白逐字翻译成 PPT 页面。核心目标是让每个镜头都形成一个不用旁白也能读懂的视觉关系。
Note
本项目描述的是一种编辑式解释视频方法,与 Vox Media 没有隶属、授权或官方合作关系。
- 按语义与时间码拆分解释型视频镜头
- 提取核心冲突关键词、情绪和视觉引力
- 把债务、风险、权利、制度等抽象概念转换成可运动的物理隐喻
- 设计半调照片、撕纸、卡纸、印章、合同和纸层视差组成的编辑式拼贴画面
- 区分首帧、尾帧、人物参考图、空间参考图和插入图的职责
- 为 Google Flow / Gemini 图生视频生成单动作、可执行的镜头提示词
- 检查人物身份、物件数量、动作因果、首尾帧和跨镜连续性
- 保留失败复盘与素材复用规则,逐步形成可复利的视觉资产库
flowchart LR
A["文案 / 旁白 / SRT"] --> B["语义拆镜"]
B --> C["每镜可见结论"]
C --> D["视觉隐喻与颜色"]
D --> E["首帧 / 尾帧 / 参考图"]
E --> F["Google Flow 动作提示词"]
F --> G["逐帧 QA 与连续性检查"]
G --> H["剪辑对齐旁白与字幕"]
技能的默认交付顺序:
- 全片叙事结构与视觉母题
- 逐镜头分镜表
- 每镜静帧生成提示词
- 每镜视频动作提示词
- 可复用素材清单
- 连贯性、模型风险与返工检查
在 Codex 中使用 skill-installer,并提供这个技能目录:
https://github.com/zhanghuadong199-pixel/vox-video-creator/tree/main/skills/vox-video-creator
克隆仓库:
git clone https://github.com/zhanghuadong199-pixel/vox-video-creator.git将下面的完整目录复制到个人技能目录:
skills/vox-video-creator
Codex 默认位置:
$CODEX_HOME/skills/vox-video-creator
兼容 Agent Skills 的跨运行时位置:
~/.agents/skills/vox-video-creator
重新打开任务后即可触发。
明确调用:
Use $vox-video-creator to turn this SRT into a 16:9 VOX paper-collage storyboard and Google Flow prompts.
也可以自然表达:
把这份中文口播稿做成 VOX 风格解释视频。
先给我核心冲突、视觉隐喻、逐镜头分镜、静帧提示词和 Flow 视频提示词。
画幅 16:9,每个镜头只保留一个主要动作。
适合的输入:
- 中文文案或文章
- 配音稿、逐字稿
.srt字幕文件- 已确定时长与画幅的短视频方案
- 希望转换成 VOX / 纸张拼贴解释视频的选题
| 输入 | 作用 |
|---|---|
| 文案、旁白或 SRT | 决定叙事顺序、镜头覆盖和时长 |
| 画幅、分辨率、帧率 | 决定分镜构图与生成规格 |
| 参考视频或图片 | 锁定风格、人物、空间或镜头职责 |
| 目标工具 | 决定首帧、首尾帧或参考图的使用方式 |
| 已确认人物与物件 | 维持身份、数量和跨镜连续性 |
| 输出 | 内容 |
|---|---|
| 叙事结构 | Hook、机制、冲突、反转、结论 |
| 视觉母题 | 核心冲突关键词、情绪、动作动词和视觉引力 |
| 分镜表 | 时间码、旁白、视觉命题、构图、动作和运镜 |
| 图片提示词 | 首帧、尾帧、人物/空间/物件参考图 |
| 视频提示词 | 单一主动作、时序、固定元素和运动元素 |
| 素材清单 | 可直接复用的图片、视频、主题和参考资产 |
| QA 清单 | 身份、数量、物件守恒、动作因果和尾帧连续性 |
- 画面是旁白命题的证据,不是名词插图。
- 每个镜头只承担一个主要视觉关系变化。
- 抽象概念必须落到可以拍出来的物件和动作。
- 相机运动要跟随人物、文件、建筑或视线等可见锚点。
- 静音看不懂的静帧,不进入视频生成。
- 提示词里的“保持一致”不能替代真实尾帧。
- 同一动作架构连续失败后,应改变结构、载体或镜头拆分,而不是继续堆限制词。
skills/vox-video-creator/
├── SKILL.md
├── agents/
│ └── openai.yaml
├── references/
│ ├── narrative-and-shot-system.md
│ ├── visual-metaphor-and-color.md
│ ├── google-flow-vox-template.md
│ ├── google-flow-failure-checklist.md
│ ├── beat-examples/
│ ├── upstream/
│ └── licenses/
└── assets/
└── style-references/
仓库自带结构、许可证、路径和凭据扫描测试:
python -m unittest discover -s tests -vGitHub Actions 会在每次推送和 Pull Request 时运行相同检查。
- 仓库不需要、也不包含任何账号密码、API Key、GitHub Token、Cookie 或私钥。
- 不要把
.env、凭据文件或本地认证缓存加入仓库。 - 示例仅保留环境变量名称,不包含真实值。
- 登录 GitHub、Google Flow 或其他平台时,应使用平台官方浏览器授权页面。
- 提交前运行仓库测试;测试会扫描常见令牌格式和私钥头。
安全问题和凭据误提交处理方式见 SECURITY.md。
欢迎改进叙事结构、视觉隐喻、模型提示词和质量检查。提交前请阅读 CONTRIBUTING.md,并保留第三方许可证和来源信息。
本仓库原创部分采用 MIT License。
整合的第三方资料和演示媒体保留各自的 MIT 许可证与署名,详见:
- THIRD_PARTY_NOTICES.md
skills/vox-video-creator/references/sources-and-licenses.mdskills/vox-video-creator/references/licenses/