Skip to content

Repository files navigation

VOX Video Creator

Validate License: MIT

把中文文案、旁白或 SRT 字幕,转换成可实际制作的 VOX 风格解释型视频方案。

vox-video-creator 是一个面向 Codex 和兼容 Agent Skills 运行时的创作技能。它负责从叙事逻辑出发,建立视觉命题、纸张拼贴分镜、静帧提示词、Google Flow 图生视频提示词和连续性检查。

它不是一个“套滤镜”的视频模板,也不会把旁白逐字翻译成 PPT 页面。核心目标是让每个镜头都形成一个不用旁白也能读懂的视觉关系。

Note

本项目描述的是一种编辑式解释视频方法,与 Vox Media 没有隶属、授权或官方合作关系。

核心能力

  • 按语义与时间码拆分解释型视频镜头
  • 提取核心冲突关键词、情绪和视觉引力
  • 把债务、风险、权利、制度等抽象概念转换成可运动的物理隐喻
  • 设计半调照片、撕纸、卡纸、印章、合同和纸层视差组成的编辑式拼贴画面
  • 区分首帧、尾帧、人物参考图、空间参考图和插入图的职责
  • 为 Google Flow / Gemini 图生视频生成单动作、可执行的镜头提示词
  • 检查人物身份、物件数量、动作因果、首尾帧和跨镜连续性
  • 保留失败复盘与素材复用规则,逐步形成可复利的视觉资产库

工作流程

flowchart LR
    A["文案 / 旁白 / SRT"] --> B["语义拆镜"]
    B --> C["每镜可见结论"]
    C --> D["视觉隐喻与颜色"]
    D --> E["首帧 / 尾帧 / 参考图"]
    E --> F["Google Flow 动作提示词"]
    F --> G["逐帧 QA 与连续性检查"]
    G --> H["剪辑对齐旁白与字幕"]
Loading

技能的默认交付顺序:

  1. 全片叙事结构与视觉母题
  2. 逐镜头分镜表
  3. 每镜静帧生成提示词
  4. 每镜视频动作提示词
  5. 可复用素材清单
  6. 连贯性、模型风险与返工检查

安装

方法一:让 Codex 安装

在 Codex 中使用 skill-installer,并提供这个技能目录:

https://github.com/zhanghuadong199-pixel/vox-video-creator/tree/main/skills/vox-video-creator

方法二:手动安装

克隆仓库:

git clone https://github.com/zhanghuadong199-pixel/vox-video-creator.git

将下面的完整目录复制到个人技能目录:

skills/vox-video-creator

Codex 默认位置:

$CODEX_HOME/skills/vox-video-creator

兼容 Agent Skills 的跨运行时位置:

~/.agents/skills/vox-video-creator

重新打开任务后即可触发。

使用方法

明确调用:

Use $vox-video-creator to turn this SRT into a 16:9 VOX paper-collage storyboard and Google Flow prompts.

也可以自然表达:

把这份中文口播稿做成 VOX 风格解释视频。
先给我核心冲突、视觉隐喻、逐镜头分镜、静帧提示词和 Flow 视频提示词。
画幅 16:9,每个镜头只保留一个主要动作。

适合的输入:

  • 中文文案或文章
  • 配音稿、逐字稿
  • .srt 字幕文件
  • 已确定时长与画幅的短视频方案
  • 希望转换成 VOX / 纸张拼贴解释视频的选题

输入与输出

输入 作用
文案、旁白或 SRT 决定叙事顺序、镜头覆盖和时长
画幅、分辨率、帧率 决定分镜构图与生成规格
参考视频或图片 锁定风格、人物、空间或镜头职责
目标工具 决定首帧、首尾帧或参考图的使用方式
已确认人物与物件 维持身份、数量和跨镜连续性
输出 内容
叙事结构 Hook、机制、冲突、反转、结论
视觉母题 核心冲突关键词、情绪、动作动词和视觉引力
分镜表 时间码、旁白、视觉命题、构图、动作和运镜
图片提示词 首帧、尾帧、人物/空间/物件参考图
视频提示词 单一主动作、时序、固定元素和运动元素
素材清单 可直接复用的图片、视频、主题和参考资产
QA 清单 身份、数量、物件守恒、动作因果和尾帧连续性

关键原则

  • 画面是旁白命题的证据,不是名词插图。
  • 每个镜头只承担一个主要视觉关系变化。
  • 抽象概念必须落到可以拍出来的物件和动作。
  • 相机运动要跟随人物、文件、建筑或视线等可见锚点。
  • 静音看不懂的静帧,不进入视频生成。
  • 提示词里的“保持一致”不能替代真实尾帧。
  • 同一动作架构连续失败后,应改变结构、载体或镜头拆分,而不是继续堆限制词。

目录结构

skills/vox-video-creator/
├── SKILL.md
├── agents/
│   └── openai.yaml
├── references/
│   ├── narrative-and-shot-system.md
│   ├── visual-metaphor-and-color.md
│   ├── google-flow-vox-template.md
│   ├── google-flow-failure-checklist.md
│   ├── beat-examples/
│   ├── upstream/
│   └── licenses/
└── assets/
    └── style-references/

验证

仓库自带结构、许可证、路径和凭据扫描测试:

python -m unittest discover -s tests -v

GitHub Actions 会在每次推送和 Pull Request 时运行相同检查。

安全与隐私

  • 仓库不需要、也不包含任何账号密码、API Key、GitHub Token、Cookie 或私钥。
  • 不要把 .env、凭据文件或本地认证缓存加入仓库。
  • 示例仅保留环境变量名称,不包含真实值。
  • 登录 GitHub、Google Flow 或其他平台时,应使用平台官方浏览器授权页面。
  • 提交前运行仓库测试;测试会扫描常见令牌格式和私钥头。

安全问题和凭据误提交处理方式见 SECURITY.md

贡献

欢迎改进叙事结构、视觉隐喻、模型提示词和质量检查。提交前请阅读 CONTRIBUTING.md,并保留第三方许可证和来源信息。

许可证与来源

本仓库原创部分采用 MIT License

整合的第三方资料和演示媒体保留各自的 MIT 许可证与署名,详见:

  • THIRD_PARTY_NOTICES.md
  • skills/vox-video-creator/references/sources-and-licenses.md
  • skills/vox-video-creator/references/licenses/

About

Codex skill for turning Chinese scripts and SRT subtitles into VOX-style editorial paper-collage storyboards and Google Flow prompts.

Topics

Resources

Contributing

Security policy

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages