Codex × 自媒体视频工作流:10 个必装 Skills
GitHub 上 10 个适合自媒体视频生产的 Codex Skills,覆盖素材拆解、分镜、生成画面、代码包装与成片剪辑。
GitHub 上的视频 Skills 数量不少,真正值得放进自媒体工具箱的,关键不在于数量,而在于它们各自处在工作流的什么位置。
“视频 Skill”其实是一个过于宽泛的分类。 有的负责找素材,有的只写分镜,有的调用付费模型,有的用代码画视频,有的才真的在剪时间线。
“必装”不等于一次装满 10 个。更合理的用法是先把它们收藏进工具箱,等某条工作流真的需要时,再装对应的两三个。
放到一条视频生产线上
- 找素材、拆长视频: YouTube Clipper
- 写提示词、做短剧分镜: seedance2-skill、OnlyShot
- 生成核心画面: Generative Media Skills、AI Avatar Video
- 把信息做成可控的视频: HyperFrames、Remotion Skills、白板视频 Skill
- 处理真人素材和成片: video-use、乘风剪辑
这样看就顺了。它们不是同一场比赛里的 10 个选手,而是站在视频生产线不同工位上的 10 个人。
01 · YouTube Clipper:先把长视频拆成能用的素材
GitHub:op7418/Youtube-clipper-skill
YouTube Clipper 最适合放在自媒体工作流的起点。
它会用 yt-dlp 下载视频和字幕,再让 Agent 按语义切章节,不是机械地每 5 分钟砍一刀。选好片段后,可以继续做双语字幕、烧录字幕和社交媒体摘要。
我会把它放在工作流最前面:访谈太长、课程太长、播客太长,先拆出几个完整观点,再决定哪些值得二创。
记一笔依赖:Python 3.8+、yt-dlp、FFmpeg,而且字幕烧录需要 libass。macOS 默认的 Homebrew FFmpeg 不一定带这个能力。仓库是 MIT,但下载和再发布视频仍然受版权与平台规则约束。开源工具不等于素材自动获得授权。
02 · seedance2-skill:把脑内画面翻译成镜头语言
GitHub:dexhunter/seedance2-skill
它很轻,基本就是一份写得比较完整的 Seedance 提示词手册:素材怎么用 @ 引用,运镜怎么写,广告、剧情、MV 和知识视频分别怎么组织 prompt。
我喜欢它的地方,是边界很清楚。它不假装自己会生成视频,产物就是一份更像导演写的镜头提示词。接下来仍然要进即梦生成、挑片和返工。
版本号需要特别注意:仓库当前写的是 Seedance 2.0,引用资料也是 2.0。不能为了蹭关键词直接把它包装成 Seedance 2.5 Skill。
03 · OnlyShot:短剧创作这件事,它想一次管到底
GitHub:A-cat-with-carrots/OnlyShot
OnlyShot 的目标最完整,也最激进。一句粗糙想法进去,它试图一路产出市场扫描、IP 简报、故事架构、逐集脚本、分镜图、视频段和剪辑包。
它不是轻巧的小 Skill,里面有大量短剧节奏、人物设定、参考图库、即梦生成和失败模式的规则。仓库采用 MIT,实际出图和出视频依赖 dreamina CLI 与生成积分。
我的用法不会是完全相信它的“爆款公式”。红果节奏、题材冷热、多少秒一个爽点,都属于很强的经验假设,不是自然定律。更适合拿它当一套短剧生产模板,保留它对分镜、参考图和成本控制的细节,把选题判断和内容品味留给人。
04 · Generative Media Skills:一个仓库接很多生成模型
GitHub:SamurAIGPT/Generative-Media-Skills
图片、视频、音频、口型、放大、抠图、智能切片,这个仓库几乎都想覆盖。底层主要通过 muapi-cli 或 MCP 调用 MuAPI。
如果我要集中测试多个模型,或者批量做产品广告、UGC 片段、音乐视频,它确实方便。但它有个必须写在旁边的备注:开源的是 Skill 和编排层,不是模型算力。 真正生成要用 MuAPI Key 和积分。
它还支持把本地图片、视频、人脸和音频上传到 CDN。拿客户素材、未发布产品或真人肖像测试前,我会先确认数据留存和授权,而不是看到 MIT License 就默认整条链路都在本机。
05 · AI Avatar Video:不想出镜时,用数字人讲
GitHub:creatify-ai/ai-avatar-video
这是 Creatify 官方放出的 Agent Skill。里面不只是 API 示例,还整理了 15 秒、30 秒、60 秒口播脚本的节奏,数字人怎么选,什么时候换场景,声音怎么停顿,以及怎样让 UGC 口吻少一点广告腔。
它适合不出镜的产品介绍、批量多语言口播、销售演示和简单 UGC 广告。Skill 仓库是 MIT,但成片生成走 Creatify API;免费积分只能用来试跑,规模化还是付费服务。
我会特别盯住自定义 Avatar、声音克隆和真人照片上传。这里不只是 API Key 安全问题,还涉及肖像和声音授权。能生成不代表有权生成。
06 · HyperFrames:前端开发者最容易上手的视频工具
GitHub:heygen-com/hyperframes
HyperFrames 的思路很直接:Agent 已经会写 HTML 和 CSS,那就让它直接写视频画面。浏览器负责按时间点捕获画面,FFmpeg 负责编码成片。
文章转视频、产品更新、动态图表、排行榜、动态海报,这些都很合适。它支持 CSS Animation、GSAP、Lottie 和 Three.js,也强调同样输入得到同样画面,做固定栏目时比较省心。
我会把它理解成“可编程动效视频”,而不是传统剪辑器。它不会替你从一小时采访里判断哪句话说错了,但很适合把已经整理好的观点包装成一条有节奏的知识视频。仓库采用 Apache-2.0。
07 · Remotion Skills:React 团队的那条路
GitHub:remotion-dev/skills
Remotion 官方 Skills 现在覆盖创建项目、React 画面、预览、渲染、字幕、地图、产品集成、文档查询和升级。
装上它,Codex 会更懂怎样写 Remotion;但它本身不是渲染器。真正的时间轴、组件和成片仍然在 Remotion 项目里。
HyperFrames 和 Remotion 经常被写成组合,其实大部分时候是二选一:熟悉 HTML/CSS,选 HyperFrames;已经有 React 组件库,想做长期批量模板,选 Remotion。
许可也要单独记。remotion-dev/skills 仓库页面当前没有展示明确 License,Remotion 本体还有自己的许可条款。GitHub 能看源码,不等于可以随手写成“完全开源、任意商用”。
08 · 白板视频 Skill:知识类账号可以单独收藏
GitHub:gnipbao/codex-whiteboard-video-skill
这个 Skill 是 whiteboard-video-engine 的 Codex 适配层,可以把图片、SVG、线稿或脚本转成白板手绘视频。数学解释、概念拆解、课程片段和知识类短视频,很容易找到它的位置。
它的仓库分工做得比较老实:Skill 仓库只放指令和轻量 wrapper,渲染器、模型 provider、笔画追踪和视频合成都在另一个 engine 仓库。
这也意味着安装不止复制一个 SKILL.md。要先装 Python 引擎,部分线稿能力还要准备上游模型代码和权重。Skill 仓库是 MIT,上游模型各自遵循自己的许可证。
我会先用一张简单插画跑 10 秒测试。白板视频最怕“技术上画出来了,视觉上却又慢又乱”,这个问题看 README 解决不了,只能看实际渲染。
09 · video-use:让 Agent 看懂口播里的废片
GitHub:browser-use/video-use
video-use 面向已经拍好的素材。它先转写语音、建立时间线,再让 Agent 判断口头禅、错误起句和无意义停顿,生成 EDL 后交给 FFmpeg 渲染,最后检查切点。
我觉得它有意思的地方,不是“AI 会剪视频”这句宣传,而是把判断和执行拆开:Agent 负责理解,脚本负责确定性剪切,还会在切点做短音频淡化,减少爆音。
默认流程需要 ElevenLabs Scribe。也就是说,音频会交给第三方服务转写,并可能产生费用。客户访谈、内部会议和未发布内容,我不会直接拿来试。仓库采用 MIT。
10 · 乘风剪辑:中文口播更像一套产品,而不是一张说明书
GitHub:Agentchengfeng/chengfeng-videocut-skills
乘风剪辑面向 Codex 的中文口播场景。它会先识别口误和剪切建议,让人审核,再执行物理剪切和生成字幕。
和普通 Skill 不同,它背后有独立 Runtime、播放器和审核界面。第一次实际剪辑会下载固定版本的 Runtime,并做 SHA-256 校验;本机还要有 Chrome、Bun、Node 和 FFmpeg。
我会把它当一套本地剪辑软件来评估,而不是把它当几百行 Markdown。仓库是 Apache-2.0,但真正要观察的是 Runtime 的安装、更新、崩溃恢复、预览和导出是否稳定。
我会怎么搭,不会怎么搭
按实际场景组合时,有几组搭配比较自然。
知识类视频: YouTube Clipper 找观点,HyperFrames 或 Remotion 做画面,video-use 处理真人口播。代码视频引擎二选一,不需要两个都维护。
中文真人口播: video-use 和乘风剪辑先二选一。前者偏通用流水线,后者偏中文交互与人工审核。先拿 30 秒非敏感素材试切点,比看 Star 数有用。
AI 短剧: OnlyShot 适合整套流程,seedance2-skill 适合只补强提示词。已经采用 OnlyShot 时,不一定还需要再叠一层相同职责的分镜 Skill。
不出镜的产品账号: AI Avatar Video 负责口播主体,HyperFrames 或 Remotion 负责产品画面、字幕和结尾 CTA。
课程和概念解释: 白板视频 Skill 单独就能形成一种稳定栏目,不必硬塞真人 Avatar 和复杂 AI 视频镜头。
安装前的几条边角笔记
- Agent Skills 会影响命令执行、文件读写和外部 API 调用。装之前至少扫一遍
SKILL.md、脚本、Hooks 和依赖。 - API Key 放环境变量或密钥管理工具,不放进聊天记录和项目文件。
- 先拿短、非敏感、能人工复核的素材试跑。视频工作流一旦开始批量烧积分,错误会比写错一段代码贵得多。
- Star 可以帮我发现项目,但不能替我判断字幕准不准、切点顺不顺、生成成本高不高。
我现在更愿意把 Codex 当视频制片台,而不是一个万能剪辑师。让它管脚本、分镜、素材清单、命令执行和质检很合理;选题审美、肖像授权、关键镜头和最终发布,还是应该由人握住。
相关引用
AI 中转站精选
从充值换算、官方价格折扣和访问量三个维度,查看当前有代表性的服务商。






