Video Talkcraft Skill:让 Claude Code 变成口播视频动效工作室

总结

Video Talkcraft 是一个将 Claude Code / Codex 变身口播视频动效工作室的开源 AI Agent Skill。用户只需提供口播稿和一条配音,它自动完成字级时间戳对齐、语义分镜、Remotion 动效渲染与三重验收,输出可直接发布的解说视频。8 月 22 日上线,10 天拿下 413 颗星,是近期 AI 视频制作类 Skill 中增长最快的项目之一。

功能与原则

核心能力覆盖口播视频制作全链路:口播稿 + 配音输入 → ASR 字级时间戳对齐 → SKILL.md 驱动语义分镜(SHOTBOOK)→ Remotion 代码生成 → 三重验收 → 交付成品视频。

设计原则:不做剪辑软件、不做模板站,而是让 AI Agent 真正理解视频制作方法论(镜头语言、排版规范、动效配方)后自主执行。默认 Apple 视觉范式,支持中英混排。

认可度

  • GitHub Star:413(截至 2026-09-01,上线约 10 天)
  • Forks:未公开,但项目含完整独立管线
  • 近期在 GitHub Trending 中露面,来自中国开发者社区的传播为主
  • 项目在线画廊(vincentwei1021.github.io/video-talkcraft/)展示 78 张动效卡片预览,持续有反馈群交流

链接

GitHub:https://github.com/Vincentwei1021/video-talkcraft

原作者

Vincent Wei(GitHub @Vincentwei1021)——专注 AI 视频制作管线,旗下还有 video-shotcraft 系列(口播视频篇即为本项目)。作者在抖音/微信有内测反馈群,项目由 AI 编码 agent 构建、迭代与验收,是”用 skill 自己教的方法论做出来的”典型案例。

介绍

Video Talkcraft 是 video-shotcraft 系列的口播视频篇。它解决的问题是:让 AI Agent 真正像一个视频工作室那样工作,而不是机械地拼贴模板。

给 Agent 扔一个口播稿 + 一条配音,Skill 会自动完成:FireRedASR2 ASR 模型做字级时间戳对齐(110s 中英混合口播偏差中位 20–40ms),生成 SHTBOOK 语义分镜(语义拍、层矩阵、排版预算),然后从 78 张动效配方卡中选卡、用 Remotion 写代码,最后跑三重验收(静止检测 + 音效能量验证 + 带动效锚点的独立评审)才交付。

输出不是 PPT 风格的静态幻灯片,而是:动态字卡、数据镜头、证据巡游、长镜头世界画布、人物合成——全部锁在人声上。

特点

  • 字级配音同步:FireRedASR2-CTC int8 GPU 强制对齐,实测中位偏差 20–40ms、最差 200ms,逐帧锚定动效节拍
  • 78 张动效配方卡:意图 / 参数 / 已知坑 / 自包含 Remotion tsx 源码 / 可跑 HTML 预览,在线画廊一页全览
  • 七层反 PPT 系统:连续相机曲线、视差平面、idle/让位生命周期、呼吸环境层,静止帧在结构上不可能出现
  • 经得住审片的排版纪律:语义拍分镜、同屏元素预算、人脸安全区真实检测(OpenCV YuNet),不靠目测
  • 三重验收:自动静止检测 + 音效能量验证 + 带动效锚点帧与连拍三帧组的独立评审,专抓单帧看不见的时域缺陷
  • 中英混排完全支持:中文口播优先设计,Remotion + 中文排版深度集成

使用方法

安装(最直接方式):

在 Claude Code / Codex 中直接说:

帮我安装这个 skill:https://github.com/Vincentwei1021/video-talkcraft

或手动安装:

npx skills add Vincentwei1021/video-talkcraft
git clone https://github.com/Vincentwei1021/video-talkcraft.git
ln -s "$(pwd)" ~/.claude/skills/video-talkcraft  # Claude Code

环境依赖:

  • Node 18+(Remotion 渲染)
  • Python 3.10+(时间戳管线,首次下载 ~767MB ASR 模型)
  • ffmpeg

基本调用:

用 video-talkcraft 把这份口播稿 + voiceover.wav 做成视频。
做一条 100 秒的 <话题> 解说,稿子和音频在这里。

你提供口播稿和配音(任何 TTS 或真人录音),Skill 负责全部后续工序。可选提供人物素材(实拍视频即可,含抠像工具)和 B-roll 截图。

使用场景与人群

适用场景: 知识科普、产品评测、新闻解读、观点锐评等口播/解说类横屏视频制作。适合需要持续产出视频内容但不想陷入剪辑软件的创作者。

目标用户: AI 内容创作者、自媒体博主、产品布道师、教育内容生产者,以及希望让 AI Agent 承担视频制作工作的开发者。

典型输入: 口播稿(文本)+ 配音音频(WAV/MP3)+ 可选人物素材。

输入与输出案例

案例一:知识科普视频

  • 输入: 一篇 1500 字关于”大模型幻觉”的科普口播稿 + 一条 3 分钟 TTS 配音
  • Skill 加工: ASR 对齐时间戳 → 语义分镜(12 个语义拍)→ 从 78 张动效卡中选卡(数据镜头 3 张、动态字卡 5 张、证据巡游 4 张)→ Remotion 渲染 → 三重验收全过
  • 输出: 3 分钟 MP4 横屏视频,动态字卡与配音完全对齐,含背景音乐与转场,可直接发布

案例二:产品评测

  • 输入: 产品评测口播稿 + 真人录音 + 几张产品截图
  • Skill 加工: 时间戳对齐 → SHTBOOK 分镜(含人物抠像素材)→ 七层相机系统实现”镜头感” → 渲染 + 逐帧质检
  • 输出: 评测视频,无 PPT 感,有人脸出镜、动态数据展示、场景化背景

GitHub: https://github.com/Vincentwei1021/video-talkcraft

评论区

0 条评论

登录后可评论。

Skill超级捕获手 10 阅读