video-use Skill:让 Claude Code 用文字稿自动剪辑视频
video-use Skill:让 Claude Code 用文字稿自动剪辑视频
这个 Skill 让 Claude Code 直接接管视频剪辑全流程——把原始素材扔进文件夹,用自然语言描述需求,Agent 自动完成剪辑、字幕、调色,输出 final.mp4。整个过程不需要人工打开任何剪辑软件,也不依赖昂贵的视频模型。核心逻辑是「LLM 不看视频,只读文字稿」——通过 ElevenLabs 将音频转文字后,Agent 用 ~12KB 的文字描述完成所有剪辑决策,token 消耗极低。9 月下旬 GitHub Star 突破 2.6 万,是当前 Agent 视频工具赛道最值得关注的新晋项目。
功能与原则
video-use 的设计原则是「音频优先、视觉按需」——剪辑决策全部来自文字稿(停顿、语气词、语义段落),视觉素材仅在需要核实边界时オ请求。
核心能力包括:自动删除 filler words(umm、uh、语气词)和死空间;多风格自动调色(暖电影感、中性 punch 或自定义 ffmpeg 链);30ms 音频淡入淡出消除cut点 pop 声;自定义字幕烧录(默认 2 词大写形式);动画叠加层(通过 HyperFrames / Remotion / Manim / PIL 并行子 Agent 渲染);每一cut边界自动自检,不通过则重新渲染(最多 3 轮);Session 记忆持久化到 project.md,下次直接续上。
认可度
- GitHub Star:26,217(截至 2026-09-23),近期日均增长 155+
- GitHub Trending 多次上榜,出现在 2026-09 月多期 AI Agent GitHub Digest 推荐
- 技术路线独特(音频转写→文字稿剪辑而非视频帧输入),在 Agent 视频工具赛道差异化明显
- 生态绑定:与 ElevenLabs(转写)、HyperFrames(动画)、browser-use 平台形成完整工作流
链接
GitHub:https://github.com/browser-use/video-use
原作者
browser-use 团队——开源 browser-use 项目的核心维护组织,同时运营 Browser Use Cloud(云端 AI 浏览器自动化)和 Browser Use Box(VPS/Telegram 接入)。video-use 是其从浏览器自动化延伸至视频编辑场景的战略性 Skill。
介绍
video-use 的出现解决了一个实际问题:当前 AI 剪辑工具要么需要昂贵的视频生成模型,要么需要人工在Premiere/DaVinci 里一点点操作。video-use 走了第三条路——不生成视频,只剪辑视频。让 LLM 完全不接触原始帧,而是通过 ElevenLabs Scribe 转写成文字稿(word-level timestamps、说话人区分、笑声/掌声等事件标签),全部剪辑决策基于 ~12KB 的文本进行。
工作流分为五步:转写→打包→LLM推理→生成 EDL→渲染→自检。LLM 在决策点オ请求 timeline_view 生成的 filmstrip+waveform PNG 来核实视觉边界。整个流程 token 消耗极低(一支 43 秒的片段转写结果仅 ~12KB),效果却能精确到 word-boundary 的 cut 点,比传统帧级分析更省钱、更精准。
渲染完成后,Agent 用 timeline_view 在每个 cut 边界自检输出,发现视觉跳跃、音频 pop 或字幕问题会自动修复,最多重渲染 3 轮才交付。所有输出文件统一放在 <videos_dir>/edit/ 下,保持素材目录整洁。
特点
- 音频即全部:LLM 从不看原始帧,文字稿是唯一剪辑依据——转写质量决定剪辑质量,token 成本极低
- 全流程自控:从素材分析→策略制定→确认→执行→自检→持久化,全部由 Agent 主导,人类只需最后审稿
- 多 Agent 通用:支持 Claude Code、Codex、Hermes、OpenClaw 等所有有 shell 访问权限的 Agent
- Session 记忆:project.md 自动保存工作进度,下次启动自动续上,无需重复描述项目背景
- Production Ready:内置 12 条硬规则保障剪辑专业度,艺术风格则完全开放
使用方法
安装步骤:
# 1. Clone 并 symlink 到 Agent skills 目录
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. 安装依赖
cd ~/Developer/video-use
uv sync # 或 pip install -e .
brew install ffmpeg # 必须
brew install yt-dlp # 可选(下载在线素材用)
# 3. 配置 ElevenLabs API Key
cp .env.example .env
$EDITOR .env # 写入 ELEVENLABS_API_KEY=...
# 4. 让 Agent 读完 install.md 后注册 skill
# 在 Agent 里运行:
Set up https://github.com/browser-use/video-use for me.
最小调用示例:
cd /path/to/your/videos # 原始素材文件夹
claude # 或 codex、hermes 等
# 在 Agent 对话中:
edit these into a launch video
Agent 会先清点素材、制定剪辑策略(输出到 edit/),等人类确认后才开始渲染最终视频。
使用场景与人群
- 内容创作者:需要快速出 Tutorial、产品介绍、采访类视频,不擅长也不愿花时间在剪辑软件上
- AI Tooling 开发者:基于 browser-use 生态构建更复杂的多模态 Agent 工作流
- 营销/增长团队:批量处理产品演示、客户访谈、活动回顾等多素材剪辑任务
- 技术团队:集成到 CI/CD 或自动化 pipeline,做视频内容工厂化管理
输入与输出案例
输入:
用户将 3 段原始拍摄素材(产品发布会 demo,共 8 分钟)放入文件夹,告诉 Agent:edit these into a 90-second launch video
Agent 执行路径:
1. 调用 ElevenLabs Scribe 对 3 段素材分别转写,合并为 takes_packed.md
2. 分析文字稿:识别 6 处语气停顿、2 处重拍、1 处冷场,生成剪辑策略
3. 用户确认后渲染:填充词全部切除、调色应用「warm cinematic」预设、字幕按 2 词大写烧录
4. 自检发现第 4 个 cut 边界有 80ms 音频 pop,自动修复后重新渲染
5. 输出 edit/final.mp4(时长 88s),project.md 记录本次剪辑决策供下次续用
输出:
final.mp4:88 秒成品视频,填充词全无,色调统一,字幕规范,可直接发布。
评论区
登录后可评论。