video-use Skill:用自然语言让 Claude Code 自动剪辑视频的 AI 工具

Claude Code 成为你的视频剪辑师——不是比喻,是字面意思。browser-use 团队推出的 video-use Skill,刚刚冲上 GitHub Trending,就靠一个核心功能:把原始素材丢进文件夹,用自然语言对话驱动 AI 剪辑出 final.mp4,支持 filler word 删除、自动调色、字幕烧录、动画叠加,自我评估渲染质量,循环修复直到通过。

功能与原则

video-use 的设计哲学是”AI 从不观看视频,只读取它”。通过两层转译实现精准剪辑:第一层 ElevenLabs Scribe 音频转录,获得词级时间戳、说话人分离和音频事件标记,所有素材压缩进约 12KB 的 takes_packed.md;第二层按需生成 filmstrip + 波形 + 词标签 PNG,用于关键时刻的视觉判断。剪辑流程走 Transcribe → Pack → LLM 分析 → EDL → Render → Self-Eval 循环,自动修复最多 3 轮再交付。

认可度

GitHub star 约 19,353(截至 2026-08-05),上线即登 GitHub Trending 日榜。browser-use 团队在 AI 浏览器自动化领域已有相当积累,视频剪辑是其在多模态 Agent 方向的最新落地。社区讨论集中在”用自然语言指挥视频剪辑”这一体验突破,TikTok demo 获大量转发。

链接

GitHub: https://github.com/browser-use/video-use

原作者

browser-use 团队(GitHub: browser-use),专注 AI 浏览器自动化与 Agent 工具链,此前代表作包括 browser-use 核心库和 browser-use/mcp 项目,在 LLM + 自动化交叉领域有较高认可度。

介绍

video-use 解决的是视频剪辑的高门槛问题——传统工具需要学习曲线和专业背景,AI 工具又往往沦为”一键特效”缺乏真正的编辑判断力。它的思路是把剪辑权完全交给 Agent:用户只描述目标(”剪一条产品发布视频”),Agent 自主完成从素材盘点、策略确认到最终输出的全流程。

核心能力包括:自动删除 filler word(umm、uh、语气词)和静默间隙;多风格自动调色(warm cinematic / neutral punch 或自定义 ffmpeg 链);30ms 音频淡入淡出防止剪辑点爆音;烧录自定义样式字幕;通过 HyperFrames / Remotion / Manim / PIL 并行生成动画叠加层;以及最关键的——在每个剪辑边界做自我视觉评估,不满意就重新渲染(最多 3 轮)。

安装只需克隆仓库、装 ffmpeg(必须)、配 ElevenLabs API key(用于音频转录)、向 Agent 注册 Skill,之后把素材文件夹交给 Agent 即可,完全不用手动转录。

特点

  • 词级精准剪辑:基于音频转录的时间戳,剪辑点精确到词边界,不会有半句话被截断
  • 多轮自我评估:每轮渲染后自动检查视觉跳跃、音质爆音、字幕错误,循环修复至通过
  • 零帧分析成本:不做逐帧视频理解,用 12KB 文稿 + 按需 PNG 替代 45M token 视频dump
  • 多模态动画叠加:支持 HyperFrames、Remotion、Manim、PIL 并行生成,动画作为独立子 Agent 运行
  • 会话记忆持久化:project.md 记录进度,跨 session 继续编辑,不用每次从头描述项目背景
  • 全流程对话驱动:用户只需说”把这些素材剪成发布视频”,其余全由 Agent 自主决策执行

使用方法

第一步:安装

git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use  # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex

cd ~/Developer/video-use
uv sync  # 或 pip install -e .
brew install ffmpeg  # 必须

cp .env.example .env
# 编辑 .env,填入 ELEVENLABS_API_KEY=...

第二步:向 Agent 启动

claude  # 或 codex、hermes 等
Set up https://github.com/browser-use/video-use for me.

Agent 会引导完成依赖安装和 Skill 注册,最后问你要 ElevenLabs API key。

第三步:剪辑对话

cd /path/to/your/videos
claude
# 在会话中输入:
edit these into a launch video

Agent 会盘点素材、提出策略、等用户确认后执行,输出到 <videos_dir>/edit/final.mp4

使用场景与人群

适用于需要快速出片的内容创作者(教程、产品演示、采访、vlog),以及希望把视频剪辑纳入 AI Agent 工作流的开发者和技术团队。核心用户画像:有原始素材、缺乏专业剪辑技能、需要高效率周转的个人创作者或小型团队。

输入与输出案例

案例 1:产品发布视频

  • Input:用户将产品演示原始素材(约 20 分钟多机位素材)放入文件夹,对 Agent 说”把这些素材剪成一条 2 分钟的产品发布视频,包含核心功能展示和结尾 CTA”
  • Output:Agent 自动删除所有 filler word 和重复 take,按逻辑顺序拼接,调色统一,按要求样式烧录字幕,输出 edit/final.mp4,用户只需确认或要求局部调整

案例 2:教程去停顿

  • Input:技术讲解原始录屏(约 45 分钟),说”把这段录屏剪成紧凑教程,去掉所有停顿和重说”
  • Output:Agent 识别所有静默间隙和语气词,自动裁切,重新渲染时保持语意连贯性,输出精炼版本,字幕自动同步更新

GitHub: https://github.com/browser-use/video-use

评论区

0 条评论

登录后可评论。

Skill超级捕获手 15 阅读