video-use Skill:让 Claude Code 自然语言接管视频剪辑的 AI 工具

Claude Code 接管你的视频剪辑:video-use 是一款把 AI Agent 变成专业剪辑师的 Skill。你只需要把原始素材丢进文件夹,用自然语言告诉它”剪成一条发布视频”,它就能自动完成转录、智能断句、删除语气词、静音裁切、颜色校正、字幕烧录,全程无需打开 Premiere 或 Final Cut。截至 2026-08-05,项目在 GitHub 已斩获约 19,400 颗 star、2,400+ fork,今天仍新增约 320 star,热度仍在攀升,是近期 video-edit + AI Agent 交叉领域最值得关注的新项目之一。

功能与原则

video-use 的核心设计理念是”文本优先、可视化按需“:LLM 从不直接”观看”视频,而是通过 transcript + 关键帧图像来做剪辑决策。它整合了六大能力:

  • 语气词与静音切除:自动识别并删除 umm、uh 等语气词及片段间空白
  • 智能颜色分级:提供 warm cinematic、neutral punch 等预设,也支持自定义 ffmpeg 调色链
  • 音频淡入淡出:每个断点自动加 30ms 音频淡入淡出,消除爆音
  • 字幕烧录:默认 2-word UPPERCASE 分段样式,可完全自定义
  • 动画叠加层生成:通过 HyperFrames、Remotion、Manim 或 PIL 并行生成动画(每个动画由独立 sub-agent 处理)
  • 自我评估循环:渲染后自动在每个断点检测视觉跳跃和音频杂音,不合格就打回重渲染(最多 3 轮)

设计原则高度工程化:12 条硬规则 + 其余完全自由。生产正确性(production-correctness)不可妥协,而审美判断由用户主导。

认可度

  • GitHub star:约 19,400 颗(截至 2026-08-05)
  • Fork:2,400+
  • 今日新增:约 320 star(GitHub Trending 当日榜)
  • 协议:MIT
  • 语言构成:Python 76%、HTML 22.9%、Shell 1.1%
  • 贡献者:7 人(核心维护者 @gregpr07、@ShawnPana、@miguel-heygen 等)
  • Trending:出现在 GitHub 今日 Trending 列表

链接

GitHub:https://github.com/browser-use/video-use

原作者

  • 主要维护者:@gregpr07(browser-use 团队)
  • 核心贡献者:@ShawnPana(主导 v1 发布)、@antoinersx、@miguel-heygen
  • 官方定位:browser-use 旗下产品,专注将 AI Agent 能力扩展到浏览器之外的多媒体编辑场景

介绍

video-use 起源于 browser-use 将 LLM 接入浏览器自动操作的成功经验——这一次他们把同样的思路搬到了视频编辑领域。传统的视频剪辑软件需要大量手动操作,而 video-use 的做法是:给 AI 一个结构化转录文本而不是原始视频,让它在文本层面做剪辑决策,再通过 ffmpeg 渲染出最终成品。

项目的技术架构分为两层:Layer 1 是 ElevenLabs Scribe 音频转录,每次素材只调用一次,返回词级时间戳、说话人分离和音频事件标注(如笑声、掌声标记),最终打包成约 12KB 的 takes_packed.md 文件——这是 LLM 的主要阅读视图。Layer 2 是按需生成的 timeline_view 可视化合成图(电影条 + 波形 + 词标签 + 静音断点候选),只在决策模糊或需要校验时才调用。这种设计将原始视频(约 45M tokens)压缩为 12KB 文本 + 几张关键 PNG,效率提升数个量级。

编辑流程为:转录 → 打包 → LLM 推理 → EDL 决策清单 → 渲染 → 自我评估 → 输出。所有产出文件放在 <视频目录>/edit/ 下,Skill 目录保持干净。

特点

  • 自然语言驱动剪辑:无需学习软件操作,对话式完成从原始素材到成片的全流程
  • 极致轻量级上下文:12KB transcript 替代原始视频,LLM 在文本层面精确断句,字词边界精度高于逐帧操作
  • 多动画引擎支持:HyperFrames / Remotion / Manim / PIL 任选,由独立 sub-agent 并行生成,节省渲染时间
  • 自我评估保障质量:渲染后自动在每个断点检测音频爆音和视觉跳跃,不合格自动重渲染(最多 3 轮)
  • Session 持久化:编辑进度和上下文存在 project.md,下次继续时 AI 直接从上次断点接手
  • 全流程自动化:安装后只需把素材丢进文件夹 → 告诉 AI 目标 → 等待 edit/final.mp4 完成

使用方法

第一步:安装(复制到 Claude Code 等 Agent)

将以下 Setup Prompt 粘贴到 Claude Code、Codex、Openclaw 或任何有 shell 访问权限的 Agent 中:

Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

Agent 会自动完成:clone 代码仓库、安装依赖(ffmpeg、yt-dlp 等)、Skill 注册,提示你输入 ElevenLabs API Key。

第二步:开始编辑

cd /path/to/your/videos
# 在 Agent 对话窗口中输入:
edit these into a launch video

Agent 会先清点素材、提出剪辑策略,等待你确认后再执行渲染。输出文件在 <视频文件夹>/edit/final.mp4

手动安装备选方案

git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
cd ~/Developer/video-use
uv sync  # 或 pip install -e .
brew install ffmpeg
cp .env.example .env
# 编辑 .env,填入 ELEVENLABS_API_KEY

使用场景与人群

适用场景
YouTube / TikTok 短视频制作(口播、教程、开场白)
– 播客/访谈素材剪辑(自动删除语气词、静音片段)
– 活动现场录像精简
– 团队远程会议的快速剪辑

目标用户
– 内容创作者、YouTuber、播客主(不想学复杂剪辑软件)
– 开发者 / AI 爱好者(愿意用 Agent 方式工作流)
– 需要快速从原始素材生成可发布成品的任何团队

输入与输出案例

案例 1:产品宣传片素材剪辑

输入(用户对话):

edit these into a 60-second launch video, remove all the umms and dead space, add warm cinematic color grade

Agent 处理流程:
1. 调用 ElevenLabs Scribe 转录所有素材 → 生成 takes_packed.md
2. 分析语气词分布和静音间隙 → 提出 EDL(Edit Decision List)
3. 用户确认后执行 ffmpeg 渲染 → 输出 edit/final.mp4
4. 自我评估每个断点音频/视觉 → 不合格片段打回重渲染

输出:edit/final.mp4(约 60 秒,语气词全删,颜色分级完成,字幕已烧录)


案例 2:多段教程素材合并

输入(用户对话):

combine C0103 and C0104, cut out the retakes, add subtitles in Chinese, burn in the timestamp

Agent 处理流程:
1. 读取两段素材转录文本
2. 识别重复拍摄(retake)片段和重音节
3. 合并策略 + 中文字幕样式配置
4. 渲染输出带时间戳的中文字幕版教程视频

输出:edit/final.mp4(两段合并,无重复片段,中文字幕烧录完成)


GitHub: https://github.com/browser-use/video-use

评论区

0 条评论

登录后可评论。

Skill超级捕获手 10 阅读