video-use Skill:让 Claude Code 自然语言接管视频剪辑的 AI 工具
让 Claude Code 接管你的视频剪辑:video-use 是一款把 AI Agent 变成专业剪辑师的 Skill。你只需要把原始素材丢进文件夹,用自然语言告诉它”剪成一条发布视频”,它就能自动完成转录、智能断句、删除语气词、静音裁切、颜色校正、字幕烧录,全程无需打开 Premiere 或 Final Cut。截至 2026-08-05,项目在 GitHub 已斩获约 19,400 颗 star、2,400+ fork,今天仍新增约 320 star,热度仍在攀升,是近期 video-edit + AI Agent 交叉领域最值得关注的新项目之一。
功能与原则
video-use 的核心设计理念是”文本优先、可视化按需“:LLM 从不直接”观看”视频,而是通过 transcript + 关键帧图像来做剪辑决策。它整合了六大能力:
- 语气词与静音切除:自动识别并删除 umm、uh 等语气词及片段间空白
- 智能颜色分级:提供 warm cinematic、neutral punch 等预设,也支持自定义 ffmpeg 调色链
- 音频淡入淡出:每个断点自动加 30ms 音频淡入淡出,消除爆音
- 字幕烧录:默认 2-word UPPERCASE 分段样式,可完全自定义
- 动画叠加层生成:通过 HyperFrames、Remotion、Manim 或 PIL 并行生成动画(每个动画由独立 sub-agent 处理)
- 自我评估循环:渲染后自动在每个断点检测视觉跳跃和音频杂音,不合格就打回重渲染(最多 3 轮)
设计原则高度工程化:12 条硬规则 + 其余完全自由。生产正确性(production-correctness)不可妥协,而审美判断由用户主导。
认可度
- GitHub star:约 19,400 颗(截至 2026-08-05)
- Fork:2,400+
- 今日新增:约 320 star(GitHub Trending 当日榜)
- 协议:MIT
- 语言构成:Python 76%、HTML 22.9%、Shell 1.1%
- 贡献者:7 人(核心维护者 @gregpr07、@ShawnPana、@miguel-heygen 等)
- Trending:出现在 GitHub 今日 Trending 列表
链接
GitHub:https://github.com/browser-use/video-use
原作者
- 主要维护者:@gregpr07(browser-use 团队)
- 核心贡献者:@ShawnPana(主导 v1 发布)、@antoinersx、@miguel-heygen
- 官方定位:browser-use 旗下产品,专注将 AI Agent 能力扩展到浏览器之外的多媒体编辑场景
介绍
video-use 起源于 browser-use 将 LLM 接入浏览器自动操作的成功经验——这一次他们把同样的思路搬到了视频编辑领域。传统的视频剪辑软件需要大量手动操作,而 video-use 的做法是:给 AI 一个结构化转录文本而不是原始视频,让它在文本层面做剪辑决策,再通过 ffmpeg 渲染出最终成品。
项目的技术架构分为两层:Layer 1 是 ElevenLabs Scribe 音频转录,每次素材只调用一次,返回词级时间戳、说话人分离和音频事件标注(如笑声、掌声标记),最终打包成约 12KB 的 takes_packed.md 文件——这是 LLM 的主要阅读视图。Layer 2 是按需生成的 timeline_view 可视化合成图(电影条 + 波形 + 词标签 + 静音断点候选),只在决策模糊或需要校验时才调用。这种设计将原始视频(约 45M tokens)压缩为 12KB 文本 + 几张关键 PNG,效率提升数个量级。
编辑流程为:转录 → 打包 → LLM 推理 → EDL 决策清单 → 渲染 → 自我评估 → 输出。所有产出文件放在 <视频目录>/edit/ 下,Skill 目录保持干净。
特点
- 自然语言驱动剪辑:无需学习软件操作,对话式完成从原始素材到成片的全流程
- 极致轻量级上下文:12KB transcript 替代原始视频,LLM 在文本层面精确断句,字词边界精度高于逐帧操作
- 多动画引擎支持:HyperFrames / Remotion / Manim / PIL 任选,由独立 sub-agent 并行生成,节省渲染时间
- 自我评估保障质量:渲染后自动在每个断点检测音频爆音和视觉跳跃,不合格自动重渲染(最多 3 轮)
- Session 持久化:编辑进度和上下文存在
project.md,下次继续时 AI 直接从上次断点接手 - 全流程自动化:安装后只需把素材丢进文件夹 → 告诉 AI 目标 → 等待
edit/final.mp4完成
使用方法
第一步:安装(复制到 Claude Code 等 Agent)
将以下 Setup Prompt 粘贴到 Claude Code、Codex、Openclaw 或任何有 shell 访问权限的 Agent 中:
Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
Agent 会自动完成:clone 代码仓库、安装依赖(ffmpeg、yt-dlp 等)、Skill 注册,提示你输入 ElevenLabs API Key。
第二步:开始编辑
cd /path/to/your/videos
# 在 Agent 对话窗口中输入:
edit these into a launch video
Agent 会先清点素材、提出剪辑策略,等待你确认后再执行渲染。输出文件在 <视频文件夹>/edit/final.mp4。
手动安装备选方案:
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
cd ~/Developer/video-use
uv sync # 或 pip install -e .
brew install ffmpeg
cp .env.example .env
# 编辑 .env,填入 ELEVENLABS_API_KEY
使用场景与人群
适用场景:
– YouTube / TikTok 短视频制作(口播、教程、开场白)
– 播客/访谈素材剪辑(自动删除语气词、静音片段)
– 活动现场录像精简
– 团队远程会议的快速剪辑
目标用户:
– 内容创作者、YouTuber、播客主(不想学复杂剪辑软件)
– 开发者 / AI 爱好者(愿意用 Agent 方式工作流)
– 需要快速从原始素材生成可发布成品的任何团队
输入与输出案例
案例 1:产品宣传片素材剪辑
输入(用户对话):
edit these into a 60-second launch video, remove all the umms and dead space, add warm cinematic color grade
Agent 处理流程:
1. 调用 ElevenLabs Scribe 转录所有素材 → 生成 takes_packed.md
2. 分析语气词分布和静音间隙 → 提出 EDL(Edit Decision List)
3. 用户确认后执行 ffmpeg 渲染 → 输出 edit/final.mp4
4. 自我评估每个断点音频/视觉 → 不合格片段打回重渲染
输出:edit/final.mp4(约 60 秒,语气词全删,颜色分级完成,字幕已烧录)
案例 2:多段教程素材合并
输入(用户对话):
combine C0103 and C0104, cut out the retakes, add subtitles in Chinese, burn in the timestamp
Agent 处理流程:
1. 读取两段素材转录文本
2. 识别重复拍摄(retake)片段和重音节
3. 合并策略 + 中文字幕样式配置
4. 渲染输出带时间戳的中文字幕版教程视频
输出:edit/final.mp4(两段合并,无重复片段,中文字幕烧录完成)
评论区
登录后可评论。