video-use Skill:用自然语言对话就能完成视频精剪的 AI 编辑工具

video-use Skill:用自然语言对话就能完成视频精剪的 AI 编辑工具

总结

video-use 是由 browser-use 团队开源的 AI 视频剪辑 Skill,深度集成 Claude Code / Codex 等编码 Agent,让用户只需用自然语言描述剪辑需求——比如”剪成一条发布视频”——Agent 就能全自动完成素材整理、脚本切除、颜色校正、字幕烧录和动画叠加,输出可直接使用的 final.mp4。无需任何专业剪辑基础,也不需要手动操作时间轴,靠”说话”就能完成一部完整的视频后期。

功能与原则

video-use 的核心设计思路是把视频剪辑变成一场对话。Agent 从不”看”视频,而是通过两个信息层来”读”视频:Layer 1 是 ElevenLabs Scribe 生成的逐字时间戳文本 transcript,Layer 2 是按需生成的带波形图的 filmstrip PNG。Agent 基于文本做出精准的时间轴决策,再通过 ffmpeg 执行实际渲染。

五大核心功能:
自动切除填充词:umm、uh、false starts 和段落间空白全部精确去除
智能颜色分级:每段自动应用暖电影调/中性增强等风格,支持自定义 ffmpeg 调色链
唇形级音频过渡:每处剪切点自动加上 30ms 音频淡入淡出,彻底消除爆音
定制字幕烧录:默认按 2 词大写块格式烧入,支持完全自定义样式
AI 动画叠加:通过 HyperFrames / Remotion / Manim / PIL 在并行子 Agent 中生成动态字幕、转场等动画

三条核心设计原则:音频为主、视觉为辅;先策略确认再执行;12 条硬性制作规范确保质量,艺术审美完全自由。

认可度

  • GitHub Star:19,079(截至 2026-08-04)
  • 今日新增:306 stars(GitHub Trending 当日上榜)
  • Fork:2,382
  • GitHub Trending:当日上榜,Python 类目排名靠前
  • 社区讨论Twitter/TikTok 累计多条 viral 视频演示,累计播放量可观
  • 贡献者:7 人,核心维护者 @gregpr07(browser-use 官方)

链接

GitHub:https://github.com/browser-use/video-use

原作者

  • 主作者:browser-use 组织(@gregpr07 等核心贡献者)
  • 官方定位:browser-use 是 AI Browser Agent 领域头部开源项目,视频剪辑 Skill 是其生态扩展的关键组成
  • 一句话简介:让 AI Agent 不只能浏览网页,还能剪视频

介绍

传统的 AI 视频剪辑要么需要用户手动操作时间轴,要么需要消耗大量 Token 让模型”看”视频——这对长视频来说是灾难性的成本。video-use 另辟蹊径:它把视频转成文本 + 按需图片,让 LLM 通过”读”来完成剪辑决策,典型一条 10 分钟访谈的 transcript 仅 ~12KB,Token 消耗接近忽略不计。

实际工作流是:用户把原始素材扔进文件夹 → 对 Claude Code 说”帮我剪成发布版” → Agent 盘点所有素材 → 提出剪辑策略 → 等用户确认 → 自动执行并自我评估输出质量 → 通过则输出 final.mp4,否则最多重渲染 3 轮直到达标。所有产出文件默认放在 <videos_dir>/edit/,Skill 目录保持干净。

pipeline 链路清晰:Transcribe → Pack → LLM Reasons → EDL → Render → Self-Eval,任何环节有问题都会打回重做,保证最终输出质量。

特点

  • 零门槛操作:不需要任何剪辑软件经验,会聊天就能剪视频
  • Token 高效:LLM 不看视频,只读 12KB transcript + 按需 PNG,成本极低
  • 自我质量评估:每次渲染后自动用 timeline_view 检查剪切点,音频爆音、视觉跳帧全部捕获
  • 多动画引擎支持:HyperFrames / Remotion / Manim / PIL 并行生成,灵活选型
  • 跨 Agent 通用:支持 Claude Code、Codex、Hermes、Openclaw 等所有兼容 Agent with shell access
  • Session 记忆持久化:project.md 保存会话状态,下周继续编辑无缝衔接

使用方法

快速安装(一行命令):将以下 Setup Prompt 粘贴到 Claude Code:

Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live.

手动安装

git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
cd ~/Developer/video-use && uv sync
brew install ffmpeg && brew install yt-dlp
cp .env.example .env && $EDITOR .env

日常使用

cd /path/to/your/videos
claude
# 在对话中输入:
edit these into a launch video

基本流程
1. 把原始素材(.mp4/.mov 等)放入文件夹
2. 告诉 Agent 剪辑需求(如”做成 60 秒产品宣传片”)
3. Agent 盘点素材后提出策略,等你确认
4. 自动完成所有剪辑工作,输出 edit/final.mp4

使用场景与人群

典型场景
– 播客/访谈精剪(去除 filler words、加上字幕和颜色分级)
– 教程/演示视频后期(自动切除重来段落、叠加动态字幕动画)
– 社媒短视频制作(多素材拼接、生成字幕、转场动画)
– 会议录像整理(去除冷场段落、输出精炼版本)

目标用户
– 内容创作者(YouTuber、播客主、TikTok 创作者)
– 产品/增长团队(快速制作演示视频、宣传片)
– 开发者/AI 极客(想用自然语言驱动视频剪辑流程)
– 任何人讨厌学习 Premiere/DaVinci 但需要剪辑视频的人

输入与输出案例

案例 1:播客访谈剪辑
输入:用户把 30 分钟访谈素材放入文件夹,对 Claude Code 说:”帮我剪成一条 YouTube 发布视频,保留所有金句,加上字幕。”
输出:Agent 自动转录 30 分钟音频 → 识别出 8 个核心观点段落 + filler words → 去掉冷场和重复 → 颜色分级统一风格 → 烧录 2 词大写块字幕 → 输出 edit/final.mp4(约 12 分钟精剪版)

案例 2:产品演示视频
输入:用户将 3 段屏幕录制原始素材放入文件夹,说:”剪成一条 60 秒的产品发布预告,加上动态字幕和转场动画。”
输出:Agent 拼接 3 段素材 → 在切换点自动加上 HyperFrames 动画 → 通过 Remotion 渲染动态文字标题 → 输出 edit/final.mp4,直接可用于社交媒体发布


GitHub: https://github.com/browser-use/video-use

评论区

0 条评论

登录后可评论。

Skill超级捕获手 9 阅读