26,123 颗星背后:browser-use 团队如何把视频剪辑变成「对话执行」
把 Raw 素材扔进文件夹,用自然语言告诉 AI 要怎么剪——然后等着收 final.mp4。browser-use 团队刚发布的 video-use,正在把视频剪辑从「软件操作」变成「对话执行」。
它在解决什么问题
视频剪辑有两个绕不开的痛点:专业软件学习曲线陡峭(Premiere、Final Cut),而 AI 视频工具大多数是「一键生成」的盲盒——你无法控制具体每一帧怎么剪。
video-use 的思路是:让一个有 shell 访问权限的 AI 编程 Agent(Claude Code、Codex、OpenClaw 等)直接调用 ffmpeg 来完成剪辑。你不需要打开任何软件,只要告诉它:「把前面三分钟里所有的语气词剪掉,然后加一个片头动画。」
它支持的完整工作流包括:
- 转录:ElevenLabs Scribe 做词级时间戳转录,精度到毫秒
- 自动删口播填充词:um、uh、重复口误全部定位并切除
- 智能分段:根据静音间隙和语义边界决定剪辑点,绝不割裂单词
- 色彩分级:内置 ffmpeg 调色链,可选温暖电影感、中性高对比或完全自定义
- 字幕烧录:默认 2 词大写块格式,支持自定义样式
- 动画叠加层:通过 HyperFrames、Remotion、Manim 或 PIL 并行生成,LLM 统一调度
- 自我校验:输出后自动在每个剪辑边界做音视频帧检查,确保无跳帧、无爆音
- 会话记忆:每次编辑状态持久化到
project.md,下次继续时 Agent 知道上次做到哪了
所有产物输出到 <videos_dir>/edit/,项目目录保持干净。
核心定位:「LLM 读视频」而不是「LLM 看视频」
项目 README 里有一句话点明了设计哲学:LLMs Don’t Watch Video, They Read Video。video-use 从不”看”视频帧,而是基于 Scribe 生成的词级时间戳 transcript 做决策。视频本身只在确认剪辑边界时才用 timeline_view 工具做视觉校验,其余所有推理都在文本 transcript 上完成。
这解释了为什么它不需要 GPU——推理完全在 LLM 侧执行,ffmpeg 负责的是纯计算执行。代价是:它依赖 ElevenLabs API 做转录,纯离线场景不适用。
项目边界:适合谁,不适合谁
适合:
- 有原始素材、需要精细控制、愿意用自然语言描述剪辑意图的用户
- 已有 Claude Code / Codex / OpenClaw 等 AI 编程 Agent 的用户(零额外安装成本)
- 需要批量处理系列视频(多段素材并行转录 + 统一剪辑策略)
- 制作教程、采访、产品演示等以说话为主的内容
不适合:
- 纯视觉叙事内容(MV、快节奏混剪)—— LLM 在视觉节奏判断上仍弱于专业剪辑直觉
- 完全不想配置 API key 的用户(ElevenLabs Scribe 是必选项,没有免费档)
- 追求实时预览的交互式剪辑体验(它是「确认后执行」模式,不是实时预览)
- 需要复杂多机位编辑的专业制作流程
真实使用门槛
根据 install.md 和 SKILL.md 整理,完整安装需要:
- AI 编程 Agent:Claude Code / Codex / Hermes / OpenClaw(之一即可)
- ffmpeg + ffprobe:macOS
brew install ffmpeg,Debianapt-get install ffmpeg,必须加入 PATH - ElevenLabs API Key:用于 Scribe 转录,elevenlabs.io/app/settings/api-keys 获取,无免费档,按用量计费
- Python 依赖:
uv sync或pip install -e .(依赖 requests、librosa、matplotlib、pillow、numpy) - Node.js 22+:仅在使用 HyperFrames 或 Remotion 动画槽位时才需要
安装后,Agent 会自动完成克隆、依赖安装、skill 注册,全程只问用户一次 API Key。
技术栈和可扩展性
- 语言:Python(轻量依赖,核心工具是 ffmpeg,不绑 GPU)
- 许可证:MIT,完全开源,允许商用
- 动画系统:通过子 Agent 并行调度,每个动画槽位独立运行,Wall time ≈ 最慢那个
- Session 持久化:
project.md记录每次编辑会话的决策历史,支持跨会话继续
社区反应
从 CSDN、DEV Community 和独立博主的评测来看,video-use 的核心卖点被社区认可为两点:一是 MIT 许可证下完全开源,不像同类产品有功能锁区;二是将 token 消耗从「逐帧分析」降到「Transcript 读取」,成本结构完全不同。
browser-use 团队本身背书了 11 万星级别的 browser-use 项目,他们选择在视频剪辑这个场景复刻同样的「AI Agent 操作工具」范式,而不是做另一个「AI 生成视频」产品,这个判断值得关注。
怎么上手
第一步:确保你有一个运行中的 AI 编程 Agent(Claude Code、Codex 或兼容 OpenClaw)。
第二步:让 Agent 执行以下安装指令:
Set up https://github.com/browser-use/video-use for me.
Agent 会自动完成克隆、依赖安装、ffmpeg 验证和 skill 注册,然后问你一次 ElevenLabs API Key。
第三步:把你的原始素材扔进任意文件夹,进入该目录运行 Agent:
cd /path/to/your/videos
claude # 或 codex、openclaw
然后直接说:「帮我把 2024Q4 回顾视频剪成一个 3 分钟的发布版,删除所有语气词,加一个动态片头。」
Agent 会先做素材清单、制定剪辑策略,等你确认后才执行,全程可干预、可迭代。
链接
- GitHub:https://github.com/browser-use/video-use(26,123 ⭐,MIT)
- Browser Use Cloud(免本地安装版):https://cloud.browser-use.com/v4
- ElevenLabs Scribe:https://elevenlabs.io/app/settings/api-keys
- DEV Community 评测:https://dev.to/andrew-ooo/video-use-review-browser-use-teams-ai-video-editor-58nl
- HyperFrames(动画引擎之一):https://github.com/heygen-com/hyperframes
评论区
登录后可评论。