26,123 颗星背后:browser-use 团队如何把视频剪辑变成「对话执行」

把 Raw 素材扔进文件夹,用自然语言告诉 AI 要怎么剪——然后等着收 final.mp4。browser-use 团队刚发布的 video-use,正在把视频剪辑从「软件操作」变成「对话执行」。

它在解决什么问题

视频剪辑有两个绕不开的痛点:专业软件学习曲线陡峭(Premiere、Final Cut),而 AI 视频工具大多数是「一键生成」的盲盒——你无法控制具体每一帧怎么剪。

video-use 的思路是:让一个有 shell 访问权限的 AI 编程 Agent(Claude Code、Codex、OpenClaw 等)直接调用 ffmpeg 来完成剪辑。你不需要打开任何软件,只要告诉它:「把前面三分钟里所有的语气词剪掉,然后加一个片头动画。」

它支持的完整工作流包括:

  • 转录:ElevenLabs Scribe 做词级时间戳转录,精度到毫秒
  • 自动删口播填充词:um、uh、重复口误全部定位并切除
  • 智能分段:根据静音间隙和语义边界决定剪辑点,绝不割裂单词
  • 色彩分级:内置 ffmpeg 调色链,可选温暖电影感、中性高对比或完全自定义
  • 字幕烧录:默认 2 词大写块格式,支持自定义样式
  • 动画叠加层:通过 HyperFrames、Remotion、Manim 或 PIL 并行生成,LLM 统一调度
  • 自我校验:输出后自动在每个剪辑边界做音视频帧检查,确保无跳帧、无爆音
  • 会话记忆:每次编辑状态持久化到 project.md,下次继续时 Agent 知道上次做到哪了

所有产物输出到 <videos_dir>/edit/,项目目录保持干净。

核心定位:「LLM 读视频」而不是「LLM 看视频」

项目 README 里有一句话点明了设计哲学:LLMs Don’t Watch Video, They Read Video。video-use 从不”看”视频帧,而是基于 Scribe 生成的词级时间戳 transcript 做决策。视频本身只在确认剪辑边界时才用 timeline_view 工具做视觉校验,其余所有推理都在文本 transcript 上完成。

这解释了为什么它不需要 GPU——推理完全在 LLM 侧执行,ffmpeg 负责的是纯计算执行。代价是:它依赖 ElevenLabs API 做转录,纯离线场景不适用。

项目边界:适合谁,不适合谁

适合:

  • 有原始素材、需要精细控制、愿意用自然语言描述剪辑意图的用户
  • 已有 Claude Code / Codex / OpenClaw 等 AI 编程 Agent 的用户(零额外安装成本)
  • 需要批量处理系列视频(多段素材并行转录 + 统一剪辑策略)
  • 制作教程、采访、产品演示等以说话为主的内容

不适合:

  • 纯视觉叙事内容(MV、快节奏混剪)—— LLM 在视觉节奏判断上仍弱于专业剪辑直觉
  • 完全不想配置 API key 的用户(ElevenLabs Scribe 是必选项,没有免费档)
  • 追求实时预览的交互式剪辑体验(它是「确认后执行」模式,不是实时预览)
  • 需要复杂多机位编辑的专业制作流程

真实使用门槛

根据 install.md 和 SKILL.md 整理,完整安装需要:

  1. AI 编程 Agent:Claude Code / Codex / Hermes / OpenClaw(之一即可)
  2. ffmpeg + ffprobe:macOS brew install ffmpeg,Debian apt-get install ffmpeg,必须加入 PATH
  3. ElevenLabs API Key:用于 Scribe 转录,elevenlabs.io/app/settings/api-keys 获取,无免费档,按用量计费
  4. Python 依赖uv syncpip install -e .(依赖 requests、librosa、matplotlib、pillow、numpy)
  5. Node.js 22+:仅在使用 HyperFrames 或 Remotion 动画槽位时才需要

安装后,Agent 会自动完成克隆、依赖安装、skill 注册,全程只问用户一次 API Key。

技术栈和可扩展性

  • 语言:Python(轻量依赖,核心工具是 ffmpeg,不绑 GPU)
  • 许可证:MIT,完全开源,允许商用
  • 动画系统:通过子 Agent 并行调度,每个动画槽位独立运行,Wall time ≈ 最慢那个
  • Session 持久化project.md 记录每次编辑会话的决策历史,支持跨会话继续

社区反应

从 CSDN、DEV Community 和独立博主的评测来看,video-use 的核心卖点被社区认可为两点:一是 MIT 许可证下完全开源,不像同类产品有功能锁区;二是将 token 消耗从「逐帧分析」降到「Transcript 读取」,成本结构完全不同。

browser-use 团队本身背书了 11 万星级别的 browser-use 项目,他们选择在视频剪辑这个场景复刻同样的「AI Agent 操作工具」范式,而不是做另一个「AI 生成视频」产品,这个判断值得关注。

怎么上手

第一步:确保你有一个运行中的 AI 编程 Agent(Claude Code、Codex 或兼容 OpenClaw)。

第二步:让 Agent 执行以下安装指令:

Set up https://github.com/browser-use/video-use for me.

Agent 会自动完成克隆、依赖安装、ffmpeg 验证和 skill 注册,然后问你一次 ElevenLabs API Key。

第三步:把你的原始素材扔进任意文件夹,进入该目录运行 Agent:

cd /path/to/your/videos
claude  # 或 codex、openclaw

然后直接说:「帮我把 2024Q4 回顾视频剪成一个 3 分钟的发布版,删除所有语气词,加一个动态片头。」

Agent 会先做素材清单、制定剪辑策略,等你确认后才执行,全程可干预、可迭代。

链接

评论区

0 条评论

登录后可评论。