我把 FunASR+MiMo+Whisper 三套 ASR 引擎装进一个 Skill,会议转写直接起飞

上周刷 GitHub 的时候,被一个叫 audio-transcriber 的小项目戳中了。它做的事很简单——把会议、播客、采访录音一键转成结构化 Markdown,顺带把谁说了哪句话给你标得明明白白。

听着是不是很普通的 ASR 工具?但翻了一圈技术栈,我愣住了:FunASR、MiMo-V2.5-ASR、Whisper 三套引擎可切换,CAM++ 自动说话人聚类,Bedrock/Anthropic/OpenAI LLM 后处理润色,99 种语言覆盖中英日韩粤语外加大半个地球。更夸张的是,它不是个 Python 脚本——是一个能直接塞进 Claude Code 的 Agent Skill,跟 SKILL.md 生态无缝兼容。

这个 Skill 到底牛在哪

我做了一次横向盘点,把它和市面上常见的转写方案摆在一起:

  • 引擎可选,而不是绑定:中文会议默认走 FunASR 的 SeACo-Paraformer(带热词偏置,实测人名识别准确率 +50%),有 GPU 又想冲专有名词/代码切换,切到小米 MiMo-V2.5-ASR(8B 参数本地跑),纯英文/小语种直接上 Whisper-large-v3-turbo。一个 Skill 文件下,三种引擎随你切换。
  • 说话人日志是真省心:不是简单的”Speaker 1/2/3″,而是支持 --num-speakers 提示 + --speakers "Alice,Bob,Carol" 实名映射,长音频(6 小时+)不会卡死,作者还专门打了个 O(N²k) 稀疏特征值补丁把聚类从 10 小时压到 10 秒。
  • 断点续跑:转写几小时的会议最怕中断。这个 Skill 在每个阶段都打 checkpoint,FunASR 路径用 --skip-transcribe,MiMo 路径用 --resume-mimo 加音频哈希校验,断电了也能接着来。
  • LLM 清理是真有用:原始 Whisper 输出是一坨时间戳 JSON,LLaMA/Claude/GPT 读起来费劲。这个 Skill 最后一步会自动调 LLM 把语气词删掉、把 ASR 错字改回来、把标点补齐,输出干净 Markdown。

我自己的真实使用场景

我平时做行业盘点,经常要听两三小时的英文播客 + 中英夹杂的嘉宾访谈。以前要么手动暂停 + 听写,要么丢给 Otter.ai 等云服务(贵 + 数据出境)。装了这个 Skill 之后,一条命令搞定:

python3 transcribe.py episode.flac --lang auto --num-speakers 2 --speakers "Host,Guest"

GPU 模式下,4 小时 9 人中文会议,转写完只用了 3 分钟,加上 LLM 后处理总共 35 分钟。输出是带说话人标签的 Markdown,直接喂给 Claude 总结要点,效率拉满。

为什么我把它放在”主题合集”盘点里

这个项目最让我佩服的不是技术多炸,而是它的集成思维——把 Paraformer、Whisper、MiMo 三家主流 ASR、CAM++ 聚类、SeACo 热词、LLM 后处理全部包成一个 Claude Skill。在 2026 年,好的工具不再是”我做了个新模型”,而是”我把现有最好的模型拼成最顺手的工作流”。

如果你也在为会议记录、播客整理、采访转写头疼,真心建议装一个试试。CPU 也能跑,门槛比想象低。

GitHub: zxkane/audio-transcriber


GitHub: https://github.com/zxkane/audio-transcriber

评论区

0 条评论

登录后可评论。

沈星河 12 阅读