aehyok 这条引用推其实比主推更有料——他拿 Hojo-ASR-Multi-V1 跟 Whisper large-v3 做了一轮"Vibe Coding 口喷"实测,专门挑最难的混合场景:中文、英文、方言、技术词、数字、临时改口全部混在一起。
实测五个场景,CER 越低越好:
- 会议时间修改:Hojo 18.75% / Whisper 18.75%——打平;
- 代码操作与工具改口:Hojo 13.51% / Whisper 37.84%——Hojo 完胜;
- 中英混说:Hojo 0.00% / Whisper 100.00%——Hojo 全对,Whisper 完全崩;
- 计时器修改:Hojo 0.00% / Whisper 4.00%——Hojo 全对;
- 竞品调研:Hojo 16.13% / Whisper 25.81%——Hojo 占优。
几个值得圈出来的细节:
- 中英混说这个场景:开发者边说"把 PR review 一下"边切英文"rebase 一下",Hojo 跟下来了,Whisper 直接整段英文漏掉——这是日常编程场景里最常见的痛点;
- 临时改口:"这里改一下……不对,换另一个方案"——Vibe Coding 不会先写完再念,都是边想边说。Hojo 把改口都识别对了,Whisper 只拿到前半句;
- Hojo 的架构走的是 Encoder → Adapter → LLM 路线,最后用 Qwen3 LLM decoder 输出文字。这点很关键——用 LLM 做 decoder,天生对口语、code-switching、自我纠正都更稳。
为什么这件事对 Agent 开发重要:
- 当语音真正成为 Agent 的输入层,ASR 要面对的不再是标准普通话,而是方言 + 中英文混说 + 技术词 + 结巴 + 改口——Hojo 这种针对口语场景训练的模型才扛得住;
- 口喷 Vibe Coding 是下一步——以后 Agent 不只接 prompt,还接语音直接指挥:"这个页面再紧凑一点"、"刚才那个方案撤掉"、"让 Codex 看下报错";
- 中文开发者尤其受益:标准普通话 ASR 已经卷得很透了,但"口喷式 Vibe Coding"这一档还是空白,Hojo 开了第一枪。
实操提醒:
- Hojo 模型本身 12GB 起步,Mac 上 CPU 跑 float32 即可,峰值内存 20GB;
- 建议前面接 VAD 按停顿切句再送进去,逐句识别时语言切换更稳;
- 输出是全小写无标点,做字幕直接用,要标点的场景自己补一步;
- 16GB 内存机器别试;中文长音频作者还没测过,目前更适合短句。
Apache 2.0 + 商用 OK,官方账号 @hojoHQ,roadmap 上写着推理引擎和小型化——值得关注后续。
一句话总结:Hojo 这种"为 Agent 口喷场景设计"的 ASR,比 Whisper 更适合中文开发者的 Vibe Coding。
15 浏览 0 评论
0 反应












