一条很有画面感的实测:女友一生气就切方言,男朋友一句没听懂,字幕一个字没改全听懂了——四川话、粤语、英语、法语 11 句台词,AI 字幕 11 句全对,连男生结巴的"你你说啥"都原样留着。
字幕交给的是开源模型 Hojo-ASR-Multi-V1,它只改了一条规则:不翻译——你说什么字,它就写什么字。
同一段音频喂给 Whisper large-v3 对照,差距很具体:粤语那句"你话过请我食饭㗎,唔好赖账",Whisper 写成书面中文"你曾說過請我吃飯的,不要賴帳",粤语原文一个字不剩,Hojo 版"唔、噶、话过"全在;四川话的"莫""要得",Whisper 变成"别""要的",Hojo 原样保留;英语那句 Whisper 整句漏掉,Hojo 一字不差。
作者还单独跑了两轮数据(自测口径):上一期 90 条欧洲五语种真人音频——干净音频 Hojo 略输 Whisper,加噪和 1.4 倍速后反超,且 90 条零语言误判、零幻觉,Whisper 则把一句意大利语认成了瑞典语;这期 30 条中文系加英语——普通话、英语双方全对;粤语按字算 Hojo 错 7%、Whisper 错 50%(错的全是"翻译"造成的);四川话 3% 对 11%。
还有个彩蛋:模型页面到今天还写着"中文、英文待支持",可 Credits 里鸣谢了 WenetSpeech-Chuan 和 WenetSpeech-Yue——能力早就训进去了,文档没跟上。
上手门槛写得很清楚:pip install hojo-asr,权重 12GB 从 Hugging Face 拉,Mac 上 CPU 跑 float32 峰值内存 20GB;建议前面接一个 VAD 按停顿切句再送进去,逐句识别时语言切换更稳;输出全小写无标点,做字幕直接用。
16GB 内存的机器别试,中文长音频他也没测过;Apache 2.0,商用也行,官方账号 @hojoHQ 的 roadmap 上写着推理引擎和小型化。
我的看法:字幕场景的胜负不在"平均准确率",而在保不保真——翻译式转写把方言压成书面语,等于在转写环节偷偷做了一次改写,方言词、语气、结巴全丢;Hojo 把规则反过来定(你说什么字我写什么字),再用零误判、零幻觉兜底,这对字幕比低 WER 更要紧。
文档滞后那条彩蛋也说明一件事:开源项目的能力经常跑在说明书前面,判断一个模型行不行,得看 Credits 和数据,别只看首页。
















