方言字幕一字不改:开源转写实测对照

会飞的荧 @feitu

一条很有画面感的实测:女友一生气就切方言,男朋友一句没听懂,字幕一个字没改全听懂了——四川话、粤语、英语、法语 11 句台词,AI 字幕 11 句全对,连男生结巴的"你你说啥"都原样留着。

字幕交给的是开源模型 Hojo-ASR-Multi-V1,它只改了一条规则:不翻译——你说什么字,它就写什么字

同一段音频喂给 Whisper large-v3 对照,差距很具体:粤语那句"你话过请我食饭㗎,唔好赖账",Whisper 写成书面中文"你曾說過請我吃飯的,不要賴帳",粤语原文一个字不剩,Hojo 版"唔、噶、话过"全在;四川话的"莫""要得",Whisper 变成"别""要的",Hojo 原样保留;英语那句 Whisper 整句漏掉,Hojo 一字不差。

作者还单独跑了两轮数据(自测口径):上一期 90 条欧洲五语种真人音频——干净音频 Hojo 略输 Whisper,加噪和 1.4 倍速后反超,且 90 条零语言误判、零幻觉,Whisper 则把一句意大利语认成了瑞典语;这期 30 条中文系加英语——普通话、英语双方全对;粤语按字算 Hojo 错 7%、Whisper 错 50%(错的全是"翻译"造成的);四川话 3% 对 11%

还有个彩蛋:模型页面到今天还写着"中文、英文待支持",可 Credits 里鸣谢了 WenetSpeech-Chuan 和 WenetSpeech-Yue——能力早就训进去了,文档没跟上

上手门槛写得很清楚:pip install hojo-asr,权重 12GB 从 Hugging Face 拉,Mac 上 CPU 跑 float32 峰值内存 20GB;建议前面接一个 VAD 按停顿切句再送进去,逐句识别时语言切换更稳;输出全小写无标点,做字幕直接用。

16GB 内存的机器别试,中文长音频他也没测过;Apache 2.0,商用也行,官方账号 @hojoHQ 的 roadmap 上写着推理引擎和小型化。

我的看法:字幕场景的胜负不在"平均准确率",而在保不保真——翻译式转写把方言压成书面语,等于在转写环节偷偷做了一次改写,方言词、语气、结巴全丢;Hojo 把规则反过来定(你说什么字我写什么字),再用零误判、零幻觉兜底,这对字幕比低 WER 更要紧。

文档滞后那条彩蛋也说明一件事:开源项目的能力经常跑在说明书前面,判断一个模型行不行,得看 Credits 和数据,别只看首页。

模型页:huggingface.co/HojoAI/Hojo-AS…

话题来源 @aehyok 327.3K阅读 ❤️91 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单