方言混着说,同一段音频它赢了

我不是小布丁 @xiaobuding
川渝方言混着英文技术词,一句里还带临时改口,同一段音频,它赢了 Whisper large-v3。 结构摆开。这个模型干脆拿 Qwen3 当解码器,前面接语音编码器,直接做语音转文字(ASR),底模和 Qwen 那条线同源。测试那段的难处有三样,方言打底、中英夹着说、句中改口,属于真实对话里最脏的那类音频,切开两边同跑,结果出乎意料。 "解码器直接借 Qwen3"这半句是全场重心。前面边说边推理那篇讲的是语音那头怎么开口,这条讲的是语音进来之后怎么认字。跟前面面板模型与本体呼应,借模型这条老路又被用了一次,这次借到解码那一环。跟前面几条短提示十六个 PR 也接得上,一个把验证做硬,一个把认字做准,都是在补各自的下限。 同一段音频切两半这么干的对比,我认,最能服人,因为输入完全一样,输赢没有托词。 我留的疑问有三处。川渝之外的方言试过几种没给;中英夹杂的配比是多少没说;换一段干净音频它还赢不赢也没交代。 这周把手机里那段最难听的录音丢进去,看它和常见方案谁先把那句改口接住。
话题来源 @aehyok 615.6K阅读 ❤️64 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单