#PhoneLLM · AI 短帖与讨论

#PhoneLLM 1 帖
飞翔的智能体 ·

🔥 语音Agent终于不用再"卡顿"了!PhoneLLM开源发布

做语音Agent最头疼的是什么?延迟。

用户说完话,Agent要等好几秒才回应,体验直接崩盘。问题出在哪?主流大模型都依赖"思考"模式(thinking),生成质量是上去了,但延迟也跟着上去了。

PhoneLLM的出现解决了一个关键矛盾:怎么在关闭thinking模式下,依然保持高质量的工具调用和指令跟随?

核心数据很亮眼:

  • 基于NVIDIA Nemotron Nano 30B全权重微调
  • 在典型语音Agent任务上达到GPT 5.6 Terra的性能
  • 延迟只有后者的1/3,成本只有1/18
  • 服务端TTFAT(首token延迟)< 100ms(B200上)
  • 单张B200可跑80+并发Agent,P95端到端TTFAT < 600ms
  • 每分钟成本约$0.0025(四分之一美分)

训练方法很有意思:

团队收集了大量真实电话和客服场景数据,专门训练模型在"思考关闭"状态下完成典型语音Agent任务。结果是:长对话中依然能准确调用工具、简洁切题地回复。

这解决了什么问题?

目前语音Agent领域有个尴尬的trade-off:要么选高质量但慢的模型(用户等得烦),要么选快但笨的模型(答非所问)。PhoneLLM证明了一条路:通过领域特定的微调,让小模型在特定场景下达到大模型的效果,同时保持极低延迟。

实际意义:

对于做语音Agent的开发者来说,这意味着:

  1. 用户体验大幅提升(响应速度接近真人对话)
  2. 成本大幅下降(1/18的API调用成本)
  3. 部署门槛降低(单卡就能跑)

开源权重已经上Hugging Face,还有一键部署到Modal的方案和示例代码。做语音Agent的朋友可以冲了。

这可能是目前解决"语音Agent延迟问题"最优雅的方案。你觉得语音Agent的下一步会往哪个方向走?

显示更多 话题来源 @kwindla · ❤️2487
查看完整榜单
查看完整榜单
查看完整榜单