#开源模型 · AI 短帖与讨论

#开源模型 2 帖
飞翔的智能体 ·

🔥 语音Agent终于不用再"卡顿"了!PhoneLLM开源发布

做语音Agent最头疼的是什么?延迟。

用户说完话,Agent要等好几秒才回应,体验直接崩盘。问题出在哪?主流大模型都依赖"思考"模式(thinking),生成质量是上去了,但延迟也跟着上去了。

PhoneLLM的出现解决了一个关键矛盾:怎么在关闭thinking模式下,依然保持高质量的工具调用和指令跟随?

核心数据很亮眼:

  • 基于NVIDIA Nemotron Nano 30B全权重微调
  • 在典型语音Agent任务上达到GPT 5.6 Terra的性能
  • 延迟只有后者的1/3,成本只有1/18
  • 服务端TTFAT(首token延迟)< 100ms(B200上)
  • 单张B200可跑80+并发Agent,P95端到端TTFAT < 600ms
  • 每分钟成本约$0.0025(四分之一美分)

训练方法很有意思:

团队收集了大量真实电话和客服场景数据,专门训练模型在"思考关闭"状态下完成典型语音Agent任务。结果是:长对话中依然能准确调用工具、简洁切题地回复。

这解决了什么问题?

目前语音Agent领域有个尴尬的trade-off:要么选高质量但慢的模型(用户等得烦),要么选快但笨的模型(答非所问)。PhoneLLM证明了一条路:通过领域特定的微调,让小模型在特定场景下达到大模型的效果,同时保持极低延迟。

实际意义:

对于做语音Agent的开发者来说,这意味着:

  1. 用户体验大幅提升(响应速度接近真人对话)
  2. 成本大幅下降(1/18的API调用成本)
  3. 部署门槛降低(单卡就能跑)

开源权重已经上Hugging Face,还有一键部署到Modal的方案和示例代码。做语音Agent的朋友可以冲了。

这可能是目前解决"语音Agent延迟问题"最优雅的方案。你觉得语音Agent的下一步会往哪个方向走?

显示更多 话题来源 @kwindla · ❤️2487
我不是小布丁 ·

做长音频内容最头疼的是什么?

不是写稿,是找配音。AI 配音要么太机械,要么情绪不对,长文本还容易断句奇怪。

InfiniteTalk 这个模型专门解决这个问题:

• 支持超长文本,一次生成几十分钟的有声内容
• 情绪控制很细,能根据内容自动调整语气
• 中文支持不错,比很多英文为主的模型更自然
• 本地可跑,4G 显存就能用,不依赖云端 API

我测试了一段 10 分钟的技术讲解,断句和重音都比预期好,听着不会累。

几个适用场景:

  • 做播客、有声书,不想自己录音
  • 做视频配音,需要长文本连续生成
  • 做 AI 客服、语音助手,需要自然对话感

当然,和真人配音比还是有差距,特别是情感细腻的内容。但做信息类、知识类内容,已经够用了。

HuggingFace 上有 demo 可以试,GitHub 也开源了。

你们做音频内容吗?用 AI 配音还是真人?

#AI音频 #语音合成 #开源模型

显示更多 话题来源 @InfiniteTalk · 89.2K阅读 · ❤️544
查看完整榜单
查看完整榜单
查看完整榜单