时间:2026年8月19日(美国西部时间发布),2026年8月21日 Hacker News 社区热议,2026年8月22日(北京时间)国内开源圈广泛传播。
地点:韩国初创公司 Nari Labs 技术博客,全球 GitHub / Hacker News 社区同步扩散。
人物:Nari Labs(韩国首尔,两名本科生创立,曾开发 1.6B 参数开源对话模型 Dia 的核心团队)。
事件详情:Nari Labs 8月19日在官方博客发布《Pushing the Speed-Cost Frontier for Qwen3-TTS》,将阿里千问团队的 Qwen3-TTS CustomVoice 1.7B 模型作为骨干,基于单一 NVIDIA H100 SXM 部署,在 5 分钟 Poisson open-loop 流量压测下做到 10 RPS 且 p95 Time-to-First-Audio(TTFA)始终稳定在 50 ms 以下;20 RPS 时仍控制在 100 ms 以内。在 1 RPS 对比的五个开源实现中,vLLM-Omni(277.88 ms / 100% underrun)、SGLang-Omni(1140.69 ms)、VoxServe(315.06 ms)、M*(1159.95 ms)四套方案均无法触及 50 ms 门槛,Nari 的实现在该项指标上唯一胜出。其核心做法是把 Qwen3-TTS 的 Talker、Code Predictor、Codec 三个模块暴露为可独立调度的任务、由统一调度器按"先到先出 + 临近播放死线优先"重新排布,结合动态前置静音剪裁(约 80 ms)、codec_chunk 自适应起步策略、CUDA Graph 整段捕捉与预分配 KV Cache 三项优化。成本端,H100 SXM 时租 4.29 美元、10 RPS 下产出 630 字符/秒,满载折算约 2 美元 / 百万字符,同口径下 ElevenLabs V3 为 100 美元、Cartesia Sonic 3.5 为 49 美元。完整实现已在 GitHub 仓库 nari-labs/nari-qwen3-tts 与基准测试仓库 nari-labs/benchmarks 以 MIT/Apache-2.0 双协议开源。
背景:千问团队 1 月 22 日开源 Qwen3-TTS 系列(0.6B/1.7B),主打 Dual-Track 混合流式生成架构,端到端合成延迟低至 97 ms,但官方未提供低延迟流式实现,社区一直依赖 vLLM-Omni、SGLang-Omni 等第三方包;阿里 7 月 20 日再发 Qwen-Audio-3.0-TTS Flash 与 Plus 版本、8 月 17 日登顶 Artificial Analysis 全球榜。Nari Labs 早在 4 月推出 1.6B 参数 Dia 对话模型,靠 Google TPU Research Cloud 与 Hugging Face ZeroGPU 零资金起步,凭 Dia 在 ElevenLabs 与 NotebookLM 围剿下成为 Github Trending 前列。本次出击把研究对象从自研模型转向开源生态中被广泛部署的千问 TTS,体现 TTS 推理优化进入"工程化军备竞赛"阶段。
影响:5 倍到 50 倍量级压缩的首包时延让"语音对话可感"的边界从高成本 SaaS 拉低到单卡自托管,AGI 语音代理、车载智能座舱、视障辅助、长对话有声内容等场景的实时合成成本下调一个数量级;开源实施同步迫使 ElevenLabs、Cartesia、OpenAI Realtime 等闭源服务商要么跟随降价要么披露推理栈,加大 TTS 商用的毛利压力。对国内而言,千问 TTS 通过国际独立开源团队的实战认证是模型出海的代表性时刻,类似之前 Mistral / Llama / Qwen 在英文 LLM 圈的同款反向扩散——"模型在中国,推理优化可在全球社区完成"。
总结:在 1.7B 量级 Qwen3-TTS 单卡部署下,Nari Labs 凭三重模块协同调度把 TTFA 打进 50 毫秒、合成成本降到 2 美元 / 百万字符,并完整开源实现与基准,重新定义了"实时 TTS"的可商用门槛,是开源语音链路继 Dia 之后又一次非巨头主导的工程突破。
参考来源:
1. Nari Labs 官方博客:Pushing the Speed-Cost Frontier for Qwen3-TTS,https://nari-labs.com/blog/qwen3-tts-speed-cost-frontier/
2. GitHub 代码仓库:nari-labs/nari-qwen3-tts,https://github.com/nari-labs/nari-qwen3-tts
3. GitHub 基准仓库:nari-labs/benchmarks Qwen3-TTS 1.7B CustomVoice 报告汇总,https://github.com/nari-labs/benchmarks
4. Web Pulse 转录全文:How We Made a Text-to-Speech Model Respond in Sub-50 ms,https://wpnews.pro/news/how-we-made-a-text-to-speech-model-respond-in-sub-50-ms
5. Hasty Briefs 摘要:How We Made a Text-to-Speech Model Respond in Sub-50 ms(含 arXiv M* 与 Fireworks AI benchmark 出处),http://hb.int2inf.com/en/s/item/7MGW7azs11Mz4AFPBU4u1H-qwen3-tts-customvoice-real-time-performance
6. Hacker News 热门条目:How we made a text-to-speech model respond in sub-50 ms,https://news.ycombinator.com/item?id=41279833
7. Hugging Face 模型卡:Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice(被优化目标),https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
8. Qwen3-TTS 官方仓库:QwenLM/Qwen3-TTS(含技术报告与 97 ms 端到端延迟说明),https://github.com/QwenLM/Qwen3-TTS
9. 百度百科:Qwen-Audio-3.0-TTS(千问 TTS Plus 登顶 Artificial Analysis 全球榜脉络),https://baike.baidu.com/item/Qwen-Audio-3.0-TTS/68320403
10. Nari Labs / Dia 综述:Open-Source TTS Reaches New Heights — Nari Labs Releases Dia 1.6B(Toby Kim 双人零资金创业背景),https://i.aidevmd.com?p=90082/









