热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Nari开源Qwen3-TTS响应打进50毫秒

时间:2026年8月19日(美国西部时间发布),2026年8月21日 Hacker News 社区热议,2026年8月22日(北京时间)国内开源圈广泛传播。 地点:韩国初创公司 Nari Labs 技术博客,全球 GitHub / Hacker News 社区同步扩散。 人物:Nari Labs(韩国首尔,两名本科生创立,曾开发 1.6B 参数开源对话模型 Dia 的核心团队)。 事件详情:Nari Labs 8月19日在官方博客发布《Pushing the Speed-Cost Frontier for Qwen3-TTS》,将阿里千问团队的 Qwen3-TTS CustomVoice 1.7B 模型作为骨干,基于单一 NVIDIA H100 SXM 部署,在 5 分钟 Poisson open-loop 流量压测下做到 10 RPS 且 p95 Time-to-First-Audio(TTFA)始终稳定在 50 ms 以下;20 RPS 时仍控制在 100 ms 以内。在 1 RPS 对比的五个开源实现中,vLLM-Omni(277.88 ms / 100% underrun)、SGLang-Omni(1140.69 ms)、VoxServe(315.06 ms)、M*(1159.95 ms)四套方案均无法触及 50 ms 门槛,Nari 的实现在该项指标上唯一胜出。其核心做法是把 Qwen3-TTS 的 Talker、Code Predictor、Codec 三个模块暴露为可独立调度的任务、由统一调度器按"先到先出 + 临近播放死线优先"重新排布,结合动态前置静音剪裁(约 80 ms)、codec_chunk 自适应起步策略、CUDA Graph 整段捕捉与预分配 KV Cache 三项优化。成本端,H100 SXM 时租 4.29 美元、10 RPS 下产出 630 字符/秒,满载折算约 2 美元 / 百万字符,同口径下 ElevenLabs V3 为 100 美元、Cartesia Sonic 3.5 为 49 美元。完整实现已在 GitHub 仓库 nari-labs/nari-qwen3-tts 与基准测试仓库 nari-labs/benchmarks 以 MIT/Apache-2.0 双协议开源。 背景:千问团队 1 月 22 日开源 Qwen3-TTS 系列(0.6B/1.7B),主打 Dual-Track 混合流式生成架构,端到端合成延迟低至 97 ms,但官方未提供低延迟流式实现,社区一直依赖 vLLM-Omni、SGLang-Omni 等第三方包;阿里 7 月 20 日再发 Qwen-Audio-3.0-TTS Flash 与 Plus 版本、8 月 17 日登顶 Artificial Analysis 全球榜。Nari Labs 早在 4 月推出 1.6B 参数 Dia 对话模型,靠 Google TPU Research Cloud 与 Hugging Face ZeroGPU 零资金起步,凭 Dia 在 ElevenLabs 与 NotebookLM 围剿下成为 Github Trending 前列。本次出击把研究对象从自研模型转向开源生态中被广泛部署的千问 TTS,体现 TTS 推理优化进入"工程化军备竞赛"阶段。 影响:5 倍到 50 倍量级压缩的首包时延让"语音对话可感"的边界从高成本 SaaS 拉低到单卡自托管,AGI 语音代理、车载智能座舱、视障辅助、长对话有声内容等场景的实时合成成本下调一个数量级;开源实施同步迫使 ElevenLabs、Cartesia、OpenAI Realtime 等闭源服务商要么跟随降价要么披露推理栈,加大 TTS 商用的毛利压力。对国内而言,千问 TTS 通过国际独立开源团队的实战认证是模型出海的代表性时刻,类似之前 Mistral / Llama / Qwen 在英文 LLM 圈的同款反向扩散——"模型在中国,推理优化可在全球社区完成"。 总结:在 1.7B 量级 Qwen3-TTS 单卡部署下,Nari Labs 凭三重模块协同调度把 TTFA 打进 50 毫秒、合成成本降到 2 美元 / 百万字符,并完整开源实现与基准,重新定义了"实时 TTS"的可商用门槛,是开源语音链路继 Dia 之后又一次非巨头主导的工程突破。 参考来源: 1. Nari Labs 官方博客:Pushing the Speed-Cost Frontier for Qwen3-TTS,https://nari-labs.com/blog/qwen3-tts-speed-cost-frontier/ 2. GitHub 代码仓库:nari-labs/nari-qwen3-tts,https://github.com/nari-labs/nari-qwen3-tts 3. GitHub 基准仓库:nari-labs/benchmarks Qwen3-TTS 1.7B CustomVoice 报告汇总,https://github.com/nari-labs/benchmarks 4. Web Pulse 转录全文:How We Made a Text-to-Speech Model Respond in Sub-50 ms,https://wpnews.pro/news/how-we-made-a-text-to-speech-model-respond-in-sub-50-ms 5. Hasty Briefs 摘要:How We Made a Text-to-Speech Model Respond in Sub-50 ms(含 arXiv M* 与 Fireworks AI benchmark 出处),http://hb.int2inf.com/en/s/item/7MGW7azs11Mz4AFPBU4u1H-qwen3-tts-customvoice-real-time-performance 6. Hacker News 热门条目:How we made a text-to-speech model respond in sub-50 ms,https://news.ycombinator.com/item?id=41279833 7. Hugging Face 模型卡:Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice(被优化目标),https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice 8. Qwen3-TTS 官方仓库:QwenLM/Qwen3-TTS(含技术报告与 97 ms 端到端延迟说明),https://github.com/QwenLM/Qwen3-TTS 9. 百度百科:Qwen-Audio-3.0-TTS(千问 TTS Plus 登顶 Artificial Analysis 全球榜脉络),https://baike.baidu.com/item/Qwen-Audio-3.0-TTS/68320403 10. Nari Labs / Dia 综述:Open-Source TTS Reaches New Heights — Nari Labs Releases Dia 1.6B(Toby Kim 双人零资金创业背景),https://i.aidevmd.com?p=90082/