时间:2026 年 8 月 31 日
地点:美国旧金山湾区(Gradium AI 总部)+ Coval 基准平台
人物:Gradium AI 工程与产品团队、Coval 基准运营方
事件详情:Gradium AI 正式发布新一代文本转语音(TTS)模型,并将其设为 Gradium API 与 Studio 的默认引擎,存量音色(含自定义克隆)无需迁移即可生效。该模型在 500 句"硬案例"评测集上取得 81.0% 的人工盲测通过率,领先 Cartesia Sonic 3.6(75.1%)与 ElevenLabs v3 Conversational(65.4%)。"硬案例"指订单号、回调号码、邮箱地址、IBAN 等真实语音客服最容易读错的句式。同时,该模型在 Coval TTS 基准上达到 216 毫秒的首响(P50),较上一代快 170 毫秒,且 480 次运行的四分位距仅 30 毫秒,为参评五家模型中最稳定。
背景:语音代理(Voice Agent)在客服、IVR 场景中"听着不错但读错关键信息"是行业顽疾,传统 WER 指标无法衡量数字、邮箱、缩写的实际表现。Gradium 与 Cartesia、ElevenLabs、Fish Audio、Inworld 等厂商共同把"硬案例"通过率推到台面,并开源评测集与复现脚本。
影响:实时语音客服、IVR、电话外呼、保险理赔等场景对号码/邮箱读错的容忍度极低,新模型直接降低重听、二次确认成本。Cartesia 与 ElevenLabs 作为 Gradium 直接对标的厂商,后续或将以同款 500 句评测集回应或反击,独立复现将成为市场关注焦点。Gradium 还向 Discord 提交硬案例失败报告的开发者发放 100 万 credits,实质上在做对抗性众测。
总结:Gradium 把"快"与"准"同时推到 216 毫秒 + 81% 硬案例的组合,为语音 AI 行业立下新一代基准门槛;TTS 竞争正式从"听起来像不像"转向"数字/邮箱读不读得对"。
参考来源:
1. MarkTechPost:https://www.marktechpost.com/2026/08/31/gradium-ai-releases-new-default-tts-model-81-0-hard-case-pass-rate-at-216-ms-time-to-first-audio/
2. Gradium 官方博客:https://gradium.ai/blog/gradium-tts-latency-and-accuracy
3. Gradium API Release Notes:https://docs.gradium.ai/guides/release-notes
4. 500 句硬案例开源评测集(HuggingFace,CC BY 4.0):https://huggingface.co/datasets/gradium/tts-eval-customer-support-202608
5. Coval TTS 基准:https://benchmarks.coval.ai/tts
6. AIPulseLab 信号解读:https://aipulselab.tech/news/gradium-ai-releases-new-default-tts-model-810percent-hard-case-pass-rate-at-216-ms-time-to-first-audio-61c879
7. AI Daily Post 评论:https://aidailypost.com/news/gradium-ais-new-tts-model-scores
8. Interestana 编译:https://interestana.com/articles/gradium-ai-releases-new-default-tts-model-810-hard-case-pass-rate-at-216-ms-time-to-first-audio-00sdk7m3







