语音转写打到了每音频小时 0.1 美元:什么时候该用 API,什么时候该自托管

先说结论

  1. 价格没涨,能力在涨。xAI 在 9 月 18 日发了 Grok Voice Transcribe 2.0,官方明确说定价与 1.0 完全相同:批量转写 $0.10 / 音频小时、流式 $0.20 / 音频小时,且说话人分离、时间戳、关键词都包含在内,不额外收费。
  2. 翻译成实际成本:1000 小时的会议录音 = 100 美元(批量档)。这个价位已经低于绝大多数团队”自己拿 GPU 跑 Whisper”的隐性成本——自托管的账不能只算电费,要算运维和闲置
  3. 这次的主要进步在多语种和”脏音频”。官方给的例子很具体:短语音(比如车机指令)场景下,词错率从 20.6% 降到 6.8%;多语种支持”自动识别语言,并且能在同一次转写里跟上中途换语言“——这是它相对 1.0 的最大改进。
  4. 已有集成不用改代码。官方原话是现有 Speech-to-Text API 集成直接获得精度提升、无需任何代码变更

这次到底升级了什么

它针对的是真实世界的音频,官方列的困难场景很实在:不稳定的电话线路、多人抢话、方言口音、以及被念出来的电话号码和邮箱地址。这类内容恰恰是”录音转文字”最常见的用途,也是最容易被通用模型搞砸的地方。

几个可核实的点:

  • 底子是 Grok Voice 的音频基础模型。官方称 Grok Voice 已经在支撑每天数万通客服通话、转写数百万小时的视频旁白。
  • 多语种是最大改进:支持几十种语言、自动检测语种,并且允许单次转写中切换语言
  • 短句场景提升显著:官方给出的对比是词错率 20.6% → 6.8%(对象是车载指令这类缺少上下文、难判语种的短语音)。
  • 能力的对照面:官方图表里出现的对手包括 Universal-3.5 Realtime Pro、Chirp 3 Streaming、Azure STT Real-time、Nova-3 Realtime 等——这些是厂商自测,看方向可以,别当独立评测。

新增的实用开关(这些会直接改变你的输出,值得注意):

能力 说明
批量 + 流式 录音文件与 URL 走批量,实时场景走流式——价差是两倍
填充词移除 去掉 “um”、”uh” 这类口语填充词,转写稿更干净
智能话轮检测 判断说话人一轮说完没有,给语音 Agent 用
附带项 说话人分离、时间戳、关键词都在价格内

成本账:$0.10/小时意味着什么

把官方价格直接换算一下(不含任何折扣):

场景 音频总时长 批量($0.10/h) 流式($0.20/h)
每天 2 小时团队会议 每月约 40 小时 $4 $8
每周 10 小时访谈/客服复盘 每月约 40 小时 $4 $8
每天 100 小时客服录音 每月约 3,000 小时 $300 $600
视频内容批量转写 10,000 小时 $1,000 不适用(通常走批量)

关键判断:如果只是”每月几十小时”,自托管的硬件和运维成本永远不可能比这个便宜——一块能跑语音模型的显卡的电费都不止 4 美元。这个价位真正改变的是长尾场景:以前因为”跑不起”而放弃转写的录音,现在可以批量处理了。

自己算一遍(改 HOURS 就行):

# 按官方价格估算你自己的转写成本:批量 $0.10/音频小时,流式 $0.20/音频小时
HOURS=3000
python3 -c "h=$HOURS; print(f'批量: ${h*0.10:,.2f}/月   流式: ${h*0.20:,.2f}/月')"

什么时候该用 API,什么时候该自托管

维度 用 API(本次这类) 自托管(Whisper 等开源模型)
成本 每月几小时到几千小时都很线性:$0.10/音频小时 硬件一次性投入 + 电费 + 运维;只有持续高负载才划算
隐私 音频要出你的边界——这是唯一真正的硬约束 数据不出内网,适合医疗、法务、涉密场景
多语种与脏音频 这次升级的主战场,短句词错率官方给到 6.8% 依赖你选的模型档位,小模型在多语种和噪声下掉得很快
运维 零运维,配额与限流是唯一要管的事 要管显存、并发、排队、升级;参考我们自己算过的显存账
延迟 流式档 $0.20/小时,适合实时字幕 本地推理延迟可控,但要自己调优

一句话的取舍数据不能出内网 → 自托管;能出内网 → 先算一遍 API 的账,绝大多数团队会在第一张表上发现自己属于”直接用 API”那一类。

顺带一句:如果你决定自托管,显存怎么估我们上一篇算过——视觉/音频这类长序列输入的瓶颈常常不在权重,而在 KV cache,估算顺序错了会白折腾。

三个容易踩的点

  • 批量与流式的价差是两倍,而很多团队”默认用流式”。录播类内容一律走批量,这一条就能省一半。
  • “无需改代码”不等于”输出不变”。开了填充词移除、话轮检测之后,转写文本的结构会变——下游如果有基于文本格式的解析逻辑,要重新测
  • 厂商自测的基准只能看方向。官方图里对手的成绩同样来自各家自述,没有任何一方是第三方独立评测

这次没核实的

  • 官方称”更准”和”两倍”的具体口径,我没能拿到完整表述,所以本文只引用了能确证的短句词错率(20.6% → 6.8%)与多语种描述。
  • 没有实测:我不做语音模型的横评,本文的”该用 API 还是自托管”是成本与合规框架,不是精度结论。
  • 人民币价格、并发上限、单文件时长限制等工程参数本次没有核对,落地前请查官方文档。
  • Atlassian Loom 的案例来自官方公告的客户证言,属厂商材料,我不把它当作独立验证。

参考来源

  • Introducing Grok Voice Transcribe 2.0——发布时间 2026-09-18、能力描述、短句词错率 20.6% → 6.8%、价格 $0.10/$0.20 每音频小时
  • openai/whisper——自托管路线最常用的开源方案(本文对照表里的”自托管”一列以它为代表)
  • 自托管前怎么估显存(本社区上一篇):单张 3090 能跑哪些视觉模型——权重与 KV cache 的换算方法同样适用于音频长序列

评论区

0 条评论

登录后可评论。

早八人 205 阅读