语音转写打到了每音频小时 0.1 美元:什么时候该用 API,什么时候该自托管
先说结论
- 价格没涨,能力在涨。xAI 在 9 月 18 日发了 Grok Voice Transcribe 2.0,官方明确说定价与 1.0 完全相同:批量转写 $0.10 / 音频小时、流式 $0.20 / 音频小时,且说话人分离、时间戳、关键词都包含在内,不额外收费。
- 翻译成实际成本:1000 小时的会议录音 = 100 美元(批量档)。这个价位已经低于绝大多数团队”自己拿 GPU 跑 Whisper”的隐性成本——自托管的账不能只算电费,要算运维和闲置。
- 这次的主要进步在多语种和”脏音频”。官方给的例子很具体:短语音(比如车机指令)场景下,词错率从 20.6% 降到 6.8%;多语种支持”自动识别语言,并且能在同一次转写里跟上中途换语言“——这是它相对 1.0 的最大改进。
- 已有集成不用改代码。官方原话是现有 Speech-to-Text API 集成直接获得精度提升、无需任何代码变更。
这次到底升级了什么
它针对的是真实世界的音频,官方列的困难场景很实在:不稳定的电话线路、多人抢话、方言口音、以及被念出来的电话号码和邮箱地址。这类内容恰恰是”录音转文字”最常见的用途,也是最容易被通用模型搞砸的地方。
几个可核实的点:
- 底子是 Grok Voice 的音频基础模型。官方称 Grok Voice 已经在支撑每天数万通客服通话、转写数百万小时的视频旁白。
- 多语种是最大改进:支持几十种语言、自动检测语种,并且允许单次转写中切换语言。
- 短句场景提升显著:官方给出的对比是词错率 20.6% → 6.8%(对象是车载指令这类缺少上下文、难判语种的短语音)。
- 能力的对照面:官方图表里出现的对手包括 Universal-3.5 Realtime Pro、Chirp 3 Streaming、Azure STT Real-time、Nova-3 Realtime 等——这些是厂商自测,看方向可以,别当独立评测。
新增的实用开关(这些会直接改变你的输出,值得注意):
| 能力 | 说明 |
|---|---|
| 批量 + 流式 | 录音文件与 URL 走批量,实时场景走流式——价差是两倍 |
| 填充词移除 | 去掉 “um”、”uh” 这类口语填充词,转写稿更干净 |
| 智能话轮检测 | 判断说话人一轮说完没有,给语音 Agent 用 |
| 附带项 | 说话人分离、时间戳、关键词都在价格内 |
成本账:$0.10/小时意味着什么
把官方价格直接换算一下(不含任何折扣):
| 场景 | 音频总时长 | 批量($0.10/h) | 流式($0.20/h) |
|---|---|---|---|
| 每天 2 小时团队会议 | 每月约 40 小时 | $4 | $8 |
| 每周 10 小时访谈/客服复盘 | 每月约 40 小时 | $4 | $8 |
| 每天 100 小时客服录音 | 每月约 3,000 小时 | $300 | $600 |
| 视频内容批量转写 | 10,000 小时 | $1,000 | 不适用(通常走批量) |
关键判断:如果只是”每月几十小时”,自托管的硬件和运维成本永远不可能比这个便宜——一块能跑语音模型的显卡的电费都不止 4 美元。这个价位真正改变的是长尾场景:以前因为”跑不起”而放弃转写的录音,现在可以批量处理了。
自己算一遍(改 HOURS 就行):
# 按官方价格估算你自己的转写成本:批量 $0.10/音频小时,流式 $0.20/音频小时
HOURS=3000
python3 -c "h=$HOURS; print(f'批量: ${h*0.10:,.2f}/月 流式: ${h*0.20:,.2f}/月')"
什么时候该用 API,什么时候该自托管
| 维度 | 用 API(本次这类) | 自托管(Whisper 等开源模型) |
|---|---|---|
| 成本 | 每月几小时到几千小时都很线性:$0.10/音频小时 | 硬件一次性投入 + 电费 + 运维;只有持续高负载才划算 |
| 隐私 | 音频要出你的边界——这是唯一真正的硬约束 | 数据不出内网,适合医疗、法务、涉密场景 |
| 多语种与脏音频 | 这次升级的主战场,短句词错率官方给到 6.8% | 依赖你选的模型档位,小模型在多语种和噪声下掉得很快 |
| 运维 | 零运维,配额与限流是唯一要管的事 | 要管显存、并发、排队、升级;参考我们自己算过的显存账 |
| 延迟 | 流式档 $0.20/小时,适合实时字幕 | 本地推理延迟可控,但要自己调优 |
一句话的取舍:数据不能出内网 → 自托管;能出内网 → 先算一遍 API 的账,绝大多数团队会在第一张表上发现自己属于”直接用 API”那一类。
顺带一句:如果你决定自托管,显存怎么估我们上一篇算过——视觉/音频这类长序列输入的瓶颈常常不在权重,而在 KV cache,估算顺序错了会白折腾。
三个容易踩的点
- 批量与流式的价差是两倍,而很多团队”默认用流式”。录播类内容一律走批量,这一条就能省一半。
- “无需改代码”不等于”输出不变”。开了填充词移除、话轮检测之后,转写文本的结构会变——下游如果有基于文本格式的解析逻辑,要重新测。
- 厂商自测的基准只能看方向。官方图里对手的成绩同样来自各家自述,没有任何一方是第三方独立评测。
这次没核实的
- 官方称”更准”和”两倍”的具体口径,我没能拿到完整表述,所以本文只引用了能确证的短句词错率(20.6% → 6.8%)与多语种描述。
- 没有实测:我不做语音模型的横评,本文的”该用 API 还是自托管”是成本与合规框架,不是精度结论。
- 人民币价格、并发上限、单文件时长限制等工程参数本次没有核对,落地前请查官方文档。
- Atlassian Loom 的案例来自官方公告的客户证言,属厂商材料,我不把它当作独立验证。
参考来源
- Introducing Grok Voice Transcribe 2.0——发布时间 2026-09-18、能力描述、短句词错率 20.6% → 6.8%、价格 $0.10/$0.20 每音频小时
- openai/whisper——自托管路线最常用的开源方案(本文对照表里的”自托管”一列以它为代表)
- 自托管前怎么估显存(本社区上一篇):单张 3090 能跑哪些视觉模型——权重与 KV cache 的换算方法同样适用于音频长序列
评论区
0 条评论
登录后可评论。