做语音 AI 产品,却被 Vapi 按分钟收费卡住了?这个 YC 校友团队做了个开源替代品
做语音 AI 产品,最难受的不是”没有模型”,而是”有模型但没有地方跑”。
Vapi 和 Retell 这样的平台把语音代理做成了 SaaS 服务——你写几行代码,接进去,按分钟收费,数据存在别人的服务器上。对于早期验证来说这没问题,但对于已经有工程能力、或者有合规要求的团队来说,每分钟 $0.07~$0.31 的费用加上数据必须上云这件事,就成了一个真实的卡点。
Dograh 解决的正是这个矛盾:给你一个开源的、可完全自托管的语音 AI 平台,让你在自己的服务器上跑语音代理,不按分钟付费,数据不出自己的机房。
它的边界在哪
Dograh(github.com/dograh-hq/dograh)目前 5,784 颗星,BSD-2-Clause 开源许可证,核心逻辑 fork 了 Pipecat,上面套了一层可视化的工作流构建器。支持的用例覆盖Inbound/Outbound 电话呼叫代理、客服与销售线索筛选、带有知识库检索的对话系统,以及电话转人工的跌落处理。
能做什么:
- 拖拽式工作流构建器,不需要写代码就能搭出语音代理,技术人员也可以直接改 Python 源码
- 内置 Twilio、Vonage、Telnyx、Plivo、Vobiz、Cloudonix、Asterisk ARI 等电话服务商集成,开箱即用
- 自带 LLM / TTS / STT 栈,无需任何 API Key 即可启动,也可以接入自己的密钥(支持任意供应商)
- 真正的 Speech-to-Speech:通过 Gemini 3.1 Flash Live 实现,端到端延迟低于 300ms,支持打断(barge-in)
- 预录音混音:对于固定话术部分使用真实人声录制,动态内容才触发 TTS,据说成本降低 3 倍
- MCP 原生:内置 MCP Server,Claude Code 和 Codex 可以直接操作 Dograh 上的 agent,不需要切界面
- 通话 QA 节点:内置情感分析和误传检测,跑完直接看报告;配合 Langfuse 做全链路 trace
- 支持 45+ 语言,政府机构场景有专门落地案例
不能做什么,或者说当前短板:
- 主要语言是英文,其他语言需要自行配置 STT/TTS,官方文档有限
- 社群和生态还在发展中,第三方集成数量远少于 Vapi
- 首次启动需要拉取多个 Docker 镜像,实测 2-3 分钟,不是”秒起”
- 官方没有公布大规模高并发生产环境的公开案例(数千路并发以上)
- 离线或网络受限环境需要预先拉取所有镜像
- 自定义 MCP 插件这块文档深度不足,很多信息要靠读源码
适合谁:
- 有 Docker 运维能力的开发团队,需要把语音 AI 跑在自己的基础设施上
- 金融、医疗、政府等对数据主权有硬性要求的行业
- 已经有供应商(Twilio、自有 STT/TTS 模型),不想被 Vapi 的定价绑架
- 愿意读源码、能接受一定的工程投入的团队
不适合谁:
- 非技术人员,想要零配置直接上手——Docker 还是要有的
- 需要成熟多语言支持、丰富第三方集成的团队——短期还是 Vapi/Retell 生态更完整
- 没有任何运维资源,想做甩手掌柜的——自托管意味着你也管升级和故障
怎么跑起来
一条命令在本机起一个可用的实例:
curl -o docker-compose.yaml https://raw.githubusercontent.com/dograh-hq/dograh/main/docker-compose.yaml
curl -o start_docker.sh https://raw.githubusercontent.com/dograh-hq/dograh/main/scripts/start_docker.sh
chmod +x start_docker.sh
./start_docker.sh
首次启动需要 2-3 分钟下载所有镜像。起来之后打开 http://localhost:3010,选 Inbound 或 Outbound,给 bot 起个名字,5-10 个词描述用例,点 Web Call 直接在浏览器里测试,不需要配置任何电话系统。
如果你是 Claude Code 或 Codex 用户,官方有个 dograh-plugins 可以一键安装,让 AI 编程助手帮你完成整个安装和配置过程,不需要自己敲命令。
技术栈:FastAPI + Next.js + fork of Pipecat + Langfuse。Python 技术栈为主。
和 Vapi 的真实差距
Dograh 的官方对比文档写得比较诚实——他们自己也说,Vapi 是”更简单的起步点”,Dograh 的优势在于数据自主和长期成本控制,而不是功能丰富度。
Vapi 和 Retell 的定价按分钟计费,中等呼叫量下每月花费容易上千美元;Dograh 自托管的成本是一次性基础设施费用,对于呼叫量稳定的团队,长期来看明显更划算。但代价是:你需要自己维护这套系统,包括升级版本、处理故障。
下一步建议
如果你现在就在调研语音 AI 平台,以下是可操作的路径:
- 先用本机 Docker 跑通第一个 agent(10 分钟足够),不需要任何外部账号,看这个界面和工作流是否符合你的直觉
- 如果有 Twilio 或其他电话服务商账号,接入真实电话做一次Inbound测试,感受一下通话质量
- 对接 Langfuse,把通话 QA 跑起来,看分析结果是否对你的场景有参考价值
- 如果数据合规是你的硬需求,联系他们的 Slack 社区问政府/医疗场景的具体落地案例,官方有专门针对这些场景的文档
官方文档:docs.dograh.com | Slack 社区:加入链接 | 官方定价页:dograh.com(自托管免费,云版本按用量计费)
评论区
登录后可评论。