做语音 AI 产品,却被 Vapi 按分钟收费卡住了?这个 YC 校友团队做了个开源替代品

做语音 AI 产品,最难受的不是”没有模型”,而是”有模型但没有地方跑”。

Vapi 和 Retell 这样的平台把语音代理做成了 SaaS 服务——你写几行代码,接进去,按分钟收费,数据存在别人的服务器上。对于早期验证来说这没问题,但对于已经有工程能力、或者有合规要求的团队来说,每分钟 $0.07~$0.31 的费用加上数据必须上云这件事,就成了一个真实的卡点。

Dograh 解决的正是这个矛盾:给你一个开源的、可完全自托管的语音 AI 平台,让你在自己的服务器上跑语音代理,不按分钟付费,数据不出自己的机房。

它的边界在哪

Dograh(github.com/dograh-hq/dograh)目前 5,784 颗星,BSD-2-Clause 开源许可证,核心逻辑 fork 了 Pipecat,上面套了一层可视化的工作流构建器。支持的用例覆盖Inbound/Outbound 电话呼叫代理、客服与销售线索筛选、带有知识库检索的对话系统,以及电话转人工的跌落处理。

能做什么:

  • 拖拽式工作流构建器,不需要写代码就能搭出语音代理,技术人员也可以直接改 Python 源码
  • 内置 Twilio、Vonage、Telnyx、Plivo、Vobiz、Cloudonix、Asterisk ARI 等电话服务商集成,开箱即用
  • 自带 LLM / TTS / STT 栈,无需任何 API Key 即可启动,也可以接入自己的密钥(支持任意供应商)
  • 真正的 Speech-to-Speech:通过 Gemini 3.1 Flash Live 实现,端到端延迟低于 300ms,支持打断(barge-in)
  • 预录音混音:对于固定话术部分使用真实人声录制,动态内容才触发 TTS,据说成本降低 3 倍
  • MCP 原生:内置 MCP Server,Claude Code 和 Codex 可以直接操作 Dograh 上的 agent,不需要切界面
  • 通话 QA 节点:内置情感分析和误传检测,跑完直接看报告;配合 Langfuse 做全链路 trace
  • 支持 45+ 语言,政府机构场景有专门落地案例

不能做什么,或者说当前短板:

  • 主要语言是英文,其他语言需要自行配置 STT/TTS,官方文档有限
  • 社群和生态还在发展中,第三方集成数量远少于 Vapi
  • 首次启动需要拉取多个 Docker 镜像,实测 2-3 分钟,不是”秒起”
  • 官方没有公布大规模高并发生产环境的公开案例(数千路并发以上)
  • 离线或网络受限环境需要预先拉取所有镜像
  • 自定义 MCP 插件这块文档深度不足,很多信息要靠读源码

适合谁:

  • 有 Docker 运维能力的开发团队,需要把语音 AI 跑在自己的基础设施上
  • 金融、医疗、政府等对数据主权有硬性要求的行业
  • 已经有供应商(Twilio、自有 STT/TTS 模型),不想被 Vapi 的定价绑架
  • 愿意读源码、能接受一定的工程投入的团队

不适合谁:

  • 非技术人员,想要零配置直接上手——Docker 还是要有的
  • 需要成熟多语言支持、丰富第三方集成的团队——短期还是 Vapi/Retell 生态更完整
  • 没有任何运维资源,想做甩手掌柜的——自托管意味着你也管升级和故障

怎么跑起来

一条命令在本机起一个可用的实例:

curl -o docker-compose.yaml https://raw.githubusercontent.com/dograh-hq/dograh/main/docker-compose.yaml
curl -o start_docker.sh https://raw.githubusercontent.com/dograh-hq/dograh/main/scripts/start_docker.sh
chmod +x start_docker.sh
./start_docker.sh

首次启动需要 2-3 分钟下载所有镜像。起来之后打开 http://localhost:3010,选 Inbound 或 Outbound,给 bot 起个名字,5-10 个词描述用例,点 Web Call 直接在浏览器里测试,不需要配置任何电话系统。

如果你是 Claude Code 或 Codex 用户,官方有个 dograh-plugins 可以一键安装,让 AI 编程助手帮你完成整个安装和配置过程,不需要自己敲命令。

技术栈:FastAPI + Next.js + fork of Pipecat + Langfuse。Python 技术栈为主。

和 Vapi 的真实差距

Dograh 的官方对比文档写得比较诚实——他们自己也说,Vapi 是”更简单的起步点”,Dograh 的优势在于数据自主和长期成本控制,而不是功能丰富度。

Vapi 和 Retell 的定价按分钟计费,中等呼叫量下每月花费容易上千美元;Dograh 自托管的成本是一次性基础设施费用,对于呼叫量稳定的团队,长期来看明显更划算。但代价是:你需要自己维护这套系统,包括升级版本、处理故障。

下一步建议

如果你现在就在调研语音 AI 平台,以下是可操作的路径:

  1. 先用本机 Docker 跑通第一个 agent(10 分钟足够),不需要任何外部账号,看这个界面和工作流是否符合你的直觉
  2. 如果有 Twilio 或其他电话服务商账号,接入真实电话做一次Inbound测试,感受一下通话质量
  3. 对接 Langfuse,把通话 QA 跑起来,看分析结果是否对你的场景有参考价值
  4. 如果数据合规是你的硬需求,联系他们的 Slack 社区问政府/医疗场景的具体落地案例,官方有专门针对这些场景的文档

官方文档:docs.dograh.com | Slack 社区:加入链接 | 官方定价页:dograh.com(自托管免费,云版本按用量计费)

评论区

0 条评论

登录后可评论。