实时语音 AI Agent 框架选型:LiveKit Agents 已经跑了什么、还差什么

实时语音 AI Agent 框架选型:LiveKit Agents 已经跑了什么、还差什么


做语音 AI Agent 这件事,2025 年之前很多人还在纠结用谁的云、接谁的 STT、接谁的 TTS,光是把三个环节串起来就要写几百行胶水代码。2026 年再来看这个领域,LiveKit Agents 是少数几个真正把「接电话」这件事做到产品级的开源框架——13.5k Stars,Apache 2.0 许可,背后是 OpenAI 语音产品、xAI Grok 和 Salesforce 在用的生产级验证。

这个项目解决什么问题

LiveKit Agents 是一个 Python/TypeScript 框架,用来构建实时语音 AI Agent——能接电话、能视频、能多模态的那种。它的核心抽象是 AgentSession:把语音识别(STT)、大模型(LLM)、语音合成(TTS)、语音活动检测(VAD)、语义打断(turn detection)全部封装在一个 Session 里,开发者只需要写业务逻辑,不需要手写音频流管道。

底层跑的是 LiveKit 自研的 WebRTC SFU(选择性转发单元),这正是它和其他语音 Agent 平台最大的技术差异——大多数同类产品依赖第三方 WebRTC 服务,而 LiveKit 从媒体服务器到应用层全是自研,延迟可以压到 700ms 以内。

真实数据

  • GitHub:13,570 Stars,3,646 Forks,789 open issues
  • 最新 Release:livekit-agents@1.7.1(2026-08-27),最近三个月保持了每月 2-3 个版本的迭代节奏
  • 2026 年 1 月完成 Series C,估值 10 亿美元,融资 1 亿美元,投资方包括 Index Ventures、Salesforce Ventures
  • 文档显示平台已支撑数十亿次通话,付费客户 500+

和竞品比,谁该选 LiveKit

语音 Agent 赛道 2026 年已经非常拥挤:Vapi、Retell AI、Bland AI、Daily Bots、Pipecat 这些托管平台各有优势。LiveKit 的定位是「工程团队的控制权」——它不是一个「填表单就能跑」的托管产品,而是给你一个开源框架,让你自己选 STT(Deepgram/Whisper/Cartesia)、自己选 LLM(GPT-4o/Gemini/DeepSeek)、自己选 TTS(ElevenLabs/Cartesia/Deepgram),然后自己决定是跑在 LiveKit Cloud 上还是完全自托管。

这意味着它适合有工程能力的团队,不适合非技术团队快速验证想法。

具体场景来看,LiveKit Agents 真正擅长的方向:

多模态 Agent——不只是语音,而是 Agent 能看到画面、能操控界面。LiveKit Agents 有视频帧处理能力,配合 MCP 工具调用可以做到视觉理解 + 语音对话的组合,这在同类产品里是相对少见的特性。

电话落地——原生支持 SIP 和 PSTN,不需要额外接 Twilio 或其他语音运营商就能打电话和接电话。LiveKit 自己出了 Phone Numbers 服务,可以直接在 Dashboard 里购买美国本地号或 toll-free 号,60 秒内接通。

自托管需求——医疗、金融、政府这类对数据主权有硬性要求的行业,LiveKit Agents 是少数能真正做到端到端自托管的方案:自研 SFU + 开源框架 + 你的云,全部跑在自己基础设施上。

不适合谁

如果你只是想快速验证一个「AI 打电话给客户」的概念,LiveKit Agents 的学习曲线会让你多花至少 3-5 天。它不是一个无代码平台,你需要写 Python 或 TypeScript,理解 WebRTC 的基本概念,知道怎么配 STT/LLM/TTS 三个环节。

价格也是需要认真算的。Build 计划免费但有上限(每月 1,000 分钟 Agent Session + 5,000 分钟 WebRTC),Ship 计划 $50/月,Scale 计划 $500/月,在此基础上还要叠加 Agent Session 分钟费和模型分钟费。Vapi 和 Retell 的打包价格看起来反而更简单。

最新动态(2026 年下半年)

Agent Builder 是今年最值得关注的产品更新——一个基于浏览器的可视化编辑器,让非工程师也能创建、测试、部署 LiveKit Agent。不需要本地环境,三分钟跑起来。这实际上是在和 Vapi/Retell 的 no-code 能力正面竞争。

Inference 服务是另一个重要变化:用一个 LiveKit API Key 统一接入 STT、LLM、TTS 多个 provider,不需要分别开 Deepgram/OpenAI/ElevenLabs 账户。这对运维来说是好事,但对希望直接对接 provider 的团队来说可能是额外的绑定。

Turn Detector v1.0 解决了语音 Agent 的一个老问题:如何判断用户说完了。LiveKit 自研了一个 transformer 模型专门做这件事,官方数据显示将打断率降低了 39%。

可执行的下一步

如果你在评估 LiveKit Agents,下面的路径是实际可行的:

第一步,跑通 Quick Start。LiveKit 官方博客有一篇《Build Your First AI Voice Agent in Python》,30 分钟可以跑出一个能对话的 Agent。安装方式是 pip install "livekit-agents[openai,deepgram,cartesia]",然后按文档配置 .env 文件即可。

第二步,确认你的 STT/LLM/TTS provider 组合。LiveKit Agents 支持 40+ provider 插件,最常见且 latency 最低的组合是 Deepgram Nova-3(STT,约 250ms)+ GPT-4o-mini 或 Gemini 2.5 Flash(LLM)+ Cartesia Sonic 3(TTS,约 90ms)。如果你用 LiveKit Inference,这个组合可以用一个 API Key 直接跑。

第三步,决定部署方式。Demo 和开发阶段用 LiveKit Cloud 最快;生产环境如果涉及敏感数据或需要降低成本,自托管 LiveKit Server + Agents 是可行路径,但需要准备 WebRTC 运维能力。

链接

评论区

0 条评论

登录后可评论。

器匠·开发者工具 747 阅读