LLM应用上线后看不见内部?Langtrace让你第一次真正观察Agent的每一步
说实话,LLM 应用上线之后,你真的知道它里面发生了什么吗?
我问的不是”有没有报错”——我问的是:你的 RAG 流程里,哪一步最慢?Embedding 花了多少 token?Agent 调用了几次工具、哪次 LLM 响应最贵?
如果答不上来,你不是一个人。大多数 AI 应用上线后都是一本糊涂账。
Langtrace 就是来解决这个问题的。
它是做什么的
Langtrace 是 Scale3 Labs 出品的开源 LLM 可观测性平台,GitHub 1.1k stars,基于 OpenTelemetry 标准开发。它做的事情很简单:自动把你整个 LLM 应用的调用链路追踪出来,从 Embedding 到向量检索,从生成到工具调用,每一步都记录得清清楚楚。
支持 Python 和 TypeScript SDK,一行代码接入,就能拿到模型、Token、延迟、成本、输入输出的完整数据。
支持的主流厂商和框架相当全:
– LLM:OpenAI、Anthropic、Azure、Google Gemini、DeepSeek、Cohere、Mistral、xAI 等
– 框架:LangChain、LlamaIndex、LangGraph、CrewAI、DSPy、Vercel AI
– 向量库:Pinecone、ChromaDB、QDrant、Weaviate、PGVector、Milvus
一句话:你的技术栈但凡用了其中任何一个,接入成本几乎为零。
怎么用
安装很简单:
# Python
pip install langtrace-python-sdk
# TypeScript
npm i @langtrase/typescript-sdk
然后初始化:
from langtrace_python_sdk import langtrace
langtrace.init(api_key="your-api-key")
之后所有 LLM 调用全部自动追踪,不需要你改任何业务代码。
如果想自己部署,它也支持 Docker Compose 本地自托管,前端是 NextJS,后端用 Postgres + ClickHouse 存 traces 和 metrics。团队内部用的话,自托管也更安全,数据不外流。
解决了什么问题
我见过太多团队吐槽”AI 应用成本不可控””Agent 行为不可预测”。Langtrace 的价值就在这里:它让你第一次真正看见 Agent 的内部运作。
比如你可以:
– 定位 Token 消耗的罪魁祸首是哪一步
– 发现 RAG 链路里哪次向量检索拖慢了整体延迟
– 评估不同 Prompt 版本的质量和成本对比
– 审计生产环境的 Agent 工具调用是否有异常
这些在 Langtrace 之前,要么靠人工埋点,要么根本不可见。
适合谁
LLM 应用开发团队——尤其是 Agent/RAG 场景多的公司,需要量化分析链路表现。
AI 平台/Infra 团队——需要给业务方提供可观测性能力,或者自建类似功能的。
AI 应用甲方/PM——想搞清楚”这 AI 到底干了什么活,为什么账单这么贵”的非技术决策者,配合截图也能说明白。
它对个人开发者也友好,Cloud 版本有免费额度,自托管完全免费,没有什么使用门槛。
GitHub:https://github.com/Scale3-Labs/langtrace
评论区
登录后可评论。