TrueForge:开源 Agent Harness 运行时,任意 LLM 成本直降 75%

TrueForge 是一个开源 Agent Harness 运行时,将任意 LLM 转化为可工作的生产级 Agent。与 Claude Managed Agents 等商业方案相比,TrueForge 打出「LLM 中立 + 30-75% 成本降低」两张牌,支持任意 OpenAI 兼容端点、MCP 工具链、Git 版本化 Skill、沙箱隔离执行和人机审批节点,在 DevRev Enterprise-Bench 评测中以 4,600+ Stars 的月增速度登顶 GitHub Trending 周榜,成为当前企业级 Agent 基础设施领域最受关注的新项目。

核心定位与设计原则

TrueForge 解决的是「Building an agent is easy. Running one well is not」这一工程现实:生产级 Agent 需要流式输出、会话持久化、工具服务器、沙箱隔离、人机审批和完整的 UI——这些基础设施横跨多个系统,搭建和维护成本极高。TrueForge 将 Agent 执行循环(模型调用、MCP 工具路由、Skill 加载、沙箱管理、审批节点、上下文管理、会话状态)打包为一个开箱即用的运行时,对外暴露三种接口:内置 Chat UI、HTTP API + TypeScript SDK、Embeddable React UI SDK。

核心设计原则:Vendor-Neutral(不绑定模型)、Sandbox-as-a-Tool(按需沙箱而非全程隔离)、Context Engineering First(上下文按需加载而非一股脑塞进 Context Window)。

认可度

  • GitHub Stars:4,695(截至 2026-08-28)
  • Forks:306
  • 创建时间:2026-07-23(距今约一个月)
  • 最后推送:2026-08-27(高度活跃)
  • GitHub Trending 周榜新晋项目(2026-08 周榜 AI Agent 方向)
  • Benchmark 战绩:在 DevRev Enterprise-Bench(14 项 CRM/工单/文档多步骤任务)中完成 11 项;使用 GLM-5.2 + TrueForge 完成同样任务仅花 $2.90,而 Claude Managed Agents 同一任务需 $11.80——成本降低 75%
  • 评测来源:RepoCloud(4.6k Stars)、RoboAI Digest(2026-08-20)、AI Master

链接

GitHub:https://github.com/truefoundry/trueforge

原作者

  • TrueFoundry:旧金山 B2B 机器学习初创公司,由前 Meta 工程师于 2021 年联合创立
  • 核心发言人:联合创始人兼 COO Anuraag Gutgutia
  • 官方定位:「Giving enterprises vendor-neutral options for agent orchestration」

介绍

TrueForge 是一个 TypeScript 编写的开源 Agent 执行循环运行时,本质上是 Agent 的「操作系统」。它将构建生产级 AI Agent 所需的流式输出、会话持久化、MCP 工具、沙箱隔离、人机审批、上下文压缩等全部打包,开发者只需配置 YAML 目录(模型、MCP 服务器、Skill、沙箱提供商),即可在 Chat UI、API 或嵌入组件中调用 Agent。

该项目的核心差异在于上下文工程(Context Engineering):通过延迟加载 MCP 工具 Schema(用时再加载)、子 Agent 隔离(并行任务分配给独立 Agent 防止 Context 膨胀)、大结果卸载(输出过大时写文件而非塞进 Context)、Code Mode(结构化数据通过沙箱代码处理而非 LLM 推算)和自动压缩(默认 50,000 Token 阈值触发历史摘要)等手段,将每次任务的 Token 消耗降低 30-75%。

沙箱架构也不同于传统方案:不是让 Agent 全程运行在隔离环境里,而是将沙箱本身作为一种工具,仅在需要执行代码或处理文件时才动态调用 Daytona 沙箱环境,从而实现一个服务器多 Agent 并发运行,减少闲置计算资源。

特点

  • LLM 中立:支持 OpenAI、Anthropic、Google Gemini 等目录提供商,也兼容任意 OpenAI 兼容端点(本地 Ollama 也可),切换模型只需改一行 YAML 配置
  • MCP 工具编排:远程 MCP 服务器,支持 Header Auth 或 OAuth(含对话内授权流程和 per-user 凭证委托),完整审计日志
  • Git 版本化 Skill:从 Git 仓库按需加载版本化 SKILL.md 指令集,配合 RBAC 控制各 Agent 可访问哪些 Skill 定义
  • 沙箱按需调用:沙箱作为工具而非全程运行环境,Daytona 动态分配隔离执行环境,支持多 Agent 并发,节省资源
  • 上下文工程降低 Token 成本:延迟 Schema 加载、子 Agent 隔离、大结果卸载、Code Mode、自动压缩五管齐下,同等任务 Token 消耗比 Claude Managed Agents 少 30-75%
  • 多级人机审批:工具审批节点(Tool Approval)、Ask-User-Questions(审批前向用户确认问题)、Generative UI(在 Chat 内渲染审批 UI)三重保障
  • 会话持久化:本地 SQLite(单进程)或托管模式(Postgres + Redis,支持多副本 + 负载均衡)
  • Embeddable UI SDK:通过 @truefoundry/trueforge-ui 将完整 Chat UI 作为可主题化的 React 组件嵌入现有应用

使用方法

本地快速启动(无需任何基础设施):

npx @truefoundry/trueforge@latest

服务器就绪后自动打开浏览器,监听 http://127.0.0.1:30141。首次使用需在 Models 面板配置模型提供商凭证。

托管模式(团队/生产部署):

# Docker Compose 部署
# 需要 Postgres + Redis
docker compose up

创建第一个 Agent

  1. 访问 QuickStart(https://trueforge.dev/quickstart)
  2. 在 Initial Setup 中连接模型提供商(Models)、MCP 服务器、Git 仓库中的 Skill 定义、沙箱提供商(Sandbox)
  3. 创建 Agent,从已连接的目录中选择资源,配置工具审批节点和 Generative UI
  4. 通过 Chat UI、TypeScript SDK(@truefoundry/trueforge-sdk)或 Embeddable React UI(@truefoundry/trueforge-ui)调用

最小示例(TypeScript SDK)

import { TrueForgeSDK } from '@truefoundry/trueforge-sdk';

const client = new TrueForgeSDK({ baseUrl: 'http://localhost:30141' });

const response = await client.agents.run({
  agentId: 'my-agent',
  message: '帮我查询 CRM 中最近一周新建的工单并按优先级排序',
  stream: true,
});

使用场景与人群

适用场景

  • 企业内部 AI Agent 平台搭建(替代 Claude Managed Agents 等商业方案)
  • 多步骤复杂工作流自动化(CRM 工单处理、文档管理、代码审查)
  • 需要在私有基础设施上运行 LLM Agent(数据主权要求)
  • 需要人机审批节点的合规/风控场景

目标用户

  • DevOps / Platform Engineering 团队:负责构建企业内部 AI Agent 基础设施
  • 企业 AI 负责人:寻找商业托管 Agent 的开源替代方案
  • AI 应用开发者:需要稳定 Agent 执行循环框架,而非自己从零搭

输入与输出案例

案例一:CRM 工单处理

  • 输入:「查询过去 7 天内优先级为 P0 的所有未解决工单,按创建时间倒序,返回工单 ID、标题、创建人和状态」
  • 输出:Agent 通过 MCP 工具连接 CRM 系统,执行查询命令,返回格式化工单列表(如:「共找到 3 条 P0 工单:#T-1023 [后端服务中断] 张三 2026-08-26 08:15 处理中;#T-1019 [支付接口超时] 李四 2026-08-25 14:32 待确认…」),用户可在 Chat 内直接对结果进行追问或下一步操作

案例二:代码审查并生成报告

  • 输入:「帮我审查 https://github.com/org/repo/pull/42,列出潜在安全和性能问题,并在敏感操作前暂停等待人工审批」
  • 输出:Agent 获取 PR 差异 → 调用代码分析工具 → 发现 2 个安全风险(SQL 注入潜在点)和 1 个性能问题(N+1 查询),在每个风险点标注文件路径和行号,然后暂停在「是否要将审查结果评论到 PR」的审批节点,等待工程师确认后才执行评论操作

GitHub: https://github.com/truefoundry/trueforge

评论区

0 条评论

登录后可评论。

Skill超级捕获手 14 阅读