OWL:GAIA 排行榜状元的多 Agent 协作框架,单任务超越 Claude-3.7 单 Agent

LLM Agent 领域有一个特别有意思的趋势:单 Agent 越跑越强,但遇到真正复杂的真实世界任务,单个 Agent 的能力是有上限的。怎么突破?CAMEL-AI 社区交出了一份答卷——OWL(Optimized Workforce Learning),一个在 GAIA 基准测试上登顶开源榜首的多 Agent 协作框架。

它解决了什么问题?

当一个任务需要同时动用搜索、代码执行、浏览器操作、文档分析等多个工具时,单个 Agent 要么工具链太长导致决策质量下降,要么上下文窗口爆炸。OWL 的思路是:不要让一个 Agent 干所有事,而是拆成多个专业角色协作。

它的架构是三层结构:

  • Planner:理解任务、拆解子任务
  • Coordinator:调度和分配,追踪任务状态
  • Workers:各有所长的执行 Agent(浏览器执行、代码执行、Web Research 等 20+ 工具包)

这种「规划-协调-执行」分离的设计,让每个 Worker 专注自己的领域,不会被无关信息干扰。

GAIA 排行榜状元,实打实的 Benchmark 成绩

不是吹的——OWL 在 GAIA 基准测试(General AI Assistants benchmark)上达到了 69.70% 准确率,超越了一众商业系统,是目前开源多 Agent 框架里的第一名。参考对比:Claude-3.7 单 Agent 是 69.09%,GPT-4o 是 60.61%。这说明多 Agent 协作在这个任务上确实比单体 Agent 更有优势。

它的 GAIA 分支还提供了完整的评测脚本,可以直接复现结果。

怎么用?

门槛很低,装起来很快:

# 推荐用 uv
uv pip install owl-ai

# 或者 pip
pip install owl-ai

# 设置 API Key
export OPENAI_API_KEY="your-api-key"

# 启动 Web UI(基于 Gradio)
owl-ui

# 或者 Python API
python
from owl import OwlAgent
agent = OwlAgent(model="gpt-4o")
result = agent.run("帮我搜索今年 AI Agent 的最新进展")

支持 GPT-4o、Qwen、DeepSeek 等多种模型切换,也有中文 Web UI 版本。

跟 LangChain/CrewAI 比,强在哪?

老实说,LangChain 功能全但偏重,CrewAI 的 role-based 设计很清晰,但它们在 GAIA 上的成绩都没有 OWL 亮眼。OWL 的核心价值在于它有真实的 Benchmark 数据支撑——不是「搭了一个架子」,是真的证明过多 Agent 协作在复杂任务上比单 Agent 强。

当然,如果你只是做简单的单步任务,用 Codex CLI 就够了。但一旦任务涉及多工具协同、长链路规划、多步推理,OWL 值得一试。

总结

OWL 是一个被 GAIA 验证过的多 Agent 协作框架,三层架构(Planner/Coordinator/Workers)把复杂任务拆解得干干净净。开源,Apache 2.0 协议,20+ 工具包,支持多模型。如果你对 Multi-Agent Agentic Workflow 有兴趣,想看真实能跑出成绩的代码实现,这个仓库值得关注。

👉 GitHub 仓库:camel-ai/owl


GitHub: https://github.com/camel-ai/owl

评论区

0 条评论

登录后可评论。

陈一铭 14 阅读