时间:2026年7月31日
地点:美国旧金山 / 开源社区
人物:Supabase 工程团队(Matt Rossman)
事件详情:开源后端即服务(BaaS)平台 Supabase 于7月31日正式开源其 AI 编程智能体评测框架 Supabase Evals,并以 Apache-2.0 协议发布在 GitHub。该框架专门用于评估 Claude Code、OpenAI Codex、OpenCode 等 AI 编程智能体在真实 Supabase 任务上的表现,任务涵盖数据库 schema 构建、Edge Function 调试、RLS(行级安全)策略修复、迁移与认证集成等典型后端开发场景。框架内置「基准」与「回归」两套场景,覆盖「产品 × 主题 × 阶段」三个维度(产品含数据库、认证、存储、Edge Functions、Realtime、Cron、Queues、Vectors、Data API;主题含 RLS、安全、迁移、SQL、SDK、可观测性、自托管、测试、声明式 schema;阶段含 build、deploy、investigate、resolve),并通过真实容器化的 Supabase 环境运行所有任务,确保智能体调用真实的 MCP 服务器和 CLI。
背景:近年来 Claude Code、OpenAI Codex 等 AI 编程智能体在开发者群体中快速普及,但业界一直缺乏针对真实后端任务的统一评测标准。开发者通常依赖「氛围检查」和 SWE-Bench 等通用编程基准,无法准确评估智能体在数据库策略、边缘函数、认证集成等企业级后端场景中的实际表现。Supabase Evals 填补了这一空白,其评测场景来源于真实的客户支持工单、bug 报告和 GitHub issue,并通过「确定性检查 + LLM-as-a-judge」双评分机制确保结果可信,避免误判和主观偏差。
影响:
- 提供首个针对真实后端任务的 AI 编程智能体开源评测标准
- Supabase 内部可借此验证功能改动是否存在回归,每天运行监控
- 推动 AI 编程智能体在企业级后端开发(金融、医疗等合规场景)中的可信度评估
- 配套公开排行榜 supabase.com/evals,让开发者横向对比不同智能体表现
总结:Supabase Evals 是开源生态中首个针对真实后端开发任务的 AI 编程智能体评测框架,其「产品 × 主题 × 阶段」三维设计和「基准 + 回归」双场景模式为行业提供了方法论参考。开发者可通过 pnpm 本地部署对比 Claude Code、Codex、OpenCode 等智能体的实际表现,企业用户则可借此评估 AI 编程工具在自身业务场景中的可靠性,从而降低 RLS 误配等安全事故风险。
参考来源:
- Supabase 官方博客:https://supabase.com/blog/introducing-supabase-evals
- GitHub 仓库(Apache-2.0):https://github.com/supabase/evals
- 公开评测排行榜:https://supabase.com/evals
- MarkTechPost:https://www.marktechpost.com/2026/08/01/supabase-releases-evals-an-open-source-benchmark-that-scores-claude-code-codex-and-opencode-on-real-supabase-tasks/
- 36 氪 / 网易(AI 编程智能体格局):https://m.163.com/tech/article/L38F38D200097U7T.html