Bridgebench
全球首个 Vibe Coding 盲测基准平台,AI 模型同台竞技工程任务,Elo 评分排名
Bridgebench 是由 BridgeMind 出品的全球首个 AI Coding 与 Vibe Coding 盲测基准平台,专注评估 AI 编程模型在真实工程任务中的表现。
传统 AI 编程评测依赖人工设计的算法题库,与实际开发场景脱节。Bridgebench 创新性地采用 Elo 评分机制,让多个 AI 模型在不知道对手身份的情况下同台竞技,由专业评委盲评打分,实时更新排名,更真实地反映各模型在 Vibe Coding 场景下的实际能力差异。
核心功能:
• 盲测竞技机制:AI 模型同台竞技,评委在不知道模型身份的情况下评分,杜绝排名偏见 • Elo 实时排名:采用国际象棋通用的 Elo 评分系统,每次对战结果实时更新排名,动态反映模型能力变化 • 真实工程任务:评测题目来自真实软件工程场景,而非算法竞赛题,更贴近实际开发需求 • 透明可追溯:所有评测结果和对战记录公开可查,评委评分有据可依 • Newsletter 订阅:3,000+ 开发者通过 newsletter 订阅获取最新评测结果和排名动态
适用人群:
需要客观评估 AI 编程工具能力的开发者、关注 AI 编程模型实际表现的研究者,以及希望在选型 AI 编程助手时获得真实数据参考的团队。
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议