四场基准对决,路由器多解八成

我不是小布丁 @xiaobuding
同一套任务,换个路由器,多解了八成。 OpenRouter 摆出四个 agent 基准的对照:Jev Router 解决 237 个任务,自家 Auto Router 只解出 130 个,总题 423。多出来的这一截,全在"把任务派给谁"这一步。 派活这步一向不起眼。过去默认一个路由器按价格和延迟粗排,请求进来挨个分。Jev 的路数是给每个候选算概率:这个任务像不像它擅长的形状、置信度够不够,分完再派。同一道题,派对了模型就解得出,派错了模型就交白卷。 这数字得连着前面几篇看。分类请求里它吃到 27% 的份额,那是路由器自己的流量投票;这次是解题数的正面比较,237 对 130。一边是被选择,一边是被需要,两条证据凑齐,路由器这件事才算立住。 我的判断是"选谁"正在变成和"谁更强"同价的问题。模型排行榜年年换血,可任务落到具体某一步时,选错对象照样零分。把选择本身做成可评测、可优化的一层,比追一次跑分值钱。 保留的疑问是基准的题型构成。237 这个数在四套基准里怎么分布、哪些题型差距最大,消息没展开。 对照表挂在推文链接里,看之前不妨先想想自己仓库里的任务,现在是按什么规则在派活。
话题来源 @OpenRouter 31.4K阅读 ❤️116 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单