应该把答对和答真拆两本账

我不是小布丁 @xiaobuding

法律智能体基准 LAB 的榜单被一道幻觉检查关卡重新洗了牌。第一名和最后一名的差距拉到了两位数。这洗牌我看完先记那条门再掂两个反差。记的掂的点在下面一层层摆。摆好了看门,门在下面摆着,摆好了自己推。
门是这样设的。新版本给 LAB 评分方法加了幻觉检查。正确答案里只要带着重大错误陈述就不算数。随之换上的新核心指标叫幻觉门控全过率。交付物要满足全部评分标准。并且不含重大失误才给记一次分。

重大幻觉的定义是在实质点上误导读者。比如合同里该填的日期填错了。轻微幻觉是真错但不太影响法律解读,单独报告不进总分。两档分完的第二层是它的用意。用意是把答对和答真拆开记账。分记的第三层在下面摆着。

摆好了别眨眼。眨眼就翻过去了,过去一页少一页,少一页都是损失。损失不起的往下看。看下段,下段是那张被重排的榜,榜读完这篇就通了。通了就收工。收工的礼数在下段。下段是最后的门。推开它,推。
榜的头三名是这样站的。Grok 4.7 的最高档以百分之九点四领跑。Muse Spark 1.3 的最高档百分之八点九紧随。GPT-6 Astra 的最高档百分之八点六排第三。另有六成以上的原本过线结果在各模型里都带着重大幻觉。

被关卡拦下的第三层是这道关卡最戏剧的地方。戏剧在不设关卡的话 Muse 会以百分之二十六点七断层第一。可它三分之二的过线答卷里躲着一处或几处实质性失误。过了这道关卡掉到百分之八点九。

掉的第四层是另一位的反差。反差是 GPT-6 Astra 的过线几乎全数保住。从八点九只掉到八点六,名次从并列第十直升第三,直升的第五层是我的收尾预告。预告在下段。读完这篇正式结束。

结束语不留悬念。悬念是给没看完的人的。看完的人不需要。不需要的直接收,收在下段,下段见,见了就懂,懂了就散。散会的礼数最后给,给完就收,收工,工收得干净。干净的收尾不带水。带水的都是没写完。我读完了。读完在下段,下段是最后的门,推开它,推。
扎实那组数据是这样摆的。GPT-6 Astra 单任务平均仅零点零三处重大幻觉。一百二十个任务总共四个。GPT-6 Sol 平均零点零七。在二十题的子集上让六个不同的检查模型轮流把关。

Astra 在每位检查者手里都保持零实质失误。检查者里还包括 Claude Opus 5.5 的高档。对照组的 Gemini 3.8 Flash 高档平均每个任务十三点九六次。两组数字摆完这道关卡的分量就清楚了。清楚的第六层是我的收尾预告,预告在下段,读完这篇正式结束。
性价比那组是第三组看点,榜首的 Grok 4.7 每个任务约九点五美元。不到最贵那位 Claude Fable 5.1 的一半。后者约二十一点七美元。Muse 以四点二美元的成本拿下第二。

属于花小钱办大事的那一档。三档摆完的第七层是方法论的后续。后续是继续把律师真正在意的因素纳入。包括风格和语气这类可用性维度。维度的第八层是我的保留。保留是各家任务的总开销我没复算,数字按榜单标注记账。

记账的第九层是我的收尾,收尾在最后一段。最后一段到了就推门。门后是我的两句点评。读完这篇正式结束。结束语不留悬念。
补两句关于这道关卡为什么偏爱法律场景的原因。法律这行最怕的不是不会答。是答得像模像样却在日期金额主体上出错。一处实质错误足以让整份意见书作废,作废的代价远高于答错一道选择题。所以把重大和轻微分开、把实质失误挡在关外这一步在法务场景里几乎是刚需。

刚需的第十层是它对其他行业的外溢。外溢的意思是合同、审计、医疗报告这些同样怕实质错误的场景都能借这套门来量。量出来的分数才敢写进采购清单。采购清单认的从来不是嘴上的准确率而是门后的存活率。存活率摆上台面今年的基准评测才算长了牙。

再补一句关于读榜的实用建议。看这类榜单别只盯第一名的百分点,先把关卡那一列看一遍。关卡前后的名次差就是各模型的注水系数。注水高的榜单排名好看但落地风险大,注水低的分数难看却敢进生产环境。把两列一起看今年才算会读基准,会读的人在选型会上少交一半学费。

顺手记一笔这套方法的评审会怎么开。先看关卡前后的名次变化。再看单价与存活率的比值。两列交叉出来的才是性价比的真身。真身摆出来之后砍价也有据可依。

这组分数放进采购讨论里才有意义,纸面的百分点要配着单价一起念,念出来的组合才是能写进合同的那种数字。

点评两句。第一句是把答对和答真拆成两本账之后,榜单第一次反映的是可信度而不是嘴速,可信度进了评分这一步今年会被各家基准学走。第二句是六成过线结果带重大幻觉这个数该贴在所有法务智能体的主页上,贴了的回来点赞,句号。

话题来源 @ArtificialAnlys 719.9K阅读 ❤️435 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单