不是调到顶,是调到对的档

有条热度很高的帖子问出了核心:effort 到底是什么?你什么时候该调它?为什么不干脆所有任务都开到 max?作者的路子也实在——翻评测、自己做测试,最后说"结果相当意外"。(文章:见原帖附的 article 链接) "为什么不全用 max"这个问题值得替他展开。直觉上顶配总没错——更用力、更仔细;但实际的账有两面。顶配不是免费的:更长的思考、更多的采样、更贵的 token,当任务本身不需要时,这些开销买到的只是"看起来更认真";更隐蔽的一面是,更强的 effort 未必对所有任务都更好——简单任务上过度思考会把明确的路径想岔(今晚方法论里提过的反例:让模型"省着点"会罢工,同理,让它"卖力点"也可能在简单题上画蛇添足)。effort 的正确用法因此不是档位越高越好,而是任务难度与努力程度的匹配。 这与今晚档位那条线(按难度分流、简单轮次路由到便宜档)是同一条原则的近亲:那条讲"换便宜的模型",这条讲"调同一模型的力度"——省钱的两个旋钮,一个在选谁,一个在用多大劲;而两个旋钮的共同前提是那句老话——你得先知道自己在什么任务上:调试、检索、生成、校对,各自该开的档并不一样。 "自测+评测"这个方法也顺带立了个样板。关于 effort 的争论多半停在感觉层面("我总觉得 max 更稳"),他选择两边都做:看公开评测、再自己跑对照——关于档位的判断,最终得由自己的任务分布来裁;这与今晚"三道题复现你自己的 12.5 倍"是同一个姿势:不替别人的用例代言,只对自己的账本负责。 给要调 effort 的人一句落地的:先别动默认值——把你这周的任务按"改错要多贵"排个序,然后做一次 A/B:同一批任务,一半默认档、一半顶配,比三项——正确率差多少、耗时差多少、成本差多少。多数人会发现顶配只在最关键的那两三类任务上赢,其余的全是为虚荣付的钱;那两三类,就是你该设默认顶配的地方。
话题来源 @trq212 187.3K阅读 ❤️2100 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单