github.com/nokia-applied-…
开源模型也能当决策器用了,这库一出手就是三档可选。
AnyJev 是刚开源的 Python 库,能把因果大模型吐出的东西换成带类型的选项、是与否的判断、分数和概率。真正有意思的是它按标注需求分了三级。
L0 零标注。它靠轮换选项的顺序来消位置偏差,代价是概率没校准过,看着有数、实际不准。L1 每道题备 100 到 500 条标注,用温度缩放把概率校准了,信心估计变准,答案排序不动。L2 每道题 100 到 300 条标签,在中间隐藏状态上拟合一个闭式头,模型权重一根毛都不动,还能在完整前向算完之前就停推理。
主要门槛写得很直白:得能拿到 logits 或隐藏状态,所以这库专为开源模型而生。L2 的头还按模型、按题各配一套,不能通用。
看完这三档,我脑子里立刻浮出一道选择题。L0 像裸好数字,L1 是花小钱买个准头,L2 则是既准又省,可标注和按题训练的成本也水涨船高。拿它和前几天那条商业版对照,一个买服务、一个自造,路线不同、终点一样:决策要带概率,还得知道概率靠不靠谱。
我保留的顾虑在 L2 的维护上。头是按题训的,题一换就重来,长期摊下来未必比 L1 划算。加上校准用的标注得跟真实分布对得上,脏标注会把校准带偏。
我的动作分两步:先拿 L0 跑通手头一个二分类门禁,看不校准的偏差有多大;再决定要不要花标注的工夫上 L1。L2 等题目稳定了再说。
话题来源 @_avichawla
54.9K阅读 ❤️531 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论
0 反应










