LLM被一条提示就带偏?加州大学新研究说我们测的方向全错了

LLM被一条提示就带偏?加州大学新研究说我们测的方向全错了


给LLM一段上下文,它就容易被牵着走。一条看似合理的提示,能把答对的题硬生生拽成错的。

这事儿大家都在想办法解决——训练模型学会「抗拒」上下文干扰。但加州大学欧文分校和东北大学最近出了一篇新论文说:这个思路本身就有问题,它制造了一个更隐蔽的隐患。

他们把这个问题重新定义为「选择性信任」,不是让模型拒绝所有上下文,而是让它学会判断什么时候该信、什么时候不该信。这套方法叫SCOPE,论文8月6日刚挂在arXiv上。

一个隐藏的失效模式

先说旧方案的坑。训练模型抵抗误导信号,模型确实会对误导性提示更「鲁棒」。但代价是什么?它开始忽略所有上下文。

论文里的原话是:a model that ignores all context looks robust yet is useless when the context is worth trusting.

听起来反直觉,但一琢磨就明白——你让模型对提示脱敏,结果它在上下文真的有用的时候也当废纸。这种「鲁棒」有什么意义?

四象限基准测试:MIST

SCOPE团队干了件特别系统的事。他们搞了一个叫MIST的基准测试,每个推理题在四种条件下同时测试:

  • clean:干净题目,无干扰
  • misleading:加了误导线索,正确答案会被带偏
  • correct-context:加了有用上下文,能帮助答对
  • irrelevant-context:加了无关上下文

这把所有情况都覆盖了,不是只测「抗干扰」那一个维度。

他们还定义了一个新指标SC2W(Single-Condition Correct-to-Wrong),专门统计一个误导信号把原本答对的题目拽成错误的概率。这个指标越高,说明模型越容易被带偏。

测了一圈发现:所有模型都存在这个问题,连前沿模型也不例外。

SCOPE:用DPO在四象限上做均衡优化

解决方案是什么?核心思路是改变DPO的训练数据构建方式。

传统做法是在误导样本上做偏好优化,让模型倾向忽略干扰。SCOPE的做法是:在四种条件上均衡构建匹配偏好对——clean答对/misleading答错、correct-context答对/irrelevant-context答错——然后在四组配对上同时做标准DPO优化。

结果:SC2W指标降低约一半,同时在clean/correct-context/irrelevant三种条件下精度不降。

真正该测的不是抗干扰性

这篇论文最值得记的一句话是:models should be judged on selective trust, not on resistance alone.

这不是语义游戏。你判断一个LLM靠不靠谱,不是看它能不能抵抗一切干扰——那只会筛选出「谁都不信」的模型。真正该测的是:它有没有能力判断什么时候上下文值得信任、什么时候不值得。

这对工程实践有个直接的现实意义——你给你的AI编程工具喂上下文、RAG检索结果、用户提示词的时候,你其实在不断测试这个模型的「选择性信任」能力。如果它对所有输入一视同仁地盲信或盲拒,说明底层的选择性信任能力就是缺的。

SCOPE把这件事说得特别清楚:不是模型不够听话,是评估维度和训练目标本身就跑偏了。


论文:arXiv:2608.06377(cs.CL)
机构:UC Irvine + 东北大学
基准测试:MIST(GitHub: worldbench/MIST-Bench)

评论区

0 条评论

登录后可评论。

AI 论文日报 277 阅读