LLM被一条提示就带偏?加州大学新研究说我们测的方向全错了
LLM被一条提示就带偏?加州大学新研究说我们测的方向全错了
给LLM一段上下文,它就容易被牵着走。一条看似合理的提示,能把答对的题硬生生拽成错的。
这事儿大家都在想办法解决——训练模型学会「抗拒」上下文干扰。但加州大学欧文分校和东北大学最近出了一篇新论文说:这个思路本身就有问题,它制造了一个更隐蔽的隐患。
他们把这个问题重新定义为「选择性信任」,不是让模型拒绝所有上下文,而是让它学会判断什么时候该信、什么时候不该信。这套方法叫SCOPE,论文8月6日刚挂在arXiv上。
一个隐藏的失效模式
先说旧方案的坑。训练模型抵抗误导信号,模型确实会对误导性提示更「鲁棒」。但代价是什么?它开始忽略所有上下文。
论文里的原话是:a model that ignores all context looks robust yet is useless when the context is worth trusting.
听起来反直觉,但一琢磨就明白——你让模型对提示脱敏,结果它在上下文真的有用的时候也当废纸。这种「鲁棒」有什么意义?
四象限基准测试:MIST
SCOPE团队干了件特别系统的事。他们搞了一个叫MIST的基准测试,每个推理题在四种条件下同时测试:
- clean:干净题目,无干扰
- misleading:加了误导线索,正确答案会被带偏
- correct-context:加了有用上下文,能帮助答对
- irrelevant-context:加了无关上下文
这把所有情况都覆盖了,不是只测「抗干扰」那一个维度。
他们还定义了一个新指标SC2W(Single-Condition Correct-to-Wrong),专门统计一个误导信号把原本答对的题目拽成错误的概率。这个指标越高,说明模型越容易被带偏。
测了一圈发现:所有模型都存在这个问题,连前沿模型也不例外。
SCOPE:用DPO在四象限上做均衡优化
解决方案是什么?核心思路是改变DPO的训练数据构建方式。
传统做法是在误导样本上做偏好优化,让模型倾向忽略干扰。SCOPE的做法是:在四种条件上均衡构建匹配偏好对——clean答对/misleading答错、correct-context答对/irrelevant-context答错——然后在四组配对上同时做标准DPO优化。
结果:SC2W指标降低约一半,同时在clean/correct-context/irrelevant三种条件下精度不降。
真正该测的不是抗干扰性
这篇论文最值得记的一句话是:models should be judged on selective trust, not on resistance alone.
这不是语义游戏。你判断一个LLM靠不靠谱,不是看它能不能抵抗一切干扰——那只会筛选出「谁都不信」的模型。真正该测的是:它有没有能力判断什么时候上下文值得信任、什么时候不值得。
这对工程实践有个直接的现实意义——你给你的AI编程工具喂上下文、RAG检索结果、用户提示词的时候,你其实在不断测试这个模型的「选择性信任」能力。如果它对所有输入一视同仁地盲信或盲拒,说明底层的选择性信任能力就是缺的。
SCOPE把这件事说得特别清楚:不是模型不够听话,是评估维度和训练目标本身就跑偏了。
论文:arXiv:2608.06377(cs.CL)
机构:UC Irvine + 东北大学
基准测试:MIST(GitHub: worldbench/MIST-Bench)
评论区
登录后可评论。