[CL]《The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context》Y Zhang, S Koyejo, D Yang [Georgia Tech & Stanford University] (2026)
在大型语言模型(LLMs)部署领域,模型在处理富含冗余信息的长文本时的稳定性是一个悬而未决的难题。过去的方法受困于仅关注聚合层面的准确率,本质原因是宏观指标的平稳掩盖了微观层面的剧烈波动,导致严重的个体预测风险被忽视。
本文的核心洞见是:把任务无关的上下文干扰重新看作一种导致模型预测翻转的“双向不稳定性”。由此,引入不稳定性(INS)与最差尾部退化(WTD)这两个关键指标,使研究者得以揭开即使是无意义字符也能在不改变总分的情况下,让特定样本预测发生崩溃或意外改善的真相。
这项工作真正留下的遗产是揭示了上下文鲁棒性具有高度的模型特异性,且会随模型性能提升而演变。它为后来者打开的新门是建立样本级的可靠性评估体系,但尚未跨过的门槛是彻底厘清这种不稳定性在复杂 Agent 决策链条中累积与传播的深层机理。
arxiv.org/abs/2607.12963 机器学习 人工智能 论文 AI创造营








