[LG]《Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex》C Park, A Ozdaglar [MIT] (2026)
在多智能体决策领域,使大语言模型(LLM)具备稳健的博弈均衡能力是一个悬而未决的难题。过去的方法受困于模型难以在无监督轨迹下自发学习复杂的在线学习算法,本质原因是标准的训练目标(如预测下文)缺乏对“遗憾值”(Regret)这一决策核心度量指标的显式优化。
本文的核心洞见是:把自注意力机制重新看作一种可微分的在线学习算法实现器。由此,引入“遗憾损失”与“交换遗憾损失”作为直接训练目标,使单层注意力模型在平稳点处精准复现了“平滑虚构演练”与“Blum-Mansour 算法”的数学逻辑,通过多头注意力结构实现了从外部遗憾到交换遗憾的认知跳跃。
这项工作真正留下的遗产是证明了极简 Transformer 架构可以通过目标函数的设计,在没有任何算法演示的情况下自发演化出具备博弈论保证的均衡行为。它为后来者打开的新门是利用遗憾值监督构建具备理论担保的自主决策智能体,但尚未跨过的门槛是将此类机制扩展到深层非线性 Transformer 及部分可观测的复杂博弈场景中。
arxiv.org/abs/2607.23333 机器学习 人工智能 论文 AI创造营




