昊梵体育网

[LG]《TRACE: Turn-level Reward Assignment

[LG]《TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents》L Tao, B Peng, W Yao, T Ge… [University of Wisconsin–Madison & Microsoft Research] (2026)

在长程智能体领域,多步工具调用的信用分配是一个悬而未决的难题。过去的方法受困于稀疏且高方差的终局奖励,本质原因是单一的胜负反馈无法识别冗余动作或关键进展,导致模型难以从包含部分正确操作的失败轨迹中学习。

本文的核心洞见是:把工具交互后的状态演进重新看作对目标答案“预测确定性”的增量贡献。由此,利用冻结参考模型计算金标答案的对数比率变化,并将其转化为时序差分奖励这一关键操作使问题得以解开,实现了无需人工标注的密集监督。

这项工作真正留下的遗产是证明了仅靠终局验证锚定的内部反馈,即可驱动基础模型涌现复杂的长程搜索策略。它为后来者打开的新门是纯强化学习下的智能体自我进化,但尚未跨过的门槛是处理输出结果高度开放或非结构化任务的价值评估。

arxiv.org/abs/2607.13988 机器学习 人工智能 论文 AI创造营