GradCuit: 稳健且可解释的测试时潜在推理
GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
本文提出GradCuit方法,通过在Transformer中间层插入可优化潜在状态,利用自注意力的“电路”特性实现直接梯度信用分配,提升大语言模型测试时潜在推理的鲁棒性与可解释性,在多推理基准上优于现有方法。
主要创新点:
1. 电路式潜在推理设计:在Transformer中间隐藏层插入可优化潜在状态,借助自注意力的前向计算与反向梯度传播,实现生成token到潜在状态的直接信用分配,规避解码过程的信息瓶颈。
2. 鲁棒性显著增强:通过奖励加权梯度直接传播至潜在状态,在学习率敏感性(如不同学习率下性能更稳定)和奖励引导依赖性(随机梯度方向仍具竞争力)分析中,表现出比LatentSeek等方法更强的鲁棒性。
3. 可解释的潜在动力学:token级梯度归因分析揭示推理连接词token对潜在状态影响最强,且早-中期Transformer层为最优优化空间,明确了潜在推理机制的关键作用。
大模型 人工智能 潜在推理 潜在空间 潜在空间推理 LatentSpace 推理 latent空间




