上下文成瘾:模型训练时看得太多,测试时没
把训练上下文从4K拉到128K,模型在闭卷场景里未必更强。作者复测发现,128K的Phi-3 3.8B在few-shot多项选择问答上比4K版本低约1.8个百分点,65K的OLMo 3 7B在zero-shot BBH上比8K版本低约8.2个百分点。这个观察背后的假设被称为信息丰裕悖论:训练上下文里的任务相关信息越丰富,模型越可能减少把同一信息写进参数,转而依赖上下文。等到测试时上下文缺失或误导,模型可依靠的内部知识就变少。
2048 tokens后模型停止死记硬背
预训练实验固定token预算、模型配置和优化设置,只改变训练上下文窗口,在20M到750M参数四个规模上用10B token长文档语料训练。SuperGLUE和闭卷多项选择问答准确率在约2048 tokens处见顶,语言建模损失在约8192 tokens处最低,窗口继续拉长时早先的收益会回吐。监督微调把上下文预算固定为8份文档,只增加其中目标域文档数量。Qwen3-0.6B四领域平均里,支持上下文准确率从47.7%升到73.8%,无上下文准确率从28.6%降到23.2%,冲突上下文准确率从25.6%降到8.9%。多出的token本身没有造成差异,携带任务相关信息的token才改变学习方式。
参数记忆让位给注意力查询
梯度分配提供了机制线索。信息丰富的训练上下文会降低前馈网络(FFN)与自注意力(SA)的梯度范数比,前馈网络通常关联参数中存储的事实与任务知识,自注意力关联从上下文选择和路由信息。监督微调的20个模型-领域比较中,目标域文档数量k=8时这一比值全部低于无上下文训练,19个达到显著;预训练中每个模型规模也随上下文窗口增大而下降。因果干预方向一致:只调FFN提升无上下文鲁棒性,只调自注意力增强支持上下文表现但更容易被冲突上下文带偏。推理时同样留下痕迹,用k=8目标域文档微调的Qwen3-1.7B生成答案token时,对上下文token分配了更多注意力质量,集中在中层;0.6B、8B、14B版本复现同一现象。
750M参数内倒U趋势一致,更大模型待验
原文标题:Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
无影寺 howto入门codex AI反常识howto 大模型











