[LG]《Data-Efficient Adaptation of LLMs via Attention Head Reweighting》T Oikarinen, Z Chen, C Siska, T Weng,… [Microsoft Research & Microsoft Security AI] (2026)
在文本分类领域,从小样本中高效学习是网络安全等数据稀缺场景的悬而未决的难题。过去的方法如 LoRA 或 AdaLoRA 受困于参数空间过大导致的过拟合,本质原因是它们试图在有限的样本下修改模型深层的内部权重,破坏了预训练知识的稳定性。
本文的核心洞见是:把大模型的自注意力头重新看作具有特定功能的专门化单元。由此,注意力头重加权(AHR)这一关键操作使问题得以解开,它仅为每个注意力头学习一个缩放标量,通过放大任务相关头并抑制干扰头,实现了极低参数量的精准适配。
这项工作真正留下的遗产是证明了仅需调整百万分之一的参数即可实现高效的任务迁移,并揭示了诱导头等特定结构在上下文学习中的核心地位。它为后来者打开的新门是基于模型内部功能组件的解释性微调,但尚未跨过的门槛是该方法在需要精细生成控制的长文本生成任务中的普适性。
arxiv.org/abs/2607.13425 机器学习 人工智能 论文 AI创造营





