【大模型全家桶的“套娃”革命】康奈尔大学等机构的研究者提出 Matryoshka 语言模型套件,核心是将不同规模的子模型嵌套在同一个架构中进行端到端训练。以 500M、1.5B 和 3B 的组合为例,这种方法比独立训练节省了 36% 的算力,且性能基本持平。由于小模型本身就是大模型的一部分,推理时的投机采样无需额外加载草稿模型,内存和激活值完全共享,使吞吐量提升了 14-26%。过去厂商发布模型全家桶往往是重复造轮子,每种尺寸都要吃一遍数据和算力。这项研究的精妙在于把知识蒸馏变成了训练的副产品,让小模型在成长过程中直接共享大模型的参数权重,解决了模型家族之间的一致性问题。这为算力捉襟见肘的团队提供了一条捷径,即用一份算力换取一套模型。社区评论虽然对其在超大规模参数下的表现以及架构灵活性持保留意见,但这种通过结构设计榨取效率的思路,显然比单纯堆算力更具启发性。



