昊梵体育网

Scaling Law(缩放定律)是 AI / 大模型领域的一条经验规律,,描述

Scaling Law(缩放定律)是 AI / 大模型领域的一条经验规律,,描述了模型性能随资源投入规模增长呈现可预测的幂律(Power Law)提升的现象

三个关键变量

OpenAI 2020 年那篇 Scaling Laws for Neural Language Models(Kaplan et al.)给出的经典结论:

• N(参数量):↑N → loss ↓,关系约为 Loss ∝ N^{-α},α ≈ 0.076

• D(训练 token 数):↑D → loss ↓,同样幂律

• C(算力,FLOPs):↑C → 更快收敛到更低 loss

💡 一个重要推论:在相同算力预算下,把模型做大、训练步数做少,比把模型做小、训练更久更划算。这就是 GPT-3 175B 那条路线的理论基础。

后续修正:Chinchilla(DeepMind, 2022)

DeepMind 通过更严谨的变量控制实验,指出初代定律存在实验设计缺陷 —— 初代实验固定所有模型的训练数据量,导致大模型训练不充分,系统性低估了数据的价值。修正后提出计算最优配比:

•最优参数规模与训练 token 数量的比例约为 1:20(每 1 个参数对应 20 个训练 token)

•同等算力预算下,“更小的模型 + 更多的训练数据” 能获得更优的最终性能基于此结论训练的 Chinchilla 模型(700 亿参数、1.4 万亿 token),在同等算力下性能全面超越参数规模更大的 GPT-3,推动行业从 “唯参数论” 转向数据与参数均衡发展的路线。

为什么市场关心这个

Scaling Law 是这一轮算力军备竞赛的"理论背书":

• 训练侧:只要砸算力+数据,loss 还能降 → 巨头敢每年几百亿美金买 H100/GB200

• 推理侧:loss 降 → 模型能力涨 → 商业化故事成立

• 瓶颈正在出现:高质量人类语料基本被啃完("数据墙"),纯靠堆 N/D 的"傻 scaling"边际收益递减,所以行业转向 推理 scaling / test-time compute / 合成数据(OpenAI o1/o3 这条路)

一句定性

Scaling Law 不是说"越大越强"这么粗暴,而是给出了"强多少、要花多少"的量化公式——它让"烧钱训练大模型"从玄学变成了可预测的资本开支模型,这也是为什么它是这一轮 AI 牛市里被投资人引用最多的论文之一。