【把 Gemini"冻"进硅片:谷歌走了一条 NV / AMD 都不敢轻易走的直线】
The Information 爆谷歌在研代号 Frozen v2 的服务器芯片——把 Gemini 的底层运算架构直接蚀刻进硬件,按单位功耗 token 吞吐量算,能效是现有 TPU 的 6–10 倍,最早 2028 年部署,独立于 TPU 产品线、不替代 。
🧊 "Frozen"设计哲学:传统 AI 芯片是通用流水线——模型存内存,每次 token 都重抓权重+架构参数+调度;Frozen v2 把 Gemini 的层级结构 / 注意力 / 残差在电路层"冻住",变成物理走线,砍掉反复搬运和调度判断,延迟下来、每瓦 token 上去 。
v1 → v2 的演进值得拎一下:
• Frozen v1(Jeff Dean 主导)曾想把权重也嵌进硅片 → 被否,怕模型一升级芯片就报废
• Frozen v2 只固架构逻辑,权重仍可更新 → 在"极致专用"和"模型迭代"之间找平衡点
推力很直白:谷歌内部算力荒已经闹到"云客户订单被回绝、部门互抢卡"的地步,Frozen v2 是给 Gemini 推理单独开的一条专用线 。
对格局的意味:
• 对 NV:GB200 / Vera Rubin 打的是"通用加速 + CUDA 生态",Frozen v2 不打擂台、走 model-specific ASIC 岔路——谷歌/亚马逊/微软每家自冻自家模型,NV 在超大规模厂那里的"默认"位还会继续松
• 对 TPU 线:官方说 Frozen 不替 TPU,但 6–10x 能效差摆着,Ironwood 之后的 TPU v7 会不会吸收 Frozen 思路,是下一个看点
• 风险点:架构一改,芯片经济性归零——所以这条线产量注定低于 TPU,更像是 DeepMind 的"技术期权"而非主力出货 !
一颗 2028 才量产的蓝图,市场先买单 。