昊梵体育网

2.8万亿参数只干1042亿的活!Kimi K3的“抠门玄学”,吊打大模型

作品声明:个人观点、仅供参考 文|硬核知识观 编辑|沐沐 序7月27日深夜,月之暗面把Kimi K3的模型权重挂上了Hu
作品声明:个人观点、仅供参考
文|硬核知识观
编辑|沐沐
序7月27日深夜,月之暗面把Kimi K3的模型权重挂上了Hugging Face。
一起放出来的,还有一份47页的技术报告。
我连夜把它啃完了,读完就一个感觉——这家公司可能是AI行业里最抠门的,简直把“消灭浪费”四个字刻进了骨子里。
这份报告从头到尾都在讲一件事:怎么把每一粒算力都榨出油来。


信息堵车?那就换种开法普通模型处理长文本,就像开一场几千人参加的全员大会,每个人轮流发言,听到最后脑子直接炸了——每句话都得结合前面所有的上下文去理解。
K3换了个思路。


它搞了个“动态纪要”加“定期复盘”的机制。
日常的新信息只需要对照一份实时更新的纪要,前面讲过什么一目了然。
等积累到一定程度,再花时间把全部内容串起来校准一次。
还有一招叫“注意力残差”。


K3的神经网络有93层,一条信息要经过93次传递,传到后面早就变形了。
K3给后面的层发了个“时光机”——随时可以回到最开始的状态去看原始信息。
就靠这俩法子,K3用极少的算力实现了100万token的上下文窗口。
100万token什么概念?相当于一口气看完《三体》三部曲。
信息来源:财联社


896个专家,一个都不能闲着K3有896个专家,但每次只叫最擅长的那16个干活。
问题来了——如果所有任务都涌向几个热门专家,其他专家闲着,整个系统照样得排队。
K3的解法很有意思。


它实时观察每个专家门口的排队情况——热门专家就提高门槛,冷门专家就降低门槛,让任务自动分散。
更狠的是,它还会动态复制繁忙的专家,就像给顶级专家搞了个分身术。
这套机制保证了一张卡都不会闲下来。


所以K3虽然有2.8万亿参数,但每次真正干活的只有1042亿——整体执行效率比上一代K2整整提升了2.5倍。
这部分是整个报告里最夸张的。
五千万个沙箱,让模型自己当牛马K3的训练和评测一共创建了五千多万个沙箱,覆盖150多万个环境镜像。
这五千多万个沙箱就是五千多万个虚拟办公室——里面有模拟的邮箱、笔记本、社交软件,甚至Photoshop。


模型就在这个完全虚拟的世界里当牛马:自己收邮件、查资料、写代码、改文件,连续处理几天几夜的复杂任务。
一次任务可能调用几千次工具,积累几百万个token。
系统会直接核查邮件有没有发、文件有没有生成、程序跑没跑出来——做错了返工,做对了才能得分,想钻空子还会被抓。


更绝的是,模型不光要完成任务,还得学会自己给自己派活——自己上网、自己探索,从没见过的论文和代码仓库里找新任务,再自己搞定。
信息来源:千龙网


结语K3从训练初期就用了量化感知训练——提前适应低精度计算,把权重显存占用压到传统精度的四分之一。
7月16日上线几个小时就在WebDev Arena登顶,开源模型第一次在编程盲测榜上压过了所有闭源模型。


在Artificial Analysis智能指数上拿了57分,排名全球第四、开源第一。
加州大学伯克利分校的教授Ion Stoica说,行业此前判定中国开源模型与全球顶尖水平有6到9个月差距,如今已经缩到2到3个月。


K3这份47页的报告,本质上是一张施工图——它告诉所有人:在算力受限的条件下,靠的不是堆更多卡,而是把每一粒算力都用到极致。
这种“抠门”,恰恰是最硬核的能力。
信息来源:央广网