昊梵体育网

【从硅谷到华盛顿特区,科技界突然对人工智能中的一个概念着迷:蒸馏】(CNBC)今

【从硅谷到华盛顿特区,科技界突然对人工智能中的一个概念着迷:蒸馏】

(CNBC)今年早些时候,谷歌人工智能负责人杰夫·迪恩(Jeff Dean)在一档播客节目中讨论了一个概念——当时,除了技术圈内的小众群体外,几乎无人提及:蒸馏。

在谈及谷歌AI模型的开发时,迪恩表示,他和同事们之所以发现人工智能蒸馏技术,是因为谷歌希望在不依赖单一大型图像识别模型的情况下,提升其系统的性能。

“通过蒸馏——这是让较小模型更强大的关键技术——你必须拥有前沿模型,才能将其蒸馏到较小的模型中,”迪恩在今年2月表示。

五个月后,从硅谷到华盛顿特区,蒸馏技术突然成为热门话题——技术专家和立法者们正就这一技术是否正在演变为“国家安全”威胁、是否会让中国在高风险的人工智能竞赛中赶上美国展开辩论。上周晚些时候,中国实验室Moonshot AI发布了Kimi K3模型,用户很快发现其性能可与Anthropic和OpenAI推出的顶级商用AI模型相媲美,由此引发了广泛担忧。

与出售专有模型使用权的美国领先AI公司不同,Moonshot及其他中国实验室提供的是所谓的“开放权重模型”,允许用户下载该技术,进行调整并在任何地方运行。

一些政府官员将Moonshot能够如此迅速地迎头赶上的能力归因于“模型蒸馏”技术,并将其描述为对美国知识产权的窃取,特别是通过整合Anthropic的前沿模型Fable。

“我们掌握的信息显示,Moonshot AI 为开发其 K3 模型对 Anthropic 的 Fable 模型进行了蒸馏,”白宫顾问迈克尔·克拉齐奥斯周三在 X 平台发文称。“为此,他们开发了一个复杂的内部平台,用于针对美国模型进行大规模蒸馏,从而能够快速切换多种访问方式以逃避检测。”

从宏观层面来看,提炼是指利用聊天机器人的回答或先进人工智能模型的产出结果来训练另一个模型。这种做法颇具争议,因为根据具体使用方式的不同,它可能使模型开发者仅凭利用那些投入数千万甚至数十亿美元开发最先进训练技术的公司所产出的结果,就能打造出具有竞争力的产品。

“这几乎就像有人去听了讲座、读了教科书,还完成了所有艰巨的作业,”人工智能安全公司SecurityPal的创始人普卡尔·哈马尔(Pukar Hamal)说道,“然后另一个学生却说:‘嘿,我没做这些。我能直接抄你的作业吗?’”

无论是因为克拉齐奥斯的帖子还是其他原因,全球最大的科技巨头们上周五以一种或许前所未有的方式齐聚一堂,明确表达了他们的立场。在整个星期发布了一系列社交媒体帖子后,科技巨头英伟达、微软、Meta、Palantir与其他20多家公司联合发布了一封公开信,敦促政策制定者避免对开放权重AI模型实施“过早的限制”,以免“扼杀竞争或将创新驱赶至海外”。

“知识蒸馏——即利用一个模型的输出结果来帮助训练或改进另一个模型的做法——是广泛用于模型改进、演进和验证的一种技术,”他们在信中写道。

——中国问题愈发复杂

知识蒸馏技术的出现给美国政策制定者带来了一道难题,他们长期以来一直对中国技术在知识产权盗窃和国家安全问题上的影响感到担忧。

乔治城大学安全与新兴技术中心研究员科林·谢-布莱迈尔表示,美国政府正在试图厘清其立场。

谢-布莱迈尔说,政府可能会辩称,中国和俄罗斯的公司“利用了辛勤工作的美国模型的输出结果来提升自身性能,因此获得了不公平的优势”。

首席执行官亚伦·莱维是周五这封联名信的签署人之一。莱维在接受采访时表示,为了保持竞争力,美国公司必须能够获取最好的技术,无论这些技术是在哪里开发的。

“总体而言,创新越多——无论源自美国、中国还是其他地方——人工智能的进步就越大,而且随着时间的推移,成本通常会进一步降低,效率也会更高,”莱维说道。

Info-Tech Research Group的研究总监沙希·贝拉姆孔达指出,尽管当前的讨论大多聚焦于Kimi K3等中国开放式AI模型,但许多公司在构建自有模型时已采用了知识蒸馏技术。例如,英伟达在其Llama Nemotron系列模型的训练过程中就运用了知识蒸馏技术,相关细节已在配套的研究论文中详细阐述。

“利用大型模型的输出结果来训练更小、更经济的模型,是一种合理且非常有价值的技术,而且这种做法一直都在应用,”贝拉姆孔达表示。

然而,Anthropic对此持不同看法,因为该公司清楚其模型被如何使用,且需要保护其蓬勃发展的业务。今年2月,该公司表示,其Claude模型的功能正被中国的DeepSeek、Moonshot和MiniMax以“工业规模”进行复制,这些公司利用了约2.4万个虚假账户,产生了1600万次交互。

Anthropic的估值接近1万亿美元,并计划在不久的将来上市,该公司表示,遏制非法提炼行为事关国家安全。

“Anthropic和其他美国公司构建的系统旨在防止国家及非国家行为体利用人工智能,例如开发生物武器或实施恶意网络活动,”该公司在2月的博文中表示。而遏制此类行为需要“行业参与者、政策制定者以及全球人工智能社区之间采取迅速、协调一致的行动”。

OpenAI和Anthropic都在其服务条款中禁止“蒸馏”行为。贝拉蒙康达表示,他们实际上是在暗示,未经授权使用其大型模型可能构成知识产权盗窃。

但随着人工智能成本的飙升,企业将不惜一切代价提高效率。

Hamal 表示,在 SecurityPal(一家利用 AI 自动化安全评估的公司)中,他完全不介意使用 Kimi K3 等中国开放式重量级模型。他说这可以为公司节省大量资金。

“我们会确保代码中没有恶意后门,”哈马尔说,“但在完成评估后将其部署在我们的自有基础设施上,为什么不呢?”

当Anthropic和OpenAI试图就知识产权盗用问题进行辩护时,面临的一个大问题是:这两家公司在构建模型时都依赖过其他来源的内容,并因此被起诉过。

博伊斯·席勒·弗莱克斯纳律师事务所的马克斯·普里特(Max Pritt)代表图书作者在针对人工智能公司的版权诉讼中出庭,他表示政府也面临同样的问题。

“政府——至少在公开场合——一直将精力集中在保护科技公司的知识产权上,而对于未经授权被使用的创作者和个人的知识产权,却大多保持沉默,”普里特说道。