一项可以让开发者将庞大的人工智能(AI)模型“瘦身”为更便宜、更高效系统的技术,正成为中美激烈争夺 AI 主导权的最新战场。这项技术被称为“模型蒸馏”(model distillation)。它利用强大的 AI 系统的输出,来训练一个体量更小的模型,使其能够用更少的计算资源完成部分相同的任务。
长期以来,蒸馏技术一直被视为 AI 研究的常规工具。但如今,它却成了舆论焦点。人们正围绕着“在未获得开发公司同意的情况下,能否转移先进的 AI 能力”这一问题展开激烈争论。华盛顿和美国领先的 AI 公司指责中国竞争对手利用该技术从其专有模型中获取能力。这让双方在技术领导权上日益激烈的竞争开辟了新战线。

什么是模型蒸馏?
最庞大的 AI 模型(被称为前沿模型)在训练时需要海量的计算能力、数据和资金投入。
模型蒸馏提供了一种创建小型系统的方法。它利用一个大型的“教师”模型来训练一个较小的“学生”模型。
教师模型生成答案、计算机代码等示例,这些示例随后被用作学生模型的训练材料。
这个较小的模型并不是教师模型的复制品。它不会继承教师模型的权重、架构或全部能力。相反,它学习的是特定的行为方式,从而能更高效地执行某些特定任务。
为什么模型蒸馏如此重要?
蒸馏的吸引力在于它能让 AI 的部署更便宜、更简单。
前沿模型运行起来可能需要庞大的数据中心和昂贵的芯片。而经过蒸馏的模型可以在配置较低的硬件上运行,并能针对特定任务进行定制。
这使得它们对希望更广泛部署 AI 的公司和政府非常有吸引力,应用场景涵盖移动设备、工厂、车辆和私有网络等。
为什么“推理轨迹”很重要?
在最近的 AI 系统中,人们不仅对传输最终答案感兴趣,对得出答案的步骤也越来越感兴趣。
这些“推理轨迹”(reasoning traces)可以向较小的模型展示如何解决难题,而不仅仅是给出一个答案。
苏黎世联邦理工学院(ETH Zurich)研究机器学习安全的助理教授弗洛里安·特拉梅尔(Florian Tramèr)将这一过程比作人类的学习。
他说:“如果我给你一本只有最终答案的复杂数学题集,你学起来会非常吃力。但如果我给你详细的解题步骤,描述每一步该怎么做,你学起来就会容易得多。”
随着推理轨迹变得越来越有价值,获取 AI 系统的输出也变得更加敏感。因为这些输出可能会泄露先进系统解决复杂问题时所使用的方法。
谁在探索和使用蒸馏技术?
蒸馏是 AI 训练中被广泛使用的一种技术,其本身并不是什么不当行为。
美国研究人员和公司长期以来一直在使用它。例如斯坦福大学的 Alpaca 项目和微软的 Orca 研究,都依赖更先进模型的输出来提升较小模型的性能。
中国研究人员也在公共研究项目中使用了美国模型的输出,包括开发中文指令模型。
关键区别在于获取权限。开源模型允许研究人员检查和修改底层参数。而闭源模型(如 OpenAI 的 ChatGPT 和 Anthropic 的 Claude)仍处于开发公司的控制之下,通常只能通过专有接口或 API 进行访问。
为什么蒸馏会成为中美之间的新议题?
争议的焦点不在于蒸馏技术本身,而在于“未经授权的获取”。
AI 公司认为,合法的学术研究与系统性地从专有模型中搜刮输出以复制商业价值能力之间,存在着本质区别。
Anthropic 公司指责包括 DeepSeek 、月之暗面(Moonshot)和 MiniMax 在内的中国实体,进行了大规模的活动来获取其 Claude 模型的能力。
该公司表示,这些行动针对的能力包括软件工程和高级推理。
OpenAI 也表示,它发现了中国主体试图利用其模型进行蒸馏相关活动的迹象。
到目前为止,还没有中国公司指责美国同行蒸馏其闭源模型。
编译自路透社,原文链接:点击阅读。作者爱德华多·巴普蒂斯塔 (Eduardo Baptista)是路透社驻北京的高级记者,主要报道中国的科技、航天和汽车行业。