白宫科学顾问 Michael Kratsios 声称一家中国公司 Moonshot 复制了 Anthropic 的 Fable 大语言模型 (LLM) 来创建 Kimi K3,这是目前可用的最大的开放权重模型。 Kratsios 表示,Moonshot 的模型使用了未经授权向中国出口的芯片,并补充说,旨在窃取美国技术的秘密工业蒸馏是“不可接受的”。他指出,关于可能禁止中国开放权重模型的讨论正在进行中,这在人工智能领域引起了争议。
财政部长斯科特·贝森特(Scott Bessent)回应了克拉齐奥斯的评论,并透露在许多中国模型中发现了美国的大型语言模型,他也称这是“不可接受的”。财政部没有澄清这些模型中发现的水印的确切性质。然而,专家们对仅靠蒸馏能否解释 Kimi K3 的先进功能表示怀疑,特别是考虑到《神鬼寓言》的发布日期为 7 月 1 日。
劳德研究所研究员 Braden Hancock 指出,仅使用蒸馏技术在如此短的时间内开发出具有 Kimi K3 强度的模型是难以置信的。他表示,“你不可能在两周内提取那么多数据、训练模型并发布它。”艾伦人工智能研究所的内森·兰伯特 (Nathan Lambert) 指出随着时间的推移,蒸馏的有效性逐渐减弱,并认为强化学习等先进方法可能是此类模型实现其功能所必需的。
蒸馏过程涉及系统地查询法学硕士以复制其功能。此过程可能包括监督微调 (SFT),其中目标模型通过模拟其行为来训练新模型。 Lambert 评估说,虽然 SFT 有好处,但随着模型复杂性的增加,这些好处正在减弱。要复制《神鬼寓言》的功能可能需要强化学习,这可能会占用大量资源,并且可能无法保证卓越的性能。
人工智能行业在蒸馏实践方面存在持续的冲突。 Anthropic 早些时候指责 Moonshot 系统地从其模型中提取数据,并列举了通过 IP 地址监控的数百万个可疑交易。埃隆·马斯克 (Elon Musk) 作证说,他的公司 SpaceXAI 还在 OpenAI 模型上利用蒸馏技术来开发 Grok,这表明这种做法在整个行业中有多么普遍。
汉考克强调,美国人的看法可能会低估中国人工智能团队的技术能力,他指的是Moonshot的联合创始人、卡内基梅隆大学的博士毕业生。据称,Moonshot 在访问泰国配备 GB300 的服务器时利用了被禁的 Nvidia 芯片来开发 Kimi K3。乔治城安全与新兴技术中心研究员萨姆·布雷斯尼克指出,此类芯片存在黑市,目前仍禁止向中国出口。对这些先进芯片的使用实施监管的努力尚未取得重大进展。
拜登总统的商务部提出了2024年数据中心建立客户识别措施的规则。然而,上届政府期间这方面没有取得重大进展,出口商必须确保其先进芯片用于合法应用。
<小时/>





