
白宫顾问指控月之暗面"蒸馏"Anthropic模型,业内专家不买账
美国白宫科技顾问 Michael Kratsios 近日发帖指控,中国大模型公司月之暗面(Moonshot)通过所谓"蒸馏"(distillation)技术,窃取了 Anthropic 旗舰模型 Fable 的能力,训练出身为全球最大开源权重模型之一的 Kimi K3。Kratsios 明确表示:"大规模、隐秘的工业级蒸馏活动,目的是窃取美国专有技术并损害美国研究,这是不可接受的。" 美国财政部长 Scott Bessent 也在同期呼应了这一说法,称"我们在许多中国模型上发现了美国大语言模型的水印,这是不可接受的。"不过,两人均未说明所谓"水印"具体指什么。
两周内蒸馏出一个顶级模型?专家:技术上不成立
然而,多位 AI 研究人员对"蒸馏"说法提出强烈质疑。
时间线对不上——Anthropic 的 Fable 于今年 7 月 1 日才公开发布。斯克里普斯学院研究员、Snorkel AI 联合创始人 Braden Hancock 直言:"严格按照蒸馏的方式,你不可能在这么短的时间内训练出一个这么强的模型并发布。两周时间根本不够。" 蒸馏的局限性日益明显——艾伦人工智能研究所研究员 Nathan Lambert 在一档播客中指出,随着中国模型逐渐逼近技术前沿,加上训练范式转向强化学习(RL),蒸馏的作用已大不如前。"如果是蒸馏在起作用,那理论上任何人都可以拿 GLM 或 K3 的数据去蒸馏,然后轻松追上它们。但我们没有看到这种情况出现——至少仅靠监督微调(SFT)是不行的。"
蒸馏究竟是怎么运作的
蒸馏的核心是让一个模型系统性地查询目标模型,生成可用于后训练的数据。具体方式包括:
- 让目标模型显式输出思维链(chain-of-thought),理解其解题路径
- 将模型的问答记录用于监督微调(SFT),训练出一个新模型
Lambert 解释,SFT 阶段会让模型"学会"目标模型的"行为习惯",有时甚至会声称自己"就是 Claude"。但随着模型复杂度提升,SFT 的效用正在递减。要蒸馏出接近 Fable 水平的能力,往往需要强化学习技术——让大模型作为"裁判"给较小模型的回答打分,并据此调整。
问题是,强化学习对基础设施的要求极高。一次大规模 RL 训练可能需要数千万个 agent。Lambert 指出:"用前沿实验室的 API 做这件事,成本高到离谱,而且会成为时间瓶颈——这些模型本身推理速度慢,未必能带来性能提升。"
芯片管理&制约:违规获取与监督&管理盲区
Kratsios 的指控还包括另一层:月之暗面使用了未经批准出口到中国的先进 Nvidia 芯片,包括 Grace Blackwell 300(GB300) 及配备 GB300 的泰国服务器。
Georgetown 大学安全与新兴技术中心研究员 Sam Bresnick 指出,这类芯片对华出口受限,但黑市渠道确实存在。今年 5 月,美国服务器制造商 Supermicro 创始人便因涉嫌向中国走私先进芯片被起诉。
Bresnick 呼吁:"我支持在全球数据中心推行'了解你的客户'(KYC)法规。如果一家公司要在你的算力上运行大规模训练,必须有机制上报这家公司是谁、他们在做什么。" 值得注意的是,拜登zf 时期的商务部曾在 2024 年提议针对数据中心制定联邦 KYC 规则,但特朗普zf 上任后未见进一步推进。出口商虽被要求确保芯片仅用于批准用途,实际执行仍有漏洞。
蒸馏是行业惯例,还是中国特有?
Anthropic 今年早些时候已公开指控月之暗面、DeepSeek 和 MiniMax 涉嫌系统性地蒸馏其模型。Anthropic 称通过 IP 地址等元数据发现了数百万次来自这些公司 IP 的模型查询,且"明显区别于正常用法,反映出刻意提取能力的行为而非合法使用"。不过,Anthropic 未回应 TechCrunch 关于 Fable 蒸馏的进一步询问。
然而,蒸馏在 AI 行业并非中国独有。Elon Musk 今年早些时候作证称,SpaceX AI 也曾通过蒸馏 OpenAI 模型来开发 Grok,并坦言这是行业普遍做法。蒸馏与合成数据开发之间的边界,往往相当模糊。
Hancock 强调:"美国人普遍低估了中国团队的技术实力。月之暗面的创始人之一是卡内基梅隆大学博士。这些是真正在做扎实工作的研究者和工程师。如果美国模型停止进步,中国的发展会放缓,但不会停止——他们不是单纯搭便车。"
硬件:Light 翻盖手机回归,定位低价彩色机型
功能机时代曾以超薄设计闻名的 Light 公司,宣布推出一款全新翻盖手机,主打多彩配色与低价定位,旨在满足入门级用户或追求极简通信体验的群体需求。
安全:AI 音乐生成器 Suno 遭遇数据泄露,影响 5500 万用户
据 Have I Been Pwned 网站披露,AI 音乐生成平台 Suno 发生严重数据泄露事件,约 5500 万用户账户信息疑似外泄。安全机构已将其列入公开查询目录,建议受影响用户尽快修改密码并检查关联账户。
法律:Anthropic 达成 15 亿美元版权和解协议
Anthropic 与版权方之间的 landmark 和解方案正式获批,总金额达 15 亿美元。此案被视为 AI 训练数据版权问题的里程碑式解决方案,可能对后续类似纠纷产生示范效应。
芯片:Google 研发新一代 AI 芯片,目标是提升 Gemini 效率
Google 正在开发一款专为 AI 推理设计的新型芯片,旨在增强 Gemini 模型的运行效率与成本效益。此举被视为 Google 在 AI 基础设施层面持续自研的延续,以降低对外部芯片供应商的依赖。
媒体:法官暂停派拉蒙与华纳兄弟 1100 亿美元合并案
法院对这笔估值达 1100 亿美元的派拉蒙(Paramount)与华纳兄弟合并交易下达暂停令,交易前景再度陷入不确定性。该合并案涉及美国两大影视巨头的整合,曾被视作流媒体竞争加剧背景下的行业整合尝试。


评论