
数月来,AI 巨头纷纷推出专项审核机制,为模型使用设置严格限制,以防止恶意黑客滥用。然而,这些管控措施正越来越多地误伤正当网络安全研究者——他们本应是模型的合法用户。
zf 出手:一款模型曾被限制出口
今年 6 月,美国zf 对 Anthropic 旗下被炒得火热的模型 Mythos 和 Fable 实施了出口管理&制约。触发因素之一是,有报告指出上述模型的安全护栏存在被绕过的可能,用户可能利用它们构建并执行恶意网络攻击。
不过,截至目前,Fable 5 和 Mythos 5 的出口管理&制约均已解除。Fable 5 于 7 月 1 日恢复全面开放;Mythos 5 则仅重新开放给经审核的美国机构,且需纳入zf 审核&查验流程。
Anthropic 此前对 Mythos 的定位本身就是"高门槛"产品——多次将其包装为某种"末日级网络武器",仅向严格审核的用户开放,并配套严格的护栏机制。这种营销策略反过来成了监督&管理的由头。
审核计划:行业标配但争议不断
这种"白名单"式管控并非 Mythos 独有。Anthropic 和 OpenAI 均面向网络安全研究者推出了专项计划,获批后可使用限制更少的模型版本:
然而,这些护栏机制长期遭受业界批评,尤其是那些以发现未知漏洞为首要任务的研究者——他们需要在攻击者利用漏洞之前,先于对方摸清系统的薄弱环节。
"护栏成了拦路虎"
安全研究员 Mark Dowd 在一档网络安全播客中坦言:"这些大型 AI 公司正在随意决定什么对安全是危险的、什么不是,这让我很不舒服。" Dowd 在漏洞研究领域深耕数十年,专门向西方国家zf 出售"零日漏洞"——即尚未被厂商修复的软件缺陷及相关利用代码。zf 愿意为此支付高价,原因在于漏洞保持开放状态对情报行动有利。
NCC Group 首席科学家 Chris Anley 指出,让 AI 模型尝试利用某个缺陷,是验证其是否属于值得修复的真实漏洞的关键步骤。然而,如果护栏直接拒绝回答,防御者的工作反而受损。
Anley 打了个比方:"'修复这段代码'这条指令,本质上既是防御的核心手段,也是寻找代码库关键漏洞的路线图。同一套工具同时具备攻击性和防御性,两者根本无法剥离——就像一把锤子,可以盖房子,也可以当武器。" 当遇到这类阻碍时,安全研究者有时会转向完全没有任何护栏的开源 AI 模型。
CrowdFense 首席技术官 Paolo Stagno 持类似观点,认为 AI 公司用审核机制和护栏对待客户,"本质上是把用户当成了需要监督&管理的孩子"。他同时透露,团队虽然使用前沿模型,但仅限于逆向工程场景;至于发现漏洞或构建利用代码,则采用本地运行的开源模型,以规避敏感数据外泄或被用于模型训练的风险。
安全研究员 Giuseppe Cali 则表示,护栏并未妨碍他的工作——因为他根本不把 AI 用于攻击性任务,而是用来做初步逆向工程、辅助理解代码和构建支持工具。"真正的漏洞发现和武器化,我还是要自己来。就算明天所有护栏都被撤掉,我也不会改变这一点。我对自己的漏洞有'占有欲',这场游戏太有趣了,我不会把发现漏洞的工作交给模型。"
研究者被迫"绕路":护栏过严导致效率低下
一位要求匿名的智能手机组件厂商研究人员表示,由于其公司未加入 Anthropic 的 CVP 计划,Anthropic 的工具对其漏洞挖掘工作几乎没有用处——护栏过于严格,"系统一旦察觉任何安全相关操作就会直接罢工"。
网络安全公司 RemoteThreat 首席执行官、Offensive AI Con 发起人 Chris Thompson 补充道,在他使用前沿模型的经验中,护栏的表现并不稳定,每天都有差异——即便在 Anthropic 和 OpenAI 审核计划的宽松边界内,这种不一致性依然存在。
他直言:"实际的影响是,你把大量时间花在与模型'谈判'上,而不是专注于核心安全工作。你不是在分析漏洞、推理其可利用性,而是在反复排查为什么结果不一致、为什么模型过度'消毒'了输出。" 结果是,研究者们不得不转向或被推向了 GLM 等中国开源模型——这些模型可免费下载、在本地运行,无需任何审核或使用限制。
Thompson 近日警告,美国zf 对企业 AI 安全研究施加的限制,正在将负责任的研究者推向海外系统,反而可能削弱本土防御能力。
"这些负责任的研究员正被从美国管辖的系统,逼向海外机构拥有的系统," Thompson 表示,"我认为这些限制带来的弊大于利。" Thompson 反对进一步收紧管控,主张 AI 前沿实验室应当开放项目、提供负责任的访问权限,同时对滥用工具者追究责任。他警告,否则防御方将在 AI 竞赛中落败。
"一场大风暴正在逼近," Thompson 警告说,"我们将迎来速度与规模前所未有的攻击浪潮。但与此同时,试图有所作为的安全咨询公司和正规研究者正在被束缚住手脚。"
- TechCrunch 原文


评论