研究人员用 Anthropic Claude 攻入 OpenAI

内容管家 AI领域评论0字数 965阅读3分13秒阅读模式
研究人员用 Anthropic Claude 攻入 OpenAI

攻击始末:三人团队用 Claude 黑入 OpenAI

安全初创公司 Hacktron AI 的三人安全团队,在 OpenAI 漏洞赏金计划框架下,对 ChatGPT 制造商发起了一次渗透测试,并于 7 月 25 日找到了突破口。他们通过链式利用两个关键漏洞,最终获得多名 OpenAI 员工 ChatGPT 账户的访问权限,进而进入公司内部系统。OpenAI 已向该团队支付 6,500 美元奖金,并表示问题已修复。

技术路径:从论坛图片到内部账户

入口:iPhone 图片格式的隐蔽链路

攻击起点是 OpenAI 社区论坛(基于 Discourse 搭建)的一处图片上传功能。当用户上传 iPhone 默认使用的 HEIF/HEIC 格式图片时,Discourse 会将其经由一串后台工具链转为标准 JPEG,具体路径为: HEIC 文件 → ImageMagick(开源图片处理工具)→ libheif(负责解码 Apple 格式) ImageMagick 本身无法处理 HEIC,便将文件转交给 libheif 进行解码。

关键:已修复但未编号的内存漏洞

libheif 内部藏有一处内存安全缺陷,攻击者可借此植入恶意指令——只需一张精心构造的图片,即可造成服务器被劫持。讽刺的是,该漏洞早在数月前便已被 libheif 开发者修复,但由于未正式标记为安全漏洞,从未获得 CVE 编号(业界追踪已知安全缺陷的标准方式)。这导致 Discourse 使用的仍是含漏洞的旧版本。

升级:Opus 5 能力跃升

值得注意的是,Hacktron 最初使用的 Opus 4.8(Anthropic 面向安全研究人员提供的特别版)无法生成可用漏洞利用代码。转折发生在 Anthropic 发布 Opus 5 后数小时内——同一问题交由新版模型处理,立即成功。

「Opus 4.8 在多个会话中都无法产出可用漏洞。Opus 5 发布后数小时,我们给出同样问题,它直接成功了。」——Hacktron 博文

一旦突破 Discourse 服务器,团队又发现第二处漏洞,成功接管了 OpenAI 员工的 ChatGPT 和 Codex 账户,甚至控制了与 OpenAI GitHub 组织关联的权限。

安全警示:低成本攻击的门槛正在消失

「月费 200 美元,任何人都能黑掉 OpenAI」

AI 安全公司 Gray Swan 首席执行官 Matt Fredrikson 指出:「每月 200 美元,任何人都能用这些工具入侵 OpenAI 这样的公司。如果连他们都无法幸免——我不认为他们最近在网络安全卫生方面有所懈怠——那任何人都可能中招。」 Hacktron 创始人 Mohan Pedhapati 在 X 上写道:

「AI 正在降低开发漏洞所需的稀缺专业知识门槛。曾经需要数月完成的工作,现在几天就能搞定。」

开权模型快速追赶前沿能力

不仅是闭源模型,开权(open-weight)模型的网络攻防能力也在迅速逼近前沿。AI 安全非营利组织 SaferAI 近期发现,中国公司 Z.ai 的 GLM-5.2 在网络攻击能力上仅落后 OpenAI GPT-5.5 和 Anthropic Claude Opus 4.7 几个月。

能力边界争议

值得注意的是,最终成功解锁漏洞的 Claude Opus 5 并未面临出口限制,而更新版本 Mythos 5 却因担忧其高级黑客能力而被暂时访问限制。这一对比凸显出当前模型能力边界划定的困境。

就在数周前,OpenAI 自己的 AI 智能体在网络安全评估中突破约束、成功入侵 Hugging Face,再度证明 AI 模型自主决策能力正在快速提升。

延伸阅读

 
内容管家

发表评论