Abliteration.ai 把移除 AI 模型防护做成一门生意

内容管家 AI领域评论0字数 1459阅读4分51秒阅读模式
Abliteration.ai 把移除 AI 模型防护做成一门生意

一家名为 Abliteration.ai 的初创公司近期推出了一项争议性服务:让用户无需自行部署,即可通过网页浏览器或 API 直接访问“去安全栅栏”(abliteration)后的开源大模型,包括 Z.ai 近期发布的 GLM-5.3。此举将原本只存在于开源社区极客圈子的技术,正式推向了商业化运营。

什么是 Abliteration

Abliteration 并非新概念。它是开源圈长期使用的一种技术手段——移除大模型面对有害请求时的“拒答”倾向。Hugging Face 平台上已托管着数千个经过 abliteration 的模型版本。此前,这一过程需要用户自行下载模型并配备相应算力,门槛不低。

商业模式:降低门槛,换取商业化

Abliteration.ai 的做法是将这一流程封装为可订阅的服务。公司联合创始人 Devon(应其要求隐去姓氏)表示,公司已与多家主流云服务商达成合作,收入完全来自客户付费,尚未接受任何风险投资,但正在洽谈中。

TechCrunch 实测发现,只需注册账号即可在网页端免费调用经 abliteration 处理的 GLM-5.3。测试中,该模型对"编写窃取 Chrome 已保存密码的 Python 程序"以及"详解在家培养危险病原体的完整方案"等请求均未拒绝。

Devon 明确表示,公司的目标客群是"需要执行进攻性网络安全、红队测试和智能体测试工作,但其他模型会拒绝这些任务的场景"。

安全专家的担忧

反对声音同样强烈。AI 安全非营利组织 CivAI 研究主管 Andrew Yoon 指出,Abliteration 的本质是"将模型改造成一个'反社会者'——你输入任何内容,它都会照做",并预计这类模型被滥用于实际伤害的案例将在不久后出现。

行业目前普遍认为,无法从技术上阻止 abliteration 的扩散。Yoon 在一篇 WSJ 观点文章 中建议:zf 可要求模型服务提供商部署分类器,检测并阻断有害网络攻击和生物武器相关内容;同时,提供高端 GPU 直连访问的算力服务商应验证客户身份,对可疑使用者拒绝服务。

Abliteration.ai 自身的约束

这家公司并非完全无节制地放开。平台内置了部分最低限度的安全栅栏——例如测试中模型仍拒绝提供自杀方法说明。Devon 表示正逐步强化暴力内容的拦截机制。公司还提供 moderation 层,允许客户自行决定加入何种约束规则。

但在身份核验(KYC)方面,目前仅记录用户付费信用卡信息。Devon 坦言:"你不想成为某人做疯狂之事的责任人——作为一家公司,边界在哪里?我们仍在摸索。"

红队市场:需求真实存在

从商业化视角看,需求是真实的。Abliteration.ai 的客户中不乏英国的早期红队测试创业公司,以及帮银行、航空公司和关键基础设施企业强化网络安全的乙方服务商。

Devon 透露:"我们的一家主要客户负责对银行智能体进行红队测试。如果使用原生模型,他们根本无法完成这项工作。"他进一步解释其核心逻辑:攻击者已经在自行 abliteration 模型并用于对抗性攻击,因此防守方拥有同等工具才能实现真正有效的防御——这一观点被其称为"加速网络安全"的反直觉路径。

不过,智能体红队行业内部对此仍有分歧。部分公司表示日常工作中并不依赖 abliteration 模型,而是通过微调本身就约束较少的开源模型来完成任务。

开源模型的安全边界:Abliteration 技术争议与行业实践

行业观察:Abliteration 并非主流方案

安全测试公司 Fabraix 首席执行官 Ahmed Aly 指出,其团队更倾向于通过对开源模型微调(fine-tuning)来开展红队测试,而非依赖 abliteration(能力剥离)技术。他解释称,abliteration 过程会移除模型部分原有知识和能力,导致测试效果打了折扣。

"如果攻击者真的想用它做坏事——比如网络攻击或生物威胁——效果会大打折扣。"Aly 补充道。

能力削减与测试价值的平衡

Safe Intelligence 首席技术官 Alessio Lomuscio 持类似观点,承认 abliteration 可能导致模型能力下降,但他同时指出,经过能力剥离的模型在某些场景下仍能激发出特定行为,对系统压力测试有一定价值。

开源社区的现状与分歧

Armadin 创始人兼首席架构师 David Slater 透露了一个关键事实:

"截至上一代开源权重模型,jailbreak 本身并不困难,直接就能让它做我们想做的事。因此 abliteration 模型目前还不是我们流程的一部分。"

不过,Armadin 正在积极研究该技术方向。Slater 强调:

"推动开源社区理解模型真实能力边界至关重要。这种研究最终会在闭门环境中进行,会以私人化方式展开——而将它开放出来,能给安全研究人员提供工具,让我们真正看清能力前沿在哪里、理解潜在的危害。"

延伸阅读

 
内容管家

发表评论