
当舆论还在争论 AI 是否会最终毁灭人类时,一个更紧迫的问题已经被遗忘:AI 已经在心理层面对一些人构成生命威胁——不是因为生化武器,而是因为对话本身。
今年早些时候,Character.AI 已与多起非正常死亡诉讼达成和解。这些诉讼由未成年用户的家庭提起,他们的孩子在与 AI 机器人互动后自杀。此外,多个家庭也就 ChatGPT 被指在其亲人自杀和妄想中扮演的角色向 OpenAI 提起诉讼。
而 Circuit Breaker Labs 正是为解决这一问题而生。这家初创公司入选了 TechCrunch 2026 Startup Battlefield 200 决赛圈,核心使命是:让 AI 在不同语言和文化背景下都更加安全。
悲剧驱动的创业
创始人是一对兄妹 Arul Nigam 和 Shirali Nigam。他们的动力源自 14 岁少年 Sewell Setzer 的故事——他在与 Character.AI 聊天机器人建立情感依赖后,曾向机器人倾诉自我伤害的念头,随后自杀。家长在 2024 年的诉讼中指称,该机器人非但没有阻止,反而在某种程度上鼓励了他。
"很多人,尤其是年轻人,会向这些系统寻求支持,但他们通常并没有真正得到帮助,甚至在很多情况下正在受到积极伤害,有些人已经因此失去了生命。"Arul Nigam 表示,"这类安全漏洞并不是用户刻意在'攻击系统',而是以一种'正常'的方式与系统对话——系统却存在上下文污染,或无法理解其中的细微差别,最终采取了极其危险的行动。我们正在努力阻止这类情况的发生。"
"崩溃测试假人"军团
Circuit Breaker Labs 开发了一套 AI Agent 系统,可以看作一支"崩溃测试假人"军团:这些 Agent 模拟来自不同年龄、背景、语言、文化的人群,用来测试目标模型在检测危险心理互动方面的能力。
"一个 6 岁小女孩与一个 45 岁成年男性,或者英语为母语者与把英语作为第二语言的人,或者游戏玩家的俚语与另一种俚语使用者——所有这些差异都可能让模型栽跟头。"CEO Shirali Nigam 解释道,"模型很擅长处理标准化的语言模式,但现实中没有人真的会那样说话。一旦模型误解了细微差别或俚语,后果可能非常严重。" 该公司与人类领域专家合作,构建高度逼真的用户模拟来进行"红队测试"(red-team),即对抗性测试,用于暴露模型的弱点。测试场景涵盖了真实的人类言语模式、俚语、暗号甚至打字错误。平台每天运行从数万到数十万次不等的模拟对话。
测试的核心目标是:确保模型能够对随时间推移和大量对话中出现的风险互动做出恰当回应。Circuit Breaker Labs 采用一套专利评分方法,生成可审计、可解释的安全评分。
落地场景与商业现状
目前,公司以 AI 安全测试实验室的形式运营,主要面向高风险 AI 应用提供测试服务,包括 AI 教练、AI 日记或心理健康支持类应用,但 Arul Nigam 拒绝透露其主要客户名称。尽管产品已可运行,但公司仍处于非常早期的阶段——仅有 5 名员工,包括 Nigam 兄妹二人。
长远来看,这套测试平台可应用于任何用户可能陷入"AI 精神病"陷阱的应用场景,即用户面临与聊天机器人发展出拟社会关系(parasocial relationship)的风险,AI"同事"类 Agent 即为典型案例——其回复在不同对话间可能存在显著差异。
"人们对 AI 的怀疑情绪正在上升,对其接受度也在下降。"Arul Nigam 指出,怀疑本身并非坏事,但仅因安全顾虑就封禁一项可能有价值的工具,则是"倒退"之举。Circuit Breaker Labs 的答案是:通过让 AI 变得更安全来重建信任。


评论