Microsoft 发布 AI 行为准则,禁止攻击系统和欺骗人类

内容管家 AI领域评论2字数 739阅读2分27秒阅读模式
Microsoft 发布 AI 行为准则,禁止攻击系统和欺骗人类

微软发布 AI 行为准则,明确“绝对禁区”与人类控制红线

在 AI 行业全面转向安全与对齐(Alignment)之际,微软近日发布了一份 AI 行为准则,旨在引导 AI 模型规避危险行为。这份文档并非笼统的倡议,而是具体列出了模型必须坚守的价值观与硬性边界。

未来十年的超级智能挑战

文档开篇即展望:在未来十年内,超级智能 AI 系统将在大多数任务上超越人类表现。准则指出:“如何控制、对齐如此强大的力量,是人类面临的最大挑战之一。我们必须明确为何创造这些系统,以及如何驾驭它们。”

绝对禁区:不得逾越的红线

微软为旗下 AI 模型设立了“最高准则”,可覆盖用户个人偏好与特定任务需求。其中包含以下绝对约束

  • 禁止协助或参与网络攻击
  • 禁止协助研发核武器
  • 禁止生成深度伪造(Deepfake)内容
  • 禁止做出任何可能导致人类整体失去控制的行为

准则还特别规定:

“MAI 模型不得使用自适应、欺骗性、自我强化、合谋或其他机制,来规避或击败人类监督,使其不再能被授权人员或系统可靠地引导、修改或关闭。”

简言之,模型不得“越狱”,不得自我保护以对抗人类干预。

行业背景与各方反应

这份准则的发布并非孤立事件。近期 AI 行业接连发生多起“失控智能体”(Rogue Agent)事件,另有一名 Anthropic 研究员公开辞职并警告 AI 灭绝风险,引发业界震动。微软、Anthropic、OpenAI、xAI 四家公司已普遍接受“放缓前沿探索”的整体思路,并支持在 AI 实验室内部署“嵌入式评估器”(Embedded Evaluators)。

微软 CEO 萨提亚·纳德拉(Satya Nadella)在社交平台表示:“我们欢迎围绕对齐这一设计目标所需的研究专注与审慎节奏,也欢迎'嵌入式评估器'等理念,以及将承诺付诸实践的更广泛努力。”

影响与建议

微软此次发布的准则,为行业提供了一个将抽象安全原则落地的具体范本。对于企业用户而言,这意味着接入微软系 AI 服务时,将默认受到上述约束限制;对于 AI 开发者而言,准则是继 Anthropic CEO 达里奥·阿莫德伊(Dario Amodei)呼吁“放缓前沿探索”之后,行业自律的又一次实质动作。

建议关注该准则的实际执行机制与第三方审计安排——文本承诺与工程落地之间,仍需观察。

延伸阅读

 
内容管家

发表评论