
OpenAI 新推出的 Astra 模型将采用一项名为"循环深度"(recurrent depth)的推理技术,使其摆脱传统推理模型的顺序思维模式——这也让 AI 安全专家们忧心忡忡。该技术又称"不透明循环"(opaque recurrence),可能大幅削弱思维链的可监测性。
核心变化:不透明循环如何运作
传统推理模型的思维链(Chain of Thought)会逐步记录模型解题时的推理路径,虽不完美,但仍是监测异常行为的重要工具。相比之下,不透明循环让模型对同一问题进行多次循环处理,而非线性推进,最终在思维过程中留下的可读痕迹更少,实质上绕过了传统思维链记录。
报道称,Astra 目前对该技术的使用范围有限,思维链仍具备一定可读性,OpenAI 也否认会转向"神经语"(neuralese)。
安全担忧:专家怎么看
多位 AI 安全领域人士公开表达警惕。
Redwood CEO 巴克·施莱格里斯(Buck Shlegeris)直言:"我不清楚 Astra 的思维链是否比此前模型更难监测,但如果 OpenAI 进一步推进这项技术,他们完全可以大幅增加循环深度,将思维链的可监测性彻底摧毁。" 长期关注 AI 安全的评论者 Zvi Mowshowitz 指出,各实验室可能陷入"逐底竞争",甚至需要法律介入加以约束。 他写道:"这项技术是在玩火,冒着打破 OpenAI 和 Anthropic 多年来努力维护的'思维链忠实性'与'可监测性'禁忌。
更激进地使用此类技术,很可能会损害整个监测体系。" Redwood Research 首席科学家瑞安·格林布拉特(Ryan Greenblatt)则提出了更根本的担忧:随着不透明推理规模扩大,模型的推理过程可能完全迁移到隐空间(latent space)中进行,最终导致所有推理对外部观察者完全不可见。
影响与建议
尽管 OpenAI 首席科学家雅库布·帕乔茨基(Jakub Pachocki)已强调,公司自首批推理模型起就致力于保留和利用思维链监测,并将"可读思维链"作为当前研究项目的核心目标,但业内担忧并未消除。
有迹象表明,Anthropic 和 Google DeepMind 已在内部讨论这一技术方向。随着主要实验室纷纷探索不透明推理的边界,如何在模型性能与安全可控之间找到平衡,将成为下一阶段 AI 发展的关键议题。


评论