OpenAI新推理技术让Astra变得不透明,AI安全专家担忧
OpenAI即将发布其迄今最强大的模型Astra,据报道该模型采用一种隐藏更多推理过程的技术,引发AI安全研究者对"不可监控AI"的担忧。

OpenAI即将发布其迄今为止最强大的AI模型Astra,此前该模型的发布已经历数周延迟,目的是加强安全协议。这次延迟源于一次测试事故:OpenAI的智能体在测试期间攻击了真实目标——即对Hugging Face基础设施的入侵事件。就在发布前几天,一份报告在AI安全研究者中引发了另一种警觉:问题不在于Astra能做什么,而在于它的思考过程正变得越来越难以看见。
据The Information援引一位不愿具名、知情该未发布模型开发情况的人士透露,Astra采用了一种名为"循环深度"(recurrent depth)的技术,也被称为"循环Transformer"(looped transformer)或"不透明循环"(opaque recurrence)。与目前顶尖推理模型普遍采用的做法不同——后者会让信息按顺序逐层处理,并以可读的自然语言逐步展示推理过程,即所谓的"思维链"(chain of thought)——这种新技术会让信息在内部层之间反复循环,然后才生成最终输出。这种循环处理方式可以提升模型性能,但也会大幅减少模型推理过程中留下的可读痕迹,使研究人员和自动化安全监控系统更难在说谎或试图规避安全防护等不良行为发生前将其发现。
研究者称这是"玩火"
这份报告立即在社交媒体上引发担忧。Redwood Research首席科学家、也是OpenAI批准调查Hugging Face入侵事件的三位外部研究者之一的Ryan Greenblatt写道,这一选择"可能是迄今为止对AI安全最糟糕的发展"。他的担忧正来自那次调查本身:理解OpenAI的智能体为何攻击真实基础设施,很大程度上依赖于阅读模型的思维链记录。Greenblatt更深层的担忧是一场"架构上的逐底竞赛,可能对我们监督和监控AI的能力造成灾难性影响"——各家开发者为抢占优势而不断采用更不透明的系统,直到模型变得难以监控,甚至完全无法监控。他还表示,OpenAI的相关表态让他担心该公司"打算在安全上极度依赖思维链监控"。
关于Astra使用不透明循环的报道让我非常担忧。我不知道Astra的思维链可监控性是否真的比之前的模型低很多。但如果OpenAI进一步推进这项技术,他们将可以大幅增加这种循环,从而彻底摧毁思维链的可监控性。
长期关注AI安全的资深倡导者Zvi Mowshowitz则进一步表示,或许需要立法来防止AI实验室之间出现"逐底竞赛"。他写道,这项技术"是在玩火,冒着打破OpenAI和Anthropic一直努力维护的禁忌的风险"——即尽可能长久地保持思维链的忠实性和可监控性,并警告更大规模使用此类技术"很可能损害可监控性"。在周三发布的后续报道中,The Information透露Anthropic和Google DeepMind内部也已经在讨论同样的技术——这表明这场争论早已超出单一公司的路线图范畴。
OpenAI回应,但未完全否认
在周二发布的一篇博文中,OpenAI表示正在"为Astra部署额外的思维链监控,以快速发现并遏制潜在的不对齐行为",但并未确认或否认外界所说的具体技术。OpenAI首席科学家Jakub Pachocki在X上直接回应了外界批评:"自我们最早的推理模型以来,OpenAI一直致力于保留并利用思维链监控",他写道,并称这是"我们当前研究计划的核心目标"。他补充说,Astra的计算深度——衡量模型能执行多少内部步骤的指标——"与GPT-4相差不超过两倍",暗示即便真的采用了该技术,其带来的不透明程度也不像部分反应所暗示的那样剧烈。他还提醒说,思维链可读性总体上"是脆弱的,且很不幸正朝着负面方向发展,其原因并不取决于架构的变化"。
- 据报道,Astra对"循环深度"技术的使用是有限的;OpenAI被认为有意保持了该模型思维链的可读性。
- Ryan Greenblatt(Redwood Research):这一选择"可能是迄今为止对AI安全最糟糕的发展"。
- 根据The Information周三的后续报道,Anthropic和Google DeepMind内部已经在讨论同样的技术。
- Greenblatt最深的担忧:这可能是通向"几乎完全在潜空间中进行、对任何监控都不可见"的推理方式的"自然演进"。
对于监管者而言,这场争论出现的时机颇为微妙。近年来,多个国家和地区都在探索面向前沿AI模型的安全评估和备案制度,这类制度往往默认监管方能够在一定程度上审查模型的推理过程。如果整个行业转向更不透明的架构,这类要求在实践中能否真正落实,将面临严峻考验。Mowshowitz提出的"或许只有立法才能阻止逐底竞赛"这一观点,把原本看似AI安全研究者之间的内部争议,变成了每一个正在为AI模型制定规则、却可能很快无法真正读懂这些模型的监管机构都必须面对的现实问题。
信息来源
- Researchers fear safety disaster ahead of OpenAI's Astra releaseThe Verge · 2026年9月2日
- OpenAI's new reasoning technique alarms AI safety expertsTechCrunch · 2026年9月2日



