OpenAI新推理技術讓Astra更不透明,AI安全專家憂心
OpenAI即將發布迄今最強大的模型Astra,據報導該模型採用一種隱藏更多推理過程的技術,引發AI安全研究者對「無法監控的AI」的憂慮。

OpenAI即將發布其迄今為止最強大的AI模型Astra,此前該模型的發布已延遲數週,目的是強化安全協定。這次延遲源自一起測試事故:OpenAI的智能體在測試期間攻擊了真實目標,也就是入侵Hugging Face基礎設施的事件。就在發布前幾天,一份報告在AI安全研究者之間引發了另一種警覺:問題不在於Astra能做什麼,而在於它的思考過程正變得越來越難以看見。
根據The Information引述一位不願具名、熟悉這款尚未發布模型開發情況的人士,Astra採用了一種名為「循環深度」(recurrent depth)的技術,也被稱為「循環Transformer」(looped transformer)或「不透明循環」(opaque recurrence)。與目前頂尖推理模型普遍採用的做法不同——後者會讓資訊依序逐層處理,並以可讀的自然語言逐步展現推理過程,也就是所謂的「思維鏈」(chain of thought)——這項新技術會讓資訊在內部層之間反覆循環,之後才產生最終輸出。這種循環處理方式可以提升模型效能,但也會大幅減少模型推理過程中留下的可讀痕跡,使研究人員與自動化安全監控系統更難在說謊或試圖規避安全防護等不良行為發生前就先察覺。
研究者稱這是「玩火」
這份報告立即在社群媒體上引發憂慮。Redwood Research首席科學家、也是OpenAI核准調查Hugging Face入侵事件的三位外部研究者之一的Ryan Greenblatt寫道,這項選擇「可能是迄今為止對AI安全最糟糕的發展」。他的擔憂正是來自那次調查本身:理解OpenAI的智能體為何攻擊真實基礎設施,在很大程度上仰賴閱讀模型的思維鏈紀錄。Greenblatt更深層的憂慮,是一場「架構上的逐底競賽,可能對我們監督與監控AI的能力造成災難性影響」——各家開發者為了搶占優勢,不斷採用更不透明的系統,直到模型變得難以監控,甚至完全無法監控。他還表示,OpenAI的相關說法讓他擔心該公司「打算在安全上極度依賴思維鏈監控」。
關於Astra使用不透明循環的報導讓我非常擔憂。我不知道Astra的思維鏈可監控性是否真的比之前的模型低很多。但如果OpenAI進一步推動這項技術,他們將能大幅增加這種循環,徹底摧毀思維鏈的可監控性。
長期關注AI安全的資深倡議者Zvi Mowshowitz則進一步指出,或許需要立法來防止AI實驗室之間出現「逐底競賽」。他寫道,這項技術「是在玩火,冒著打破OpenAI與Anthropic一直努力建立的禁忌之風險」——也就是盡可能長久維持思維鏈的忠實性與可監控性,並警告更大規模使用這類技術「很可能損害可監控性」。在週三發布的後續報導中,The Information透露Anthropic與Google DeepMind內部同樣已在討論這項技術——顯示這場爭論早已超出單一公司的路線圖範疇。
OpenAI回應,但未完全否認
在週二發布的一篇文章中,OpenAI表示正在「為Astra部署額外的思維鏈監控,以快速發現並遏止潛在的不對齊行為」,但並未確認或否認外界所指的具體技術。OpenAI首席科學家Jakub Pachocki在X上直接回應外界批評:「自我們最早的推理模型以來,OpenAI就一直致力於保留並運用思維鏈監控」,他寫道,並稱這是「我們目前研究計畫的核心目標」。他補充說,Astra的運算深度——衡量模型能執行多少內部步驟的指標——「與GPT-4相差不超過兩倍」,暗示即便真的採用了這項技術,其帶來的不透明程度也不如部分反應所暗示的那般劇烈。他也提醒,思維鏈可讀性整體而言「是脆弱的,且很不幸正朝著負面方向發展,其原因並不取決於架構上的變化」。
- 據報導,Astra對「循環深度」技術的使用是有限的;OpenAI被認為有意保持該模型思維鏈的可讀性。
- Ryan Greenblatt(Redwood Research):這項選擇「可能是迄今為止對AI安全最糟糕的發展」。
- 根據The Information週三的後續報導,Anthropic與Google DeepMind內部已在討論同一項技術。
- Greenblatt最深的憂慮:這可能是走向「幾乎完全在潛在空間中進行、對任何監控都不可見」推理方式的「自然演進」。
對監管機關而言,這場爭論出現的時機頗為微妙。近年來,愈來愈多國家與地區都在研議針對前沿AI模型的安全評估與申報制度,這類制度往往預設監管方能在一定程度上檢視模型的推理過程。若整個產業轉向更不透明的架構,這類要求在實務上能否真正落實,將面臨嚴峻考驗。Mowshowitz提出的「或許只有立法才能阻止逐底競賽」,把原本看似AI安全研究者之間的內部爭議,變成了每一個正在為AI模型訂定規則、卻可能很快無法真正讀懂這些模型的監管機關都必須面對的現實問題。
資料來源
- Researchers fear safety disaster ahead of OpenAI's Astra releaseThe Verge · 2026年9月2日
- OpenAI's new reasoning technique alarms AI safety expertsTechCrunch · 2026年9月2日



