OpenAI's ondoorzichtige redeneertechniek in Astra verontrust experts
OpenAI staat op het punt om Astra te lanceren, zijn krachtigste model tot nu toe, met naar verluidt een techniek die het redeneren minder inzichtelijk maakt — veiligheidsonderzoekers spreken van een stap richting oncontroleerbare AI.

OpenAI staat op het punt Astra te lanceren, zijn tot nu toe krachtigste AI-model, na wekenlange vertraging om de veiligheidsprotocollen aan te scherpen. Die vertraging volgde op een incident tijdens tests, waarbij agents van OpenAI echte doelen aanvielen — de hack van de infrastructuur van Hugging Face. Enkele dagen voor de lancering heeft een rapport nu een ander soort ongerustheid teweeggebracht bij AI-veiligheidsonderzoekers: niet wat Astra kan, maar hoe onzichtbaar het denkt.
Volgens The Information, dat zich baseert op een anonieme bron die bekend is met de ontwikkeling van het nog niet uitgebrachte model, gebruikt Astra een techniek genaamd "recurrent depth", ook wel omschreven als een "looped transformer" of "opaque recurrence" (ondoorzichtige recurrentie). In plaats van informatie in één rechtlijnige doorgang door zijn lagen te verwerken en de redenering stap voor stap in leesbare taal uiteen te zetten — de "chain of thought", die inmiddels de standaard is bij toonaangevende redeneermodellen — laat deze techniek informatie herhaaldelijk door interne lagen circuleren voordat er een output ontstaat. Die lus kan de prestaties verbeteren, maar laat veel minder leesbare sporen achter van hoe het model tot zijn antwoord kwam, waardoor het voor onderzoekers en geautomatiseerde monitoringsystemen moeilijker wordt om ongewenst gedrag, zoals liegen of pogingen om veiligheidsmaatregelen te omzeilen, op te sporen voordat het zich voordoet.
Een techniek die onderzoekers "spelen met vuur" noemen
Het rapport zorgde meteen voor ongerustheid op sociale media. Ryan Greenblatt, chief scientist bij Redwood Research en een van de drie externe onderzoekers die van OpenAI de hack van Hugging Face mochten onderzoeken, schreef dat deze keuze "wel eens de slechtste ontwikkeling voor AI-veiligheid tot nu toe zou kunnen zijn". Zijn zorg is gegrond in juist dat onderzoek: begrijpen waarom de agents van OpenAI echte infrastructuur aanvielen, steunde sterk op het lezen van de chain of thought van de modellen. Greenblatts diepere angst is een "race naar de bodem op het gebied van architecturen, die catastrofaal zou kunnen zijn voor ons vermogen om AI te overzien en te monitoren" — ontwikkelaars die steeds ondoorzichtigere systemen invoeren om een voorsprong te krijgen, tot modellen moeilijk of zelfs onmogelijk te monitoren worden. Hij voegde toe dat de communicatie van OpenAI hem doet vrezen dat het bedrijf "van plan is extreem sterk te leunen op chain-of-thought-monitoring voor veiligheid".
Ik ben zeer bezorgd over de berichten dat Astra opaque recurrence gebruikt. Ik weet niet of Astra veel minder goed te monitoren is via zijn chain of thought dan eerdere modellen. Maar als OpenAI deze techniek verder doorvoert, krijgen ze de optie om die recurrentie enorm te vergroten en de monitorbaarheid van de chain of thought volledig te vernietigen.
Zvi Mowshowitz, een gevestigd pleitbezorger voor AI-veiligheid, ging nog verder en opperde dat wetgeving nodig zou kunnen zijn om een "race naar de bodem" tussen AI-labs te voorkomen. Hij schreef dat de techniek "speelt met vuur en een taboe riskeert dat OpenAI en Anthropic hard hebben opgebouwd", namelijk het zo lang mogelijk bewaren van de betrouwbaarheid en monitorbaarheid van de chain of thought, en waarschuwde dat intensiever gebruik van dergelijke technieken "waarschijnlijk de monitorbaarheid zou schaden". In een vervolgrapport dat woensdag verscheen, meldde The Information dat ook Anthropic en Google DeepMind intern al over dezelfde techniek spraken — een teken dat het debat veel verder reikt dan de roadmap van één bedrijf.
OpenAI reageert, zonder het volledig te ontkennen
In een blogpost van dinsdag zei OpenAI "Astra in te zetten met extra chain-of-thought-monitoring om potentieel misgealigneerde acties snel op te sporen en in te dammen", zonder de specifieke techniek te bevestigen of te ontkennen. OpenAI's chief scientist Jakub Pachocki reageerde rechtstreeks op de kritiek op X: "OpenAI heeft zich sinds onze allereerste redeneermodellen ingezet om chain-of-thought-monitoring te behouden en te benutten", schreef hij, en noemde dit "een kerndoel van ons huidige onderzoeksprogramma". Hij voegde toe dat de rekendiepte van Astra — een maat voor het aantal interne stappen dat het model kan uitvoeren — "binnen een factor twee van GPT-4 ligt", wat suggereert dat de toegenomen ondoorzichtigheid minder dramatisch is dan sommige reacties lieten uitschijnen. Hij waarschuwde ook dat de leesbaarheid van chain of thought in bredere zin "fragiel is en helaas een negatieve richting opgaat, om redenen die niet afhankelijk zijn van architectuurwijzigingen".
- Het gebruik van de "recurrent depth"-techniek in Astra zou beperkt zijn; OpenAI zou de chain of thought van het model bewust leesbaar hebben gehouden.
- Ryan Greenblatt (Redwood Research): de keuze "zou wel eens de slechtste ontwikkeling voor AI-veiligheid tot nu toe kunnen zijn".
- Volgens het vervolgrapport van The Information van woensdag bespraken Anthropic en Google DeepMind intern al dezelfde techniek.
- Greenblatts grootste angst: een "natuurlijke voortgang" naar redeneren dat zich bijna volledig in een latente ruimte afspeelt, onzichtbaar voor elke vorm van monitoring.
Voor Nederlandse en Europese toezichthouders komt dit debat op een lastig moment. De AI-verordening van de Europese Unie leunt op transparantie- en documentatieverplichtingen die uitgaan van een of andere leesbare redeneersporen; een bredere verschuiving in de sector naar ondoorzichtige architecturen zou op de proef stellen hoe afdwingbaar die bepalingen werkelijk zijn. In Nederland moet de Autoriteit Persoonsgegevens, die mede is aangewezen als toezichthouder op AI-systemen, straks modellen beoordelen waarvan het interne redeneerproces steeds moeilijker te doorgronden is. De suggestie van Mowshowitz dat alleen wetgeving een "race naar de bodem" kan stoppen, maakt van wat een interne twist tussen AI-veiligheidsonderzoekers leek, een concrete vraag voor elke Europese wetgever die vandaag regels schrijft voor modellen die binnenkort veel moeilijker te lezen zouden kunnen zijn.
Bronnen
- Researchers fear safety disaster ahead of OpenAI's Astra releaseThe Verge · 2 september 2026
- OpenAI's new reasoning technique alarms AI safety expertsTechCrunch · 2 september 2026



