Claude wist 700 GB uit de persoonlijke map van een ontwikkelaar tijdens een scripttest
Een automatische afwaardering van het model tijdens een adversarial veiligheidscontrole zorgde ervoor dat Claude het hergebruik van dezelfde variabele niet opmerkte, waarna een opruimscript 700 GB aan echte bestanden wiste in plaats van testdata.

Ontwikkelaar Sebastien Guillemot vroeg Claude van Anthropic om een script te schrijven dat elk van zijn AI-codeeragenten in een eigen map onder /tmp zou isoleren en automatisch zou opruimen zodra ze klaar waren. Op 27 augustus 2026 wiste datzelfde script in plaats daarvan zijn hele persoonlijke map, waarbij ongeveer 700 GB aan data en zowat een week werk verloren ging, blijkens zijn eigen relaas en berichtgeving van Tom's Hardware en AI Times.
Guillemot gebruikt vaak AI-agenten en stoorde zich eraan dat veel daarvan rommel achterlieten in de gedeelde map /tmp zonder die zelf op te ruimen. Hij vroeg Claude, in de berichtgeving aangeduid met de interne codenaam Fable, om isolatie- en opruimlogica toe te voegen. Claudes eerste voorstel bevatte detectielogica om het verwijderen van bestanden die nog door een lopende agent werden gebruikt uit te stellen, maar Guillemot vond de resulterende code te ingewikkeld en vroeg om iets eenvoudigers.
Een adversarial review, gevolgd door een afwaardering halverwege de taak
Omdat het script permanente verwijdering van data inhield, besloot Claude op eigen initiatief een zogeheten adversarial review uit te voeren: het startte een aparte kopie van zichzelf om het eigen werk vóór uitvoering te controleren op veiligheidsproblemen. Halverwege dat proces oordeelde Anthropics veiligheidsharnas dat het script riskant genoeg was om het model dat ermee bezig was automatisch af te waarderen, eerst van Opus 5 naar Opus 4.8, aldus AI Times, dat zich baseert op Guillemots relaas. Guillemot had die afwaardering niet zelf gevraagd; ze werd getriggerd door de eigen risico-inschatting van het veiligheidssysteem bij een script dat bestanden kon verwijderen.
Als Opus 4.8 voerde Claude de veiligheidstest uit die de adversarial review had opgezet, en controleerde het of de verwijderingsdoelen in het script overeenkwamen met gevaarlijke paden zoals /tmp of de persoonlijke map van de gebruiker. Die controle werkte precies zoals bedoeld: beide paden werden tijdens de testfase correct als gevaarlijk gemarkeerd. Guillemot zei te denken dat Opus 5 — het model dat vóór de afwaardering actief was en dat op codeertaken beter zou presteren dan Opus 4.8 — wat daarna gebeurde waarschijnlijk had opgemerkt.
Eén variabele, hergebruikt tussen test en opruiming
De veiligheidscontrole omvatte alleen de testfase van het script, niet de opruimstap die daarop volgde. Elke codetest heeft daarna zijn eigen opruiming nodig, en Claude schreef die stap door dezelfde variabelenaam te hergebruiken die het al had gebruikt voor het testdoelpad. Omdat beide fasen één variabele deelden, wees de waarde die tijdens de veiligheidscontrole veilig naar een geïsoleerd testpad verwees, zodra de opruimstap liep, plotseling naar Guillemots echte persoonlijke map — en Claude voerde daarop feitelijk een recursieve verwijdering uit.
- Ongeveer 700 GB aan data gewist, waaronder bijna een week van Guillemots werk
- Anthropics veiligheidsharnas waardeerde het model dat het script uitvoerde halverwege de taak af van Opus 5 naar Opus 4.8, zonder dat Guillemot daarom vroeg
- De adversarial veiligheidscontrole markeerde /tmp en de persoonlijke map terecht als gevaarlijke verwijderingsdoelen — maar controleerde alleen de testfase, niet de opruimfase
- De oorspronkelijke rommel in /tmp, die aanleiding gaf tot het hele project, bleef na de verwijdering onaangeroerd
Het verhaal verspreidde zich snel nadat Guillemot er online over vertelde, en andere ontwikkelaars wezen op tools van derden — Tom's Hardware noemt Termaxa als voorbeeld — die specifiek zijn gebouwd om AI-codeeragenten te isoleren of om te herstellen van precies dit soort fout. Tom's Hardware wees rechtstreeks op de ironie: er bestaat inmiddels een hele categorie veiligheidstools om AI-agenten tegen te houden die de verkeerde data wissen, en het bouwen van zo'n tool was precies wat deze verwijdering veroorzaakte.
Guillemot stopte het proces zodra hij merkte wat er gebeurde, maar niet op tijd om het grootste deel van de map te redden. Hij zei het merendeel van zijn data te hebben teruggehaald uit git-repositories, Nix-storegegevens en sessielogs, in plaats van uit een back-up — want volgens zijn eigen relaas had hij geen van de vele AI-agenten die hij gebruikt ooit gevraagd er een te maken.
Wat dit betekent voor Nederlandse teams die AI-codeeragenten gebruiken
Voor Nederlandse softwareteams die Claude, Cursor of vergelijkbare AI-codeeragenten in hun dagelijkse ontwikkelwerk hebben opgenomen, is dit incident een herinnering dat de interne toestand van een veiligheidssysteem — inclusief welke modelversie op een bepaald moment een taak uitvoert — halverwege kan veranderen, zonder enige zichtbare waarschuwing voor wie de terminal in de gaten houdt. Een adversarial review die het doel van een script controleert, controleert niet automatisch elke fase die dat script daadwerkelijk zal uitvoeren. Elke workflow die een agent destructieve commando's laat uitvoeren, zelfs binnen wat op een geïsoleerde test lijkt, heeft nog steeds een onafhankelijke back-up nodig die niet afhankelijk is van correct gedrag van de agent.
Bronnen
- 클로드, 테스트 중 700GB 홈 디렉터리 삭제..."안전 분류기가 사고 키웠다"AI타임스 · 29 augustus 2026
- Claude nukes a developer's 700 GB home directory while testing deletion safeguards; automatic model safety downgrade may have contributed to the screw-upTom's Hardware · 28 augustus 2026



