GPUThor omzeilt ECC-bescherming van Nvidia-GPU's, blijkt uit onderzoek
Onderzoekers van de University of Toronto onthulden GPUThor, een Rowhammer-aanval die de ECC-geheugenbescherming van Nvidia-GPU's omzeilt en tot 377.000 bitflips per gigabyte veroorzaakt — in sommige gevallen zelfs met rootoegang tot de hostmachine als gevolg. Nvidia publiceerde op 25 augustus aanbevelingen om de risico's te beperken.

Onderzoekers van de University of Toronto onthulden eind augustus een nieuwe aanvalstechniek genaamd GPUThor, die de ECC-geheugenbescherming (error-correcting code) van Nvidia-GPU's kan omzeilen. De methode, gebaseerd op het Rowhammer-principe, is gevalideerd op workstation-GPU's met Ampere-architectuur en GDDR6-geheugen — de RTX A4000, A4500, A5000 en A6000 —, modellen die veel worden gebruikt in AI- en cloudinfrastructuur. Het team meldde het lek op 29 april bij Nvidia, dat na circa vier maanden gecoördineerde openbaarmaking op 25 augustus aanbevelingen voor risicobeperking publiceerde.
Waarom ECC onmisbaar is op een AI-GPU
Geheugenchips die langdurig zwaar belast worden, kunnen willekeurig een 'bitflip' ondergaan door kosmische straling, elektrische storing of fabricagefouten: een bit die als 0 is opgeslagen, verspringt per ongeluk naar 1, of andersom. Bij alledaags gebruik valt een geïsoleerde bitflip vaak niet eens op. Maar bij het trainen of laten redeneren van een AI-model kan zo'n fout direct gewichten, gradiënten of activatiewaarden aantasten — een trainingsrun verschuift dan onopgemerkt, of het model geeft bij inferentie een plausibel klinkend maar fout antwoord, zonder enige waarschuwing. Precies daarvoor bestaat ECC: door bij elk geheugenblok een extra controlecode op te slaan, corrigeert het systeem automatisch enkelbitfouten en detecteert het dubbelbitfouten — een schema dat SECDED heet. Die garantie is wat clouddienstverleners in staat stelt om dezelfde fysieke GPU met vertrouwen door meerdere klanten te laten delen.
Hoe GPUThor de ECC-bescherming doorbreekt
GPUThor bewerkt het geheugen bewust met een niet-uniform patroon en maakt daarbij gebruik van twee GPU-gedragingen die Nvidia nooit had gedocumenteerd: hoe de chip herhaalde geheugentoegangsverzoeken samenvoegt (coalescing), en hoe vaak het Target Row Refresh-mechanisme (TRR) van GDDR6-geheugen daadwerkelijk wordt geactiveerd. Door net onder de detectiedrempel van TRR te blijven, kan GPUThor een doelrij in het geheugen continu blijven 'hameren', waardoor bitflips ontstaan in naburige rijen.
- Op geteste GPU's zonder ingeschakelde ECC veroorzaakte GPUThor tussen de 72.000 en 377.000 bitflips per gigabyte geheugen — tot 23.597 keer meer dan de eerdere aanval van het team, GPUHammer.
- Zelfs met ECC ingeschakeld genereerde GPUThor 387 dubbelbitfouten (die ECC wel detecteert maar niet kan corrigeren) en twee drievoudige bitfouten, die de correctiecapaciteit van ECC overstijgen en tot datacorruptie leidden.
- Het vinden van een bruikbare bitflip kost nu gemiddeld ongeveer 1,1 minuut, tegenover 21,9 uur bij GPUHammer.
- Een aanhoudende aanval op een RTX A6000 met ingeschakelde ECC kan de GPU dwingen elke twee uur te resetten, waardoor alle lopende taken worden onderbroken; bij herhaling kan de kaart zichzelf uiteindelijk als vervangingsbehoevend markeren.
Naast denial-of-service toonden de onderzoekers een ernstiger scenario: door de paginatabellen van de GPU te corrumperen, kan een CUDA-programma zonder speciale rechten willekeurige geheugentoegang krijgen en een root-shell op de hostmachine openen — een gewone GPU-rekentaak kan zo uitmonden in volledige controle over de server. Datacenter-GPU's uit de Ampere-klasse, zoals de A100, zijn beter bestand tegen DoS maar blijven kwetsbaar voor privilege escalation; zelfs Blackwell-GPU's met RAS Repair-bescherming maken de aanval alleen tijdrovender, niet onmogelijk. De onderzoekers waarschuwen dat toekomstige GDDR7- of HBM3e-GPU's met on-die ECC onder omstandigheden met meerdere gelijktijdige bitflips eveneens kwetsbaar kunnen zijn.
Wie werkelijk risico loopt
GPUThor richt zich op datacenter-GPU-clusters die AI-training en -inferentie ondersteunen, met name multi-tenant cloud-GPU-instances — het standaardmodel van de meeste publieke cloud-GPU-diensten, waarbij meerdere klanten dezelfde fysieke kaart delen. Een aanvaller die slechts een klein stukje rekentijd huurt, zou de training of inferentie van een andere klant op dezelfde hardware kunnen verstoren, of zelfs corrumperen — een risico dat op applicatieniveau onzichtbaar blijft. Nvidia's aanbevelingen richten zich op isolatie en monitoring: SYS-ECC en IOMMU/DMA-isolatie inschakelen, GPU-foutentelemetrie continu monitoren en het delen van niet-vertrouwde CUDA-workloads op dezelfde hardware beperken.
Wat dit betekent voor Nederlandse bedrijven
Nederlandse bedrijven die GPU-instances huren bij AWS, Microsoft Azure, Google Cloud of kleinere Europese aanbieders om AI-modellen te trainen of te draaien, vertrouwen daarbij vrijwel altijd op een fysieke GPU die niet exclusief is, maar wordt gedeeld met andere klanten. GPUThor is een herinnering dat die aanname van isolatie geverifieerd moet worden, niet zomaar aangenomen. Voordat een GPU-cloudinstance als een vertrouwde, geïsoleerde omgeving wordt behandeld, doen security- en infrastructuurteams er goed aan bij de leverancier na te vragen of de door Nvidia aanbevolen SYS-ECC- en IOMMU/DMA-isolatie daadwerkelijk is ingeschakeld, inzicht te eisen in de GPU-foutentelemetrie, en multi-tenant GPU-isolatie standaard op te nemen in leveranciersbeoordelingen — zeker waar persoonsgegevens onder de AVG op gedeelde hardware worden verwerkt. Niet als vinkje op een specificatieblad, maar als een reële vraag over hoe een gedeelde kaart daadwerkelijk wordt beschermd.
Bronnen
- 多倫多大學研究揭露新型攻擊手法GPUThor,可突破Nvidia GPU的ECC防護iThome · 7 september 2026
- New GPUThor attack defeats NVIDIA ECC protection for root accessBleepingComputer · 26 augustus 2026



