GPUThor: هجوم يخترق حماية ECC في وحدات معالجة رسومات Nvidia
كشف باحثون من جامعة تورنتو عن هجوم Rowhammer جديد يحمل اسم GPUThor، قادر على تجاوز حماية ECC في وحدات معالجة الرسومات من Nvidia، وتسبب في اختبارات بما يصل إلى 377 ألف انقلاب بِت لكل غيغابايت من الذاكرة، بل وأتاح في بعض الحالات الوصول بصلاحيات root إلى الجهاز المضيف. ونشرت Nvidia توصياتها للتخفيف من المخاطر في 25 أغسطس.

كشف باحثون من جامعة تورنتو، في أواخر أغسطس، عن أسلوب هجوم جديد يحمل اسم GPUThor، قادر على تجاوز حماية ECC (رمز تصحيح الأخطاء) المدمجة في وحدات معالجة الرسومات (GPU) من Nvidia. وقد جرى التحقق من هذه الطريقة، القائمة على مبدأ هجمات Rowhammer، على وحدات معالجة رسومات لمحطات العمل من فئة Ampere ومزودة بذاكرة GDDR6 — طرازات RTX A4000 وA4500 وA5000 وA6000 — وهي طرازات منتشرة على نطاق واسع في البنية التحتية للذكاء الاصطناعي والحوسبة السحابية. وأبلغ الفريق البحثي شركة Nvidia بالثغرة في 29 أبريل، ونشرت الشركة توصيات للتخفيف من المخاطر في 25 أغسطس، بعد نحو أربعة أشهر من الإفصاح المنسق.
لماذا تُعد حماية ECC ضرورية في وحدات معالجة الرسومات المخصصة للذكاء الاصطناعي
يمكن أن تتعرض رقاقات الذاكرة الخاضعة لحمل مستمر بشكل عشوائي لظاهرة «انقلاب البِت» (bit flip)، حيث يتحول بِت مخزَّن كصفر إلى واحد عن طريق الخطأ، أو العكس، بفعل الأشعة الكونية أو التداخل الكهربائي أو عيوب التصنيع. في الاستخدام العادي، غالبًا ما يمر انقلاب بِت واحد دون أن يُلاحَظ. أما في تدريب نماذج الذكاء الاصطناعي أو استدلالها، فقد يؤدي مباشرة إلى إتلاف الأوزان أو التدرجات أو قيم التنشيط — ما يُحرِّف نتائج التدريب بصمت، أو يُنتج في مرحلة الاستدلال إجابة تبدو معقولة لكنها خاطئة، دون أي إنذار على الإطلاق. ولهذا السبب بالتحديد وُجدت تقنية ECC: فمن خلال تخزين رمز تحقق إضافي مع كل كتلة ذاكرة، يصحح النظام تلقائيًا الأخطاء أحادية البِت ويكتشف الأخطاء ثنائية البِت، وفق مخطط يُعرف باسم SECDED. وهذا الضمان هو ما يتيح لمزودي الخدمات السحابية مشاركة وحدة معالجة رسومات فعلية واحدة بين عدة عملاء بثقة.
كيف يخترق GPUThor حماية ECC
يعتمد GPUThor على «قرع» الذاكرة بنمط غير منتظم (non-uniform) عمدًا، مستغلًا في الوقت نفسه سلوكين لم توثقهما Nvidia من قبل: طريقة دمج (coalescing) وحدة معالجة الرسومات لطلبات الوصول المتكررة إلى الذاكرة، ومدى التكرار الفعلي لتفعيل آلية Target Row Refresh (TRR) في ذاكرة GDDR6. وبالبقاء تحت عتبة اكتشاف TRR مباشرة، يتمكن GPUThor من الاستمرار في «قرع» صف الذاكرة المستهدف باستمرار، مما يتسبب في انقلابات بِت في الصفوف المجاورة.
- على وحدات معالجة الرسومات التي اختُبرت من دون تفعيل ECC، تسبب GPUThor في ما بين 72,000 و377,000 انقلاب بِت لكل غيغابايت من الذاكرة — بزيادة تصل إلى 23,597 ضعفًا مقارنة بهجوم الفريق السابق GPUHammer.
- وحتى مع تفعيل ECC، أنتج GPUThor 387 خطأ ثنائي البِت (تستطيع ECC اكتشافها لكن لا يمكنها تصحيحها) وخطأين ثلاثيي البِت تجاوزا قدرة ECC على التصحيح، ما أدى إلى إتلاف البيانات.
- أصبح العثور على انقلاب بِت قابل للاستغلال يستغرق نحو 1.1 دقيقة في المتوسط، مقارنة بـ21.9 ساعة مع GPUHammer.
- يمكن لهجوم مستمر على وحدة RTX A6000 المفعَّل عليها ECC أن يجبر وحدة معالجة الرسومات على إعادة التشغيل كل ساعتين، ما يوقف جميع المهام الجارية؛ ومع تكرار الهجوم، قد تصل البطاقة إلى وضع تُعلن فيه عن حاجتها للاستبدال.
وإلى جانب هجمات حجب الخدمة (DoS)، أظهر الباحثون سيناريو أكثر خطورة: فمن خلال إتلاف جداول صفحات وحدة معالجة الرسومات، يمكن لبرنامج CUDA لا يتمتع بأي صلاحيات خاصة أن يحصل على وصول عشوائي إلى الذاكرة ويفتح shell بصلاحيات root على الجهاز المضيف — أي أن مهمة حوسبية عادية على وحدة معالجة الرسومات قد تتحول إلى سيطرة كاملة على الخادم. وتُظهر وحدات معالجة الرسومات من فئة Ampere المخصصة لمراكز البيانات، مثل A100، مقاومة أفضل لهجمات حجب الخدمة لكنها تبقى عرضة لتصعيد الصلاحيات؛ حتى وحدات جيل Blackwell المزودة بحماية RAS Repair لا تمنع الهجوم بل تجعله أبطأ فقط. ويحذر الباحثون من أن وحدات المعالجة المستقبلية المزودة بذاكرة GDDR7 أو HBM3e، والتي تتضمن ECC مدمجة داخل الشريحة نفسها، قد تظل عرضة للخطر في سيناريوهات انقلاب بِتات متعددة.
من المعرَّض فعليًا لهذا الخطر
يستهدف GPUThor مجموعات وحدات معالجة الرسومات في مراكز البيانات التي تدعم تدريب الذكاء الاصطناعي واستدلاله، وتحديدًا نسخ وحدات معالجة الرسومات السحابية متعددة المستأجرين — وهو النموذج الافتراضي لمعظم عروض وحدات معالجة الرسومات في السحابة العامة، حيث يتشارك عدة عملاء البطاقة الفعلية نفسها. ويكفي أن يستأجر مهاجم شريحة صغيرة من وقت الحوسبة كي يتمكن من تعطيل، بل وحتى إتلاف، مهمة تدريب أو استدلال عميل آخر يعمل على الجهاز نفسه — وهو خطر لا يمكن رصده من طبقة التطبيق. وتُركّز توصيات Nvidia على العزل والمراقبة: تفعيل SYS-ECC وعزل IOMMU/DMA، والمراقبة المستمرة لبيانات القياس عن بعد لأخطاء وحدة معالجة الرسومات، وتقييد مشاركة أحمال عمل CUDA غير الموثوقة على الجهاز نفسه.
ما الذي يتغيّر بالنسبة للشركات في المنطقة العربية
كثير من الشركات في المنطقة العربية التي تدرّب أو تشغّل نماذج ذكاء اصطناعي تستأجر نسخ وحدات معالجة رسومات من مزودين مثل AWS وMicrosoft Azure وGoogle Cloud، إلى جانب مزودي حوسبة سحابية إقليميين. ويذكّر GPUThor بحقيقة يسهل تجاهلها: وحدة معالجة الرسومات الفعلية الكامنة خلف كل استدعاء واجهة برمجة تطبيقات نادرًا ما تكون عتادًا مخصصًا بالكامل، بل غالبًا ما تكون مشتركة مع مستأجرين آخرين. وقبل التعامل مع نسخة وحدة معالجة رسومات سحابية باعتبارها بيئة معزولة وموثوقة بشكل افتراضي، ينبغي لفرق الأمن والبنية التحتية التأكد لدى المزوّد من أن تفعيل SYS-ECC وعزل IOMMU/DMA اللذين توصي بهما Nvidia قد تمّا بالفعل، وطلب رؤية واضحة لبيانات القياس عن بعد لأخطاء وحدة معالجة الرسومات، وإدراج مخاطر عزل المستأجرين المتعددين لوحدة معالجة الرسومات كبند رسمي ضمن مراجعات أمن الموردين — لا كخانة تُعلَّم في ورقة المواصفات، بل كسؤال حقيقي عن كيفية حماية بطاقة مشتركة فعليًا.
المصادر
- 多倫多大學研究揭露新型攻擊手法GPUThor,可突破Nvidia GPU的ECC防護iThome · ٧ سبتمبر ٢٠٢٦
- New GPUThor attack defeats NVIDIA ECC protection for root accessBleepingComputer · ٢٦ أغسطس ٢٠٢٦



