نظام HomeBody يربط GPT‑6 Astra بوحدة Unitree G1 لتنظيف المطبخ بشكل مستقل
باحثو ستانفورد وكاليتك يقدمان HomeBody، نظام يدمج نموذج اللغة البصري GPT‑6 Astra مباشرةً مع روبوت Unitree G1 لتفقد، رسم خريطة وتنظيف مطبخ غير مألوف دون طبقات تحكم مسبقة التدريب.

في جهد مشترك، قدم باحثون من جامعة ستانفورد ومعهد كاليفورنيا للتقنية نظام HomeBody، وهو بنية جديدة تربط نموذج الرؤية‑اللغة الضخم GPT‑6 Astra مباشرةً بروبوت رباعي الأرجل Unitree G1. يتجاوز هذا التكامل مجموعة التحكم التقليدية المدربة منفصلًا ويعتمد بدلاً من ذلك على نموذج اللغة لإصدار أوامر عالية المستوى تُترجم إلى حركات الروبوت عبر مكتبة مهارات قابلة للتوسيع.
تكمن الفكرة الأساسية في HomeBody في أن نموذج رؤية‑لغة واحد قابل للتبديل يمكن أن يكون دماغًا للوكيل الفيزيائي. يتلقى GPT‑6 Astra مدخلات بصرية من كاميرات الروبوت، يفسر المشهد، ويستدعي كتالوجًا من المهارات المبرمجة مسبقًا – مثل الإمساك، والتنقل، والتعامل مع الأدراج – لتنفيذ السلوك المطلوب.
الاستكشاف وإنشاء التوأم الرقمي
قبل بدء أي عملية تنظيف، يقوم روبوت Unitree G1 بجولة استكشافية في المطبخ. في هذه المرحلة يلتقط صورًا RGB، يبني تمثيلًا ثلاثي الأبعاد داخل Isaac Sim من Nvidia، ويسجل هوية الأشياء وإحداثياتها المكانية في بنية ذاكرة مخصصة. يتيح هذا التوأم الرقمي للروبوت استرجاع العناصر التي تصبح غير مرئية لاحقًا، مما يمنحه نموذجًا عالميًا مستمرًا.
تم تصميم نظام الذاكرة بحيث يكون قابلًا للاستعلام من قبل GPT‑6 Astra. عندما يخطط النموذج تسلسلًا من الإجراءات – على سبيل المثال، "امسك الكوب الأحمر من المنضدة وضعه في غسالة الصحون" – يمكنه الرجوع إلى المواقع المخزنة لتحديد مكان الكوب حتى بعد أن يبتعد الروبوت ويختفي العنصر عن البصر.
التخطيط المدفوع باللغة والتصحيح الذاتي
يتبع تنفيذ المهمة عملية حلقة مغلقة. يتلقى نموذج اللغة تعليمًا عالي المستوى مثل "نظّف المطبخ"، يفككه إلى أهداف فرعية، ويصدر أوامر إلى مكتبة المهارات. إذا فشلت عملية – على سبيل المثال، إذا لم يفتح درج – يكتشف GPT‑6 Astra الخطأ عبر التغذية البصرية، يراجع خطته، ويحاول إجراءً تصحيحيًا.
يعزو الباحثون صراحةً هذه القدرة على التصحيح الذاتي إلى قدرة النموذج على التفكير في نتائجه وإعادة تقييم الحالة البصرية بعد كل خطوة. لا يتطلب ذلك إشرافًا خارجيًا أو إشارة تعزيزية أثناء التجارب.
الأداء على معايير التنقل بدون تدريب مسبق
لتقييم كفاءة التنقل لـ GPT‑6 Astra بمعزل عن أي تعديل، اختبر الفريق النموذج على معيار R2R‑CE، وهو اختبار تنقل تجسيدي بدون تدريب يقتصر على صور RGB أحادية العين. حقق النموذج معدل نجاح قدره 79 %، متجاوزًا أفضل نتيجة صفرية سابقة بـ13 نقطة مئوية، وأعلى نتيجة تحت إشراف بـ6.9 نقطة.
تظهر هذه الأرقام أن نموذج اللغة قادر على تحويل تدفقات بصرية خام إلى قرارات تنقلية دون أي تحسين مخصص للمهمة. يعكس مقياس النجاح قدرة الروبوت على الوصول إلى الموقع المستهدف ضمن تسامح محدد بعد اتباع خطة النموذج.
- تأخر نموذج Astra يبطئ إصدار الأوامر.
- ارتفاع حرارة محركات الأصابع في الروبوت يحد من الإمساك المطول.
- التكلفة الحسابية العالية تقيد النشر الفوري على أجهزة منخفضة القدرة.
- تستمر انحرافات المسار وفشل المرور عبر الممرات الضيقة في التخطيطات المعقدة.
على الرغم من الأرقام القوية في المعيار، أبرزت التقييمات أنماط فشل متكررة. أحيانًا ينحرف الروبوت عن المسار المثالي، يواجه صعوبة في المرور عبر الممرات الضيقة، ويخطئ في تحديد ما إذا كان قد وصل إلى الهدف المقصود. في إعداد الاختبار المتقدم، سُجلت 21 حالة فشل، تركت الروبوت في كثير من الأحيان على بُعد عدة أمتار من الهدف.
يؤكد المؤلفون أن المعيار اقتصر على مجموعة تحقق مكوّنة من 100 حلقة تجريبية. لم تُستَخدم أي تحسينات مخصصة للتنقل، ولا خرائط مُعدة مسبقًا، ولا وحدات توقع نقاط الطريق. وبالتالي، يعكس معدل النجاح المبلغ عنه قدرة خام صفرية، وليس نظامًا مُحسّنًا.
تم إجراء عرض HomeBody نفسه في مطبخ واحد غير مألوف. تلقى الروبوت التعليم "نظّف المطبخ" وشرع في الاستكشاف، ورسم الخريطة، وتحريك الأشياء بشكل مستقل. جميع الإجراءات كانت مدفوعة بتخطيط GPT‑6 Astra ومكتبة المهارات دون أي تصحيح بشري أثناء العملية.
القيود والأسئلة المفتوحة
ظهرت قيود تقنية رئيسية من التجارب. يضيف التأخير الناجم عن استدعاء نموذج لغة كبير عبر واجهة برمجة تطبيقات خارجية تأخيرًا ملحوظًا بين الإدراك والتنفيذ. بالإضافة إلى ذلك، شهدت محركات أصابع Unitree G1 تراكمًا حراريًا أثناء الإمساك المتكرر، مما اضطر النظام إلى التوقف أو تقليل قوة القبض لتفادي الضرر.
تشكل المطالب الحاسوبية أيضًا حاجزًا. تشغيل GPT‑6 Astra جنبًا إلى جنب مع Nvidia Isaac Sim ومحرك تنفيذ المهارات يتطلب وحدات معالجة رسومية عالية الأداء وذاكرة كبيرة، ما يحد من إمكانية نشر HomeBody على الأجهزة الطرفية أو في بيئات ذات ميزانية محدودة.
أخيرًا، يبقى نطاق التقييم ضيقًا. مجموعة الـ100 حلقة لا تغطي التنوع الكامل لتصاميم المطابخ، وتعدد الأشياء، أو تعقيد التعليمات التي قد تواجهها التطبيقات الواقعية. يدعو المؤلفون إلى اختبارات أوسع تشمل مهام متنوعة، مسارات تنقل أطول، وبيئات متعددة لتقييم القدرة على التعميم.
آثار عملية للمنظمات
بالنسبة للمنظمات التي تفكر في روبوتات خدمة مستقلة، يوضح HomeBody مسارًا لتقليل الجهد الهندسي المطلوب لبرمجة وحدات تحكم منخفضة المستوى لكل بيئة جديدة. من خلال الاستفادة من نموذج رؤية‑لغة يمكن استبداله، يمكن لمنصة روبوت واحدة، نظريًا، التكيف مع مجالات مختلفة ببساطة عبر تحديث النموذج أو توسيع مكتبة المهارات.
مع ذلك، تعني القيود الحالية على الأجهزة والتأخير أن التشغيل الفوري في بيئات مزدحمة لا يزال صعبًا. يجب على الشركات تقييم ما إذا كانت البنية التحتية الحاسوبية اللازمة لتشغيل GPT‑6 Astra على نطاق واسع تتماشى مع ميزانياتهم وتحملهم للوقت المستغرق.
تشير أنماط الفشل الموثقة إلى أن التطبيقات الحرجة للسلامة ستحتاج إلى حواجز إضافية، مثل مخططات تنقل احتياطية أو أنظمة مراقبة في الوقت الحقيقي، لتقليل انحرافات المسار وضمان التحقق الموثوق من الوصول إلى الهدف.
خلاصة القول، يقدم HomeBody إثباتًا مقنعًا للمفهوم أن نماذج الرؤية‑اللغة الضخمة يمكنها قيادة الوكلاء المجسَّدين مباشرةً في مساحات منزلية غير منظمة. يقلل النهج الاعتماد على تدريب تحكم مخصص للمهمة، لكنه يجلب تحديات هندسية جديدة تتعلق بالحوسبة، وإدارة الحرارة، والموثوقية التي يجب على المنظمات معالجتها قبل الاعتماد على نطاق واسع.



