ريكا تكشف عن Rho‑1، نموذج أومني ب19 مليار معامل للنص والصورة والفيديو والتحكم الروبوتي
في 5 أكتوبر 2026 أعلنت ريكـا AI عن Rho‑1، نموذج موحد ب19 مليار معامل يعالج النصوص، الصور، الفيديو، الاستدلال والعمليات الروبوتية في تدفق رمزي واحد، مع وعد بتوليد فيديو في الوقت الحقيقي والتحكم المباشر في الروبوتات.

في الخامس من أكتوبر عام 2026، قدمت شركة ريكـا AI نموذجها الجديد Rho‑1 خلال حدث افتراضي حضره عدد كبير من المتخصصين في الذكاء الاصطناعي، حيث أوضح المتحدثون أن النموذج يتألف من 19 مليار معامل تم بناؤه من الصفر بهدف معالجة مجموعة واسعة من الوسائط بما فيها النصوص، الصور، مقاطع الفيديو، الاستدلال المنطقي، والعمليات الروبوتية داخل بنية عصبية موحدة.
يُعرّف Rho‑1 نفسه بأنه نظام "بحثي" يختلف جذريًا عن المنهجية السائدة التي تعتمد على نماذج متخصصة منفصلة لكل نوع من البيانات. فبدلاً من إنشاء خطوط أنابيب مستقلة للغة، رؤية أو تحكم، يقوم النموذج بترميز جميع المدخلات والمخرجات كرموز تشترك في سياق موحد، ما يلغي الحاجة إلى تحويلات متعددة ويتيح للمصفوفة الواحدة من الأوزان تفسير وإنشاء المحتوى عبر جميع المجالات في آن واحد.
تمثيل رمزي موحد عبر جميع الوسائط
تؤكد ريكـا أن النصوص، قطع الصور، إطارات الفيديو، وحتى أوامر الروبوت تُحوَّل جميعها إلى تمثيل رمزي موحد قبل أن يتعامل معها النموذج. هذا التوحيد يسمح للنظام بالحفاظ على سجل تفاعلي مستمر، بحيث يمكن تعديل صورة أو مقطع فيديو عبر عدة خطوات متتالية دون الحاجة إلى إعادة ضبط الحالة أو إعادة تشغيل النموذج من الصفر.
وبحسب ما صرح به المتحدثون، فإن النسخة الأساسية من Rho‑1 قادرة على توليد مقاطع فيديو بسرعة تصل إلى 0.79 مرة من الوقت الحقيقي، مع بدء تشغيل يقترب من ست ثوانٍ بعد إرسال الطلب. وفي تجارب داخلية، أظهرت نسخة مخفضة إلى ثماني خطوات قدرة على إنتاج مقطع بطول 5.3 ثانية في زمن يقارب الثانية الواحدة، رغم أن هذه الأرقام لم تُستقل بعد للتحقق منها من قبل جهات خارجية.
تفاصيل التدريب والموارد الحاسوبية
تشير تقارير موقع The Decoder إلى أن عملية تدريب Rho‑1 استغرقت نحو ثلاثة أشهر، واستخدمت 320 وحدة معالجة رسوميات من نوع Nvidia H100. هذا الاستثمار الضخم في القدرة الحاسوبية يعكس طموح ريكـا في دمج مجموعة متعددة الوسائط في بنية واحدة، وهو ما تصفه الشركة كخطوة أساسية نحو أنظمة قادرة على الإدراك، الفهم، والعمل في البيئة الواقعية باستخدام نموذج موحد.
من بين الميزات التي تبرزها ريكـا، القدرة على إنشاء وتعديل ومقارنة الوسائط البصرية عبر عدة جولات من التفاعل. يمكن للمستخدمين طلب سلسلة من التحسينات مثل تعديل الإضاءة، إضافة عناصر جديدة، أو تغيير حركة الكاميرا، بينما يظل النموذج يحتفظ بتمثيل داخلي متماسك للمشهد يضمن استمرارية الجودة عبر جميع التغييرات.
التحكم الروبوتي باستخدام نفس الأوزان
أحد الجوانب المبتكرة في Rho‑1 هو إمكانية إعادة توظيف مجموعة الأوزان نفسها للتحكم في الروبوتات. يترجم المكوّن العكسي الديناميكي مقاطع الفيديو المتاحة على الإنترنت إلى إشارات حركة تُرسل إلى محركات الروبوت، ما يفتح آفاقًا جديدة حيث يمكن للتعلم البصري أن يغذي السلوك الحركي مباشرة دون الحاجة إلى طبقة تحكم منفصلة.
- 19 مليار معامل في شبكة واحدة
- تدريب من الصفر على مدار ثلاثة أشهر باستخدام 320 وحدة GPU H100
- تدفق رمزي موحد للنص، الصورة، الفيديو وأوامر الروبوت
- النسخة الأساسية تُولِّد فيديو بسرعة 0.79× من الوقت الحقيقي، بدء التشغيل ~6 ثوانٍ
- النسخة المختزلة ذات الثماني خطوات تدعي إنتاج مقطع 5.3 ثانية في ~1 ثانية
يُصوِّر الإعلان عن Rho‑1 النموذج كدليل على مفهوم ما تسميه ريكـا "نموذج أومني"، أي نظام قادر على الانتقال بسلاسة بين الإدراك، اللغة، والعمل. من خلال دمج ما كان يُعَدّ سابقًا سلسلة من الأنابيب المتعددة الوسائط، تجادل الشركة بأن دورات التطوير قد تُقصر وتعقيدات التكامل قد تُخفَّف، ما يفتح الباب أمام تطبيقات أوسع وأكثر تكاملًا.
مع ذلك، يُظهر النقاد حذرًا إزاء الادعاءات المتعلقة بالأداء، خاصةً فيما يخص النسخة المختزلة التي لم تُختبر بعد من قبل مؤسسات مستقلة. يعتقدون أن وجود مقاييس مستقلة وبيانات تجريبية موثوقة سيكون ضروريًا لتأكيد ما إذا كانت السرعات والجودة المعلنة تفوق النماذج المتخصصة الحالية.
ما يعنيه ذلك للمنظمات الناطقة بالعربية
بالنسبة للشركات والمؤسسات العاملة في الأسواق العربية، قد يمثل Rho‑1 فرصة لتبسيط البنية التحتية للذكاء الاصطناعي عبر استبدال مجموعة من النماذج المتخصصة بخدمة موحدة واحدة. سيمكن ذلك صانعي المحتوى من توليد فيديوهات سريعة ومتكررة، ويسمح للمسوقين بإنتاج أصول متعددة الوسائط في وقت قصير، بينما يمكن للمصانع تجربة التحكم الروبوتي المدعوم بالرؤية دون الحاجة لتدريب نماذج تحكم مخصصة.
علاوة على ذلك، من المتوقع أن يقلل النهج الرمزي الموحد من الأخطاء الناتجة عن ربط مخرجات أنظمة مختلفة، ما يعزز موثوقية العمليات ويخفض تكاليف الصيانة التقنية. وهذا قد ينعكس إيجابًا على معدلات الاعتماد والابتكار في القطاعات المتنوعة مثل الإعلام، التعليم، والصناعة.
تحديات مستقبلية وإمكانات البحث
رغم الإمكانات الواعدة، يظل السؤال الأساسي حول مدى قابلية توسيع النموذج لتضمين لغات إضافية أو وسائط جديدة مثل الصوت ثلاثي الأبعاد. كما يتطلب تحقيق الأداء المعلن في بيئات الإنتاج الفعلية اختبارات مكثفة لضمان استقرار النموذج تحت أحمال متنوعة.
تُظهر التجربة الأولية لـ Rho‑1 أن الدمج العميق للوسائط المتعددة داخل بنية واحدة قد يكون خطوة حاسمة نحو تحقيق أنظمة ذكاء اصطناعي عامة أكثر تكاملًا، لكن الطريق لا يزال يتطلب جهودًا مشتركة من الباحثين، المطورين، والجهات التنظيمية لضمان الشفافية، الأمان، والفعالية.
في الختام، يبقى Rho‑1 نموذجًا طموحًا يفتح آفاقًا جديدة في مجال الذكاء الاصطناعي المتعدد الوسائط، ويتطلب متابعة دقيقة من المجتمع العلمي لتقييم ما إذا كان سيحقق الوعود التي قدمتها ريكـا AI في الواقع العملي.
المصادر
- Rho-1: collapsing the multimodal stackReka AI · ٥ أكتوبر ٢٠٢٦
- Reka AIs Omni-Modell Rho-1 vereint Text, Bild, Video und RobotersteuerungThe Decoder · ٥ أكتوبر ٢٠٢٦



