ميتا تجعل نموذجاً بـ8 مليارات معامل يضاهي أداء كلود أوبوس 4.5
دَرَّب باحثون من ميتا للذكاء الاصطناعي وجامعة إلينوي في أوربانا-شامبين نموذج Qwen3-8B مفتوح المصدر باستخدام طريقة تعلم معزز جديدة تُدعى EvoHarness-RL. وفي اختبار ALFWorld القياسي للمهام المتسلسلة متعددة الخطوات، حقق النموذج نسبة نجاح بلغت 96.9%، متجاوزاً نسبة 96.4% التي حققها كلود أوبوس 4.5، أي بزيادة 49 نقطة عن أساسه بطريقة ReAct.

كشف باحثون من ميتا (Meta) للذكاء الاصطناعي وجامعة إلينوي في أوربانا-شامبين (UIUC) عن طريقة تدريب للوكلاء الذكيين تعتمد على التعلم المعزز، أطلقوا عليها اسم EvoHarness-RL. ووفقاً لتقرير نشرته صحيفة AI Times في 29 أغسطس، طبّق الفريق هذه الطريقة على نموذج Qwen3-8B مفتوح المصدر، الذي لا يتجاوز حجمه 8 مليارات معامل، فحقق نسبة نجاح بلغت 96.9% في اختبار ALFWorld القياسي، الذي يقيّم مهام منزلية متسلسلة متعددة الخطوات. وتتجاوز هذه النتيجة نسبة 96.4% التي سجّلها نموذج أنثروبيك الرائد كلود أوبوس 4.5 باستخدام طريقة ReAct التقليدية، كما تمثل قفزة قدرها 49.0 نقطة مئوية مقارنة بأداء Qwen3-8B الأساسي بطريقة ReAct (47.9%). وغطّت منصة VentureBeat الأمريكية البحث ذاته بشكل منفصل في 28 أغسطس، مشيرةً إلى أن نموذجي GPT-4.1 وGPT-5 من OpenAI تحسّن أداؤهما أيضاً بنسبة 22.1 و25.7 نقطة مئوية على التوالي، عند تطبيق الطريقة فقط في وقت الاستدلال دون إعادة تدريب.
BPE: تقسيم حالة الوكيل إلى اعتقاد وتقدم وخبرة
يقوم جوهر EvoHarness-RL على تجريد للحالة يسميه الباحثون BPE — أي Belief وProgress وExperience (الاعتقاد والتقدم والخبرة). يمثّل الاعتقاد ما يعرفه الوكيل حالياً عن بيئته، ويسجّل التقدم الأهداف الفرعية المنجزة والعمل المتبقي، بينما تخزّن الخبرة المهارات وحالات الفشل السابقة وأولويات البحث المتراكمة من المهام السابقة. ولإدارة هذه الحالات الثلاث، يعتمد الوكيل على أربعة أفعال وصفية فقط: التتبع (التحقق من الحالة الحالية)، والتثبيت (تسجيل التقدم)، والاسترجاع (استدعاء الخبرة السابقة)، والتدوين (تسجيل معلومة جديدة). ويوضح الباحثون أنه في حين كانت أنظمة الذاكرة الخارجية واستخدام الأدوات السابقة تتبع قواعد ثابتة يحددها البشر مسبقاً، فإن BPE يدرّب الوكيل على أن يقرر بنفسه متى يسجّل معلومة ومتى يستدعي خبرة سابقة.
التدريب على مرحلتين: ضبط دقيق موجَّه ثم تعلم معزز
يجري التدريب على مرحلتين. في المرحلة الأولى، الضبط الدقيق الموجَّه (SFT)، يتعلم Qwen3-8B أولاً معنى BPE وكيفية استخدام الأفعال الوصفية الأربعة. وفي المرحلة الثانية، مرحلة التعلم المعزز، يطبّق الفريق ما يسميه «تحسين السياسة النسبية للمجموعة المراعي للتكلفة» (cost-aware GRPO)، الذي يدرّب النموذج على أن يقرر بنفسه ما إذا كان استدعاء الأداة المساعدة (harness) يسهم فعلياً في إنجاز المهمة. ونقلت VentureBeat عن المشاركة في تأليف البحث شويينغ نينغ (Xuying Ning) قولها إن «الأداة المساعدة المثلى غالباً ما تختلف من نموذج لآخر»، وإن «الذاكرة التي تكتفي بالإضافة فقط تفترض أن المزيد من السياق مفيد دائماً، وهذا الافتراض ليس صحيحاً بالضرورة». وعندما أزال الباحثون عنصر الخبرة (Experience) في اختبار حذف، انخفض متوسط نسبة النجاح إلى 48.6%، وهو أكبر انخفاض بين العناصر الثلاثة.
- ReAct الأساسي: 47.9%
- تطبيق BPE في وقت الاستدلال فقط (دون إعادة تدريب): 56.4%
- مع الضبط الدقيق الموجَّه (SFT): 68.6%
- مع SFT والتعلم المعزز (EvoHarness-RL، النتيجة النهائية): 96.9%
- كلود أوبوس 4.5 — 96.4% مع ReAct الأساسي، 98.5% مع BPE (+2.1 نقطة)
- GPT-4.1 — من 47.9% إلى 70.0% مع BPE وقت الاستدلال (+22.1 نقطة)
- GPT-5 — من 60.7% إلى 85.0% مع BPE وقت الاستدلال (+25.7 نقطة)
- أنظمة للمقارنة — SkillRL بنسبة 89.9%، وSkillOS بنسبة 80.2%
نجح أيضاً في بيئات غير مألوفة… وظاهرة «تلدين الأداة المساعدة»
اختبر الباحثون النموذج أيضاً في مهام جديدة من ALFWorld لم يرَها من قبل أثناء التدريب. اكتفى Qwen3-8B الأساسي بنسبة 50.0%، بينما ارتفعت النسبة إلى 77.6% عند إضافة BPE في وقت الاستدلال فقط، ووصلت إلى 86.6% مع النسخة المدرَّبة بالكامل باستخدام EvoHarness-RL. ولاحظ الباحثون أثناء التدريب ظاهرة أطلقوا عليها اسم «تلدين الأداة المساعدة» (harness annealing): ففي البداية كان الوكيل يستدعي الأداة المساعدة الخارجية في كل خطوة تقريباً، لكن مع تقدم التدريب، ترسّخت أنماط المهام المتكررة داخل النموذج، وانخفض استدعاء الأداة المساعدة بشكل حاد، واستقر في النهاية عند نحو استدعاء واحد في المتوسط لكل حلقة مهمة. وتطور مخزن الخبرة بالطريقة نفسها: في البداية كان يتراكم بسرعة بمهارات متنوعة وحالات فشل، ثم بعد ذلك جرى دمج المعلومات المتكررة وحذف المهارات قليلة الفائدة، بحيث احتفظ بالمعلومات الأساسية فقط بدلاً من التراكم بلا حدود. وفي مثال ذكره الباحثون، اكتشف وكيل كان يبحث عن غلاية أن ذاكرته السابقة عن موقع سطح المطبخ لم تعد تطابق البيئة الفعلية، فصحّح نفسه بكتابة ملاحظة جديدة تفيد بأن المعلومة السابقة كانت خاطئة.
من تطوير البرمجيات إلى الامتثال المالي
يرى الباحثون أن هذا الإطار يتجاوز بيئات الألعاب ليشمل مهام العمل الفعلية. ففي تطوير البرمجيات، يقابل الاعتقاد الحالة الراهنة لقاعدة الشيفرة ومكوناتها، ويقابل التقدم المهام والاختبارات والتبعيات المنجزة، وتقابل الخبرة طرق الإصلاح وحالات الأخطاء السابقة. أما في المجال المالي والامتثال التنظيمي، فيقابل الاعتقاد اللوائح المعمول بها والأدلة، ويقابل التقدم عمليات التدقيق المكتملة والاستثناءات المعلقة، وتقابل الخبرة المشكلات المتكررة وطريقة معالجتها سابقاً. ومن خلال ما يسميه الفريق «محولات البيئة»، يمكن لكل مؤسسة الاحتفاظ بأدواتها الداخلية الخاصة وطريقتها في إدارة الحالة، مع إضافة BPE كطبقة تنسيق قابلة للتعلم، دون الحاجة إلى استبدال الأدوات أو الأطر القائمة بالكامل. ونُشر البحث على منصة الأبحاث الأولية arXiv برقم arXiv:2608.05446v1.
تحمل هذه النتيجة دلالة مباشرة للشركات العربية العاملة على تطوير الوكلاء الذكيين. فحتى الآن، كان الاعتماد على واجهات برمجة تطبيقات باهظة الثمن لنماذج متطورة من أنثروبيك أو OpenAI يبدو الخيار شبه الوحيد لمعالجة المهام المعقدة متعددة الخطوات بشكل موثوق. أما إثبات أن نموذجاً مفتوح المصدر بحجم 8 مليارات معامل، إذا صُمم بعناية على مستوى الذاكرة واستخدام الأدوات، يمكن أن يضاهي تلك النماذج المتطورة، فيفتح المجال أمام عمليات نشر أقل تكلفة، بما في ذلك استضافتها على بنية تحتية خاصة بدلاً من الاعتماد على واجهة برمجة تطبيقات خارجية مكلفة. غير أن هذه النتيجة تبقى مقتصرة على اختبار قياسي واحد هو ALFWorld، في ظل شروط محددة، وتحتاج إلى تأكيد إضافي عبر حالات استخدام فعلية قبل تعميمها على بيئات الإنتاج.
المصادر
- 메타, 80억 소형 AI로 '클로드 오퍼스 4.5'급 성능 구현…'에보하네스-RL' 공개AI타임스 · ٢٩ أغسطس ٢٠٢٦
- Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tagVentureBeat · ٢٨ أغسطس ٢٠٢٦



