CLM-8B: نموذج مفتوح لتقييم إجراءات الوكلاء بسرعة فائقة
أطلقت مؤسسة Contrastive-LM نموذج CLM-8B المفتوح لتقييم الإجراءات بدلا من توليد النصوص، مما يحقق سرعة تفوق Jev بما يصل إلى تسعة أضعاف في مهام الوكلاء.

كشفت منظمة الأبحاث كونتراستيف إل إم (Contrastive-LM) رسمياً عن نموذجها الجديد CLM-8B، معلنة بذلك إدخال نموذج مفتوح المصدر ومتاح للعموم ضمن فئة ناشئة تُعرف باسم النماذج اللغوية التباينية (Contrastive Language Models). وخلافاً للنماذج اللغوية الكبيرة التقليدية ذات الطبيعة التوليدية التراجعية الذاتية، والتي تضطر لتوليد النصوص كلمة تلو الأخرى ورمزاً تلو الآخر، فإن نموذج CLM-8B لا يقوم بتوليد النصوص على الإطلاق. وبدلاً من هذا المسار التوليدي المستهلك للوقت، يعمل النموذج على فحص وتقييم مجموعة معلنة مسبقاً من الإجراءات والخيارات المرشحة ومقارنتها بالحالة الراهنة لبيئة التشغيل، ليقوم بعد ذلك باستخراج توزيع احتمالي دقيق يغطي كافة هذه الخيارات المطروحة. ويهدف هذا التحول المعماري الجذري بالدرجة الأولى إلى معالجة عمليات اتخاذ القرار وتوجيه المسارات داخل حلقات عمل الوكلاء الذاتيين المستقلين، وهي المراحل التي تتسبب فيها الأعباء الحسابية لعمليات التوليد النصي التقليدية في إحداث زمن تأخير ملحوظ وكبير يعيق الكفاءة التشغيلية.
ويشكل نموذج Jev المعيار الأساسي والمقارن لنموذج CLM-8B، وهو نموذج مغلق الملكية يندرج ضمن فئة النظام الأول (System One) ومطور من جانب شركة تايب سيف إيه آي (TypeSafe AI)، حيث كان قد دخل مرحلة الوصول المبكر المحدود في تاريخ 15 سبتمبر 2026. وعلى غرار بنية Jev، جرى تصميم وهندسة CLM-8B خصيصاً لتقديم اختيارات فئوية مصنفة وبنائية بدلاً من كتابة وصياغة نصوص نثرية توليدية ممتدة. ولضمان إتاحة عمليات دمج وتكامل برمجية سلسة ومباشرة ودون تعقيدات تقنية، يعمل مستودع CLM البرمجي على تقديم النموذج واستضافته عبر واجهة استخدام متوافقة تماماً مع معايير TypeSafe. وتدعم هذه الواجهة ثلاثة تنسيقات استعلام محددة ودقيقة: التنسيق الأول هو Noul، والذي يقوم بحساب وتقدير احتمالية صحة عبارة ما؛ والتنسيق الثاني هو Choice، والمخصص لاختيار مرشح وحيد ومحدد من قائمة صريحة من الخيارات مع إسناد وتعيين الاحتمالات لكل منها؛ والتنسيق الثالث هو Score، الذي يقوم بتقييم المدخلات ووزنها مقابل سلم تقييم وقواعد متدرجة ومرتبة بدقة.
المشفرات المزدوجة والتخزين المؤقت للمتجهات في حلقات الوكلاء
من الناحية المعمارية والهندسية، يعتمد نموذج CLM-8B تصميماً ثنائي التشفير يتألف بنيوياً من مشفر مخصص للحالة ومشفر مخصص للإجراءات. ويتشارك المشفران في الاعتماد على عمود فقري أساسي مجمد غير خاضع للتدريب من طراز Qwen3-8B، مقترناً برأس إسقاط قابل للتدريب يحتوي على 20 مليون معلمة. وتعتمد عملية التدريب الرياضي على تحسين هدف دالة خسارة InfoNCE ثنائية الاتجاه، والتي تقوم بجذب ومواءمة التضمين الاتجاهي لحالة معينة نحو التضمين الاتجاهي للإجراء الذي جرى تنفيذه واعتماده فعلياً، مع دفع هذا التضمين وإبعاده في الوقت ذاته عن التضمينات الخاصة بالإجراءات المرشحة التي لم يتم اختيارها. وخلال مرحلة الاستدلال التشغيلي، يتم ترتيب الإجراءات المرشحة وحساب تفوقها من خلال عملية الضرب النقطي لحاصل تضميناتها مع تضمين الحالة الراهنة، متبوعة بتطبيق دالة Softmax الحسابية لتحديد التوزيع الاحتمالي النهائي لكل خيار.
ويتيح هذا الفصل المعماري المستقل بين تمثيلات الحالة وتمثيلات الإجراءات إمكانية تطبيق تحسينات حسابية بالغة الأهمية. ففي بيئات عمل الوكلاء البرمجية والعملية، غالباً ما تظل مجموعة الإجراءات المتاحة ثابتة ودون تغيير، بينما تتغير حالة البيئة وتتبدل مع كل خطوة ودورة عمل جديدة. ومن خلال المكون المخصص للاستضافة وتقديم الخدمات clm-serve، يقوم النظام بحجز مساحة مخصصة داخل ذاكرة وحدة معالجة الرسوميات لتخزين متجهات الإجراءات المحسوبة مسبقاً بشكل مؤقت، مستلهماً بنيته المعمارية من آليات التخزين المؤقت المعتادة للمفتاح والقيمة (Key-Value Caching). وعند إجراء الاختبارات على وحدة معالجة رسوميات فردية من طراز NVIDIA RTX 4090 مع وجود ثلاثة إجراءات مرشحة، ساهمت إعادة استخدام المتجهات المخزنة مؤقتاً في تقليص زمن التأخير من 1.7 مللي ثانية إلى 0.6 مللي ثانية للحالات التي تتم إعادة زيارتها وتكرارها. أما في مجموعات الخيارات الكبيرة التي تتضمن ما يقرب من 1000 إجراء مرشح، فقد سجلت بطاقة بيانات النموذج الرسمية سرعات استدلال وتشغيل فائقة تفوق نموذج Jev بما يصل إلى 13 ضعفاً.
وتعتمد منهجية التدريب لنموذج CLM-8B على خطة متسلسلة تتألف من ثلاث مراحل تدريبية رئيسية جرى تصميمها بعناية لرفع دقة التصنيف والترتيب دون زعزعة استقرار المشفر الأساسي المجمد:
- مرحلة التدريب المسبق على قرابة 60 مليون زوج من الأسئلة والأجوبة المستمدة من Nemotron DQA، محققة دقة top-1 بلغت 52.1% في مجموعة اختبار مستقلة ومعزولة تضم 100,000 سؤال.
- مرحلة التدريب الأوسط على قرابة 30 مليون عينة سلبية صعبة اصطناعية جرى توليدها بواسطة نموذج Gemini 2.5 Flash-Lite، مما ساهم في رفع دقة top-1 إلى 69.2%.
- مرحلة ما بعد التدريب على ما يقرب من مليون مسار ومخطط لوكلاء أذكياء مأخوذة من مجموعات بيانات Agent Data Protocol وEndless-Terminals وLiteCoder-Terminal-SFT.
وأشار باحثو Contrastive-LM إلى أن محاولة التدريب على العينات السلبية الصعبة انطلاقاً من مرحلة التدريب المسبق الأولى تسببت في وصول الأداء إلى ذروة مبكرة عند دقة بلغت 62.4% قبل الاصطدام بفرط التخصيص والملاءمة الشديدة (Overfitting)، مما يبرز الأهمية الحتمية لهذا المنهج التدريبي المرحلي المتدرج.
التقييمات الفورية وأداء النموذج كمدقق ومحقق
خلال التقييمات المقارنة الفورية في ظروف عدم المعرفة المسبقة (Zero-Shot)، أظهر نموذج CLM-8B تفوقاً واضحاً في معدلات الإنتاجية وسرعة المعالجة بالمقارنة مع Jev. وقد جرى تسجيل الرقم البارز المتمثل في خفض زمن التأخير بمقدار تسعة أضعاف أثناء إجراء الاختبارات التجريبية داخل لعبة T-Rex، حيث تتكرر خيارات المرشحين بصورة دورية ومتلاحقة عبر حالات بيئية متتالية. وفي إطار التقييمات الشاملة، طابق نموذج CLM-8B أداء نموذج Jev في بيئتي الألعاب T-Rex وSuper Mario، بينما تأخر وتخلف عن Jev في اختبارات استدعاء الأدوات البرمجية (Tool-calling) ومهام WikiRacing، غير أنه واصل العمل بزمن تأخير منخفض بصورة مطلقة في سائر السيناريوهات التي خضعت للاختبار.
وفضلاً عن تطبيقات التحكم التفاعلي في الألعاب، خضع CLM-8B للاختبار والتقييم كنموذج مدقق ومحقق (Verifier) لوكلاء هندسة وتطوير البرمجيات. وفي سياق تدفق العمل هذا، يتولى نموذج لغوي توليدي سحب وتوليد حلول مرشحة متعددة، ثم يأتي دور نموذج التحقق لترتيب هذه الخيارات واختيار الإتمام البرمجي الأمثل والأكثر ملائمة. وعلى 38 مهمة اختبار معزولة من معيار DeepSWE بالاعتماد على مجموعات تضم أفضل 4 مرشحين مولدة بواسطة Opus 5، حقق رأس إسقاط خفيف ومضبوط بدقة على CLM-8B معدل نجاح بلغ 81.6%. وعلى 30 مهمة معزولة من معيار Terminal-Bench 2.1 باستخدام أفضل 5 مرشحين مولدة بواسطة Fable 5، بلغت دقة النموذج 87.6%.
وأظهرت قياسات المعايير المرجعية المنفذة على خادم حوسبة مدعوم بوحدات NVIDIA H100 أن CLM-8B عمل بسرعة تتراوح بين 4.1 و5.7 أضعاف سرعة Jev أثناء أداء مهام التحقق والتدقيق. وسلط الفريق البحثي الضوء على أن نموذج Jev حقق نتائج أدنى من خط الأساس لمعدل النجاح من المحاولة الأولى pass@1 في كلا جناحي اختبارات التحقق، وهو ما يعني أن الاعتماد على Jev للاختيار أسفر عن نتائج أسوأ من مجرد اختيار عينة عشوائية واحدة. ومع ذلك، حرص الباحثون على توضيح أن نتائج التحقق هذه تعكس أداء رؤوس متخصصة خضعت لضبط دقيق على مجموعات فرعية معزولة، وليست ناتجة عن نقاط فحص فورية مباشرة أو مشاركات كاملة في لوحات المتصدرين الرسمية.
القيود التقنية ومتطلبات النشر لدى المؤسسات
على الرغم من الكفاءة التشغيلية العالية التي يتمتع بها CLM-8B، فإنه يخضع لمجموعة من القيود الوظيفية الصريحة. فرؤوس الإسقاط الخاصة به مرتبطة هيكلياً بتضمينات الرمز الأخير المجمعة لنظام Qwen3-8B، وهو ما يمنع إمكانية استخدامها أو تطبيقها مع معماريات أساسية أخرى مختلفة. وإضافة إلى ذلك، فإن النموذج يعجز تماماً عن توليد أي إجابات أو نصوص جديدة، حيث تقتصر مهمته الكلية على حساب الاحتمالات النسبية ضمن نطاق قائمة مرشحين يتم تزويده بها خارجياً. وقد ذكرت مؤسسة Contrastive-LM أنها بصدد استكشاف قدرات تعميم أوسع عبر نموذج CLM-35B متعدد الوسائط والمرتقب إصداره رسمياً في مطلع شهر أكتوبر.
أما بالنسبة لفرق التطوير المؤسسية وقطاعات الأعمال التي تبني وتدير أنظمة الوكلاء الذاتيين، أو المساعدات البرمجية الذكية، أو مسارات التوجيه المنظم للقرارات، فإن CLM-8B يوفر بديلاً عملياً واقتصادياً يغني عن الاستدعاءات التوليدية البطيئة والمكلفة لنماذج LLM الكبيرة. ويخضع النظام بالكامل لترخيص أباتشي 2.0 (Apache-2.0)، حيث يبلغ وزن رأس الإسقاط 75 ميغابايت فقط مع قدرته على العمل على وحدة معالجة رسوميات واحدة من إنفيديا جنباً إلى جنب مع إطار vLLM. وتستطيع الشركات والمؤسسات استضافة آليات توجيه الأدوات وترتيب الإجراءات ذات الإنتاجية العالية محلياً وداخلياً، مما يلغي تماماً الحاجة للاعتماد على واجهات برمجة التطبيقات الخارجية، ويخفض زمن التأخير إلى أدنى حد في مسارات العمل المعقدة ومتعددة الخطوات.
المصادر
- Contrastive-LM Releases CLM-8BMarkTechPost · ٢٤ سبتمبر ٢٠٢٦
- CLM-v0.1-8B model cardContrastive-LM · ٢٣ سبتمبر ٢٠٢٦



