ThinkingBox يقيم وكلاء الذكاء الاصطناعي بناءً على نتائج قواعد البيانات وموثوقية التكرار
أطلق باحثو مايكروسوفت مشروع ThinkingBox، وهو معيار يقيم وكلاء نماذج اللغة الكبيرة (LLM) وفقًا للحالة النهائية لقواعد بيانات الأعمال بدلاً من طلاقة المحادثة، كاشفًا عن فجوات كبيرة بين استدعاءات الأدوات وتأثيراتها في العالم الحقيقي.

4 أكتوبر 2026 – أعلن باحثو مايكروسوفت عن إطلاق ThinkingBox على منصة هاغنغ فيس، مقدمين طريقة جديدة لتقييم وكلاء نماذج اللغة الكبيرة الذين يتفاعلون مع أدوات خارجية. على عكس المعايير السابقة التي تكافئ الإجابة النصية الصحيحة أو استدعاء الأداة بصيغة صحيحة نحويًا، يقيس ThinkingBox الحالة النهائية للواجهة الخلفية والآثار الجانبية بعد تشغيل الوكيل لسير عمل تجاري. يحتوي المعيار على 507 عملية تجارية حالة، مثل إدخال طلب، تحديث المخزون، أو تعديل سجل عميل، تُنفّذ كل منها 20 مرة في جلسات أدوات Microsoft Copilot (MCP) معزولة. من خلال التركيز على نتائج قاعدة البيانات الفعلية، يهدف هذا المجموع إلى إظهار مشاكل الموثوقية التي لا تظهر إلا بعد الاستخدام المتكرر في بيئات واقعية.
كيف يعمل ThinkingBox
كل من عمليات الـ 507 مشفرة كسلسلة من استدعاءات الأدوات التي تُعدّل قاعدة بيانات علائقية. يُجرى المعيار عزلًا كاملاً لبيئة أداة MCP لكل تجربة، لضمان عدم وجود تلوث بين التجارب قد يخفي الأخطاء. بعد إكمال الوكيل لتشغيله، يقوم ThinkingBox بفحص اللقطة النهائية لقاعدة البيانات ومقارنتها بمواصفات الحقيقة الأرضية التي تُحدّد الصفوف المتوقعة، قيم الأعمدة، والآثار الجانبية مثل سجلات التدقيق. لا يأخذ دليل التقييم في الاعتبار ما إذا كان الوكيل قد أنتج ملخصًا نصيًا فصيحًا؛ فهو يسجل فقط ما إذا كانت الحالة الخلفية تتطابق مع المواصفات، وما إذا حدثت تغييرات غير مقصودة، وما إذا أبلغت أي أداة عن خطأ.
شملت التقييمات 12 وكيلًا متاحًا للجمهور، بدءًا من النماذج المفتوحة المصدر إلى العروض التجارية. في المجموع، أنتج التجربة 121 680 تجربة صالحة – ناتج ضرب 507 عمليات عمل، 20 تكرارًا، و12 نموذجًا. من بين هذه التجارب، فشل 79 853 محاولة في مرحلة فحص القابلية للتنفيذ، مما يعني أن الوكيل إما لم يصدر استدعاء الأداة المطلوب أو أصدر استدعاءً لا يمكن تحليله. ومن الجدير بالذكر أن 67.24 % من تلك المحاولات الفاشلة انتهت دون خطأ نهائي في الأداة، حيث استدعى الوكيل على الأقل أداة تُغيّر الحالة قبل التوقف. يبرز هذا النمط الفجوة بين ما يبدو كنجاح للوكيل والاختلالات المخفية التي تظل في قاعدة البيانات.
النتائج الرئيسية
عند فشل تجربة ما في فحص القابلية للتنفيذ، سجل المعيار ثلاث فئات من الانحراف. ظهرت قيم حقول خاطئة في 77.61 % من المحاولات الفاشلة، مما يدل على أن الوكلاء غالبًا ما يكتبون بيانات غير صحيحة حتى عندما ينجح استدعاء الأداة. لوحظت آثار غير مقصودة – أي إجراءات غير محددة في سير العمل – في 43.30 % من الفشل، بينما حدثت آثار مفقودة – تغييرات متوقعة لم تظهر أبدًا – في 25.36 % من الحالات. تتداخل النسب لأن تجربة واحدة قد تُظهر عدة أنواع من الأخطاء في آن واحد. تُظهر هذه الأرقام أن غالبية الفشل المرتبط بالأدوات يترك قاعدة البيانات في حالة غير متسقة أو جزئيًا صحيحة.
تفاوت الأداء كان واضحًا بين النماذج. حقق Claude Opus 5.5 أعلى درجة pass@1، حيث نجح في 67.16 % من 121 680 تجربة في المحاولة الأولى. بينما أظهر Kimi‑K3 ملفًا مختلفًا: حلّ 93.89 % من المهام مرة واحدة على الأقل عبر الـ 20 تكرارًا، لكن فقط 13.41 % من التجارب نجحت في كل تكرار. يبرز هذا التباين أهمية قياس الموثوقية عبر تنفيذ متكرر بدلاً من الاعتماد على أفضل حالة واحدة. تراجعت النماذج المتبقية بين هذين الطرفين، حيث سجل العديد منها معدلات pass@1 أقل من 50 % وتفاوتًا كبيرًا عبر التكرارات.
قيود المعيار
تم تصميم ThinkingBox بنطاق مقصود يقتصر على مجموعة مختارة من سير عمل الأعمال، ويؤكد المؤلفون أن الأرقام لا تمثل كل سيناريو إنتاج قد تواجهه مؤسسة. يعزل المعيار كل تجربة في جلسة MCP جديدة، ما يزيل تأثير تراكم الحالة على المدى الطويل، التخزين المؤقت، أو الاعتمادات المتبادلة بين سير العمل التي توجد في الأنظمة الحية. علاوةً على ذلك، يركز التقييم على نتائج قواعد البيانات العلائقية؛ الوكلاء الذين يتفاعلون مع خدمات غير SQL، أنظمة ملفات، أو واجهات برمجة تطبيقات خارجية لا تُغطى. أخيرًا، يعتبر المعيار أي انحراف عن مواصفات الحقيقة الأرضية فشلًا، حتى وإن كان الانحراف غير مؤثر في سياق تجاري محدد.
- 79 853 محاولة فشلت في فحص القابلية للتنفيذ من أصل 121 680 تجربة إجمالية.
- 67.24 % من المحاولات الفاشلة انتهت بنهاية نظيفة دون خطأ نهائي في الأداة.
- 77.61 % من الفشل أظهر قيم حقول خاطئة في قاعدة البيانات.
- 43.30 % من الفشل نتج عنها آثار جانبية غير مقصودة.
- 25.36 % من الفشل أغفلت الآثار المتوقعة.
- Claude Opus 5.5 تصدر pass@1 بنسبة نجاح 67.16 %.
- Kimi‑K3 حلّ 93.89 % من المهام مرة واحدة على الأقل لكن فقط 13.41 % في جميع الـ 20 تشغيلًا.
التداعيات العملية فورية للمطورين الذين يبنون أتمتة مدفوعة بالذكاء الاصطناعي. من خلال كشف عدد المرات التي يكتب فيها الوكلاء بيانات خاطئة صامتًا أو يتغاضون عن تحديثات ضرورية، يدفع ThinkingBox إلى تحول من سؤال "هل نجح استدعاء الأداة؟" إلى سؤال "هل انتهت قاعدة البيانات بالحالة الصحيحة؟" يمكن للفرق الآن استخدام المعيار لتحديد أولويات اختبار المتانة، إضافة معاملات تعويضية، أو إعادة تصميم المطالبات التي تُعزز السلوك المتعدد التنفيذ. كما تزود البيانات البائعين بهدف ملموس: تحسين القابلية للتكرار عبر التجارب، وليس مجرد تحقيق معدل نجاح مرتفع في محاولة واحدة. مع تبني المؤسسات للوكلاء LLM في مهام الدعم الخلفي الحرجة، تصبح القدرة على شهادة أن البيانات الأساسية لا تزال موثوقة ميزة تنافسية.
في المستقبل، تخطط مايكروسوفت والمجتمع البحثي الأوسع لتوسيع ThinkingBox بإضافة فئات سير عمل إضافية، وتعقب آثار جانبية أكثر غنى، وتكامل مع خطوط أنابيب التكامل المستمر. المعيار متاح بالفعل على منصة هاغنغ فيس، مما يتيح لأي شخص تشغيل نفس الـ 507 سير عمل ضد وكلائه الخاصة ومقارنة النتائج مع الخط الأساسي المنشور. من خلال جعل التقييم القائم على النتيجة مفتوحًا وقابلًا للتكرار، يستعد ThinkingBox لتغيير طريقة قياس موثوقية وكلاء الذكاء الاصطناعي، من التركيز على الصواب السطحي إلى السؤال الأعمق: هل تعكس قاعدة البيانات – المصدر النهائي للحقائق – النتيجة التجارية المقصودة.
المصادر
- The Agent Said It Was Done. The Database DisagreedMicrosoft / Hugging Face · ٣ أكتوبر ٢٠٢٦
- ThinkingBox paperarXiv · ٣١ أغسطس ٢٠٢٦



