Vals تجمع 40 مليون دولار لسلسلة التمويل الأولى لتقديم مقاييس IA قائمة على مهام واقعية
قامت شركة Vals التي تأسست عام 2024 بجمع 40 مليون دولار في جولة تمويل السلسلة A بقيادة Andreessen Horowitz بعد جولة تمهيدية قادتها 8VC وBloomberg Beta، وتستهدف استبدال معايير الاختبار العامة القديمة بمقاييس سرية تقيم مهام فعلية في مجالات القانون والمالية والبرمجة والأمن السيبراني والصحة النفسية والبيوسيفتي وقانون النزاعات المسلحة.

فالس تؤمن تمويلاً من السلسلة أ بقيمة 40 مليون دولار لإعادة تعريف قياس الذكاء الاصطناعي
في أوائل عام 2024، أعلنت فالس عن إغلاق جولة تمويل من السلسلة أ جمعت 40 مليون دولار. قادت الجولة شركة أندريسن هورويتز، بعد جولة تمويل أولية نظمها 8VC وبلومبرغ بيتا. يمثل هذا التدفق الرأسمالي علامة فارقة لشركة تأسست قبل أشهر قليلة فقط، ويوفر العمود الفقري المالي لطموح الشركة في إعادة هيكلة طريقة تقييم أنظمة الذكاء الاصطناعي.
الدافع الأساسي وراء جهد جمع الأموال لدى فالس هو استبدال ما تصفه الشركة بـ "المقاييس العامة القديمة" بفئة جديدة من التقييمات. وفقًا لفالس، تعاني العديد من المقاييس الحالية من تلوث البيانات، بمعنى أن مجموعات البيانات المستخدمة في التقييم قد تم دمجها بالفعل في خطوط تدريب النماذج الرائدة. من خلال الحفاظ على سرية مواد التقييم، تهدف فالس إلى إنشاء بيئة اختبار معزولة عن هذا التسرب، وبالتالي تقديم صورة أوضح عن القدرات الحقيقية للنموذج.
من الامتحانات المجردة إلى المهام الواقعية
رايان كريشنان، مؤسس فالس، صاغ فلسفة محددة حول ما يشكل معيارًا ذا معنى. يجادل بأن المعيار ينبغي أن يتحقق مما إذا كان النموذج قادرًا على إنتاج عمل بمستوى جودة بشرية داخل مجال ملموس، بدلاً من مجرد النجاح في امتحان تجريدي متعدد الخيارات. هذا المنظور يؤثر على اختيار فئات المهام التي تقيسها فالس حاليًا، والتي تشمل القانون، والمالية، والبرمجة، والأمن السيبراني، والصحة النفسية، والسلامة البيولوجية، وقانون الصراع المسلح.
كل من هذه المجالات يمثل مجموعة متميزة من المعايير المهنية والأطر التنظيمية. من خلال التركيز على مهام مثل صياغة الحجج القانونية، وإجراء تحليل مخاطر مالية، وكتابة شفرة برمجية جاهزة للإنتاج، وتحديد التهديدات السيبرانية، وتقديم نصوص استشارات الصحة النفسية، وتقييم بروتوكولات السلامة البيولوجية، أو تفسير قانون الصراع المسلح، تسعى فالس إلى التقاط أبعاد الأداء التي تكون ذات صلة مباشرة بالمستخدمين النهائيين وأصحاب المصلحة.
نموذج الأعمال واعتماد السوق
تعمل فالس بنموذج عمل من شركة إلى شركة حيث يدفع مطورو نماذج الذكاء الاصطناعي للشركة لتقييم أنظمتهم مقابل مهامها المملوكة. تُتاح النتائج بعد ذلك للمشترين المحتملين، الذين يمكنهم استخدامها لمقارنة الأنظمة المتنافسة وفق معايير ذات صلة بالتطبيقات الواقعية. يخلق هذا الهيكل السوقي ذو الوجهين حافزًا لمقدمي النماذج لإظهار الكفاءة في مهام فالس مع تزويد المشترين بأداة اتخاذ قرار أكثر دقة.
تشير الشركة إلى أن إيراداتها نمت بمقدار ثمان مرات خلال العام الماضي، وهو ادعاء يتماشى مع التوسع السريع لقاعدة عملائها. في الوقت نفسه، وسعت فالس طاقمها من ثمانية إلى خمسة وعشرين موظفًا وأعلنت عن خطط لتوظيف عشرة إلى خمسة عشر شخصًا إضافيًا في المستقبل القريب. توحي هذه الأرقام بوجود علاقة بين تدفق رأس المال، واعتماد خدمات التقييم، والنمو التنظيمي.
من بين المتبنين الأوائل لتقييمات فالس عدة وكالات فدرالية أمريكية. أطلقت الشركة برنامج تقييم مخصص لهذه الوكالات، مما يشير إلى أن منهجيتها تُدرس للاستخدام في عمليات الشراء الرسمية وسياقات الامتثال. قد يدل هذا التطور على اهتمام حكومي أوسع بمقاييس أداء الذكاء الاصطناعي المعيارية القابلة للتطبيق في المهام.
الشفافية والاستقلالية وإمكانية إعادة الإنتاج
تنشر فالس كلًا من نتائج تقييماتها والمنهجيات الأساسية على موقعها العام. يهدف هذا النهج إلى توفير رؤية حول كيفية اشتقاق الدرجات والسماح للأطراف الخارجية بفحص العملية. ومع ذلك، لا يزال من الضروري فحص استقلالية الشركة، خاصةً لأن الكيانات التي تمول التقييمات هي نفسها موضوع تلك التقييمات.
تنشأ احتمالية تعارض المصالح من حقيقة أن مطوري النماذج يدفعون لفالس لإجراء الاختبار، مما قد يؤثر على تصور الحيادية للنتائج. بينما تؤكد فالس أن أساليبها قوية، يبقى سؤال إمكانية إعادة إنتاج نتائجها من قبل باحثين مستقلين مفتوحًا، نظرًا لأن مواد التقييم نفسها تبقى سرية.
- مواد الاختبار السرية تقلل من خطر تسرب بيانات التدريب
- نموذج الإيرادات يربط رسوم التقييم بمطوري النماذج
- تُشارك النتائج مع المشترين للتحليل المقارن
- الإفصاح العام عن المنهجيات يهدف إلى تعزيز الشفافية
سرية مجموعات الاختبار سلاح ذو حدين. من ناحية، تحافظ على نزاهة التقييم بمنع النماذج من الإفراط في التخصيص للبيانات المعروفة. ومن ناحية أخرى، تحد من قدرة المدققين من الطرف الثالث على تكرار الاختبارات، مما قد يؤثر على الثقة في الدرجات المبلغ عنها.
مجال آخر من عدم اليقين يتعلق بقابلية توسيع مجموعة مهام فالس. بينما يغطي مجموعة المجالات الحالية طيفًا واسعًا من الأنشطة المهنية، قد يتطلب توسيع الإطار إلى قطاعات إضافية—مثل التعليم، أو النقل، أو مراقبة البيئة—تصميم مهام جديدة، وخبرات متخصصة، وربما بروتوكولات سرية متميزة.
يطرح التوسع السريع في عدد الموظفين أيضًا أسئلة حول استدامة نموذجها التشغيلي. توحي توظيف عشرة إلى خمسة عشر موظفًا إضافيًا بالحاجة إلى مزيد من المقيمين، ومهندسي البيانات، وخبراء المجال، لكن الطلب طويل الأجل على مثل هذه التقييمات المتخصصة سيعتمد على مدى تبني الصناعة للمعايير القائمة على المهام.
نظرة مستقبلية، قد يؤثر نهج فالس على معايير الصناعة الأوسع. إذا حظيت تقييماتها السرية الموجهة للمهام بقبول بين الشركات الخاصة والوكالات العامة، فقد تصبح نقطة مرجعية للأطر التنظيمية المستقبلية التي تسعى لضمان تحقيق أنظمة الذكاء الاصطناعي لحدود أداء ملموسة.
مع ذلك، سيعتمد التأثير النهائي لمنهجية فالس على عدة عوامل غير محسومة: قدرة الباحثين المستقلين على التحقق من النتائج دون الوصول إلى محتوى الاختبار، واستمرار رغبة مطوري النماذج في دفع رسوم لتقييمات مملوكة، ومدى اعتماد المشترين على هذه الدرجات في قرارات الشراء. كل من هذه المتغيرات قد يؤثر على ما إذا كان نموذج فالس سيصبح نموذجًا سائدًا أو سيظل خدمة متخصصة لتطبيقات محددة.
المصادر
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · ١٩ سبتمبر ٢٠٢٦
- Independent Evaluation, Unbiased BenchmarksVals AI · ٢١ سبتمبر ٢٠٢٦



