Vals recauda 40 millones de dólares para crear benchmarks de IA basados en tareas reales
Vals, fundada en 2024, obtuvo una ronda Serie A de 40 millones de dólares liderada por Andreessen Horowitz tras una fase seed con 8VC y Bloomberg Beta, y busca sustituir los benchmarks públicos obsoletos por evaluaciones confidenciales que cubran derecho, finanzas, programación, ciberseguridad, salud mental, bioseguridad y derecho de conflictos armados.

Vals asegura una ronda Serie A de 40 millones de dólares para redefinir la evaluación de IA
A principios de 2024, Vals anunció el cierre de una ronda de financiación Serie A que recaudó 40 millones de dólares. La ronda fue liderada por Andreessen Horowitz, tras una ronda semilla anterior organizada por 8VC y Bloomberg Beta. Esta inyección de capital marca un hito significativo para una empresa que se fundó sólo unos meses antes, y proporciona la base financiera para la ambición de la firma de reformar la forma en que se evalúan los sistemas de inteligencia artificial.
La motivación central detrás del esfuerzo de recaudación de fondos de Vals es reemplazar lo que la empresa describe como "antiguos benchmarks públicos" con una nueva clase de evaluaciones. Según Vals, muchos benchmarks existentes sufren de contaminación de datos, lo que significa que los conjuntos de datos utilizados para la evaluación pueden ya haber sido incorporados en las canalizaciones de entrenamiento de los modelos líderes. Al mantener confidenciales los materiales de evaluación, Vals pretende crear un entorno de pruebas aislado de esa filtración, ofreciendo así una imagen más clara de las verdaderas capacidades de un modelo.
De exámenes abstractos a tareas del mundo real
Rayan Krishnan, el fundador de Vals, ha articulado una filosofía específica sobre lo que constituye un benchmark significativo. Él argumenta que un benchmark debe verificar si un modelo puede producir trabajo de calidad a nivel humano dentro de un dominio concreto, en lugar de simplemente triunfar en un examen abstracto de opción múltiple. Esta perspectiva informa la selección de categorías de tareas que Vals mide actualmente, que incluyen derecho, finanzas, programación, ciberseguridad, salud mental, bioseguridad y el derecho de los conflictos armados.
Cada uno de estos dominios representa un conjunto distinto de normas profesionales y marcos regulatorios. Al centrarse en tareas como redactar argumentos legales, realizar análisis de riesgo financiero, escribir código de producción, identificar amenazas cibernéticas, ofrecer guiones de asesoramiento en salud mental, evaluar protocolos de bioseguridad o interpretar el derecho de los conflictos armados, Vals busca capturar dimensiones de desempeño que son directamente relevantes para usuarios finales y partes interesadas.
Modelo de negocio y adopción en el mercado
Vals opera bajo un modelo business‑to‑business en el que los desarrolladores de modelos de IA pagan a la empresa para que sus sistemas sean evaluados contra sus tareas propietarias. Las puntuaciones resultantes se ponen a disposición de compradores potenciales, que pueden utilizarlas para comparar sistemas competidores según criterios que importan en implementaciones del mundo real. Esta estructura de mercado de dos lados crea un incentivo para que los proveedores de modelos demuestren competencia en las tareas de Vals mientras brinda a los compradores una herramienta de decisión más matizada.
La empresa informa que sus ingresos han crecido ocho veces en el último año, una afirmación que se alinea con la rápida expansión de su base de clientes. Simultáneamente, Vals amplió su personal de ocho a veinticinco empleados y anunció planes para reclutar diez a quince personas adicionales en el futuro cercano. Estas cifras sugieren una correlación entre la entrada de capital, la adopción de sus servicios de evaluación y el crecimiento organizativo.
Entre los primeros adoptantes de las evaluaciones de Vals se encuentran varias agencias federales de Estados Unidos. La firma ha lanzado un programa de evaluación dedicado para estas agencias, lo que indica que su metodología está siendo considerada para contextos oficiales de adquisición y cumplimiento. Este desarrollo podría señalar un interés gubernamental más amplio en métricas de rendimiento de IA estandarizadas y basadas en tareas.
Transparencia, independencia y reproducibilidad
Vals publica tanto los resultados de sus evaluaciones como las metodologías subyacentes en su sitio web público. Este enfoque pretende proporcionar visibilidad sobre cómo se derivan las puntuaciones y permitir que partes externas examinen el proceso. Sin embargo, la independencia de la empresa aún debe ser analizada, particularmente porque las entidades que financian las evaluaciones son también los sujetos de esas evaluaciones.
El posible conflicto de intereses surge del hecho de que los desarrolladores de modelos pagan a Vals por las pruebas, lo que podría influir en la percepción de imparcialidad de los resultados. Mientras Vals afirma que sus métodos son robustos, la reproducibilidad de sus resultados por investigadores independientes sigue siendo una cuestión abierta, dado que los materiales de evaluación se mantienen confidenciales.
- Los materiales de prueba confidenciales reducen el riesgo de filtración de datos de entrenamiento
- El modelo de ingresos vincula las tarifas de evaluación a los desarrolladores de modelos
- Los resultados se comparten con compradores para análisis comparativo
- La divulgación pública de métodos busca mejorar la transparencia
La confidencialidad de los conjuntos de prueba es una espada de doble filo. Por un lado, protege la integridad de la evaluación al impedir que los modelos se sobreajusten a datos conocidos. Por otro lado, limita la capacidad de auditores externos para replicar las pruebas, lo que podría afectar la confianza en las puntuaciones reportadas.
Otro ámbito de incertidumbre concierne la escalabilidad del conjunto de tareas de Vals. Mientras el conjunto actual de dominios cubre un amplio espectro de actividades profesionales, extender el marco a sectores adicionales —como educación, transporte o monitoreo ambiental— podría requerir nuevos diseños de tareas, experiencia temática y posiblemente protocolos de confidencialidad distintos.
La rápida expansión del personal de la empresa también plantea preguntas sobre la sostenibilidad de su modelo operativo. Contratar diez a quince empleados adicionales sugiere una necesidad de más evaluadores, ingenieros de datos y expertos en dominios, pero la demanda a largo plazo de esas evaluaciones especializadas dependerá de cuán ampliamente la industria adopte la evaluación basada en tareas.
De cara al futuro, el enfoque de Vals podría influir en normas industriales más amplias. Si sus evaluaciones confidenciales y orientadas a tareas ganan aceptación tanto entre empresas privadas como agencias públicas, podrían convertirse en un punto de referencia para futuros marcos regulatorios que busquen garantizar que los sistemas de IA cumplan umbrales de rendimiento concretos.
No obstante, el impacto final de la metodología de Vals dependerá de varios factores no resueltos: la capacidad de investigadores independientes para verificar los resultados sin acceso al contenido de las pruebas, la disposición de los desarrolladores de modelos a seguir pagando por evaluaciones propietarias y el grado en que los compradores confíen en esas puntuaciones en decisiones de adquisición. Cada una de estas variables podría influir en si el modelo de Vals se convierte en un paradigma dominante o permanece como un servicio de nicho para aplicaciones especializadas.
Fuentes
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · 19 de septiembre de 2026
- Independent Evaluation, Unbiased BenchmarksVals AI · 21 de septiembre de 2026



