Vals capta 40 milhões de dólares para lançar benchmarks de IA baseados em tarefas reais
Vals, criada em 2024, angariou 40 milhões de dólares numa ronda Série A liderada pela Andreessen Horowitz após uma fase seed com 8VC e Bloomberg Beta, e pretende substituir benchmarks públicos ultrapassados por avaliações confidenciais que cobrem direito, finanças, programação, cibersegurança, saúde mental, biossegurança e direito dos conflitos armados.

Vals assegura uma Série A de 40 milhões de dólares para redefinir a avaliação de IA
No início de 2024, a Vals anunciou o encerramento de uma ronda de financiamento Série A que levantou 40 milhões de dólares. A ronda foi liderada pela Andreessen Horowitz, após uma ronda seed anterior organizada pela 8VC e Bloomberg Beta. Esta injeção de capital representa um marco significativo para uma empresa fundada apenas alguns meses antes, e fornece a base financeira para a ambição da firma de reformular a forma como os sistemas de inteligência artificial são avaliados.
A motivação principal por trás do esforço de angariação de fundos da Vals é substituir o que a empresa descreve como "benchmarks públicos antigos" por uma nova classe de avaliações. Segundo a Vals, muitos benchmarks existentes sofrem de contaminação de dados, o que significa que os conjuntos de dados usados para avaliação podem já ter sido incorporados nas pipelines de treino de modelos de referência. Ao manter os materiais de avaliação confidenciais, a Vals pretende criar um ambiente de teste isolado desse tipo de vazamento, proporcionando uma imagem mais clara das verdadeiras capacidades de um modelo.
De Exames Abstractos a Tarefas do Mundo Real
Rayan Krishnan, fundador da Vals, articulou uma filosofia específica sobre o que constitui um benchmark significativo. Ele argumenta que um benchmark deve verificar se um modelo pode produzir trabalho de qualidade a nível humano dentro de um domínio concreto, em vez de simplesmente ter sucesso num exame abstracto de escolha múltipla. Esta perspetiva informa a seleção de categorias de tarefas que a Vals mede atualmente, que incluem direito, finanças, programação, cibersegurança, saúde mental, biossegurança e direito dos conflitos armados.
Cada um destes domínios representa um conjunto distinto de normas profissionais e quadros regulatórios. Ao focar‑se em tarefas como redigir argumentos jurídicos, realizar análises de risco financeiro, escrever código de produção, identificar ameaças cibernéticas, entregar roteiros de aconselhamento em saúde mental, avaliar protocolos de biossegurança ou interpretar o direito dos conflitos armados, a Vals procura capturar dimensões de desempenho diretamente relevantes para utilizadores finais e partes interessadas.
Modelo de Negócio e Adoção no Mercado
A Vals opera num modelo business‑to‑business em que os desenvolvedores de modelos de IA pagam à empresa para que os seus sistemas sejam avaliados contra as suas tarefas proprietárias. As pontuações resultantes são então disponibilizadas a compradores potenciais, que podem utilizá‑las para comparar sistemas concorrentes com base em critérios que importam em implementações do mundo real. Esta estrutura de mercado de dois lados cria um incentivo para que os fornecedores de modelos demonstrem competência nas tarefas da Vals, ao mesmo tempo que oferece aos compradores uma ferramenta de decisão mais matizada.
A empresa relata que a sua receita cresceu oito vezes ao longo do último ano, uma afirmação que se alinha com a rápida expansão da sua base de clientes. Simultaneamente, a Vals ampliou a sua equipa de oito para vinte‑e‑cinco colaboradores e anunciou planos para recrutar mais dez a quinze pessoas num futuro próximo. Estes números sugerem uma correlação entre a entrada de capital, a adoção dos seus serviços de avaliação e o crescimento organizacional.
Entre os primeiros adotantes das avaliações da Vals estão várias agências federais dos Estados Unidos. A empresa lançou um programa de avaliação dedicado a estas agências, indicando que a sua metodologia está a ser considerada para contextos oficiais de aquisição e conformidade. Este desenvolvimento pode sinalizar um interesse governamental mais amplo em métricas padronizadas de desempenho de IA baseadas em tarefas.
Transparência, Independência e Reprodutibilidade
A Vals publica tanto os resultados das suas avaliações como as metodologias subjacentes no seu website público. Esta abordagem pretende proporcionar visibilidade sobre como as pontuações são derivadas e permitir que partes externas examinem o processo. Contudo, a independência da empresa ainda precisa ser analisada, particularmente porque as entidades que financiam as avaliações são também as sujeitas a essas avaliações.
O potencial conflito de interesses surge do facto de os desenvolvedores de modelos pagarem à Vals pelos testes, o que poderia influenciar a perceção de imparcialidade dos resultados. Embora a Vals afirme que os seus métodos são robustos, a reprodutibilidade dos seus resultados por investigadores independentes continua a ser uma questão aberta, dado que os materiais de avaliação são mantidos confidenciais.
- Materiais de teste confidenciais reduzem o risco de vazamento de dados de treino
- Modelo de receita vincula taxas de avaliação a desenvolvedores de modelos
- Resultados são partilhados com compradores para análise comparativa
- Divulgação pública de métodos visa melhorar a transparência
A confidencialidade dos conjuntos de teste é uma espada de dois gumes. Por um lado, protege a integridade da avaliação ao impedir que os modelos se ajustem a dados já conhecidos. Por outro lado, limita a capacidade de auditores externos replicarem os testes, o que pode afetar a confiança nas pontuações reportadas.
Outra área de incerteza diz respeito à escalabilidade do conjunto de tarefas da Vals. Embora o conjunto atual de domínios cubra um amplo espectro de atividades profissionais, estender a estrutura a setores adicionais — como educação, transporte ou monitorização ambiental — pode exigir novos designs de tarefas, expertise especializada e possivelmente protocolos de confidencialidade distintos.
A rápida expansão da equipa da empresa também levanta questões sobre a sustentabilidade do seu modelo operacional. Contratar mais dez a quinze colaboradores adicionais indica uma necessidade de mais avaliadores, engenheiros de dados e especialistas de domínio, mas a procura a longo prazo por avaliações tão especializadas dependerá de quão amplamente a indústria adotar benchmarks baseados em tarefas.
Olhar para o futuro, a abordagem da Vals pode influenciar normas mais amplas da indústria. Se as suas avaliações confidenciais e orientadas por tarefas ganharem aceitação tanto entre empresas privadas como agências públicas, podem tornar‑se um ponto de referência para futuros quadros regulatórios que buscam garantir que os sistemas de IA cumpram limiares de desempenho concretos.
No entanto, o impacto final da metodologia da Vals dependerá de vários fatores ainda não resolvidos: a capacidade de investigadores independentes verificarem os resultados sem acesso ao conteúdo dos testes, a disposição dos desenvolvedores de modelos em continuarem a pagar por avaliações proprietárias, e o grau em que os compradores confiam nestas pontuações nas decisões de aquisição. Cada uma destas variáveis pode influenciar se o modelo da Vals se torna um paradigma dominante ou permanece um serviço de nicho para aplicações especializadas.
Fontes
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · 19 de setembro de 2026
- Independent Evaluation, Unbiased BenchmarksVals AI · 21 de setembro de 2026



