Vals arrecada US$ 40 milhões para implantar benchmarks de IA baseados em tarefas reais
Vals, fundada em 2024, levantou US$ 40 milhões em rodada Série A liderada pela Andreessen Horowitz após seed com 8VC e Bloomberg Beta, e pretende substituir benchmarks públicos antigos por avaliações confidenciais que medem tarefas concretas em direito, finanças, programação, cibersegurança, saúde mental, biossegurança e direito de conflitos armados.

Vals garante uma Série A de US$ 40 milhões para redefinir a avaliação de IA
No início de 2024, a Vals anunciou o fechamento de uma rodada de financiamento Série A que arrecadou US$ 40 milhões. A rodada foi liderada pela Andreessen Horowitz, após uma rodada semente anterior organizada pela 8VC e Bloomberg Beta. Essa injeção de capital marca um marco significativo para uma empresa fundada há apenas alguns meses, e fornece a base financeira para a ambição da empresa de reformular a maneira como os sistemas de inteligência artificial são avaliados.
A motivação central por trás do esforço de captação de recursos da Vals é substituir o que a empresa descreve como "benchmarks públicos antigos" por uma nova classe de avaliações. Segundo a Vals, muitos benchmarks existentes sofrem de contaminação de dados, ou seja, os conjuntos de dados usados para avaliação podem já ter sido incorporados aos pipelines de treinamento de modelos de ponta. Ao manter os materiais de avaliação confidenciais, a Vals pretende criar um ambiente de teste isolado desse vazamento, proporcionando uma imagem mais clara das verdadeiras capacidades de um modelo.
De exames abstratos a tarefas do mundo real
Rayan Krishnan, fundador da Vals, articulou uma filosofia específica sobre o que constitui um benchmark significativo. Ele argumenta que um benchmark deve verificar se um modelo pode produzir trabalho de qualidade humana dentro de um domínio concreto, em vez de apenas ter sucesso em um exame abstrato de múltipla escolha. Essa perspectiva orienta a seleção das categorias de tarefas que a Vals atualmente mede, que incluem direito, finanças, programação, cibersegurança, saúde mental, biossegurança e direito dos conflitos armados.
Cada um desses domínios representa um conjunto distinto de padrões profissionais e estruturas regulatórias. Ao focar em tarefas como redigir argumentos jurídicos, realizar análises de risco financeiro, escrever código de produção, identificar ameaças cibernéticas, entregar roteiros de aconselhamento em saúde mental, avaliar protocolos de biossegurança ou interpretar o direito dos conflitos armados, a Vals busca capturar dimensões de desempenho que são diretamente relevantes para usuários finais e partes interessadas.
Modelo de negócio e adoção de mercado
A Vals opera em um modelo business‑to‑business no qual desenvolvedores de modelos de IA pagam à empresa para que seus sistemas sejam avaliados contra suas tarefas proprietárias. As pontuações resultantes são então disponibilizadas a compradores potenciais, que podem usá‑las para comparar sistemas concorrentes com base em critérios que importam em implantações reais. Essa estrutura de mercado de dois lados cria um incentivo para que os provedores de modelos demonstrem competência nas tarefas da Vals, ao mesmo tempo em que oferece aos compradores uma ferramenta de decisão mais matizada.
A empresa relata que sua receita cresceu oito vezes ao longo do último ano, uma afirmação que coincide com a rápida expansão de sua base de clientes. Simultaneamente, a Vals ampliou seu quadro de funcionários de oito para vinte‑e‑cinco colaboradores e anunciou planos de recrutar mais dez a quinze pessoas no futuro próximo. Esses números sugerem uma correlação entre a entrada de capital, a adoção de seus serviços de avaliação e o crescimento organizacional.
Entre os primeiros adotantes das avaliações da Vals estão várias agências federais dos Estados Unidos. A empresa lançou um programa de avaliação dedicado a essas agências, indicando que sua metodologia está sendo considerada para contextos oficiais de aquisição e conformidade. Esse desenvolvimento pode sinalizar um interesse governamental mais amplo por métricas padronizadas de desempenho de IA baseadas em tarefas.
Transparência, independência e reproducibilidade
A Vals publica tanto os resultados de suas avaliações quanto as metodologias subjacentes em seu site público. Essa abordagem pretende proporcionar visibilidade sobre como as pontuações são derivadas e permitir que partes externas examinem o processo. Contudo, a independência da empresa ainda precisa ser analisada, particularmente porque as entidades que financiam as avaliações são também as sujeitas a essas avaliações.
O potencial conflito de interesse surge do fato de que desenvolvedores de modelos pagam à Vals pelos testes, o que poderia influenciar a percepção de imparcialidade dos resultados. Embora a Vals afirme que seus métodos são robustos, a reproducibilidade de seus resultados por pesquisadores independentes permanece uma questão aberta, dado que os materiais de avaliação são mantidos confidenciais.
- Materiais de teste confidenciais reduzem o risco de vazamento de dados de treinamento
- Modelo de receita vincula taxas de avaliação a desenvolvedores de modelos
- Resultados são compartilhados com compradores para análise comparativa
- Divulgação pública de métodos visa aprimorar a transparência
A confidencialidade dos conjuntos de teste é uma espada de dois gumes. Por um lado, protege a integridade da avaliação ao impedir que os modelos se ajustem excessivamente a dados conhecidos. Por outro, limita a capacidade de auditores externos de replicar os testes, o que pode afetar a confiança nas pontuações relatadas.
Outra área de incerteza diz respeito à escalabilidade do conjunto de tarefas da Vals. Embora o conjunto atual de domínios cubra um amplo espectro de atividades profissionais, expandir a estrutura para setores adicionais — como educação, transporte ou monitoramento ambiental — pode exigir novos designs de tarefas, expertise de assunto e possivelmente protocolos de confidencialidade distintos.
A rápida expansão da equipe da empresa também levanta questões sobre a sustentabilidade de seu modelo operacional. Contratar mais dez a quinze funcionários adicionais indica a necessidade de mais avaliadores, engenheiros de dados e especialistas de domínio, mas a demanda de longo prazo por avaliações tão especializadas dependerá de quão amplamente a indústria adotar a avaliação baseada em tarefas.
Olhando para o futuro, a abordagem da Vals pode influenciar padrões mais amplos da indústria. Se suas avaliações confidenciais e orientadas a tarefas ganharem aceitação tanto entre empresas privadas quanto agências públicas, elas podem se tornar um ponto de referência para futuros marcos regulatórios que buscam garantir que sistemas de IA atinjam limites de desempenho concretos.
No entanto, o impacto final da metodologia da Vals dependerá de vários fatores ainda não resolvidos: a capacidade de pesquisadores independentes verificarem os resultados sem acesso ao conteúdo dos testes, a disposição dos desenvolvedores de modelos em continuarem pagando por avaliações proprietárias e o grau em que os compradores confiam nessas pontuações nas decisões de aquisição. Cada uma dessas variáveis pode influenciar se o modelo da Vals se tornará um paradigma dominante ou permanecerá um serviço de nicho para aplicações especializadas.
Fontes
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · 19 de setembro de 2026
- Independent Evaluation, Unbiased BenchmarksVals AI · 21 de setembro de 2026



