Valsが4,000万ドル調達 実タスクベースのAIベンチマークを導入へ
2024年設立のValsは、Andreessen Horowitzが主導する4,000万ドルのシリーズAを完了し、8VCとBloomberg Betaがリードしたシードラウンドに続き、データ汚染の懸念がある従来の公開ベンチマークに代わり、法務、金融、プログラミング、サイバーセキュリティ、メンタルヘルス、バイオセーフティ、武力紛争法などの具体的タスクを評価する機密ベンチマークを提供することを目指す。

ValsはAIベンチマークの再定義に向けて4,000万ドルのシリーズAを確保
2024年初頭、Valsは4,000万ドルを調達したシリーズA資金調達ラウンドの完了を発表しました。このラウンドはAndreessen Horowitzが主導し、以前のシードラウンドは8VCとBloomberg Betaが主催していました。この資本注入は、創業から数か月しか経っていない企業にとって重要なマイルストーンであり、人工知能システムの評価方法を根本的に変えるという同社の野望を支える財政的基盤となります。
Valsが資金調達に踏み切った根本的な動機は、同社が「古い公開ベンチマーク」と呼ぶものを新しいクラスの評価に置き換えることです。Valsによれば、既存のベンチマークの多くはデータ汚染に悩まされており、評価に使用されるデータセットが既に主要モデルのトレーニングパイプラインに組み込まれている可能性があります。評価資料を機密に保つことで、Valsはそのような情報漏洩から隔離されたテスト環境を構築し、モデルの真の能力をより明確に把握できるようにしようとしています。
抽象的な試験から実世界タスクへ
Valsの創業者であるRayan Krishnanは、意味のあるベンチマークとは何かについて具体的な哲学を示しています。彼は、ベンチマークは抽象的な選択式試験で成功するだけでなく、具体的な領域で人間レベルの品質の成果を生成できるかどうかを検証すべきだと主張します。この視点は、現在Valsが測定しているタスクカテゴリの選定に反映されており、法務、金融、プログラミング、サイバーセキュリティ、メンタルヘルス、生物安全、武装紛争法が含まれます。
これらの領域はそれぞれ、独自の専門基準と規制枠組みを持っています。法的論点の作成、金融リスク分析の実施、実務レベルのコード執筆、サイバー脅威の特定、メンタルヘルスカウンセリングのスクリプト提供、生物安全プロトコルの評価、あるいは武装紛争法の解釈といったタスクに焦点を当てることで、Valsはエンドユーザーやステークホルダーに直接関係するパフォーマンス次元を捉えようとしています。
ビジネスモデルと市場採用
ValsはBtoBモデルで運営しており、AIモデル開発者が自社システムを同社の専有タスクで評価してもらうために料金を支払います。その評価結果は潜在的な購入者に提供され、実際の導入シナリオで重要となる基準で競合システムを比較できるようになります。この双方向市場構造は、モデル提供者がValsのタスクで実力を示すインセンティブを生み出すと同時に、購入者にはより細分化された意思決定ツールを提供します。
同社は、過去1年間で収益が8倍に成長したと報告しており、これは顧客基盤の急速な拡大と一致します。同時に、従業員数は8名から25名に増加し、近い将来さらに10〜15名の採用を計画しています。これらの数字は、資本流入、評価サービスの採用、組織規模の拡大が相関していることを示唆しています。
Valsの評価を早期に採用したのは米国の複数の連邦機関です。同社はこれら機関向けに専用評価プログラムを開始しており、公式な調達やコンプライアンスの文脈でその手法が検討されていることを示しています。この動きは、標準化されたタスクベースのAI性能指標に対する政府全体の関心が高まる可能性を示唆しています。
透明性、独立性、再現性
Valsは評価結果と基礎となる手法の両方を自社の公開ウェブサイトに掲載しています。このアプローチは、スコアの算出方法に対する可視性を提供し、外部の関係者がプロセスを検証できるようにすることを目的としています。しかし、評価資金を提供する主体が評価対象でもあるため、同社の独立性は依然として検証が必要です。
利益相反の可能性は、モデル開発者がテスト費用としてValsに支払う点に起因します。これが結果の公平性に対する認識に影響を与える恐れがあります。Valsは手法が堅牢であると主張していますが、評価資料自体が機密であるため、独立した研究者が結果を再現できるかは未解決の課題です。
- 機密テスト資料はトレーニングデータ漏洩リスクを低減
- 収益モデルは評価料をモデル開発者に結びつける
- 結果は購入者に共有され比較分析に活用
- 手法の公開は透明性向上を狙い
テストセットの機密性は両刃の剣です。一方では、既知データへの過学習を防ぐことで評価の整合性を守ります。もう一方では、第三者監査人がテストを再現できないため、報告されたスコアに対する信頼性が損なわれる可能性があります。
別の不確実性は、Valsのタスクスイートのスケーラビリティです。現在のドメインは幅広い専門活動をカバーしていますが、教育、交通、環境モニタリングなどの追加セクターへ拡張するには、新たなタスク設計、専門知識、場合によっては別個の機密プロトコルが必要になるでしょう。
急速な人員拡大は、運営モデルの持続可能性に関する疑問も提起します。10〜15名の追加採用は、評価者、データエンジニア、ドメイン専門家の需要増加を示唆しますが、こうした高度に特化した評価への長期的な需要は、業界全体がタスクベースのベンチマークをどれだけ採用するかに左右されます。
将来的に、Valsのアプローチは業界標準に影響を与える可能性があります。機密かつタスク指向の評価が民間企業と公共機関の両方で受け入れられれば、AIシステムが具体的な性能閾値を満たすことを保証する規制枠組みの参照点となり得ます。
しかしながら、Valsの手法が最終的にどれだけインパクトを持つかは、いくつかの未解決要因に依存します。すなわち、テスト内容へのアクセスなしに独立研究者が結果を検証できるか、モデル開発者が専有評価に支払い続ける意欲、そして購入者が調達決定でこれらのスコアをどれだけ重視するかです。これらの変数が、Valsのモデルが支配的なパラダイムになるか、あるいは特化されたニッチサービスに留まるかを左右するでしょう。
出典
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · 2026年9月19日
- Independent Evaluation, Unbiased BenchmarksVals AI · 2026年9月21日



