Vals籌得4000萬美元 推出以真實任務為基礎的AI基準
Vals於2024年創立,完成由 Andreessen Horowitz 主導的4000萬美元A輪融資,先前由8VC與 Bloomberg Beta 主導種子輪,目標以保密的真實任務評估取代可能受訓練數據污染的舊公共基準,涵蓋法律、金融、程式設計、資安、心理健康、生物安全與武裝衝突法等領域。

Vals 獲得 4000 萬美元 A 輪融資以重新定義 AI 基準測試
在 2024 年初,Vals 宣布完成了一輪 A 輪融資,籌得 4000 萬美元。此輪由 Andreessen Horowitz 主導,之前的種子輪則由 8VC 與 Bloomberg Beta 組織。這筆資金的注入對於僅成立數月的公司而言是一個重要里程碑,也為該公司徹底改革人工智慧系統評估方式提供了財務支撐。
Vals 籌資的核心動機在於取代其所稱的「舊公共基準」,推出全新類型的評估。Vals 表示,許多現有基準存在資料污染問題,也就是用於評估的資料集可能已被領先模型的訓練管線所使用。透過將評估材料保密,Vals 旨在打造一個免於此類洩漏的測試環境,從而提供模型真實能力的更清晰圖像。
從抽象考試到實務任務
Vals 的創辦人 Rayan Krishnan 提出了一套關於有意義基準的具體哲學。他主張,基準應該驗證模型是否能在具體領域內產出符合人類水平的工作,而非僅僅在抽象的多選題考試中取得好成績。這一觀點指引了 Vals 目前測量的任務類別,包括法律、金融、程式設計、網路安全、心理健康、生物安全以及武裝衝突法。
上述每個領域都代表一套獨特的專業標準與監管框架。透過聚焦於撰寫法律論點、執行金融風險分析、編寫生產等級程式碼、辨識網路威脅、提供心理健康諮詢腳本、評估生物安全程序或詮釋武裝衝突法等任務,Vals 希望捕捉與最終使用者與利害關係人直接相關的績效面向。
商業模式與市場採用
Vals 採用企業對企業(B2B)模式,AI 模型開發者需支付公司費用,以讓其系統接受專有任務的評估。評估後的分數會提供給潛在買家,讓他們能在實際部署中依據重要指標比較不同系統。這種雙邊市場結構激勵模型提供者在 Vals 任務上展現能力,同時為買家提供更細緻的決策工具。
公司報告稱,其營收在過去一年成長了八倍,這與客戶基礎的快速擴張相呼應。同時,Vals 將員工人數從八人擴增至二十五人,並宣布近期將再招聘十至十五名新員工。這些數據暗示資金流入、評估服務的採用以及組織規模之間存在相關性。
Vals 的早期採用者包括多個美國聯邦機構。該公司為這些機構啟動了專屬的評估計畫,顯示其方法正被考慮用於正式採購與合規情境。此發展或預示政府對標準化、任務導向 AI 效能指標的更廣泛興趣。
透明度、獨立性與可再現性
Vals 在其公開網站上同時發布評估結果與背後的方法論。此舉旨在讓外界了解分數的計算方式,並允許第三方審查過程。然而,公司獨立性的問題仍需檢視,尤其是因為資金提供者同時也是被評估的對象。
利益衝突的潛在來源在於模型開發者為測試付費,這可能影響結果的公正性。雖然 Vals 主張其方法堅實,但由於評估材料本身保密,獨立研究者能否再現其結果仍是一個未解之問。
- 保密的測試材料降低訓練資料洩漏風險
- 營收模式將評估費用與模型開發者掛鉤
- 結果與買家共享以進行比較分析
- 公開方法論旨在提升透明度
測試集的保密性是一把雙刃劍。一方面,它防止模型對已知資料過度擬合,保護評估的完整性;另一方面,它限制第三方稽核者複製測試的能力,可能影響對報告分數的信心。
另一個不確定領域是 Vals 任務套件的可擴展性。雖然目前的領域已覆蓋廣泛的專業活動,若要將框架延伸至教育、交通或環境監測等其他產業,可能需要全新任務設計、領域專家以及可能不同的保密協議。
公司快速的員工擴張也引發對其營運模式可持續性的疑問。招聘十至十五名新員工顯示對評估員、資料工程師與領域專家的需求增加,但此類高度專業化評估的長期需求將取決於產業對任務導向基準測試的接受程度。
展望未來,Vals 的做法可能影響更廣泛的產業標準。如果其保密且以任務為導向的評估在私營企業與公共機構之間獲得認可,未來的監管框架可能將其作為確保 AI 系統達到具體效能門檻的參考點。
然而,Vals 方法論的最終影響仍取決於多項尚未解決的因素:獨立研究者在未取得測試內容的情況下驗證結果的能力、模型開發者是否持續為專有評估付費,以及買家在採購決策中對這些分數的依賴程度。這些變數皆可能決定 Vals 的模式是成為主流範式,抑或僅是針對特定應用的利基服務。
資料來源
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · 2026年9月19日
- Independent Evaluation, Unbiased BenchmarksVals AI · 2026年9月21日



