Vals融资4000万美元 推出基于真实任务的AI基准评估
Vals公司于2024年成立,完成由 Andreessen Horowitz 主导的4000万美元A轮融资,之前由8VC和Bloomberg Beta领投种子轮,旨在用保密的真实任务评估取代已被训练数据污染的旧公共基准,覆盖法律、金融、编程、网络安全、心理健康、生物安全和武装冲突法等领域。

Vals 获得 4000 万美元 A 轮融资,以重新定义 AI 基准测试
2024 年初,Vals 宣布完成了一轮 A 轮融资,筹集了 4000 万美元。该轮融资由 Andreessen Horowitz 主导,此前的种子轮由 8VC 和 Bloomberg Beta 组织。这笔资本注入标志着一家仅成立数月的公司迈入了重要里程碑,并为公司彻底改革人工智能系统评估方式提供了财务支撑。
Vals 融资的核心动机是用一种新型评估取代公司所称的“旧公共基准”。Vals 表示,许多现有基准存在数据污染问题,即用于评估的数据集可能已经被领先模型的训练流程所使用。通过对评估材料保密,Vals 旨在创建一个免受此类泄漏影响的测试环境,从而更清晰地呈现模型的真实能力。
从抽象考试到真实任务
Vals 创始人 Rayan Krishnan 阐述了一套关于何为有意义基准的具体哲学。他认为,基准应当验证模型是否能够在具体领域内产出人类水平的工作,而不是仅在抽象的多项选择考试中取得成功。这一观点决定了 Vals 当前测量的任务类别,包括法律、金融、编程、网络安全、心理健康、生物安全以及武装冲突法。
这些领域各自代表了一套独特的职业标准和监管框架。通过聚焦于起草法律论点、进行金融风险分析、编写生产级代码、识别网络威胁、提供心理健康咨询脚本、评估生物安全方案或解释武装冲突法等任务,Vals 试图捕捉与终端用户和利益相关者直接相关的绩效维度。
商业模式与市场采纳
Vals 采用 B2B 模式,AI 模型开发者为其系统接受专有任务评估而付费。评估得到的分数随后向潜在买家公开,买家可据此比较竞争系统在实际部署中关键指标的表现。这种双边市场结构激励模型提供商在 Vals 任务上展示能力,同时为买家提供更细致的决策工具。
公司报告称,其收入在过去一年增长了八倍,这一说法与其客户基数的快速扩张相吻合。同时,Vals 将员工规模从八人扩大到二十五人,并宣布计划在近期再招聘十至十五人。这些数字暗示了资本流入、评估服务采纳以及组织规模增长之间的关联。
Vals 评估的早期采用者包括多家美国联邦机构。公司为这些机构启动了专门的评估项目,表明其方法正被考虑用于官方采购和合规情境。这一进展可能预示着政府对标准化、基于任务的 AI 性能指标的更广泛兴趣。
透明度、独立性与可重复性
Vals 在其公开网站上发布评估结果及其底层方法论。此举旨在让外界了解分数的生成过程,并允许外部方审查该过程。然而,公司独立性仍需审视,特别是因为为评估提供资金的实体也是评估的对象。
潜在的利益冲突源于模型开发者为测试向 Vals 支付费用,这可能影响结果的公正性。虽然 Vals 声称其方法稳健,但由于评估材料本身保密,独立研究者能否复现其结果仍是未解之问。
- 保密的测试材料降低了训练数据泄漏的风险
- 收入模式将评估费用与模型开发者挂钩
- 结果与买家共享以进行对比分析
- 公开方法论旨在提升透明度
测试集的保密性是一把双刃剑。一方面,它通过防止模型对已知数据过拟合来维护评估的完整性;另一方面,它限制了第三方审计员复现测试的能力,可能影响对报告分数的信心。
另一个不确定领域是 Vals 任务套件的可扩展性。虽然当前的领域集合覆盖了广泛的专业活动,但将框架扩展至教育、交通或环境监测等其他行业,可能需要新的任务设计、学科专家以及可能不同的保密协议。
公司快速的员工扩张也引发了对其运营模式可持续性的疑问。招聘十至十五名新员工表明对更多评估员、数据工程师和领域专家的需求,但此类专业评估的长期需求将取决于行业对基于任务的基准测试的采纳程度。
展望未来,Vals 的做法可能影响更广泛的行业标准。如果其保密、面向任务的评估在私营企业和公共机构中获得认可,它们可能成为未来监管框架的参考点,以确保 AI 系统达到具体的性能阈值。
然而,Vals 方法论的最终影响仍取决于若干未解因素:独立研究者在未获取测试内容的情况下验证结果的能力、模型开发者是否继续为专有评估付费,以及买家在采购决策中对这些分数的依赖程度。这些变量都可能决定 Vals 的模型是成为主流范式,还是仅在特定专业应用中保持小众服务。
信息来源
- Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarkingTechCrunch · 2026年9月19日
- Independent Evaluation, Unbiased BenchmarksVals AI · 2026年9月21日



