
基准测试已成为 AI 行业验证模型能力的主流方式——当指标对己有利时,企业便能借此脱颖而出、彰显优势。换句话说,好用的基准测试几乎等同于好公关。
然而问题也随之而来:企业已找到绕过传统基准测试的方法,其中很多测试框架早已年久失修,并未针对现代模型的能力而设计。
Vals 正是瞄着这个痛点而来。这家成立于 2024 年的创业公司,不到两年便在科技行业建立了自己的声量。去年获得由 8VC 和 Bloomberg Beta 领投的种子轮融资;上月又宣布完成4000 万美元 A 轮融资,由 Andreessen Horowitz 领投。
公司联合创始人 Rayan Krishnan 年仅 25 岁,此前曾在 Palantir 实习,本科就读斯坦福期间先后在微软和该校久负盛名的人工智能实验室工作。Krishnan 表示,Vals 的诞生源于他对基准测试严重滞后于行业发展的亲身观察。
"我们看到大量新型、能力强劲的模型快速进入市场,但学术基准测试未能跟上这一前沿进展。"Krishnan 说道。随着 AI 被融入社会的方方面面,基准测试的真正意义在于验证模型能否做到企业所宣称的那样。
差异化路径:不公开题目,防止"刷分"
传统基准测试的另一大缺陷在于题目往往公开——这给了企业在考试中作弊的机会。Vals 选择不公开具体测试材料,同时将评估维度从通用知识转向法律、金融、编码等行业场景下的复杂任务完成能力。
"我们真正关注的是模型在实际工作中能带来什么,"Krishnan 表示,"它们能否在每个领域内产出与人类同等质量的工作成果?" 评估不仅看正向结果,也关注潜在负面风险——即模型若大规模应用,可能带来哪些负面影响。
新疆域:递归自我改进、心理健康、网络安全
除了传统行业,Vals 还在向更前沿的领域拓展。Krishnan 透露,公司已推出递归自我改进基准测试,并在心理健康、网络安全、生物安全等领域开展评估,甚至涉及武装冲突法与日内瓦公约的应用能力。
商业模式方面,企业付费请 Vals 评测自身模型——这听起来反直觉,却类似于考生向美国大学理事会付费参加 SAT 考试:有效的测量本身就是改进的基础。
高速增长,进军联邦机构
Vals近期披露其当前收入已达去年的 8 倍。团队规模年初仅 8 人,现已扩至 25 人,计划继续扩张至 35\~40 人并搬迁至更大办公空间。公司还推出面向联邦机构的评测项目。
Krishnan 认为,Vals 的评测体系将成为 AI 公司建立公众信任的核心机制:"AI 公司正在陆续上市——SpaceX 已上市,Anthropic 预计今年稍后,OpenAI 应该也会很快。当 AI 模型成为经济核心并广泛渗透时,我们所做的基准测试将驱动其应用,并成为这些公司提交公开文件、说明投资规划的核心依据。"


评论