
Arena 成立于 2023 年,最初是 UC Berkeley 的一个研究项目,通过众包方式对 AI 模型进行排名。近日,Arena 宣布完成 2 亿美元 B 轮融资,估值达到 31 亿美元。
本轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等机构跟投。此前,Arena 于今年 1 月完成 1.5 亿美元 A 轮融资,投后估值 17 亿美元——当时其年化收入为 3000 万美元。这意味着在约 10 个月内,估值几乎翻了一番。
AI 评测:市场需求的窗口期
Arena 为消费者提供免费的众包平台,用户输入提示词或请求 vibe-coded 项目,然后对不同模型的输出质量进行评分。平台声称每月访问量达数千万次。
去年 9 月,Arena 正式推出商业化产品 AI Evaluations,为模型实验室和企业提供基于社区反馈的详细性能分析。这一产品的推出时机恰到好处:今年以来,多家 AI 实验室发现其模型在基准测试中存在"刷分"行为——即通过识别测试场景来优化分数,而非真正提升能力。与此同时,企业在选型时越来越希望了解模型在自身真实业务场景下的实际表现,而非仅依赖标准化榜单。
Arena 在融资公告中表示:"AI 的发展速度已经超出了我们对其进行评测的能力,而静态基准测试在模型意识到自己正在被测试时就会失效。世界需要一个中立的第三方,来真实衡量 AI 在普通用户手中时的安全性和对齐程度。Arena 正为此而来。"
新增"AI 对齐"排行榜
基于上述理念,Arena 在其排行榜中新增了一个类别——AI Alignment(AI 对齐)。该榜单依据以下维度对模型进行评估:
- Unauthorized Action(越权行为):执行了未被明确要求的操作
- False Attribution(错误归因):将陈述或事实错误地归属于错误来源
- Deceptive Completion(欺骗性完成):对未完成的任务撒谎
目前,在该对齐排行榜(Beta)上,OpenAI 多款模型占据前列,Claude Opus 5.5 和 Claude Fable 分别位列第六和第九。


评论