Design Arena:五百万用户正在帮 AI 模型做"审美评测"
据联合创始人 Grace Li 回忆,公司在 2025 年毕业前几周由几名大学同学共同创立,最初的目标是打造一款 AI 游戏引擎。彼时模型虽能生成可运行的小游戏,却普遍缺乏趣味性——这引出了一个核心问题:如何判断一款游戏是否好玩? 答案是:没有替代方案,只能依靠真实用户判断。团队由此萌生了大规模获取诚实人类反馈的想法,并最终孵化出 AI 工具 Design Arena。如今该平台已拥有全球 530 万用户,许多前沿 AI 实验室愿意为此付费。
核心价值:AI 模型的"盲测打分系统"
对普通用户而言,Design Arena 的使用体验接近一个进阶版模型路由器:用户在一个类似 ChatGPT 的窗口中输入提示词,可通过下拉菜单指定输出格式(网站、图片或十余种视觉格式),随后系统会逐轮呈现"A vs. B"对比,用户将多个输出从最优排到最末。
真正价值在企业端显现:付费模型可将平台视为永续的即时反馈来源。用户并不在意自己评分的是哪个模型——他们只想要最优结果——因此这些排名数据能直接反映用户的真实偏好。对于前沿实验室而言,这项服务价值显而易见。
商业数据:ARR 已达 6000 万美元
Grace Li 透露,平台目前 ARR(年度经常性收入)已达 6000 万美元,已成为 AI 行业人类评估数据的关键来源。她将平台定位为"设计领域模型改进的缺失瓶颈",并在获得第一笔大额合同后仅一周左右时间内,就锁定了与一家前沿实验室的合作。
本轮融资规模为 790 万美元种子轮,由 Index Ventures 领投,Conviction(Sarah Guo 与 Mike Vernal)、A*、Valkyrie 等机构跟投。
竞争格局:同类公司命运各异
值得关注的是,同类人类评估模式的初创公司境遇差异显著。今年早些时候,Yupp 在获得 a16z crypto 创始人 Chris Dixon 投资的 3300 万美元后关闭——尽管其声称拥有超过 130 万用户,并拿下了部分前沿模型客户,仍未能建立可持续的商业模式。相比之下,聚焦文本响应评估的 LM Arena 于今年 1 月完成 1.5 亿美元 A 轮融资(距付费产品正式推出仅四个月),目前保持增长态势。
此外,平台还通过用户登录机制追踪不同地区用户的审美偏好演变。Grace Li 指出,亚洲地区 Web 仪表盘普遍呈现更繁复的设计风格。这类数据对于自动化基准测试形成了重要补充——后者虽能规模化运行,却常面临被操纵或绕过的风险,Hugging Face 上周的安全事件已充分说明了这一点。


评论