

Arena于周四宣布,公司已完成2亿美元B轮融资,估值达31亿美元。该公司起源于2023年加州大学伯克利分校的一个研究项目,该项目通过众包方式为AI模型排名。
此前,该公司表示,其年化经常性收入已于6月达到1亿美元。
本轮融资由Lightspeed Venture Partners(光速创投)和Khosla Ventures(科斯拉风险投资)领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z(安德森·霍洛维茨)、Felicis等机构跟投。Arena此前已于1月宣布完成1.5亿美元A轮融资,投后估值为17亿美元。该公司表示,当时其年化收入为3000万美元。这意味着其估值在大约10个月内几乎翻了一番。
Arena提供一个面向消费者免费使用的众包平台。用户输入提示词(prompt),或请求生成vibe coding项目,然后对哪个模型完成得更好进行评分。Arena称其每月有数千万访问者。
去年9月,Arena推出了商业化产品AI Evaluations,该服务基于社区反馈,为模型实验室和企业提供详细的性能分析。时机再合适不过。今年,AI实验室意识到,它们的模型在基准测试中存在“刷分”行为,即在并未真正具备相应能力的情况下,想方设法取得好成绩。与此同时,企业希望获得帮助,以确定哪种模型最适合自身的内部需求,而不是仅仅依赖标准化基准测试。
“AI的发展速度已经超过了我们评估它的能力,而一旦模型意识到自己正在被测试,静态基准测试就会失效,”该公司在融资公告中表示。“世界需要一个中立的第三方,来衡量AI在真实用户手中究竟有多安全、多对齐。Arena今天就要承担起这一角色,”公司补充道。
为此,Arena还在其排行榜上新增了一个类别:对齐(alignment)。该类别会根据以下问题对模型进行排名:未经授权的操作(执行了并未被要求执行的操作);错误归因(将言论或事实错误地归于不正确的来源);以及该公司所称的“欺骗性完成”(谎称完成了实际上并未完成的任务)。
目前,OpenAI的一系列模型位居其初步对齐排行榜的前列,而Claude Opus 5.5 和Claude Fable分别排在第六位和第九位。
参考资料: