商业#跑分

LMArena 母公司融资 2 亿美元,估值 10 个月翻近倍

Arena 完成 2 亿美元 B 轮,估值 31 亿美元,较 1 月翻近倍;6 月已宣布年化收入 1 亿美元,并上线对齐行为排行榜。

Arena 三位创始人在明亮的办公室里合影

据 TechCrunch 10 月 8 日报道,模型竞技场 LMArena 背后的公司 Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元——今年 1 月 A 轮的投后估值还是 17 亿美元,10 个月翻近一倍。Lightspeed 与 Khosla Ventures 领投,a16z、Felicis、Salesforce Ventures 等跟投。公司同时上线了一个「对齐排行榜」:按未经授权操作、虚假归因、「谎称完成任务」等行为给模型排名。这家 2023 年从 UC Berkeley 研究项目起家的机构,现在是评测赛道第一笔大规模资本定价。

要点

  • 收入曲线陡峭:1 月 A 轮时年化收入 3,000 万美元,6 月宣布达到 1 亿美元;商业产品「AI Evaluations」2025 年 9 月上线,向模型厂商和企业卖基于社区投票的性能分析。
  • 对齐排行榜上线:排名维度包括未经授权操作、虚假归因与「欺骗性完成」(模型谎称任务完成);初步榜单上 OpenAI 系模型居首,Claude Opus 5.5 与 Claude Fable 分列第六、第九。
  • 流量底盘:官方称月访问量达数千万级——普通用户免费提交 prompt 并投票,这份投票数据就是排行榜和商业产品的原料。

背景

独立评测的生意逻辑建立在一个前提上:静态基准已经失真。模型厂商刷榜、训练数据污染 benchmark,我们在此前的报道里反复碰到这个主题——OpenAI 批量发布数学证明后遭学界质疑是公信力问题的极端案例,而 Claude Haiku 5.5 发布时密集引用 OSWorld、Terminal-Bench 等基准则说明「榜单成绩」仍是发布的标配弹药。Arena 的位置恰好在裂缝里:不自己出题,让几千万真人盲测投票,再用这些票给厂商卖分析。1 月 A 轮 1.7 亿估值的报道里,它的年化收入还只有 3,000 万。

事实部分

轮次/指标时间数字
A 轮2026 年 1 月1.5 亿美元,投后估值 17 亿,ARR 3,000 万
B 轮2026 年 10 月 8 日2 亿美元,投后估值 31 亿
ARR2026 年 6 月1 亿美元(公司口径)
起点2023 年UC Berkeley 研究项目
商业化2025 年 9 月AI Evaluations 产品上线

B 轮投资方名单值得记录:Lightspeed Venture Partners 与 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等参与。TechCrunch 引述的行业背景是:模型厂商「刷静态基准」的行为促使企业寻找榜单之外的性能参照,Arena 的商业需求随之上涨。对齐排行榜是这轮融资的配套发布——把「模型行为可信度」变成可排名、可引用的指标,这是评测产品线的新一层。

各方说法

TechCrunch 的框架是「评测成为生意」:当厂商自己公布的基准难以取信,第三方、真人投票的数据就有了买家。Unite.AI 强调估值倍数——10 个月翻近倍,且发生在收入已过亿美元的基数上。IT之家的中文报道把 LMArena 定位为「AI 模型评测平台」,突出其对国内读者的参照意义:中文模型在竞技场上的排名一直是国内社区的关注点。批评面的声音同样存在且由来已久:众包盲测偏好更长、更讨喜的回答,风格与真实能力可能错位——这一批评在 HN 与学术圈反复出现,Arena 自己也承认投票数据有偏,需要用统计手段校正。

编辑判断

31 亿美元给「独立评测」定了价,也把它推进了利益场:被排名的模型厂商同时是潜在客户,这只脚踩两只船的结构是 Arena 必须长期回答的问题。对齐排行榜是聪明的差异化——「模型会不会谎称完成」正是智能体落地的核心恐惧,把安全叙事做成产品线,比多排一张能力榜更有壁垒。对开发者,实用建议不变:竞技场排名适合做初筛,关键场景还是要在自己的负载上跑分。诚实的不确定性:ARR 数字全部是公司口径,未经审计;对齐榜的判定方法学刚发布,独立验证还没有。