# 不造AI,年入1亿美元:LMArena 如何成为AI行业的裁判?
整个硅谷都在这场AI淘金热里拼命挖矿——OpenAI烧了几十亿美元,Anthropic烧了几十亿美元,Google和Meta砸的更是天文数字。
它们造模型、堆参数、拼Benchmark(标准评测,用于比较不同AI模型的表现好坏)。
最后真正稳定赚到钱的,是谁?
裁判。
一个从UC伯克利学生项目起步的评测平台,不造模型不搞API,靠着给所有模型排队打分,商业化服务上线仅8个月,年化营收突破1亿美元。[1][2]
它的名字叫Arena(原名Chatbot Arena,AI模型盲测排行榜平台)。
这篇文章想讲清楚三件事:Arena凭什么成为AI行业的基础设施?它做对了什么?对AI时代的创业者和知识工作者来说,这告诉了我们什么?
01 一个简单的擂台
Arena的运作方式出乎意料的简单。用户输入一段提示词,系统匿名派出两个模型同时作答。你盲测(不知道哪个模型在回答),哪个回答更好就投谁一票。
规模已经大到可怕:1,000万+用户评测、累计7亿次对话、累计8,200万张投票。每月1,000万活跃访客,覆盖150多个国家。[2][3]
更关键的不是用户数,而是投票质量。据平台方自述,每天约有80%的用户提问是全新的——没有任何模型能提前"背题"。千万次真实的、多元的投票汇成Elo排行榜(Elo:一种修正对手强弱后计算得分的排名算法,起源于国际象棋,广泛用于电竞和AI评测),含金量极高。
所以模型厂商主动把自家旗舰送上来测。OpenAI甚至在GPT-5正式发布前,用代号"summit"偷偷在Arena上测了一圈。[2]
把Arena放在已有的商业格局里看,它让人联想到的不是普通的"评测机构",而是中国质量认证中心(CQC)的职能——**不是造东西的,但东西要上市就得先过它的检。**
全世界的AI公司都在拼命证明自己的模型最强,但它们都需要Arena来给这个"最强"背书。
02 免费排行榜的印钞机逻辑
Arena的核心商业化产品叫**AI Evaluations**,2025年9月上线。
商业模式极其简单:公开评测免费——所有人都能看到两个模型谁更强。但模型厂商想要更深度的、定制化的评测分析,就得付费。
CEO Angelopoulos形容为"面向真实世界的CI/CD系统(持续集成/持续部署,软件工程中的自动测试发布流程,这里借喻为AI的自动评估流水线)":模型发布前,社区免费测一遍;企业如果想要专属分析报告、特定场景诊断,就是收费服务。
效果惊人——
- **2025年9月** 商业化上线
- **2026年1月** A轮融资时公布年化营收3,000万美元
- **2026年6月** 年化营收突破1亿美元
- 8个月翻了3倍多[1][2][3]
更重要的是客户质量——所有主流模型厂商都是它的付费客户。OpenAI、Google、Anthropic、Meta,"全行业交保护费"的商业模式在AI领域极其罕见。
CEO Angelopoulos坦诚表示,这本质是"consumption"(消费型收入),不是严格意义上的recurring revenue(订阅式经常性收入)——但市场显然不介意这个分类。[3]
Arena没有像样的直接竞品——Yupp已于2026年3月关停。它的真正对手是Scale AI(数据标注与模型评估公司)、Mercor(AI评测与人才平台)、Surge这样的"后训练调优"公司。作为参考,据The Information报道,Handshake的年化AI训练收入从5.5亿美元涨到近10亿美元;Mercor年化收入也突破10亿美元。[1]
淘金热里,卖水的比挖金子的先赚到钱。AI浪潮里也一样——**只不过Arena不光卖水,它还在出具"金子成色检验报告"。**
03 三个伯克利人,一个宿舍项目
**Anastasios Angelopoulos**(CEO),数学出身,斯坦福电子工程本科,伯克利博士。他的博士课题是"对黑箱模型做数学上严格站得住脚的判断"——Arena的核心理念,本质上就是他博士论文的产业化。[1][2][3]
**Wei-Lin Chiang**(CTO),Vicuna(知名开源聊天机器人)的作者。2022年底ChatGPT公测后,停掉所有其他研究,一头扎进Arena。和Angelopoulos一起搬到合租,搭档称之为"a labor of love"——一个爱的劳作。[2]
**Ion Stoica**,联合创始人兼顾问。伯克利教授,Databricks联合创始人。一人撑起学术和创业两条线。A轮1.5亿美元、估值17亿美元的融资里,一半是资本在赌AI产业基础设施化趋势,另一半赌的就是Stoica从0到1做平台的记录。
从2023年伯克利实验室的学生项目,到2026年6月年化营收1亿美元——两年多时间,从宿舍到行业基础设施。
04 为什么Arena正在成为AI行业的基础设施?
**在消费级和企业通用场景下,当模型能力趋同,"测试标准"成为利润区。** 在PC时代的IT产业史上,Windows和Office本身不是最赚钱的部分,真正稳定的是SQL Server(数据库)、Active Directory(企业身份认证)、Azure(云服务)——定义"企业级IT能力"的基础设施。同样,当AI模型从一千多个竞争到只剩五六个时,谁能定义"好模型"的标准,谁就掌握商业话语权。
**与此同时,评价标准本身也在从"知识型"转向"任务型"。** MiniMax M3的发布方向是BrowserComp、SWE Bench等"任务完成型"指标。据开发者社区信息(未经OpenAI官方确认),GPT-5.6的分层定价也是"按任务价值"收费。[4][5] Arena推出Agent Mode——从"人评聊天好坏"扩展到"机器评任务完成率"——恰好捕捉了这个趋势。[2]
**商业规模才开始兑现。** Arena目前1亿美元年化营收,相比Scale AI近10亿美元、Mercor 10亿美元级的收入规模,还有巨大增长空间。它所处的AI评测市场正在快速膨胀。[1]
这不只是开一家公司,这是在AI的基础设施层占下一个不可替代的生态位。就像Databricks定义了"企业数据湖"——Arena正在定义"AI能力评估与认证"的标准。
05 创业者和知识工作者可以带走的三件事
Arena的案例提供了AI时代生态位选择的几个思考方向:
**第一,"评测权比制造权更持久"。** 标准制定者拥有最持久的商业基础。中国质量认证中心(CQC)、国家食品标准(GB标准)、瑞士SGS——在全球分工成熟的产业里,最赚钱的往往不是生产商,而是认证商。Arena验证了它同样适用于AI。
**第二,"从学术项目到商业成功有一条清晰路径"。** Angelopoulos的博士课题直接产业化。不是所有研究都需要立即商业化,但保留一个"商业化的窗口"比想象中更重要。
**第三,"裁判本身也要进化"。** Arena从Chatbot Arena到Agent Mode,从纯人类投票到客观任务指标。当被评判的标准本身也在变化,评测体系必须同步更新——这是它未来最大的挑战。
**一个自检清单**,帮你评估自己是否处在类似的基础设施型生态位上:
**归根结底,最赚钱的AI公司,造的不是AI。** 这句话不仅是观察结论,也是AI生态商业逻辑的一个高度浓缩的概括——基础设施层拥有这个行业最稳定、最长效的商业命脉。
参考文献
- **LMArena lands $1.7B valuation four months after launching its product** — Julie Bort, TechCrunch, 2026-01-06. https://techcrunch.com/2026/01/06/lmarena-lands-1-7b-valuation-four-months-after-launching-its-product/
- **Arena, the AI leaderboard everyone uses, is now a $100M business** — Marina Temkin, TechCrunch, 2026-06-29. https://techcrunch.com/2026/06/29/arena-the-ai-leaderboard-everyone-uses-is-now-a-100m-business/
- **《年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意》** — 新智元(36氪),2026-07-06. https://www.36kr.com/p/3883329844555777
- **《MiniMax M3:一家AI公司,为什么开始重新定义自己的价值?》** — 奇点湃(36氪),2026-07-05. https://www.36kr.com/p/3882467938040710
- **《硅谷无间道:GPT-5.6"偷跑"截杀Claude,最快明天端出三大模型》** — 第一新声(36氪),2026-07-06. https://www.36kr.com/p/3883839281099016
- **《狂揽2.4万星标:一行命令,AI会自己找技能了》** — 新智元(36氪),2026-07-06. https://www.36kr.com/p/3883329457483784
- **《AI砍掉的第一批大厂人:高薪,高绩效,高P|深氪》** — 任彩茹(36氪),2026-07-06. https://www.36kr.com/p/3883456791163138
- **Canaries in the Coal Mine? The Impact of AI on the Employment of Software Developers** — Stanford University, 2025. 转引自参考文献[7]