# 从"卖智能"到"卖工作流":AI公司重新定义自己的价值

2026年7月,MiniMax 发布 M3。如果你只看它的 Benchmark(标准评测,用于比较不同AI模型的表现好坏)排名,可能会觉得这不过是又一轮模型参数竞赛中的普通一场。

但如果你仔细看它展示了什么,会发现这家公司实质上发布了完全不同的东西——不是一个更聪明的模型,而是一套关于AI公司如何创造价值的新叙事。

这篇文章试图拆解:M3 的发布为什么不是一次普通的版本迭代,而是整个AI产业价值锚点迁移的信号。


01 评价标准变了:从"成绩单"到"能不能干活"

M3发布时,最醒目的内容不是MMLU(大规模多任务语言理解评测,测试模型知识广度)、GSM8K(小学数学应用题评测,测试数学推理能力)、HumanEval(代码生成评测,测试模型写函数的能力)这些传统知识考试。MiniMax花了大量篇幅介绍另一类指标:BrowserComp(浏览器操作能力评测)、SWE-Bench(软件工程任务评测,测试修复真实项目Bug的能力)、Terminal Bench(命令行操作评测)、OSWorld(操作系统级任务评测)。

这些指标测的是同一个东西:**模型能不能完成一项完整工作——修复一个真实项目的Bug、独立操作网页、调用开发环境、连接企业系统。** [1]

36氪奇点湃对此有一个精准概括:过去评价的是Intelligence(智能/知识),今天评价的是Task Completion(任务完成度)。[1]

**这就像一个公司招人,以前只看成绩单,现在考你能不能干活。AI行业的"考试制度"正在从笔试变成面试。**

这不是MiniMax一家在变。几乎同时期,LMArena(AI模型评测平台)推出Agent Mode(智能体模式——自动评估模型在真实任务中的完成率),评测重心从"聊天好不好"转向智能体执行真实任务的完成率和幻觉率。[5] Vercel发布skills生态,一键装技能包的工具安装量冲到230万次。[7]

最明显的趋势是——在消费级和企业通用场景下,几乎所有人都在从"你的模型多聪明"转向"你的模型能帮我干多少活"。

02 为什么是MiniMax——需要具体问题具体分析

MiniMax在产品表达中,同时在推进四种能力:Browser(浏览器操作)、Coding(代码修复)、Terminal(命令行环境)、MCP(Model Context Protocol,一种连接企业系统的标准协议)。这些能力合在一起看,它想展示的不只是一个模型,而是一套完整工作流。[1]

为什么?因为在消费级和通用企业场景中,今天大多数模型在"知识类"Benchmark上的差距已经缩小到几个百分点。与此同时,企业在AI上的支出正从"验证探索"转向"生产落地"。据奇点湃引用Gartner报告预测,2026年全球AI软件支出将达1350亿美元,其中大部分流向能融入实际工作流程的AI产品。[1]

但有一个重要的前提需要标注:**"模型能力趋同"这个判断更多适用于消费级/企业通用场景。在前沿推理、长上下文、多模态领域,顶级的头部模型与追赶者之间仍存在明显差距。** M3选择Workflow方向,更多是基于中国市场的现实——在API价格战的挤压下,工作流是差异化竞争的关键跳板。

这引出两个值得注意的中美差异:

**美国** — OpenAI、Google、Anthropic的驱动逻辑是"通用AGI(通用人工智能)→企业级Agent(智能体)"的顺延。据奇点湃引用Sequoia 2026年AI投资报告显示,Agent/Workflow领域融资占比从2024年的18%跃升至42%。[1] 这些公司先建立技术壁垒,再做工作层延伸。

**中国** — 据奇点湃报道,百度ERNIE API价格在过去18个月下降超90%,字节豆包以免费+场景绑定抢市场。MiniMax等工作流策略,更多是在模型价格战中寻找"逃离同质化竞争"的逃生出口。[1]

两者虽然都走向Workflow,但出发的原因完全不同。前者是建设者的自然外延,后者是囚徒困境中的突围选择。

03 从Token到Workflow:商业模式的底层重构

Token(大模型的基本计费单位,约等于一个字或几个英文字符)——这是目前大多数AI API计费的基础。你使用得越多,付费越高。

但越来越多企业购买AI,不是因为需要更多"回答",而是为了完成更多"工作"。修一个Bug、整理一次会议、处理一张工单。价值单位从Token变成了Task。

这个逻辑有多严肃?看看一个叫Arena的平台就知道了。

Arena(原名Chatbot Arena,AI模型盲测排行榜平台)——一个不造模型、只做评测的平台。商业化服务上线8个月年化营收突破1亿美元,估值17亿美元。它的客户包括OpenAI、谷歌、Anthropic、Meta——所有造模型的公司都在找它付费评测。[2][3]

**资本投资的不是AI模型本身,而是"谁能定义AI工作能力"的基础设施。**

另一个佐证是Vibe Coding(一种用自然语言描述需求、由AI自动生成代码的编程方式)的爆发。一家金融科技公司Slash的员工,用AI编程消耗了约8万美元的token费用,搓出一款像素游戏。游戏意外走红,带来了关注度和新客户,最终转化为1亿美元的新增资产管理规模(AUM,Asset Under Management,即管理的资金量)。

这个案例的逻辑链是:**8万美元做游戏 → 游戏走红 → 吸引客户关注 → 客户转化为资管用户 → AUM增长1亿美元。**[6]

它不是"做游戏就能赚钱"的简单公式。关键在于:AI降低了"做一个完整产品"的门槛,让个体可以用较低成本完成一项商业任务。而"完成商业任务"正是AI从Token时代走向Workflow时代的核心驱动力。

奇点湃指出:Workflow的商业壁垒高于技术壁垒。因为技术可以被追赶——一个更好的模型发布,你的排名就往下掉。但工作流绑定了数据沉淀、员工习惯、系统集成,这些意味着更强的用户黏性和更稳定的商业模式。[1]

**企业的数据不会沉淀在一次聊天里,它最终沉淀在每天发生的工作流中。**

04 这场价值迁移的行业印证

把M3放进更大的产业图景里,四个维度同时发生着类似的转变:

**模型层** — 据开发者社区信息(未经OpenAI官方确认),OpenAI最新的GPT-5.6放弃传统Mini/Standard/Ultra分级,改用Sol(高难度推理和代码)、Terra(日常生产)、Luna(批量高频)分层定价。[4] 不再只卖"最强大脑",而是卖不同精度的生产力工具。

**工具层** — Vercel的skills生态正把AI能力变成可复用、可下载的模块。但同时,Snyk安全审计发现3984个技能中超三成带安全缺陷,13.4%属严重级。[7] 能力好用了,风险也同步上升——这是企业落地时必须面对的另一面。

**评测量** — Arena从"人就判定谁聊得好"扩展到"机器自动评估任务完成率"。谁定义这个新标准,谁就掌握商业话语权。[2][3]

**企业层** — 36氪最新报道《AI砍掉的第一批大厂人》揭示了一个现实:携程、美团、字节等大厂的裁员潮中,"高薪、高绩效、高P"的保护屏障全部失效。AI提效、老业务增长乏力、投资AI新业务的现金压力三重叠加。斯坦福研究显示ChatGPT普及以来,22-25岁软件开发者的就业相比2022年底峰值下降了近20%。[9]

**所有这些信号指向同一个方向:AI的价值度量单位,从Token向Task迁移。**

05 对知识工作者的启示

读到这里,你可能觉得这只是AI行业的内部变化,和普通用户关系不大。

但事实是——它直接改变了你选择和使用AI的方式。

以前你挑AI,看的是Benchmark排行榜,"谁最聪明谁最好"。现在标准变了:不只看它能答对多少题,而要看它能不能帮你完成今天的工作。

这里有一个简单的三步自检清单,帮你评估手头任何AI工具:

**第一步:问它能不能完成一件具体任务?**

**第二步:问它能不能连进你的工作流?**

**第三步:问它干完活后留下了什么?**

这三个问题,普通人也能做。它们不需要你懂AI技术,只需要你明白一个道理:**AI的价值,最终取决于它帮你完成了多少工作。**

当模型能力趋同,AI公司的价值锚点不在它能答对多少道题,而在于它能进入你多少工作流。

这个转变刚刚开始。

参考文献

  1. **《MiniMax M3:一家AI公司,为什么开始重新定义自己的价值?》** — 奇点湃(36氪),2026-07-05. https://www.36kr.com/p/3882467938040710
  2. **LMArena lands $1.7B valuation four months after launching its product** — Julie Bort, TechCrunch, 2026-01-06. https://techcrunch.com/2026/01/06/lmarena-lands-1-7b-valuation-four-months-after-launching-its-product/
  3. **Arena, the AI leaderboard everyone uses, is now a $100M business** — Marina Temkin, TechCrunch, 2026-06-29. https://techcrunch.com/2026/06/29/arena-the-ai-leaderboard-everyone-uses-is-now-a-100m-business/
  4. **《硅谷无间道:GPT-5.6"偷跑"截杀Claude,最快明天端出三大模型》** — 第一新声(36氪),2026-07-06. https://www.36kr.com/p/3883839281099016
  5. **Arena launches Agent Mode** — 转引自TechCrunch Arena报道(参考文献[3])
  6. **《Vibe Coding误烧55万元token,他靠嘲笑声反手赚了7个亿》** — 量子位(36氪),2026-07-06. https://www.36kr.com/p/3883634355695878
  7. **《狂揽2.4万星标:一行命令,AI会自己找技能了》** — 新智元(36氪),2026-07-06. https://www.36kr.com/p/3883329457483784
  8. **Gartner Forecasts Worldwide AI Software Spending to Reach $135 Billion in 2026** — Gartner, January 2026. 数据引用自参考文献[1]
  9. **《AI砍掉的第一批大厂人:高薪,高绩效,高P|深氪》** — 任彩茹(36氪),2026-07-06. https://www.36kr.com/p/3883456791163138
  10. **Canaries in the Coal Mine? The Impact of AI on the Employment of Software Developers** — Stanford University, 2025. 转引自参考文献[9]