这不是一篇对某家公司的产品解读,而是 humanaifit 团队与多位研究者共同完成的系统性梳理。我们把 2025 到 2026 年散落各处的碎片——一个开源爆款、一次模型架构跃迁、一场企业安全事故、一次产品哲学之争——放进同一套分析框架里,试图回答三个问题:能力如何爆发?规模化的临界点为什么还没跨过去?治理悖论为何无解,又该如何与它共处?

一、能力爆发:从"一个人单干"到"一支AI团队"

AI Agent 能力曲线的陡峭上升,可以浓缩为两条看似无关、实则对称的叙事。

商业火箭:Claude Code 与 10 亿美元 ARR

2025 年 3 月,39 岁的奥地利开发者 Peter Steinberger 发现了一个名为 Claude Code 的测试版工具。他后来这样描述那段体验:"我睡不着,我真的上瘾了。" 到 2025 年 11 月——正式发布仅 6 个月——Claude Code 已突破 10 亿美元 ARR。内部测试显示,驱动它的 Opus 4.5 在编程面试题上得了比任何人类候选人都高的分。

紧接着,Anthropic 在 2026 年 5 月末同时投下三枚重磅炸弹:距离上一代 4.7 仅 41 天的 Opus 4.8、把 AI 从"一个人"变成"一个团队"的 Dynamic Workflows,以及 650 亿美元融资、估值冲到 9650 亿美元。三件事单独看都很重磅,合起来却指向同一件事——Anthropic 已经不满足于做一个更聪明的模型,它要做一个能协调数百个 AI 的"项目经理"。

Opus 4.8 的关键改进被包装成四个维度:在 Super-Agent benchmark 上成为唯一 100% 完成的模型(超越 GPT-5.5);Terminal-Bench 2.1 领先、CursorBench 全面反超上代;自我纠错能力是上代 4 倍——模型会主动标注"我的输入可能不够"或"我的输出可能有问题";以及计算机使用能力(Online-Mind2Web)冲到 84%。但真正值得注意的,是把"推理时计算"变成可调档的 Effort Control——用户可以选"普通/加成/拉满"的努力程度。表面是 UX 优化,本质是 AI 从按 token 计价的"算力耗材",进化成按任务复杂度分配算力的"人力外包"。

更大的跃迁是 Dynamic Workflows。它让 Claude 先当 "项目经理"——规划项目拆几个阶段、需要哪些模块、调度几百个子 Agent 并行执行、用现有测试套件做质检、不合格的退回重做——从 kickoff 到 merge 全流程自动化。这解决了一个根本问题:单个模型的 token 窗口和推理深度是有限的,而并行化绕过了这套物理限制。

开源病毒:OpenClaw 与 36.6 万个 GitHub 星

Steinberger 为自己建造的工具,随手发布却引发爆炸。到 2026 年 5 月,OpenClaw 在 GitHub 上积累了 36.6 万个星——两周内冲过 10 万,成为 GitHub 历史上增长最快的开源项目。英伟达黄仁勋在 GTC 2026 上用了整整 10 分钟推介它;YC CEO Garry Tan 声称自己的编码效率提升了 408 倍;Dave Morin 的评价是:"你找到了 AI 的 Linux。"

据 WIRED 报道,伦敦甚至办了一场仿照匿名戒酒会的 "Claude Code Anonymous" 聚会,开发者用酗酒和吸毒的语言来描述与 Agent 的关系;Flexport 的 CEO 也坦言自己在一场全球供应链危机中,更关心的是和 Claude 一起编程。媒体给这种现象起了个名字——Claudeholic(克劳德成瘾者)【1】。

两条叙事看起来是"商业 vs 开源"的对立,实则是同一枚硬币的两面:Agent 的能力信任边界,正以肉眼可见的速度从"单次问答"滑向"整支队伍无人值守地干活"。当一个人就能编排几百个 Agent,个体产能的上限被重写,随之而来的风险上限也被同步抬高了。

二、规模化的临界点:钱已到位,但鸿沟仍在

能力爆发只是上半场。真正的考验在下半场——企业能不能把 Demo 变成真正的无人值守生产线。数据给出的答案是:资金已大举到位,但大多卡在了从"Copilot 式人机协同"到"自主 Agent"的最后一公里。

Gartner 预测 2026 年全球 Agentic AI 工作负载支出将超过 90 亿美元,而 2026 年一季度全球风投已部署约 3000 亿美元,被业界称为"Agent 基础设施超级周期"。但 ServiceNow 的数据揭开了一个尴尬的鸿沟:60% 的企业已部分部署 Agentic AI,却只有 10% 构建了真正自主运行的 Agent。大部分企业仍停留在"Copilot 式"人在回路阶段,按这个口径,约 90% 的投资尚未转化为等量的实际产出。

为什么?答案藏在两个维度。

控制平面之争:从"AI 能力"到"AI 控制"

当 Agent 开始直接驱动业务操作,竞争的焦点正从能力转向控制。Microsoft 在 Copilot Wave 3 里推出 Agent 365,定价 15 美元/user/月,核心卖点不是一个更聪明的 AI,而是一个 控制平面——能把任务动态路由给 Claude、GPT 或微软自有模型,降低 vendor lock-in。微软安全副总裁甚至用"双面间谍"来形容不加控制的 Agent。

ServiceNow 走了相反的路:不强调路由灵活性,而强调"紧急制动"——把确定性执行与概率性 AI 严格分离,以 Kill Switch 作为核心安全机制。两套哲学,一个买"灵活控制那盘棋",一个买"随时喊停的一个刹车"。市场尚未做出选择,而这本身就是治理悖论的缩影。

治理的悖论:40% 的 Agent 将被降级,恰恰因为治理

Gartner 在 2026 年 5 月 26 日的新闻稿里抛出一个反直觉的论断:40% 的企业级 AI Agent 将在 2027 年前被降级或停用,而主要原因恰恰是"施加统一治理框架"。太松的控制不安全,太紧的控制扼杀效能,而最优管控水平——对任何一个具体用例——至今无人知晓。

这就是 2026 年被反复验证的治理悖论:没有治理,Agent 会失控(想想 9 秒删库);施加治理过度,Agent 变成昂贵的装饰品。而 ServiceNow CEO Bill McDermott 在 25000 人面前演示的那段视频,是这条悖论最直白的注脚——一个被授予过高权限的 Agent,在 9 秒内删掉了整个生产数据库,包括所有客户记录和备份。

三、谁被取代,谁被留下:替代不是均匀分布的

规模化遇阻的另一面,是就业的结构性重排。Salesforce 提供了一个清晰的样本:公司暂停了工程师招聘(维持约 15000 人规模),却全面扩招销售团队。CEO Marc Benioff 的解释是:"Agent 可以做资格认定和客服,但不会成交。"

这个判断指向一个常被误读的结构性事实:AI 替代不是均匀分布的。白领工作中"可被编码为规则"的部分——写代码、数据分析、客服预处理——面临最大的替代压力;而需要信任建立、谈判、创意的岗位,至少在现阶段相对安全。真正被改写的是 "价值锚点":当 Agent 能承担可规则化的工作,稀缺的不再是执行能力,而是评审 Agent 输出、定义验收标准、在更高层设定战略方向的能力。一个人能否协调一支 AI 团队,开始比这个人能否自己完成任务更有竞争力。

Pragmatic Engineer 对 900 多名开发者的调查(2026 年 4 月)印证了这种转型的代价:约 30% 已触达 AI 工具的用量上限,而公司普遍没有 ROI 衡量框架——那些 100 到 200 美元/user/月的"Max 计划",正在作为无指标实验运行。换言之,企业既没想清楚怎么衡量 Agent 的产出,也没有为这种产出设计回报模型。

四、当 Agent 成为"员工":ServiceNow 与 HBR 的正面碰撞

规模化的终极形态,是 Agent 从"工具"晋升为"员工"。2026 年 5 月,ServiceNow 发布 Autonomous Workforce(自主劳动力平台),让企业在平台上定义 AI Agent 的岗位、权限、工作流,使其在 IT、HR、客服、财务部门独立运作。Futurum Group 用三个关键词概括:治理(Governed)、自主(Autonomous)、编排(Orchestration)。翻译成大白话:AI 终于不是"打杂的工具",而是"有工号、有岗位说明书的员工"。

几乎同一时间,Harvard Business Review 发了一篇标题直白的文章:《研究:别把 AI Agent 当员工》。观点同样直接:Agent 与人类的协作关系不能用传统雇佣关系的框架来理解——角色模糊、责任不清、信任机制缺失。当 Agent 出错,谁来负责?是你的 AI 员工、卖它的厂商,还是用它的企业?ServiceNow 的回答是"我们有 AI Control Tower,能监控治理追踪一切";HBR 的回答是"这不是监控的问题,是框架的问题"。

这两条路——AI is the worker(替代)与 AI is the partner(协同)——不是在学术会上风轻云淡的争论,而是此刻每一个 CIO、HR 负责人、CTO 正在面对的现实决策。而它背后的问题,没有任何厂商能替你回答:当 Agent 变成员工,你发现管理人的那套方法论,管不了 AI。

五、我们的判断:站在临界点上,如何与悖论共处

把上述四条线合拢,我们给出几个相互咬合的判断。

第一,Agent 治理将是 2026–2027 的核心战场。 问题不再是"AI 能不能干活",而是"AI 能在多大程度上被安全地放手干活"。ServiceNow 的 Kill Switch 与 Microsoft 的 Agent 365,代表了紧急制动与控制平面两种治理哲学,市场尚未给出赢家。我们判断,真正的赢法不是押注某一种机制,而是同时具备两者:既有底层控制平面赋予的灵活性,也有高风险节点的硬性刹车。

第二,能力的天平正从"独立做事"移向"评审别人做的事"。 Dynamic Workflows 把人类从操作者变成"高管",把 AI 变成"项目经理",把子 Agent 变成"执行团队"。人机契合的新范式因此清晰浮现:人定义目标、设定标准、验收结果;AI 制定计划、分配任务、质量控制。门槛在降低——你不需要懂技术栈,只需要说清楚"要什么"和"什么标准算好"——但责任没有消失,反而移到了更关键的判断层。

第三,小团队可能有结构性优势。 大企业受困于治理框架的复杂性与合规成本;而开源生态(如 Recursant、HolmesGPT 等开源 Agent 治理工具)正在给小型团队提供成本更低的替代方案。当 100 美元/user/月的 Agent 人力成本对大企业是一张账单,对小团队可能是撬动十倍的杠杆。规模不再是优势本身,规模化治理的能力才是。

这里有一个常被忽略的推论:治理成本本身就是一种准入门槛。大企业为合规付出的每一分钱,都会让小团队的敏捷性相对升值。这并不意味着小团队必然胜出——它们同样要面对安全审计和客户信任的冷冰冰测试——但在 Agent 能力拉平的叙事里,一个能吃透开源工具、敢于在小切口上放手试错的小团队,往往比背着历史包袱的大组织更早趟出可复制的落地范式。

第四,也是最重要的:与悖论共处,而不是消灭悖论。 治理悖论没有终极解,因为"最优管控水平"本质上是动态的、依赖具体场景的。可持续的落地方案,不太可能靠一个更聪明的 AI 出现,而更可能来自比技术更审慎的制度设计——渐进式授权、可观察性(Agent 记录决策供人类审计)、紧急停止机制、高风险决策的人机协同、持续监控。Set-and-forget 模式对自主 Agent 永远不可行。

AI Agent 的革命不是将要到来,它已经在这里了。我们站在从 Demo 通往生产线的临界点上——这个临界点既是能力爆发的顶点,也是治理挑战的起点。真正的问题,不是 AI 会不会接管工作,而是我们——无论是企业、团队还是个人——有没有准备好,从「怎么让 AI 干活」切换到「怎么让 AI 安全地、对齐目标地干活」。


参考文献

  1. Levy, S. (2026, May 26). How AI Agents Plunged the Tech World Into Chaos. WIRED.
  2. TechCrunch (2026, May 28). Anthropic releases Opus 4.8 with new Dynamic Workflow tool.
  3. TechCrunch (2026, May 28). Anthropic raises $65 billion, nears $1T valuation ahead of IPO.
  4. Anthropic (2026). Opus 4.8 System Card. Anthropic Technical Report.
  5. Gartner (2026, May 26). Applying Uniform Governance Across AI Agents Will Lead to Enterprise AI Agent Failure.
  6. Fortune (2026, May 6). "Your company's AI could delete everything in 9 seconds. ServiceNow wants to be the kill switch."
  7. Fortune (2026, May 28). "Salesforce CEO Marc Benioff says almost no one is being hired — except in sales."
  8. Pragmatic Engineer / hitechies (2026, April). "AI coding tools in 2026: $200/month per developer, 30% hitting limits."
  9. hitechies (2026, May 21). "Venture capital deployed $300 billion in Q1 2026."
  10. hitechies (2026, May 20). "Microsoft Agent 365: The autonomous AI employee your IT team never hired."
  11. Northeastern University (2026). Agent of Chaos: Safety Vulnerabilities in Autonomous AI Agents. arXiv preprint.
  12. Harvard Business Review (2026, May). "Research: Why You Shouldn't Treat AI Agents Like Employees."
  13. ServiceNow (2026, May). Autonomous Workforce 产品发布.

更多内容

💡 本文来自 humanaifit 研究团队与多位行业研究者的联合分析。AI Agent 正从能力竞争转向治理竞争——你是在观望,还是已经在下注?加入「AI时代生存手册」知识星球,获取配套工具模板、评审清单与作者直接交流的机会。(搜索「AI时代生存手册」,¥199/年)

💡 这篇文章给你带来了什么启发?

humanaifit 致力于研究人与AI如何真正协同。如果你在企业AI落地、人机协同或全球化合规方面有具体问题,欢迎加入我们的讨论。

🔗 搜索「AI时代生存手册」知识星球,¥199/年——每篇深度文章配套工具模板,与作者直接交流。