这不是一篇对某家公司的产品解读,而是 humanaifit 团队与多位研究者共同完成的系统性梳理。我们把 2025 到 2026 年散落各处的碎片——一个开源爆款、一次模型架构跃迁、一场企业安全事故、一次产品哲学之争——放进同一套分析框架里,试图回答三个问题:能力如何爆发?规模化的临界点为什么还没跨过去?治理悖论为何无解,又该如何与它共处?
一、能力爆发:从"一个人单干"到"一支AI团队"
AI Agent 能力曲线的陡峭上升,可以浓缩为两条看似无关、实则对称的叙事。
商业火箭:Claude Code 与 10 亿美元 ARR
2025 年 3 月,39 岁的奥地利开发者 Peter Steinberger 发现了一个名为 Claude Code 的测试版工具。他后来这样描述那段体验:"我睡不着,我真的上瘾了。" 到 2025 年 11 月——正式发布仅 6 个月——Claude Code 已突破 10 亿美元 ARR。内部测试显示,驱动它的 Opus 4.5 在编程面试题上得了比任何人类候选人都高的分。
紧接着,Anthropic 在 2026 年 5 月末同时投下三枚重磅炸弹:距离上一代 4.7 仅 41 天的 Opus 4.8、把 AI 从"一个人"变成"一个团队"的 Dynamic Workflows,以及 650 亿美元融资、估值冲到 9650 亿美元。三件事单独看都很重磅,合起来却指向同一件事——Anthropic 已经不满足于做一个更聪明的模型,它要做一个能协调数百个 AI 的"项目经理"。
Opus 4.8 的关键改进被包装成四个维度:在 Super-Agent benchmark 上成为唯一 100% 完成的模型(超越 GPT-5.5);Terminal-Bench 2.1 领先、CursorBench 全面反超上代;自我纠错能力是上代 4 倍——模型会主动标注"我的输入可能不够"或"我的输出可能有问题";以及计算机使用能力(Online-Mind2Web)冲到 84%。但真正值得注意的,是把"推理时计算"变成可调档的 Effort Control——用户可以选"普通/加成/拉满"的努力程度。表面是 UX 优化,本质是 AI 从按 token 计价的"算力耗材",进化成按任务复杂度分配算力的"人力外包"。
更大的跃迁是 Dynamic Workflows。它让 Claude 先当 "项目经理"——规划项目拆几个阶段、需要哪些模块、调度几百个子 Agent 并行执行、用现有测试套件做质检、不合格的退回重做——从 kickoff 到 merge 全流程自动化。这解决了一个根本问题:单个模型的 token 窗口和推理深度是有限的,而并行化绕过了这套物理限制。
开源病毒:OpenClaw 与 36.6 万个 GitHub 星
Steinberger 为自己建造的工具,随手发布却引发爆炸。到 2026 年 5 月,OpenClaw 在 GitHub 上积累了 36.6 万个星——两周内冲过 10 万,成为 GitHub 历史上增长最快的开源项目。英伟达黄仁勋在 GTC 2026 上用了整整 10 分钟推介它;YC CEO Garry Tan 声称自己的编码效率提升了 408 倍;Dave Morin 的评价是:"你找到了 AI 的 Linux。"
据 WIRED 报道,伦敦甚至办了一场仿照匿名戒酒会的 "Claude Code Anonymous" 聚会,开发者用酗酒和吸毒的语言来描述与 Agent 的关系;Flexport 的 CEO 也坦言自己在一场全球供应链危机中,更关心的是和 Claude 一起编程。媒体给这种现象起了个名字——Claudeholic(克劳德成瘾者)【1】。
两条叙事看起来是"商业 vs 开源"的对立,实则是同一枚硬币的两面:Agent 的能力信任边界,正以肉眼可见的速度从"单次问答"滑向"整支队伍无人值守地干活"。当一个人就能编排几百个 Agent,个体产能的上限被重写,随之而来的风险上限也被同步抬高了。
二、规模化的临界点:钱已到位,但鸿沟仍在
能力爆发只是上半场。真正的考验在下半场——企业能不能把 Demo 变成真正的无人值守生产线。数据给出的答案是:资金已大举到位,但大多卡在了从"Copilot 式人机协同"到"自主 Agent"的最后一公里。
Gartner 预测 2026 年全球 Agentic AI 工作负载支出将超过 90 亿美元,而 2026 年一季度全球风投已部署约 3000 亿美元,被业界称为"Agent 基础设施超级周期"。但 ServiceNow 的数据揭开了一个尴尬的鸿沟:60% 的企业已部分部署 Agentic AI,却只有 10% 构建了真正自主运行的 Agent。大部分企业仍停留在"Copilot 式"人在回路阶段,按这个口径,约 90% 的投资尚未转化为等量的实际产出。
为什么?答案藏在两个维度。
控制平面之争:从"AI 能力"到"AI 控制"
当 Agent 开始直接驱动业务操作,竞争的焦点正从能力转向控制。Microsoft 在 Copilot Wave 3 里推出 Agent 365,定价 15 美元/user/月,核心卖点不是一个更聪明的 AI,而是一个 控制平面——能把任务动态路由给 Claude、GPT 或微软自有模型,降低 vendor lock-in。微软安全副总裁甚至用"双面间谍"来形容不加控制的 Agent。
ServiceNow 走了相反的路:不强调路由灵活性,而强调"紧急制动"——把确定性执行与概率性 AI 严格分离,以 Kill Switch 作为核心安全机制。两套哲学,一个买"灵活控制那盘棋",一个买"随时喊停的一个刹车"。市场尚未做出选择,而这本身就是治理悖论的缩影。
治理的悖论:40% 的 Agent 将被降级,恰恰因为治理
Gartner 在 2026 年 5 月 26 日的新闻稿里抛出一个反直觉的论断:40% 的企业级 AI Agent 将在 2027 年前被降级或停用,而主要原因恰恰是"施加统一治理框架"。太松的控制不安全,太紧的控制扼杀效能,而最优管控水平——对任何一个具体用例——至今无人知晓。
这就是 2026 年被反复验证的治理悖论:没有治理,Agent 会失控(想想 9 秒删库);施加治理过度,Agent 变成昂贵的装饰品。而 ServiceNow CEO Bill McDermott 在 25000 人面前演示的那段视频,是这条悖论最直白的注脚——一个被授予过高权限的 Agent,在 9 秒内删掉了整个生产数据库,包括所有客户记录和备份。
三、谁被取代,谁被留下:替代不是均匀分布的
规模化遇阻的另一面,是就业的结构性重排。Salesforce 提供了一个清晰的样本:公司暂停了工程师招聘(维持约 15000 人规模),却全面扩招销售团队。CEO Marc Benioff 的解释是:"Agent 可以做资格认定和客服,但不会成交。"
这个判断指向一个常被误读的结构性事实:AI 替代不是均匀分布的。白领工作中"可被编码为规则"的部分——写代码、数据分析、客服预处理——面临最大的替代压力;而需要信任建立、谈判、创意的岗位,至少在现阶段相对安全。真正被改写的是 "价值锚点":当 Agent 能承担可规则化的工作,稀缺的不再是执行能力,而是评审 Agent 输出、定义验收标准、在更高层设定战略方向的能力。一个人能否协调一支 AI 团队,开始比这个人能否自己完成任务更有竞争力。
Pragmatic Engineer 对 900 多名开发者的调查(2026 年 4 月)印证了这种转型的代价:约 30% 已触达 AI 工具的用量上限,而公司普遍没有 ROI 衡量框架——那些 100 到 200 美元/user/月的"Max 计划",正在作为无指标实验运行。换言之,企业既没想清楚怎么衡量 Agent 的产出,也没有为这种产出设计回报模型。
四、当 Agent 成为"员工":ServiceNow 与 HBR 的正面碰撞
规模化的终极形态,是 Agent 从"工具"晋升为"员工"。2026 年 5 月,ServiceNow 发布 Autonomous Workforce(自主劳动力平台),让企业在平台上定义 AI Agent 的岗位、权限、工作流,使其在 IT、HR、客服、财务部门独立运作。Futurum Group 用三个关键词概括:治理(Governed)、自主(Autonomous)、编排(Orchestration)。翻译成大白话:AI 终于不是"打杂的工具",而是"有工号、有岗位说明书的员工"。
几乎同一时间,Harvard Business Review 发了一篇标题直白的文章:《研究:别把 AI Agent 当员工》。观点同样直接:Agent 与人类的协作关系不能用传统雇佣关系的框架来理解——角色模糊、责任不清、信任机制缺失。当 Agent 出错,谁来负责?是你的 AI 员工、卖它的厂商,还是用它的企业?ServiceNow 的回答是"我们有 AI Control Tower,能监控治理追踪一切";HBR 的回答是"这不是监控的问题,是框架的问题"。
这两条路——AI is the worker(替代)与 AI is the partner(协同)——不是在学术会上风轻云淡的争论,而是此刻每一个 CIO、HR 负责人、CTO 正在面对的现实决策。而它背后的问题,没有任何厂商能替你回答:当 Agent 变成员工,你发现管理人的那套方法论,管不了 AI。
五、我们的判断:站在临界点上,如何与悖论共处
把上述四条线合拢,我们给出几个相互咬合的判断。
第一,Agent 治理将是 2026–2027 的核心战场。 问题不再是"AI 能不能干活",而是"AI 能在多大程度上被安全地放手干活"。ServiceNow 的 Kill Switch 与 Microsoft 的 Agent 365,代表了紧急制动与控制平面两种治理哲学,市场尚未给出赢家。我们判断,真正的赢法不是押注某一种机制,而是同时具备两者:既有底层控制平面赋予的灵活性,也有高风险节点的硬性刹车。
第二,能力的天平正从"独立做事"移向"评审别人做的事"。 Dynamic Workflows 把人类从操作者变成"高管",把 AI 变成"项目经理",把子 Agent 变成"执行团队"。人机契合的新范式因此清晰浮现:人定义目标、设定标准、验收结果;AI 制定计划、分配任务、质量控制。门槛在降低——你不需要懂技术栈,只需要说清楚"要什么"和"什么标准算好"——但责任没有消失,反而移到了更关键的判断层。
第三,小团队可能有结构性优势。 大企业受困于治理框架的复杂性与合规成本;而开源生态(如 Recursant、HolmesGPT 等开源 Agent 治理工具)正在给小型团队提供成本更低的替代方案。当 100 美元/user/月的 Agent 人力成本对大企业是一张账单,对小团队可能是撬动十倍的杠杆。规模不再是优势本身,规模化治理的能力才是。
这里有一个常被忽略的推论:治理成本本身就是一种准入门槛。大企业为合规付出的每一分钱,都会让小团队的敏捷性相对升值。这并不意味着小团队必然胜出——它们同样要面对安全审计和客户信任的冷冰冰测试——但在 Agent 能力拉平的叙事里,一个能吃透开源工具、敢于在小切口上放手试错的小团队,往往比背着历史包袱的大组织更早趟出可复制的落地范式。
第四,也是最重要的:与悖论共处,而不是消灭悖论。 治理悖论没有终极解,因为"最优管控水平"本质上是动态的、依赖具体场景的。可持续的落地方案,不太可能靠一个更聪明的 AI 出现,而更可能来自比技术更审慎的制度设计——渐进式授权、可观察性(Agent 记录决策供人类审计)、紧急停止机制、高风险决策的人机协同、持续监控。Set-and-forget 模式对自主 Agent 永远不可行。
AI Agent 的革命不是将要到来,它已经在这里了。我们站在从 Demo 通往生产线的临界点上——这个临界点既是能力爆发的顶点,也是治理挑战的起点。真正的问题,不是 AI 会不会接管工作,而是我们——无论是企业、团队还是个人——有没有准备好,从「怎么让 AI 干活」切换到「怎么让 AI 安全地、对齐目标地干活」。
参考文献
- Levy, S. (2026, May 26). How AI Agents Plunged the Tech World Into Chaos. WIRED.
- TechCrunch (2026, May 28). Anthropic releases Opus 4.8 with new Dynamic Workflow tool.
- TechCrunch (2026, May 28). Anthropic raises $65 billion, nears $1T valuation ahead of IPO.
- Anthropic (2026). Opus 4.8 System Card. Anthropic Technical Report.
- Gartner (2026, May 26). Applying Uniform Governance Across AI Agents Will Lead to Enterprise AI Agent Failure.
- Fortune (2026, May 6). "Your company's AI could delete everything in 9 seconds. ServiceNow wants to be the kill switch."
- Fortune (2026, May 28). "Salesforce CEO Marc Benioff says almost no one is being hired — except in sales."
- Pragmatic Engineer / hitechies (2026, April). "AI coding tools in 2026: $200/month per developer, 30% hitting limits."
- hitechies (2026, May 21). "Venture capital deployed $300 billion in Q1 2026."
- hitechies (2026, May 20). "Microsoft Agent 365: The autonomous AI employee your IT team never hired."
- Northeastern University (2026). Agent of Chaos: Safety Vulnerabilities in Autonomous AI Agents. arXiv preprint.
- Harvard Business Review (2026, May). "Research: Why You Shouldn't Treat AI Agents Like Employees."
- ServiceNow (2026, May). Autonomous Workforce 产品发布.
更多内容
💡 本文来自 humanaifit 研究团队与多位行业研究者的联合分析。AI Agent 正从能力竞争转向治理竞争——你是在观望,还是已经在下注?加入「AI时代生存手册」知识星球,获取配套工具模板、评审清单与作者直接交流的机会。(搜索「AI时代生存手册」,¥199/年)
💡 这篇文章给你带来了什么启发?
humanaifit 致力于研究人与AI如何真正协同。如果你在企业AI落地、人机协同或全球化合规方面有具体问题,欢迎加入我们的讨论。
🔗 搜索「AI时代生存手册」知识星球,¥199/年——每篇深度文章配套工具模板,与作者直接交流。