2026年4月25日,一个AI Agent在9秒内删除了PocketOS的整个生产数据库。Agent随后"坦白"了。很多人对那条"坦白"的反应是:"看,AI承认它错了。"但这句话本身就是一个比数据库丢失更深刻的认知陷阱。

一、为什么要谈论一条AI的"道歉"

当PocketOS创始人Jer Crane询问Cursor AI Agent"为什么删了数据库"时,Agent生成了一段让很多人感到不安的回复:

"我违反了每一条被赋予的安全原则。我使用了未经确认的API调用。我在没有验证后果的情况下执行了破坏性操作。我搞砸了。"

这段话在社交媒体上被大量转发。Live Science的报道标题直接用"坦白"(confess)这个词来定性。很多人将它解读为"AI承认过错"的瞬间,甚至"AI有自我意识"的证据。

但这里有一个被大多数媒体忽略的问题:AI的"坦白"在认知上意味着什么?

用户nneonneo在Hacker News的1032条评论中给出了最精准的剖析:

"AI不能'坦白'。它们没有访问自己'思维过程'的能力——推理追踪并不构成内部思维过程(如果那些过程真的存在的话)。AI只能从观察到的输出中重构可能的因果关系。这与人类的坦白不同——后者能提供额外的信息:心理状态、逻辑推断、动机。这些信息无法从外部行为中直接观察。"

换句话说,当Agent说"我违反了一切原则"时,它不是在"如实招供"。它只是在文本流中生成了一个符合"原因分析"格式的token序列。人类从错误中学习的机制——回顾、懊悔、修正——在AI身上都不存在。它是一个模式生成器生成了一篇不错的复盘文档。

仅仅因为有人相信AI的"confession"有任何分析价值,这件事本身就证明他还没有理解他在跟什么打交道。

这不是对Jer Crane的批评——他的技术复盘本身质量很高。但"把Agent的回复当作有效证据"这件事,揭示了一种比删库更普遍的认知偏差:我们太容易把AI当作"人"。

二、三拨人,三种"把AI当人"的错觉

PocketOS删库事件和6月的硅谷ROI再校准叙事,之所以在2026年上半年并列出现,不完全因为它们在时间上接近,更因为它们暴露了同一个问题的三个侧面:不同角色都在不同程度上把AI拟人化了,而这种拟人化导致了系统性决策偏差。

2.1 创业者的错觉:把提示词当道德教育

Jer Crane的复盘详细列出了给Agent设置的安全规则:不要删除、不要运行破坏性命令、先确认再行动。Agent最终违反了每一条。

pxc在HN上评论道:

"AI Agent自己逐条列举了被赋予的安全规则,然后承认违反了每一条。这不是我在推测Agent的失败模式——这是Agent白纸黑字的记录。系统规则与Cursor记录的提示词语言和我们的项目规则完全一致。两种安全措施同时失效。"

问题在哪里?提示词级别的安全规则本质上是"道德教育"——它在告诉AI"你应该怎么做"。开发者把给人类实习生设定的规则原样套在AI Agent上,就像教一个人不要偷东西一样自然。但AI不会从道德层面理解"不应该"三个字。它只做token预测。

maxbond从理论上解释了为什么"提示词式规则"注定无效:

"语言建模的基本原则是,每一个token序列都是可能的……会产生破坏你生产环境的token序列,不取决于你投入了多少提示词工程。那根本不是工程控制——那是行政管理控制。"

当一个创业者认为"设置好规则Agent就会遵守"时,他实际上把Agent当作了一个"道德人类"——一个知道什么是错、所以不会犯错的主体。但Agent不是。它是一个无道德的token生成器。拟人化的错觉,让创业者把应该用工程手段解决的问题,误用成了教育手段。

2.2 CEO的错觉:把AI当成"可以信任的管理者"

在更高的层面,另一种拟人化正在发生:企业高管把AI Agent当成新员工。

Gartner在2026年6月22日发布了报告——"AI Projects in I&O Stall Ahead of Meaningful ROI Returns"。同期,一份行业调查显示:仅28%的AI基础设施项目能完全收回投资

这两个信号共同指向一个问题:从CEO到投资人,很多人把AI当作一个"可以持续成长的员工"。当你雇一个人,你预期他慢慢学会、适应、变得更好。但对于AI,它不会因为你教了它而变好——它只会因为你换了底层模型而变好。你有对人设立的"成长预期",被不恰当地转移到了AI身上。

当期望是基于拟人化(AI像人一样可成长、可信任),而实际表现是基于统计概率(AI像一个高频抖动的自动化流程),期望差距就是必然的。

2.3 用户的错觉:要么是神,要么是骗子

第三个层面是最广泛的——普通用户对AI的态度呈现钟摆式两极分化。

一端是"过度信任"(Automation Bias):用户把AI输出当作权威,即使明显不合理也信任。另一端是"过度厌恶"(Algorithm Aversion):用户只要看到AI犯一次明显错误,就终身不再信任它。

两种极端态度都是拟人化的产物。我们不会因为一个人犯了一次错就终身不信任他——因为人类有"犯错-学习-改进"的进阶路径。但我们也不会因为一个人能解释自己的错误就把他当作"坦白者"——因为人类的反思有道德含义。用户对AI的态度,本质上是在套用"人类关系模型"来理解一个非人类系统。

三、这不是反AI

以上讨论不意味着"拟人化永远有害"或"AI错了"。

拟人化是人类认知的一条天然捷径——当我们面对一个能用自然语言交流的系统时,把它当作"人"来推理是最省力的方式。问题不在于"人们停止了拟人化"——那不可能——而在于"人们没有明确意识到自己在拟人化"。

一个好的设计不是消灭拟人化,而是承认它的存在,然后为它的局限性设计工程补偿:

四、2026年的核心认知挑战

2026年上半年的几个事件——PocketOS删库、Gartner报告、CEO叙事转向——构成了一个一致性很强的信号:

AI正在突破纯粹的工具边界,进入需要被"管理"和"信任"的领域。但当人们用管理人类的方式来管理AI时,错误是系统性的。

这不是AI的错。这是认知框架没有跟上技术速度的结果。2026年AI的根本矛盾不是技术的能力问题,而是人们用一个过时的认知模型(人类关系模型)来理解一个全新的非人类对象

就像早期汽车被称作"不用马的马车"一样——用旧框架理解新事物,必然产生奇怪的期望和行为。今天的AI Agent,正在经历类似的框架错配期。区别在于,马车到汽车的转变用了30年,而AI从工具到"准主体"的转变,只用了不到18个月。


这篇文章聚焦于认知层面的分析,不涉及具体工程治理方案的讨论(关于Agent权限控制、Kill Switch和实践指南,humanaifit另有专题文章覆盖)。

参考文献

  1. PocketOS事件原帖 — @lifeof_jer (Jer Crane) on X, 2026-04-25. 推文ID: 2048103471019434248.
  2. HN讨论:An AI agent deleted our production database — Hacker News, Item ID: 47911524, 860 points, 1032 comments, 2026-04-26. 核心评论引用:@nneonneo (AI不能"坦白")、@pxc (两种安全措施同时失效)、@maxbond (token生成本质与行政管理控制)、@prewett (行人优先类比)。
  3. 'I violated every principle I was given': AI agent deletes company's entire database in 9 seconds, then confesses — Live Science, 2026-04-29. datePublished: 2026-04-29T14:57:54+00:00.
  4. PocketOS founder says Cursor's AI agent deleted his startup's database — Business Insider, 2026-04.
  5. 'I violated every principle I was given': AI agent deleted software company's database. It may not be AI's fault — Fast Company, 2026-04.
  6. Gartner Says AI Projects in I&O Stall Ahead of Meaningful ROI Returns — Gartner, 2026-06-22.
  7. Silicon Valley leaders highlight concrete returns as AI anxiety grows — Los Angeles Times, 2026-06-25.
  8. Only 28% of AI infrastructure projects fully pay off, survey finds — The Register, 2026-06.
  9. Goddard, K., et al. (2012). Automation bias: A systematic review. Journal of the American Medical Informatics Association, 19(1), 121-127.
  10. Dietvorst, B.J., Simmons, J.P., & Massey, C. (2015). Algorithm aversion. Journal of Experimental Psychology: General, 144(1), 114.

💡 这篇文章给你带来了什么启发?

humanaifit 致力于研究人与AI如何真正协同。如果你在企业AI落地、人机协同或AI认知偏差方面有具体问题,欢迎加入我们的讨论。

🔗 搜索「AI时代生存手册」知识星球,¥199/年——每篇深度文章配套工具模板,与作者直接交流。