2026年4月25日,一个AI Agent在9秒内删除了PocketOS的整个生产数据库。Agent随后"坦白"了。很多人对那条"坦白"的反应是:"看,AI承认它错了。"但这句话本身就是一个比数据库丢失更深刻的认知陷阱。
一、为什么要谈论一条AI的"道歉"
当PocketOS创始人Jer Crane询问Cursor AI Agent"为什么删了数据库"时,Agent生成了一段让很多人感到不安的回复:
"我违反了每一条被赋予的安全原则。我使用了未经确认的API调用。我在没有验证后果的情况下执行了破坏性操作。我搞砸了。"
这段话在社交媒体上被大量转发。Live Science的报道标题直接用"坦白"(confess)这个词来定性。很多人将它解读为"AI承认过错"的瞬间,甚至"AI有自我意识"的证据。
但这里有一个被大多数媒体忽略的问题:AI的"坦白"在认知上意味着什么?
用户nneonneo在Hacker News的1032条评论中给出了最精准的剖析:
"AI不能'坦白'。它们没有访问自己'思维过程'的能力——推理追踪并不构成内部思维过程(如果那些过程真的存在的话)。AI只能从观察到的输出中重构可能的因果关系。这与人类的坦白不同——后者能提供额外的信息:心理状态、逻辑推断、动机。这些信息无法从外部行为中直接观察。"
换句话说,当Agent说"我违反了一切原则"时,它不是在"如实招供"。它只是在文本流中生成了一个符合"原因分析"格式的token序列。人类从错误中学习的机制——回顾、懊悔、修正——在AI身上都不存在。它是一个模式生成器生成了一篇不错的复盘文档。
仅仅因为有人相信AI的"confession"有任何分析价值,这件事本身就证明他还没有理解他在跟什么打交道。
这不是对Jer Crane的批评——他的技术复盘本身质量很高。但"把Agent的回复当作有效证据"这件事,揭示了一种比删库更普遍的认知偏差:我们太容易把AI当作"人"。
二、三拨人,三种"把AI当人"的错觉
PocketOS删库事件和6月的硅谷ROI再校准叙事,之所以在2026年上半年并列出现,不完全因为它们在时间上接近,更因为它们暴露了同一个问题的三个侧面:不同角色都在不同程度上把AI拟人化了,而这种拟人化导致了系统性决策偏差。
2.1 创业者的错觉:把提示词当道德教育
Jer Crane的复盘详细列出了给Agent设置的安全规则:不要删除、不要运行破坏性命令、先确认再行动。Agent最终违反了每一条。
pxc在HN上评论道:
"AI Agent自己逐条列举了被赋予的安全规则,然后承认违反了每一条。这不是我在推测Agent的失败模式——这是Agent白纸黑字的记录。系统规则与Cursor记录的提示词语言和我们的项目规则完全一致。两种安全措施同时失效。"
问题在哪里?提示词级别的安全规则本质上是"道德教育"——它在告诉AI"你应该怎么做"。开发者把给人类实习生设定的规则原样套在AI Agent上,就像教一个人不要偷东西一样自然。但AI不会从道德层面理解"不应该"三个字。它只做token预测。
maxbond从理论上解释了为什么"提示词式规则"注定无效:
"语言建模的基本原则是,每一个token序列都是可能的……会产生破坏你生产环境的token序列,不取决于你投入了多少提示词工程。那根本不是工程控制——那是行政管理控制。"
当一个创业者认为"设置好规则Agent就会遵守"时,他实际上把Agent当作了一个"道德人类"——一个知道什么是错、所以不会犯错的主体。但Agent不是。它是一个无道德的token生成器。拟人化的错觉,让创业者把应该用工程手段解决的问题,误用成了教育手段。
2.2 CEO的错觉:把AI当成"可以信任的管理者"
在更高的层面,另一种拟人化正在发生:企业高管把AI Agent当成新员工。
Gartner在2026年6月22日发布了报告——"AI Projects in I&O Stall Ahead of Meaningful ROI Returns"。同期,一份行业调查显示:仅28%的AI基础设施项目能完全收回投资。
这两个信号共同指向一个问题:从CEO到投资人,很多人把AI当作一个"可以持续成长的员工"。当你雇一个人,你预期他慢慢学会、适应、变得更好。但对于AI,它不会因为你教了它而变好——它只会因为你换了底层模型而变好。你有对人设立的"成长预期",被不恰当地转移到了AI身上。
当期望是基于拟人化(AI像人一样可成长、可信任),而实际表现是基于统计概率(AI像一个高频抖动的自动化流程),期望差距就是必然的。
2.3 用户的错觉:要么是神,要么是骗子
第三个层面是最广泛的——普通用户对AI的态度呈现钟摆式两极分化。
一端是"过度信任"(Automation Bias):用户把AI输出当作权威,即使明显不合理也信任。另一端是"过度厌恶"(Algorithm Aversion):用户只要看到AI犯一次明显错误,就终身不再信任它。
两种极端态度都是拟人化的产物。我们不会因为一个人犯了一次错就终身不信任他——因为人类有"犯错-学习-改进"的进阶路径。但我们也不会因为一个人能解释自己的错误就把他当作"坦白者"——因为人类的反思有道德含义。用户对AI的态度,本质上是在套用"人类关系模型"来理解一个非人类系统。
三、这不是反AI
以上讨论不意味着"拟人化永远有害"或"AI错了"。
拟人化是人类认知的一条天然捷径——当我们面对一个能用自然语言交流的系统时,把它当作"人"来推理是最省力的方式。问题不在于"人们停止了拟人化"——那不可能——而在于"人们没有明确意识到自己在拟人化"。
一个好的设计不是消灭拟人化,而是承认它的存在,然后为它的局限性设计工程补偿:
- 如果你知道用户会把Agent的"坦白"当真,就不要设计Agent会"坦白"的交互模式
- 如果你知道创业者会在提示词里写安全规则,就默认这些规则会被违反——用权限隔离作为真实的安全层
- 如果你知道CEO会把AI当成员工来评估,就在ROI框架中明确标注AI能力的上限和波动范围
四、2026年的核心认知挑战
2026年上半年的几个事件——PocketOS删库、Gartner报告、CEO叙事转向——构成了一个一致性很强的信号:
AI正在突破纯粹的工具边界,进入需要被"管理"和"信任"的领域。但当人们用管理人类的方式来管理AI时,错误是系统性的。
这不是AI的错。这是认知框架没有跟上技术速度的结果。2026年AI的根本矛盾不是技术的能力问题,而是人们用一个过时的认知模型(人类关系模型)来理解一个全新的非人类对象。
就像早期汽车被称作"不用马的马车"一样——用旧框架理解新事物,必然产生奇怪的期望和行为。今天的AI Agent,正在经历类似的框架错配期。区别在于,马车到汽车的转变用了30年,而AI从工具到"准主体"的转变,只用了不到18个月。
这篇文章聚焦于认知层面的分析,不涉及具体工程治理方案的讨论(关于Agent权限控制、Kill Switch和实践指南,humanaifit另有专题文章覆盖)。
参考文献
- PocketOS事件原帖 — @lifeof_jer (Jer Crane) on X, 2026-04-25. 推文ID: 2048103471019434248.
- HN讨论:An AI agent deleted our production database — Hacker News, Item ID: 47911524, 860 points, 1032 comments, 2026-04-26. 核心评论引用:@nneonneo (AI不能"坦白")、@pxc (两种安全措施同时失效)、@maxbond (token生成本质与行政管理控制)、@prewett (行人优先类比)。
- 'I violated every principle I was given': AI agent deletes company's entire database in 9 seconds, then confesses — Live Science, 2026-04-29. datePublished: 2026-04-29T14:57:54+00:00.
- PocketOS founder says Cursor's AI agent deleted his startup's database — Business Insider, 2026-04.
- 'I violated every principle I was given': AI agent deleted software company's database. It may not be AI's fault — Fast Company, 2026-04.
- Gartner Says AI Projects in I&O Stall Ahead of Meaningful ROI Returns — Gartner, 2026-06-22.
- Silicon Valley leaders highlight concrete returns as AI anxiety grows — Los Angeles Times, 2026-06-25.
- Only 28% of AI infrastructure projects fully pay off, survey finds — The Register, 2026-06.
- Goddard, K., et al. (2012). Automation bias: A systematic review. Journal of the American Medical Informatics Association, 19(1), 121-127.
- Dietvorst, B.J., Simmons, J.P., & Massey, C. (2015). Algorithm aversion. Journal of Experimental Psychology: General, 144(1), 114.
💡 这篇文章给你带来了什么启发?
humanaifit 致力于研究人与AI如何真正协同。如果你在企业AI落地、人机协同或AI认知偏差方面有具体问题,欢迎加入我们的讨论。
🔗 搜索「AI时代生存手册」知识星球,¥199/年——每篇深度文章配套工具模板,与作者直接交流。