当KPI杀死AI价值:亚马逊员工'Tokenmaxxing'事件的系统分析

一场由KPI引发的AI闹剧

亚马逊员工发明了一个新词:tokenmaxxing。它的意思是给AI分配毫无价值的任务,仅仅为了消耗更多Token、在内部排行榜上刷排名。

事情的起因是这样的:亚马逊在公司内部推广了一款名为MeshClaw的AI Agent工具(灵感来自2026年2月爆火的开源项目OpenClaw),同时引入了AI使用的KPI考核——要求80%以上的开发者每周使用AI,并在内部排行榜上追踪Token消耗量。

结果毫不意外:员工开始给AI派无意义任务。一位员工对FT坦言:"有些人就是通过MeshClaw最大化他们的Token使用量。"另一位说:"当管理者开始追踪使用量,就会产生扭曲的激励。而且有些人特别有竞争意识。"

亚马逊高管Dave Treadwell说了一句精准的概括:"不要为了用AI而去用AI。"但当领导层同时在追踪Token消耗、设定激进的采纳目标时,员工听到的是另一种声音。

三重激励错配

考核层的错配

为什么选Token消耗作为指标?因为它可量化、客观、容易上排行榜。但可量化不等于可衡量——AI输出的"价值"本质上很难度量。当组织选择度量活动而不是成果时,它实际上在告诉员工:我们真正在意的是什么。

亚马逊说Token不计入绩效评估,但员工报告管理者在追踪这些数据。这种官方声明与实际行为之间的差距,无论真实还是感知到的,都会催生策略性行为。

成本层的错配

Agentic AI比传统AI贵得多。根据Tom's Hardware的报道,一个Agentic任务的Token消耗是标准AI交互的50到1000倍。复杂的多步推理、工具调用、上下文窗口管理都推高了成本。

问题在于成本不可见——员工完全不知道自己的Token消耗对公司的成本意味着什么。对他们而言,这是免费资源——为什么不多用?当亚马逊2026年预计资本开支约2000亿美元、大部分投向AI和数据中心时,管理层需要看到回报的压力巨大——但把这种压力通过活动指标传导到一线员工身上,是错误的方式。

信任层的错配

官方说Token不算绩效,但管理者在看。这种差距——无论是真实的还是感知的——都在催生玩世不恭的员工心态。员工学会了一个教训:官方声明可以安全忽略,真正重要的是管理者实际看什么。

这不是亚马逊独有的问题,但它在AI时代被放大了——因为AI的度量比传统软件使用更复杂,Token的"成本"完全不透明,而Agent的自主行为又让管理者感到有必要监督到每一个细节。

Goodhart's Law的AI版教科书案例

"当一个指标成为目标,它就不再是一个好指标。"——Charles Goodhart的这句话,在亚马逊的tokenmaxxing事件中被完美验证。

Campbell's Law进一步指出:量化社会指标用于社会决策的程度越高,它就越容易受到压力扭曲,从而扭曲它原本要监督的社会过程。

历史上有无数先例:苏联的钉子工厂(按数量奖励→生产无用的小钉子,按重量奖励→生产巨大的单根钉子),教育领域的标准化考试(教学生考试),医疗系统的候诊时间指标(先登记再让病人继续等)。亚马逊的tokenmaxxing不过是这个长名单上的最新条目。

这不是亚马逊一家的事

Meta员工同样在tokenmaxxing。微软报告Agentic AI成本在多个企业部署中爆炸式增长。Tom's Hardware将这一现象定性为重大科技公司的"AI成本危机"。

核心矛盾:Agentic AI确实带来了生产力提升,但其成本结构是传统企业预算体系无法应对的。当一次AI辅助的代码迁移可能消耗数百万美元的算力时,衡量ROI的问题就变得关乎企业生存。

重新设计AI采纳指标

不要度量这些

应该度量这些

人机契合成熟度模型

级别描述风险
1 - 随机采纳用AI因为能用。没有策略,没有指标。混乱、资源浪费
2 - 指标驱动用AI因为被考核使用量(当前陷阱)Tokenmaxxing、刷数据、玩世不恭
3 - 价值驱动在AI能创造可衡量价值的地方使用度量复杂性
4 - 优化协同人与AI发挥各自优势需要组织成熟度

给企业的建议

  1. 预算感知型AI治理:给团队Token预算而不是使用量目标。资源有限时,团队自然会优化价值。
  2. 价值指标优先:把AI采纳与业务成果挂钩——收入影响、客户满意度、运营效率——而不是活动次数。
  3. 成本透明化:让员工看到AI推理的真实成本。知道自己的Token消耗相当于一顿团餐的开销后,行为会改变。
  4. 信任架构:让官方政策与实际管理行为一致。员工非常擅长发现虚伪,而虚伪会摧毁负责任使用AI所需的文化。
  5. 激励设计是伦理选择:选择追踪哪些指标,是AI治理中的伦理决策。每个指标体系都在激励某些行为、抑制另一些行为。

结语

亚马逊的tokenmaxxing事件是一面镜子,照出了企业AI落地的普遍困境。真正的AI成熟度,不是用得多,而是用得对。在你部署AI排行榜之前,先问自己:你真正在激励的是什么行为?


参考文献

  1. Ars Technica / Financial Times. (2026, May 12). Amazon employees are tokenmaxxing due to pressure to use AI tools.
  2. Tom's Hardware. (2026, May 23). AI cost crisis hits tech giants as employee tokenmaxxing backfires.
  3. Hacker News. Amazon employees tokenmaxxing discussion. https://news.ycombinator.com/item?id=48110529
  4. Goodhart's Law. Wikipedia.
  5. Campbell's Law. Wikipedia.

💡 这篇文章给你带来了什么启发?

humanaifit 致力于研究人与AI如何真正协同。如果你在企业AI落地、人机协同或全球化合规方面有具体问题,欢迎加入我们的讨论。

🔗 搜索「AI时代生存手册」知识星球,¥199/年——每篇深度文章配套工具模板,与作者直接交流。