当KPI杀死AI价值:亚马逊员工'Tokenmaxxing'事件的系统分析
一场由KPI引发的AI闹剧
亚马逊员工发明了一个新词:tokenmaxxing。它的意思是给AI分配毫无价值的任务,仅仅为了消耗更多Token、在内部排行榜上刷排名。
事情的起因是这样的:亚马逊在公司内部推广了一款名为MeshClaw的AI Agent工具(灵感来自2026年2月爆火的开源项目OpenClaw),同时引入了AI使用的KPI考核——要求80%以上的开发者每周使用AI,并在内部排行榜上追踪Token消耗量。
结果毫不意外:员工开始给AI派无意义任务。一位员工对FT坦言:"有些人就是通过MeshClaw最大化他们的Token使用量。"另一位说:"当管理者开始追踪使用量,就会产生扭曲的激励。而且有些人特别有竞争意识。"
亚马逊高管Dave Treadwell说了一句精准的概括:"不要为了用AI而去用AI。"但当领导层同时在追踪Token消耗、设定激进的采纳目标时,员工听到的是另一种声音。
三重激励错配
考核层的错配
为什么选Token消耗作为指标?因为它可量化、客观、容易上排行榜。但可量化不等于可衡量——AI输出的"价值"本质上很难度量。当组织选择度量活动而不是成果时,它实际上在告诉员工:我们真正在意的是什么。
亚马逊说Token不计入绩效评估,但员工报告管理者在追踪这些数据。这种官方声明与实际行为之间的差距,无论真实还是感知到的,都会催生策略性行为。
成本层的错配
Agentic AI比传统AI贵得多。根据Tom's Hardware的报道,一个Agentic任务的Token消耗是标准AI交互的50到1000倍。复杂的多步推理、工具调用、上下文窗口管理都推高了成本。
问题在于成本不可见——员工完全不知道自己的Token消耗对公司的成本意味着什么。对他们而言,这是免费资源——为什么不多用?当亚马逊2026年预计资本开支约2000亿美元、大部分投向AI和数据中心时,管理层需要看到回报的压力巨大——但把这种压力通过活动指标传导到一线员工身上,是错误的方式。
信任层的错配
官方说Token不算绩效,但管理者在看。这种差距——无论是真实的还是感知的——都在催生玩世不恭的员工心态。员工学会了一个教训:官方声明可以安全忽略,真正重要的是管理者实际看什么。
这不是亚马逊独有的问题,但它在AI时代被放大了——因为AI的度量比传统软件使用更复杂,Token的"成本"完全不透明,而Agent的自主行为又让管理者感到有必要监督到每一个细节。
Goodhart's Law的AI版教科书案例
"当一个指标成为目标,它就不再是一个好指标。"——Charles Goodhart的这句话,在亚马逊的tokenmaxxing事件中被完美验证。
Campbell's Law进一步指出:量化社会指标用于社会决策的程度越高,它就越容易受到压力扭曲,从而扭曲它原本要监督的社会过程。
历史上有无数先例:苏联的钉子工厂(按数量奖励→生产无用的小钉子,按重量奖励→生产巨大的单根钉子),教育领域的标准化考试(教学生考试),医疗系统的候诊时间指标(先登记再让病人继续等)。亚马逊的tokenmaxxing不过是这个长名单上的最新条目。
这不是亚马逊一家的事
Meta员工同样在tokenmaxxing。微软报告Agentic AI成本在多个企业部署中爆炸式增长。Tom's Hardware将这一现象定性为重大科技公司的"AI成本危机"。
核心矛盾:Agentic AI确实带来了生产力提升,但其成本结构是传统企业预算体系无法应对的。当一次AI辅助的代码迁移可能消耗数百万美元的算力时,衡量ROI的问题就变得关乎企业生存。
重新设计AI采纳指标
不要度量这些
- Token消耗量/API调用次数
- 单纯的用户使用频次
- 没有上下文的功能采纳率
应该度量这些
- 任务完成率:AI是否帮助达成了预期结果?
- 单任务节省时间:净生产力提升
- 错误率变化:AI是减少了还是引入了错误?
- 用户满意度:交互后的NPS型调查
- 每有效任务成本:Token成本÷成功完成的任务数
- 技能成长:员工是否在使用AI过程中变得更好?
人机契合成熟度模型
| 级别 | 描述 | 风险 |
|---|---|---|
| 1 - 随机采纳 | 用AI因为能用。没有策略,没有指标。 | 混乱、资源浪费 |
| 2 - 指标驱动 | 用AI因为被考核使用量(当前陷阱) | Tokenmaxxing、刷数据、玩世不恭 |
| 3 - 价值驱动 | 在AI能创造可衡量价值的地方使用 | 度量复杂性 |
| 4 - 优化协同 | 人与AI发挥各自优势 | 需要组织成熟度 |
给企业的建议
- 预算感知型AI治理:给团队Token预算而不是使用量目标。资源有限时,团队自然会优化价值。
- 价值指标优先:把AI采纳与业务成果挂钩——收入影响、客户满意度、运营效率——而不是活动次数。
- 成本透明化:让员工看到AI推理的真实成本。知道自己的Token消耗相当于一顿团餐的开销后,行为会改变。
- 信任架构:让官方政策与实际管理行为一致。员工非常擅长发现虚伪,而虚伪会摧毁负责任使用AI所需的文化。
- 激励设计是伦理选择:选择追踪哪些指标,是AI治理中的伦理决策。每个指标体系都在激励某些行为、抑制另一些行为。
结语
亚马逊的tokenmaxxing事件是一面镜子,照出了企业AI落地的普遍困境。真正的AI成熟度,不是用得多,而是用得对。在你部署AI排行榜之前,先问自己:你真正在激励的是什么行为?
参考文献
- Ars Technica / Financial Times. (2026, May 12). Amazon employees are tokenmaxxing due to pressure to use AI tools.
- Tom's Hardware. (2026, May 23). AI cost crisis hits tech giants as employee tokenmaxxing backfires.
- Hacker News. Amazon employees tokenmaxxing discussion. https://news.ycombinator.com/item?id=48110529
- Goodhart's Law. Wikipedia.
- Campbell's Law. Wikipedia.
💡 这篇文章给你带来了什么启发?
humanaifit 致力于研究人与AI如何真正协同。如果你在企业AI落地、人机协同或全球化合规方面有具体问题,欢迎加入我们的讨论。
🔗 搜索「AI时代生存手册」知识星球,¥199/年——每篇深度文章配套工具模板,与作者直接交流。