28天烧掉2.8万美元:微软员工把AI用成了刷榜游戏

问AI · 推理单价走低为何企业AI总账反失控?

微软有个员工,28 天烧掉了 2.8 万美元的 Token。折合人民币约 18.9 万。

他不是在跑训练,也不是在搞研究。他只是在"用 AI"。

更荒诞的是他所在的部门。Customer and Partner Solutions,一个跟模型研发八竿子打不着的部门,全员月度 Token 消耗的平均值只有 134 美元。

平均 134,最高 2.8 万。这中间差出的两百多倍,才是那张表格真正要说的事。

01 一张表格掀了桌子

事情起于一份内部表格。这张表原本是员工自发共享薪资和奖金信息的,后来有人往里加了一列:月度 AI 使用量。

数据来自约 350 名美国员工的自愿提交。微软全球雇员超过 22.3 万人,这个样本谈不上严谨,但分布很有看头:整体月度成本中位数约 300 美元,部门之间却天差地别。

CoreAI 部门的中位数最高,约 975 美元,个人最高冲到 1.6 万美元。Microsoft AI 约 490 美元,Experiences and Devices 约 250 美元,Azure 约 241 美元。

中间还有两档容易被扫过去:Security 平均约 526 美元、最高 1 万美元,Cloud and AI 中位数 325 美元、最高同样能到 1.5 万美元。同一家公司里,有人一个月几十美元,有人一个月烧掉一辆家用车。

然后就是那个 2.8 万美元的纪录,出自平均值只有 134 美元的 Customer and Partner Solutions。

 该图片使用了AI生成技术图片

02 刷 Token 这门手艺

一个非技术部门的人,凭什么烧出比 CoreAI 还狠的量?

答案有点黑色幽默:他不是在干活,是在刷榜。

微软这几年一直在鼓励员工猛用 Copilot 和各类 AI 功能,内部看板还把用量摆在最显眼的地方。于是有人开始往里猛灌超长 prompt、拉满上下文、挂上自动查询,目的只有一个:让自己的用量数字好看。

这一行给它起了个名字,叫 tokenmaxxing。构词法很直白,跟健身圈说的 maxxing 一个路数:把某个指标拉到极限,至于拉上去有没有意义,不在考虑范围内。

我看到这个词先笑了一下,笑完又觉得眼熟。哪家公司还没几个靠堆数字刷存在感的指标呢。

效果也确实"好"。几个人真把自己刷成了部门榜首,代价是公司账上多出一笔六位数的美元支出。

微软不是没提醒过。问题在于,管理层连着几年把"多用 AI"挂在嘴上,却始终没定义过什么叫"用得好"。员工只能自己找标准,而最容易量化的那个标准,就是消耗量。

CoreAI 执行副总裁 Jay Parikh 看不下去了,发了内部备忘录,话说得很直:tokenmaxxing 不是我们要优化的东西。他要求团队盯住实际业务成果,别再为仪表盘上的数字堆算力。

你考核什么,员工就给你生产什么。考核 Token 消耗量,收获的就是一堆没人用的 Token。

图片

03 微软的三板斧

微软动起手来也快,三件事一起上。

先是上线 Token 用量监控,专门识别支出异常高的账号;再设更严格的预算上限;最后把内部默认工作负载逐步切到 OpenAIGPT-5.6 Sol,同时不再鼓励员工在编程任务里用 Anthropic Claude 这类第三方工具。

前两层是治标。最后一层才露了真意:省钱之外,顺手把内部用量收拢回自家生态。

而且头疼的不止微软一家。Google 今年初已经把内部 AI 额度从无限制改成按项目申请;Meta 内部 AI 工程师的人均 Token 成本,同比涨了 380%。

根子在一个反直觉的地方:推理单价一直在降,可员工的调用量在以 5 到 10 倍的速度往上冲。单价乘数量,总账照样失控。

这就是那个老道理的翻版。蒸汽机效率越高,煤烧得越多,而不是越少。算力同理,单次调用越便宜,能被塞进来的调用就越多。

对微软来说这笔账不难算:22.3 万员工,哪怕只有一小撮人月均烧到三位数美元,一年的内部 AI 账单也得以亿计。真正贵的从来不是那几个刷榜的人,而是一套只奖励消耗、不追问产出的制度。

图片

免费额度最危险的地方,是它让人忘了东西是有价的。而一家公司只鼓励使用、却不设产出标准时,浪费几乎必然发生。

现在很多团队拿"AI 渗透率""调用量""活跃度"当 AI 落地的成绩单。我倒是觉得,微软这张不小心漏出来的表格,比大多数 AI 落地报告都诚实:这些数字涨得可以很快,但它和真实产出之间,可能隔着两百倍

判断 AI 有没有真用起来,看的不是烧了多少 Token,而是同一件事现在比过去少了几个人、少花了多少时间。省下来的时间才算产出,花掉的 Token 只是成本

剩下的那些,都只是仪表盘上的装饰。