Token 账单到期:行业应对 AI 成本失控

内容管家 AI领域评论8字数 1961阅读6分32秒阅读模式
Token 账单到期:行业应对 AI 成本失控

企业 AI 支出失控:预算烧穿、工具停用、监督&管理空白

科技行业正在经历一场 AI 支出的清算时刻。

多家企业已触及红线。 据 TechCrunch 报道,Uber 在今年 4 月就用完了 2026 年全部 AI 编程预算。微软在向开发者开放 Claude Code 许可证仅数月后,便撤销了相关授权。Priceline 一名员工透露,Cursor 常规续费的价格涨幅达到此前的 4~5 倍。

尽管 Token 单价持续下降,但企业大规模采用 AI、以及 AI 自主代理(Agent)能力的增强,使得 Token 消耗量不减反增。2025 年初大量企业签下的「无限畅用」订阅,正在变成一笔糊涂账——没人知道钱花在了哪里,更不清楚如何收回成本。

从「能做什么」到「钱花哪了」

OpenAI 企业业务负责人 Alexander Embricos 在纽约一场活动中对 TechCrunch 表示:「半年前,客户聊的是'这东西能做到吗?够不够好?'现在完全不同了——他们问的是:'我们花太多了,你们能提供多少可见性?可审计性如何?Token 管控有什么方案?模型效率怎么样?'」 这一转变的背景是:2025 年 11 月 Anthropic 推出 Claude Opus 4.5、OpenAI 发布 GPT-5.1、Google 上线 Gemini 3 Pro,这些模型显著提升了 AI 代理能力,却也带来了消耗量的急剧膨胀。

有公司据报道因忘记为员工设置使用限额,最终收到了 5 亿美元的 Claude 账单。

Priceline IT 财务高级总监 Chris Reed 将此形容为「可卡因式上瘾」:「他们让你免费试用,等你依赖了,就再也离不开了。」该公司已开始对特定团队实施 Token 限额管控。

工程运营平台 Faros AI CEO Vitaly Gordon 分享了一个更极端的案例:某公司 CTO 告诉他,「我手下有个工程师上个月花了 4 万美元的 Token,我真心不知道该阻止他还是让其他人向他学习。」

效率悖论:用量涨 18 倍,产出却没有等比提升

Jellyfish 研究主管 Nicholas Arcolano 指出,AI 支出激增的核心驱动力是代理功能的普及——每位开发者的 Token 消耗量在 9 个月内增长了约 18.6 倍。Faros 3 月对 2 万名开发者的调查显示:产出确实在上升,但 Bug 和返工量也在同步增加。Jellyfish 自身数据表明,Token 用量最高的工程师生产力约为基础水平的 2 倍,但他们消耗的 Token 数量是普通工程师的 10 倍

Arcolano 直言:「巨额支出是否值得,最终取决于已交付代码的商业价值(比如收入),而大多数企业仍然无法有效衡量这一点。」 更棘手的是数据规模本身。FinOps Foundation 执行董事 J.R. Storment 打了个比方:「追踪云成本是每月数亿行数据的问题;追踪 Token 成本则是每月数万亿行数据的问题。你没法把这些塞进电子表格,甚至普通工具都承载不了——你必须从根本上重新思考工具、规格和核算体系。」 Priceline 的 Reed 已发现数据对不上的情况——供应商报告的使用量与企业内部记录存在差异。他表示:「我从电信费用管理做起,现在看到的剧本完全一样——从电信到云再到 AI,每次新技术出现,都会伴随计费错误、审计和优化机会。」

解决方案市场崛起:FinOps 之后,Tokenomics 上场

Linux Foundation 本周宣布成立 Tokenomics Foundation,旨在将 FinOps 对云成本的管控方法论引入 AI Token 领域。

Storment 透露:「今年 4、5 月,我开始听到企业说:'天哪,我们 2026 年全年 Token 预算已经超了 3 倍——而现在才 4 月。'整个对话从'Token 最大化'变成了'我们得设置护栏,怎么控制这东西?'」 一批创业公司和传统厂商正在抢占这个新赛道:

  • Pay-iPaid:专注追踪、测量和优化 GenAI 投资成本与性能
  • JellyfishWaydevFaros AI:提供 AI 代理监控,证明开发者工具的投资回报率
  • Ramp 上线 AI 支出管理功能;DatadogNew Relic 新增云成本管理、Token 级可观测性、GPU 监控等服务
  • 企业级 SaaS 厂商 Factory 本周推出模型路由器,可自动为每项任务分配合适的模型

NEA 合伙人 Tiffany Luck 预计,Token 效率和可观测性能力将逐渐被整合进「工具链或应用层」。下周 FinOps X 大会上,AWS 预计也将发布面向企业 AI 支出的财务管理新功能。

FinOps Foundation 旗下 180 家供应商多数已向该领域倾斜——云成本管控的故事,正在 AI 时代重演。

Gordon 预计,前沿实验室和其他模型提供商将逐步采用类似 OpenRouter 的成本优化策略,将查询请求导向最便宜的模型——这一趋势已经在企业级 Claude 账单中有所体现。

"你的 Anthropic 账单显示花了多少钱,即使你调用的是 Opus 模型,部分支出其实流向了 Sonnet 或 Haiku,因为它们足够'聪明'能承接这部分任务,"Gordon 表示,"我认为这会变得越来越普遍。"

省钱秘诀:大模型"套壳"调用渐成主流

当前,企业在使用大模型时面临一个普遍困境:旗舰模型能力最强,但成本也最高。为了控制支出,越来越多的企业开始采用"智能路由"策略——先用便宜的小模型处理简单请求,只在必要时才调用贵价大模型。这套逻辑本质上是让模型自己判断哪些任务该用什么规格来处理。

Tokenomics Foundation:AI 计费标准呼之欲出

问题在于,这一切都是在缺乏通用语言和统一定义的环境下进行的——Token 的成本如何计算、产出如何衡量、不同厂商之间的支出如何对比,都缺乏共识。

Tokenomics Foundation 试图改变这一现状。该组织正在推进三件事:

  • 标准定义:为"Token 经济"建立权威框架
  • 开放规范:制定 AI Token 使用与计量的技术规格和指标
  • 新度量体系:引入成本-智能比(cost-per-intelligence)、每瓦 Token 数(tokens-per-watt)等新指标,衡量 Token 工厂效率和消耗效率

该组织计划于今年 7 月正式发布,并将在下周 FinOps X 大会上公布更多成员。

Salesforce 首席可用性官 Nishant Gupta 在声明中指出:"Token 经济本质比以往任何大规模管理的领域都更抽象、更不透明。它需要行业构建一套全新的运营能力,而不是照搬当年云时代的打法。" 高盛预计,到 2030 年全球 Token 使用量将增长 24 倍。对于已经超支的企业而言,需求迫在眉睫,但该基金会推出的首个成果仍需数月才能落地。

"也许我们造出了蒸汽机,但还没搞懂流水线,"Gordon 如此形容。

行业共识:让"沉默的大多数"从低频迈向中频

Arcolano 认为,明智的策略是大范围、适度地推广 AI 应用。

"最好的 ROI 来自推动'沉默的大多数'从低频使用走向中频使用,而不是逼迫高频用户进一步提高用量,"他表示。

延伸阅读

 
内容管家

发表评论