
AI 行业正站在一个关键转折点。多年来,「更大的模型意味着更强的能力」几乎是行业公理,各家公司争相训练和部署最前沿的模型。但现在,成本压力之下,这个逻辑开始动摇。
成本压力倒逼模型选择转向
Coinbase 联合创始人 Brian Armstrong 近期在 X 上给出了一个大胆预测:
「智能需求近乎无限,但 12-18 个月内,80% 的工作负载将跑在便宜 99% 的模型上。仍有 20% 的工作负载需要最新一代模型——那些需要『智商拉满』的场景。」
如果这一预测成真,对 AI 行业将是地震级的变化。长期以来,大多数 AI 公司竞争的核心是质量,而质量往往等同于「用最先进的模型」。一旦同等质量可以用更便宜的模型实现,AI 的经济逻辑将被彻底改写。
更关键的是,如果用户大规模迁移至低价模型,省下的钱将直接来自大厂的口袋——正值 OpenAI 和 Anthropic 筹备 IPO 之际,这无异于给它们一记财务重击。
便宜模型真的能顶用吗?
初步测试表明,在系统设计得当的情况下,低价模型完全可以替代顶级模型,且不影响输出质量。
法律 AI 工具 Harvey 近期与推理平台 Fireworks AI 合作测试:他们将 Claude Opus 与 Fireworks 的 GLM 5.1 组合,仅在最耗算力的任务上调用 Opus,最终将推理成本降低了 3 倍,且质量未降。
Harvey 联合创始人 Gabe Pereyra 对 TechCrunch 表示:「质量永远是第一位的,法律领域尤其如此。但质量的定义正在变化——从『什么任务都用最强模型』转向『用能最高效得出正确答案的模型』。」
真正的分野不是「开源 vs 闭源」
这场变革常被描述为大厂闭源模型与中国模型/开源权重模型之间的竞争,但这其实掩盖了更核心的问题。
真正的分野是:大模型 vs 小模型。
从 GPT-5.5 切到 DeepSeek V4 Flash 能省钱,但从 GPT-5.4-mini 入手同样有效。价格战正在大厂自有推理服务与独立托管的开源模型之间激烈展开,至于哪种小模型最终胜出,对这个宏观趋势而言并不重要。
这与过去几年「规模优先」(Scaling First)的行业主流思路背道而驰。受「苦涩的教训」(The Bitter Lesson)启发,各实验室一直在拼命训练算力密集型模型、不断突破 AI 能力边界。在投资者补贴丰厚的时候,用户没有理由不选最先进的选项。
行业影响仍不确定
Token 价格持续上涨、补贴力度减弱,用户正首次面临真正的成本压力。但这种压力是否会真正推动企业转向小模型,还是未知数——它们完全可能通过减少调用次数、缩短上下文、放弃最不靠谱的部署项目来省钱。
不过,如果事实证明大多数场景完全可以用更小的模型跑通,那对推理需求的增长预期将被泼一盆冷水,前沿模型训练成本的合理性也将受到更多质疑。


评论