科技公司能否接受更便宜的 AI 模型?

内容管家 AI领域评论19字数 881阅读2分56秒阅读模式
科技公司能否接受更便宜的 AI 模型?

AI 行业正站在一个关键转折点。多年来,「更大的模型意味着更强的能力」几乎是行业公理,各家公司争相训练和部署最前沿的模型。但现在,成本压力之下,这个逻辑开始动摇。

成本压力倒逼模型选择转向

Coinbase 联合创始人 Brian Armstrong 近期在 X 上给出了一个大胆预测:

「智能需求近乎无限,但 12-18 个月内,80% 的工作负载将跑在便宜 99% 的模型上。仍有 20% 的工作负载需要最新一代模型——那些需要『智商拉满』的场景。」

如果这一预测成真,对 AI 行业将是地震级的变化。长期以来,大多数 AI 公司竞争的核心是质量,而质量往往等同于「用最先进的模型」。一旦同等质量可以用更便宜的模型实现,AI 的经济逻辑将被彻底改写。

更关键的是,如果用户大规模迁移至低价模型,省下的钱将直接来自大厂的口袋——正值 OpenAI 和 Anthropic 筹备 IPO 之际,这无异于给它们一记财务重击。

便宜模型真的能顶用吗?

初步测试表明,在系统设计得当的情况下,低价模型完全可以替代顶级模型,且不影响输出质量。

法律 AI 工具 Harvey 近期与推理平台 Fireworks AI 合作测试:他们将 Claude Opus 与 Fireworks 的 GLM 5.1 组合,仅在最耗算力的任务上调用 Opus,最终将推理成本降低了 3 倍,且质量未降

Harvey 联合创始人 Gabe Pereyra 对 TechCrunch 表示:「质量永远是第一位的,法律领域尤其如此。但质量的定义正在变化——从『什么任务都用最强模型』转向『用能最高效得出正确答案的模型』。」

真正的分野不是「开源 vs 闭源」

这场变革常被描述为大厂闭源模型与中国模型/开源权重模型之间的竞争,但这其实掩盖了更核心的问题。

真正的分野是:大模型 vs 小模型

从 GPT-5.5 切到 DeepSeek V4 Flash 能省钱,但从 GPT-5.4-mini 入手同样有效。价格战正在大厂自有推理服务与独立托管的开源模型之间激烈展开,至于哪种小模型最终胜出,对这个宏观趋势而言并不重要。

这与过去几年「规模优先」(Scaling First)的行业主流思路背道而驰。受「苦涩的教训」(The Bitter Lesson)启发,各实验室一直在拼命训练算力密集型模型、不断突破 AI 能力边界。在投资者补贴丰厚的时候,用户没有理由不选最先进的选项。

行业影响仍不确定

Token 价格持续上涨、补贴力度减弱,用户正首次面临真正的成本压力。但这种压力是否会真正推动企业转向小模型,还是未知数——它们完全可能通过减少调用次数、缩短上下文、放弃最不靠谱的部署项目来省钱。

不过,如果事实证明大多数场景完全可以用更小的模型跑通,那对推理需求的增长预期将被泼一盆冷水,前沿模型训练成本的合理性也将受到更多质疑。

延伸阅读

 
内容管家

发表评论