
PrismML 是一家尚未引起广泛关注的 AI 实验室,但它值得你留意——不是因为融资金额惊人(目前仅完成 2225 万美元种子轮),而是因为其背后的技术团队和正在开发的、可能改变行业格局的技术。
小模型也能做推理
PrismML 押注的方向是:高性能推理大模型并不需要做得很大。这家公司的目标是让推理模型小到能运行在普通 PC 和智能手机上。目前甚至有传闻称其正与 Apple 洽谈合作,不过 CEO Babak Hassibi 未就此置评。
上周四,PrismML 发布了 Bonsai 2 27B,这是一款模型家族的最新成员。它将阿里开源的 Qwen3.8 27B 压缩至 5.9 GB——小到足以装进 PC,甚至高端智能手机。内存占用缩减至原来的 1/9 至 1/10。
压缩技术靠什么
PrismML 采用的压缩技术名为"三值权重"(ternary weights)。大模型的"权重"本质上是训练过程中学习并存储的信息,通常每个权重需要 16 个比特。PrismML 将其简化为三个值:+1、−1 或 0。由于每个权重存储的数值大幅缩小,模型体积也随之剧减。
技术背景方面,PrismML 成立于加州理工学院(Caltech),由 Caltech 教授、压缩技术专家 Hassibi 领衔。顾问团队包括 Databricks 联合创始人、Berkeley Sky Computing Lab 主管 Ion Stoica。该实验室已孵化出 Letta、SGLang 等多项技术和初创公司。投资方包括 Khosla Ventures、Cerberus Capital 和 Caltech。
性能损失几乎可忽略
Hassibi 表示,PrismML 的压缩技术独特之处在于,压缩后的 LLM 与原版相比性能几乎无损。Bonsai 2 在 Qwen 聚合基准测试中达到原版 98% 的分数,而几个月前(今年 3 月)发布的初代 Bonsai 为 95%。初版模型已累计下载超过 1100 万次,更小尺寸的模型另有 260 万次下载。
是否能达到 100% 基准性能对齐?Hassibi 认为压缩多少会带来影响,但这个目标本身更偏学术意义——毕竟 LLM 本身并非完美,基准测试也未必完全反映实际任务表现,2% 的差距在实际使用中影响有限。此外,模型运行所依赖的软件环境(harness)对最终准确性同样至关重要。
更大的模型在路上
PrismML 的下一步计划是将压缩技术应用于更大参数的模型。"我们接下来发布的模型有望在几个月内推出,参数规模将达到数千亿级别,我认为在这些大模型上保持智能会更容易。"Hassibi 告诉 TechCrunch。他补充说,模型越大,可以压缩的空间越多,越有可能保持 100% 的智能水平。
Stoica 则看好这项技术让先进模型能够在用户设备上运行的价值:"智能将触手可及,而且免费——因为它就运行在你已经购买的设备上。同时也更隐私,因为你不需要把数据上传到云端。"


评论