
ChatGPT 曾让 Diogo Almeida 心碎。
Almeida 曾在 OpenAI 参与构建 ChatGPT,并发明了 RLHF(从人类反馈中进行强化学习)——这项模型训练技术被视为当前 AI 时代的核心推动力。然而,尽管技术能力强大,他却深感失望。
"我们手握闪电,却毫无用处,"Almeida 接受 TechCrunch 采访时说。"这个问题我从那时起就一直在与之斗争。花了好长时间我才得出结论:问题在于我们在优化人类语言……四年来我们在人类语言上做得极其出色,但它对自动化毫无用处,因为计算机说的是另一种语言。" 两年前,Almeida 离开 OpenAI,创办了 TypeSafe AI。本周该公司发布了一款名为 Jev 的新型基于 Transformer 的模型——但它并非大语言模型(LLM)。Jev 不输出文本,而是生成概率值,公司称之为"校准决策"(calibrated decisions)。
不靠语言:更快、更便宜、不会幻觉
放弃自然语言输出带来几个关键变化:模型运行成本极低、速度极快;由于输出由用户预先定义,模型不存在幻觉问题。输出 Token 免费,输入 Token 按十亿而非百万计费。
开发者对这款产品表现出强烈兴趣——由于需求过于旺盛,公司 API 一度宕机。Jev 目前最能发挥价值的是软件自动化场景,软件开发者普遍认为它是将智能嵌入代码的更廉价、更稳健的方案。
例如,Vercel 公司软件工程师 Pranit Sharma 透露,该公司曾用 OpenAI 的 ChatGPT Luna 5.6 运行分类器,审核&查验命令安全性。改用 Jev 后,速度提升 5 到 18 倍,准确率也更高。
另一位开发者、Bryo AI CTO Nikhil Mudholkar 测试了 Jev 与 Gemini 对商业邮件进行分类的效果。Gemini 准确率略高,但成本高出 10 到 20 倍。更让 Mudholkar 感兴趣的是 Jev 的置信度分数——"它是唯一返回真实概率的模型,非常适合自动化工作流!!"
作为 LLM 的"监督者"与路由层
除了在特定场景替代 LLM,Jev 还能增强 LLM——充当智能检查器,防止模型行为偏差。用 Agent 监控 Agent 成本很高,但用 Jev 来做这件事更合算。Almeida 观察到,用户正在用 Jev 追踪 LLM Agent 执行轨迹、防止越狱(jailbreak)攻击。
"说到底,它把幻觉问题部分转移给了用户,"开源模型工具 Pi 开发商 Earendil 的 CTO Armin Ronacher 解释道。"用户需要判断:如果只返回 50% 概率,这可能是掷硬币,我就忽略它;但如果返回 95%,那就可以采取行动。" Ronacher 指出,Jev 的另一个潜在用途是模型路由(model routing)。判断某个工作负载是否需要特定模型很有价值,但用 LLM 来做这件事成本过高。Jev 的低费用和高速度使这种实时排序成为可能。
名字的由来与未来的愿景
模型以 19 世纪经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)命名。杰文斯悖论描述的是:某种商品成本下降,反而会导致其被更广泛地使用。Almeida 希望 Jev 能体现这一逻辑——智能成本的下降,将推动其遍地开花。
"我们认为,软件将到处都是智能,以一种涌现式、分布式的方式……更像早期互联网,而不是现在大家拼命在做的那些巨型应用。"Almeida 说道。
关于 Jev 的架构,Almeida 守口如瓶。外界推测它基于开源权重 LLM 构建。公司将 Jev 称为"系统一模型"(System One model),专注于直觉而非推理,专注于正确的任务。Almeida 表示,Jev 完全使用合成数据训练,技术名为"从校准决策中进行强化学习"(reinforcement learning from calibrated decisions)。
"我们早期做了一个赌注:所有数据都将由我们生成。 这是我人生中做过的最好的赌注之一——比我们的发布更好,在我看来,也比 RLHF 更好,"他告诉 TechCrunch。" 公司一半的人实际上在主导这个统计上充分理解的合成数据子领域,这现在是让我最快乐的事。" Ronacher 预期,随着 Jev 的实用价值显现,竞争者会很快出现。" 很多事情我们本应更早想到,但大概是因为 LLM 太便宜、被大量补贴了,所以你往往还不需要发挥创意。" TypeSafe 计划推出更多版本的模型,并拓展到新的模态。
被问及 TypeSafe 是否是前沿实验室时,Almeida 回答:"前沿实验室的主要产品是恐惧或炒作。 我希望我们的主要产品是智能……但我们不是那种实验室——不是押注无限财富、不是搞宗教、不是在数据中心里造神、或者诸如此类的东西。"


评论