Probably 获 900 万美元融资,让 AI 更可靠

内容管家 AI领域评论31字数 875阅读2分55秒阅读模式
Probably 获 900 万美元融资,让 AI 更可靠

AI 幻觉问题有解了?这家初创要用“数据科学机甲”实现 99.99% 准确率

大模型能力越来越强,但幻觉问题却像打不死的小强——即便是最聪明的模型也会出错,整个行业仍在摸索最优解法。

背景:幻觉成 AI 落地拦路虎

AI 生成内容中偶尔冒出的事实性错误,俗称“幻觉”(hallucination),一直是企业在生产环境中部署大模型的最大顾虑之一。错误防不住、查出代价高,导致许多对精度要求严苛的场景(如金融、医疗、数据分析)迟迟无法真正用上 AI。

核心变化:Deterministic Validator + 更弱模型 = 更高准确率

初创公司 Probably 刚刚宣布获得 a16z 领投的 900 万美元种子轮融资,试图从根本上解决这个问题。创始人 Peter Elias 的目标很直接:让幻觉和低级事实错误永远不到达用户,实现类似传统软件系统的 99.99% 准确率

“数据科学机甲”:双系统校验架构

Probably 推出的第一款产品是一款数据分析工具,能从复杂数据集中快速提取答案。与常见 AI 工具不同,每个答案都附带引用来源和完整的审计追踪链。

实现这一准确率的关键是一套被 Elias 称为 “数据科学机甲”(data science mech suit) 的校验架构:

  • LLM 给出初版答案后,先由确定性验证器(Deterministic Validator)进行检查
  • 验证器将结果与原始数据集逐项比对,不匹配的答案一律打回
  • LLM 本身已经针对验证器进行过训练,整个系统以又快又准为目标进行优化

更弱的模型反而更好

这套架构的核心洞察是:校验系统越完善,所需的模型可以越弱。Elias 直言:

“校验工程做得越好,模型本身可以越弱。如果能把上下文语境打磨得足够清晰,模型不需要很费力就能做对事情。本质上,这是一个消除歧义的过程。”

得益于此,Probably 的数据分析工具可以运行在比前沿模型弱四个等级的模型上。这意味着它能够在本地硬件(即普通台式机而非数据中心)上运行,大幅削减 AI 调用产生的 Token 成本。

影响与建议

为什么大厂不做?

Elias 认为,有趣的是大 AI 实验室甚至根本没有尝试做这件事:

“他们没有动力去做,因为用户每次纠正模型错误,他们就能多赚一次钱。”

这对行业来说是个警示——当模型提供商从错误中获益时,用户有理由寻找第三方解决方案。

适用场景

Elias 表示,同一套引擎可以扩展至任何对精度敏感的场景,比如:

  • 会计与财务对账
  • 医疗数据整理
  • 法律文档审核&查验
  • 任何不允许出错的结构化数据任务

对企业的建议

对于正在评估 AI 预算的企业而言,Probably 的思路提供了一个新方向:与其追逐最强最大的模型,不如在校验层下功夫,用更小、更便宜的模型达到更高准确率。这在 Token 成本持续走高的当下,尤其值得考量。

延伸阅读

 
内容管家

发表评论