
AI 幻觉问题有解了?这家初创要用“数据科学机甲”实现 99.99% 准确率
大模型能力越来越强,但幻觉问题却像打不死的小强——即便是最聪明的模型也会出错,整个行业仍在摸索最优解法。
背景:幻觉成 AI 落地拦路虎
AI 生成内容中偶尔冒出的事实性错误,俗称“幻觉”(hallucination),一直是企业在生产环境中部署大模型的最大顾虑之一。错误防不住、查出代价高,导致许多对精度要求严苛的场景(如金融、医疗、数据分析)迟迟无法真正用上 AI。
核心变化:Deterministic Validator + 更弱模型 = 更高准确率
初创公司 Probably 刚刚宣布获得 a16z 领投的 900 万美元种子轮融资,试图从根本上解决这个问题。创始人 Peter Elias 的目标很直接:让幻觉和低级事实错误永远不到达用户,实现类似传统软件系统的 99.99% 准确率。
“数据科学机甲”:双系统校验架构
Probably 推出的第一款产品是一款数据分析工具,能从复杂数据集中快速提取答案。与常见 AI 工具不同,每个答案都附带引用来源和完整的审计追踪链。
实现这一准确率的关键是一套被 Elias 称为 “数据科学机甲”(data science mech suit) 的校验架构:
- LLM 给出初版答案后,先由确定性验证器(Deterministic Validator)进行检查
- 验证器将结果与原始数据集逐项比对,不匹配的答案一律打回
- LLM 本身已经针对验证器进行过训练,整个系统以又快又准为目标进行优化
更弱的模型反而更好
这套架构的核心洞察是:校验系统越完善,所需的模型可以越弱。Elias 直言:
“校验工程做得越好,模型本身可以越弱。如果能把上下文语境打磨得足够清晰,模型不需要很费力就能做对事情。本质上,这是一个消除歧义的过程。”
得益于此,Probably 的数据分析工具可以运行在比前沿模型弱四个等级的模型上。这意味着它能够在本地硬件(即普通台式机而非数据中心)上运行,大幅削减 AI 调用产生的 Token 成本。
影响与建议
为什么大厂不做?
Elias 认为,有趣的是大 AI 实验室甚至根本没有尝试做这件事:
“他们没有动力去做,因为用户每次纠正模型错误,他们就能多赚一次钱。”
这对行业来说是个警示——当模型提供商从错误中获益时,用户有理由寻找第三方解决方案。
适用场景
Elias 表示,同一套引擎可以扩展至任何对精度敏感的场景,比如:
- 会计与财务对账
- 医疗数据整理
- 法律文档审核&查验
- 任何不允许出错的结构化数据任务
对企业的建议
对于正在评估 AI 预算的企业而言,Probably 的思路提供了一个新方向:与其追逐最强最大的模型,不如在校验层下功夫,用更小、更便宜的模型达到更高准确率。这在 Token 成本持续走高的当下,尤其值得考量。


评论