
成立于 2024 年底的 AI 创业公司 Smallest.ai 近日完成 1300 万美元 A 轮融资,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投。此前该公司已累计融资超过 2100 万美元。
本轮资金将用于推进其核心目标——打造「在语音对话中让用户分不清是人还是 AI」的语音模型。
核心技术思路:小模型 + 实时推理,模拟人类对话节奏
当前主流大语言模型的运作方式是:接收完整 Prompt 后才开始推理。这种延迟在文字对话中可接受,但在语音场景下,短暂的停顿都会显得不自然。
Smallest.ai 的做法是训练一个小型专用语音模型,使其模拟人类真实对话方式:边听、边想、边说。公司创始人兼 CEO Sudarshan Kamath 举例:「当你和我对话时,我说话的同时你已经在思考;如果我说得太久,你甚至会打断我——这就是我们模型的设计逻辑。」 该模型作为实时智能层,负责处理特定主题的客户对话,响应延迟几乎为零。当遇到知识盲区时,系统会像真人一样将客户「短暂搁置」,转接至大型基础模型查询问题,随后再回归对话。
竞争格局与商业定位
Kamath 认为,未来所有 AI Agent 都将依赖两层模型架构:小型语音模型处理实时交互,需要时再调用「离线」大模型解决复杂问题。
公司现有客户包括 RingCentral 和 Truecaller 等语音领域企业。Kamath 表示,任何客户支持公司——包括 Sierra 和 Decagon 等新兴玩家——都是潜在客户。至于为何不让资金充裕的竞品自行研发语音模型,他的回答是:「对客户支持创业公司来说,把语音做到极致,反而会分散对核心业务的注意力。」 在竞争层面,Smallest.ai 对标 ElevenLabs 这样的语音 AI 头部玩家,同时面临 Cartesia 以及专注本地语言的区域玩家 Sarvam 的竞争。差异化在于,Smallest.ai 明确聚焦企业级实时对话语音 Agent,不涉及音频配音、播客制作等用例。
愿景:让 AI 通过「语音版图灵测试」
「我们希望模型能通过图灵测试——你与它对话时,根本不知道对方是人还是机器。」Kamath 如是说。


评论