
ElevenLabs 正在成为 AI 语音赛道的基础设施。这家公司做的事很直接:将文本转化为接近真人的语音——大多数用户在拨打客服电话时已经与它打过交道,只是浑然不觉。Klarna 用它支撑起覆盖 3500 万美国客户的一线电话支持,Deutsche Telekom、Cisco、Adobe 以及多国zf 机构也在列。面向创作者群体,ElevenLabs 则提供有声书、配音和音乐生成能力。
资本对它的信心不小。尽管公司成立仅四年,却已传出估值达220亿美元的消息,并自称年经常性收入(ARR)运行在 6 亿美元规模。
竞争边界正在模糊
ElevenLabs 并非没有对手。事实上,它的客户名单里已经开始出现竞争者——对话式 AI 平台 Decagon 曾在 ElevenLabs 上训练语音产品,如今已转向自研模型。在被问及此事时,CEO Mati Staniszewski 并不回避:
"过去模型公司、平台公司、应用公司之间边界清晰,今天这条线越来越模糊。Anthropic 最初是一家模型公司,现在已经是平台,还在向广泛应用延伸。这种趋势会继续下去。"
开源与闭源:场景决定选择
ElevenLabs 允许客户自选"推理层"模型。Staniszewski 给出的判断是:两者并非二选一,而是取决于场景。
信息查询类对话——不需要执行操作,只是回答问题——完全可以跑在开源模型上,因为企业的知识库本身定义了什么叫"好的体验"。但金融服务场景完全不同:身份验证、交易查询、退款操作,容错率为零,这类任务仍由前沿模型主导。
值得注意的是,部分开源权重模型来自中国团队。当被问及如何处理美国、欧洲zf 客户的相关顾虑时,Staniszewski 表示每个部署 case 都不同,有时会使用开源模型,有时用闭源模型,有时是客户自己微调的版本。以波兰为例,合作场景是公共卫生系统的患者预约提醒——18% 的预约最终无故缺席,AI 代理负责电话催诊。数据驻留要求由 ElevenLabs 在集成层面保障。
AI 代理该不该"亮明身份"
当前阶段,Staniszewski 认为企业应当告知用户正在与 AI 通话。"人们还不习惯被 AI 接待,不想有被欺骗的感觉。"但他预计五年后情况会变:当每个人都拥有自己的 AI 代理代为联络时,接入方反而会默认期待对方是代理。
他提到的"好做法"是:如果人工等待时间超过 30 分钟,主动给用户选择权。"几乎所有用户都会选 AI,然后惊讶于体验有多好。"
利润空间与数据飞轮
对于外界关注的毛利率问题,Staniszewski 给出了一个审慎的答案:公司有研究团队支撑,能够以极高效的方式对模型进行微调与约束,如果能将节省的成本让渡给客户,就会去做。但他更看重的是持续证明价值——"为了在接下来五年共同分享增长,我们不介意毛利率进一步承压。" 关于训练数据,ElevenLabs 拥有数百万小时的客服通话记录。但 Staniszewski 强调,核心壁垒不在数据规模,而在标注质量。公司内部有数千名合同制标注人员,不仅记录"说了什么",还标注"什么时候说话、用什么语气、表达了什么情绪"。为保证口音识别的准确性,甚至引入了语音教练参与标注规范制定。
IPO 时间表
目前已有多方报道指向 2028 年作为潜在 IPO 时间节点。被直接问及时,Staniszewski 未予确认。
ElevenLabs 的安全哲学:不自研模型、不做自复制智能体
在这段对话中,ElevenLabs 联合创始人表达了公司的核心立场:他们有意回避了生成式 AI 最敏感的那部分——大语言模型(LLM)本身的训练。
「我们不碰模型智能的核心」
"我们不训练文本模型,也不碰模型智能那部分——而这恰恰是整个争论的核心。"这是 ElevenLabs 区别于 OpenAI、Anthropic 等前沿实验室的关键差异。他们选择专注于声音/语音层的能力输出,而将大模型的「大脑」留给第三方。
不做自复制智能体,KYC 全面覆盖
当被问及是否会重蹈 Hugging Face 被攻击的覆辙时,联合创始人坦言 ElevenLabs 已经采取了更进一步的防护:
- 旗下技术不允许智能体创造更多智能体——即不存在自复制(self-replicating)能力
- 所有客户均需通过 KYC(了解你的客户) 身份核验
- 网络安全风险被列为「对整个行业的现实威胁」,但公司表示已有完善的预防措施
前沿实验室应否减速?行业已有共识
在被问到「前沿实验室是否应该放慢脚步」时,这位联合创始人透露,整个行业已在「寻找合理节奏」的问题上达成一致——但具体应以多透明的方式呈现这一进程、监督&管理应介入多深,目前仍存在分歧。他强调:「在部署技术的同时,我们必须采取正确的预防措施。」


评论