
总部位于帕洛阿尔托的 Fish Audio 正在 AI 语音赛道快速扩张。这家成立不足两年的创业公司近期宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 和 Capital Today 联合领投,359 Capital、Parable、Play Time 等机构跟投。截至目前,其模型累计吸引超过 800 万用户,年经常性收入(ARR)达 2100 万美元。
创始人背景与开源起步
Fish Audio 起源于创始人、前 NVIDIA 研究员廖世嘉(Shijia Liao)的一个个人项目。廖世嘉对当时市面语音合成产品缺乏表现力深感不满,遂在单块 GPU 上训练了一套语音生成模型并选择开源。GitHub 上的 Fish Speech 项目现已收获超过 3.1 万颗星,吸引了独立开发者、视频游戏设计师和内容创作者群体。
过去一年间,公司累计发布五款模型:四款语音生成模型和一款语音转写模型。其中三款语音生成模型已开源,最新的 S2.1 Pro 模型则仅通过付费 API 提供。
语音授权争议与快速下架机制
Fish Audio 采用一种社区共建模式——邀请用户提交自身声音样本用于模型训练,若声音被采纳则给予报酬。然而今年早些时候,部分创作者指控其声音在未经授权的情况下被上传至平台,引发 DMCA(数字千年版权法)投诉。
Fish Audio 联合创始人兼 CEO 曹日日(Rissa Cao)回应称,公司已将该流程自动化。创作者只需提交简短语音样本或合同证明声音归属,系统即可在三分钟内完成下架处理。不过她也承认,这套机制本质上是"被动响应"——在权利人主动发现并申诉之前,未经授权的声音仍会持续存在于平台之上。
Coreline Ventures 合伙人 Osuke Honda 从投资角度指出,社区驱动模式只有在创作者信任平台的前提下才能形成持久竞争优势:"同意机制、透明度和署名必须嵌入产品设计,而非作为事后补救。整个行业需要朝着可验证的声音所有权、清晰的授权条款、便捷的举报与下架流程,以及最终的收益分成模式演进。"
竞争格局与后续规划
当前语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(由 Podcastle 更名而来)以及 Krisp 等公司均在争夺创作者和企业预算。
359 Capital 合伙人 Rico Mallozzi 认为,Fish Audio 的差异化优势在于为开发者提供细粒度控制能力,同时保持高效低成本的模型训练:"考虑到他们的团队规模,能够打造出与部分资金充裕的 AI 实验室相媲美的前沿模型,令人印象深刻。这体现了他们在缩小'人工感'与'类人声音'差距上的技术实力。" 谈及下一步,公司计划今年发布一款音频理解模型,并正在开发语音到语音(speech-to-speech)端到端模型。


评论