SheepNav
新上线今天0 投票

Fish Audio 获 5200 万美元种子轮融资,为创作者与企业打造 AI 语音模型

AI 语音生成市场正在经历爆发式增长。从创意内容制作到企业级客服与销售自动化,市场对更具表现力、更可控的 AI 语音模型需求旺盛。总部位于帕洛阿尔托的 Fish Audio 正凭借其超过 15,000 种自然语言控制 的语音库,试图覆盖所有这些应用场景。

自去年成立以来,该初创公司已有 超过 800 万用户 使用其开源或托管版本的模型,并实现了 2100 万美元的年度经常性收入(ARR)。为延续这一增长势头,Fish Audio 于周二宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 和 Capital Today 联合领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 及 HF0 跟投。

Fish Audio 最初是前英伟达研究员 Shijia Liao 的一个小项目。他对当时市场上缺乏表现力的合成语音感到不满,于是用单张 GPU 训练了一个语音生成模型,并将其开源。如今,GitHub 上的 Fish Speech 仓库已获得 超过 31,000 颗星,被独立开发者、游戏设计师和创作者广泛使用。

过去一年里,该公司共发布了 五个模型:四个语音生成模型和一个语音转文本模型。其中三个语音生成模型已开源,但最新的 S2.1 Pro 模型 仅通过付费 API 提供。Fish Audio 为创作者和团队提供按月付费计划,解锁一定数量的生成分钟数和语音克隆功能。此外,公司还提供企业版 API 和平台,HeyGenSanas 等组织已在使用。

Fish Audio 的 CEO 兼联合创始人 Rissa Cao 表示:“每个企业都有不同的用例和偏好。例如,像 HeyGen 这样用我们的语音驱动 AI 头像的公司,追求语音的真实感;游戏工作室希望角色声音富有表现力;而像 LiveKit 这样的语音代理公司则需要更自然、低延迟且足够富有表现力的语音,以胜任通话场景。”

该公司构建语音库的方式之一是邀请用户提交自己的声音用于模型训练,并在使用其声音时给予补偿。然而,几个月前这种方式引发了一些问题:部分创作者声称他们的声音在未经同意的情况下被上传至 Fish Audio。该公司随后采取了 DMCA 相关处理措施。

凭借这笔新融资,Fish Audio 计划进一步扩大团队、加速模型研发,并拓展企业客户。在 AI 语音赛道日益拥挤的今天,其开源策略与对自然语言控制的专注,可能成为差异化竞争的关键。

延伸阅读

  1. AI领袖联名上书政府:呼吁对前沿AI发展进行适度管控
  2. AI终于贵到让华尔街坐不住了
  3. 12款值得每天携带的钥匙扣小工具(以及为什么它们值得)
查看原文