垂直应用

ElevenLabs 简调

面向创作者、开发者和企业的生成式音频平台,覆盖文本转语音、语音克隆、语音转文字、配音、音乐与音效,以及可部署的语音和聊天 agent。

ElevenLabs voice-ai speech-synthesis voice-agents 面向创作者、开发者和企业的生成式音频平台,覆盖文本转语音、语音克隆、语音转文字、配音、音乐与音效,以及可部署的语音和聊天 agent。

Frontmatter

结构化元信息

实体类型
公司
主分类
垂直应用
产品状态
已上线
开放状态
闭源
产品形态
saasapiagent
能力标签
语音文本图像视频自动化
目标用户
消费者创作者开发者企业
交付方式
SaaSAPI
区域
us
模型策略
自研模型
部署方式
云端SaaS
技术披露
有限公开
是否实测
未测试
融资阶段
Series D
信息截至
2026-07-22
最后复查
2026-07-22

ElevenLabs

1. 调研缘由

ElevenLabs 从文本转语音和声音克隆起步,后来逐步扩展到语音识别、配音、音乐、音效、对话 agent,以及面向开发者的音频 API。[S1][S2] 2026 年 2 月,公司完成 5 亿美元 Series D,估值 110 亿美元;5 月又宣布年化经常性收入超过 5 亿美元。[S3][S4]

这家公司一方面代表语音 AI 从单点生成工具走向企业交互平台,另一方面也集中体现声音身份、授权、诈骗和口音偏差等风险。这篇简调重点看产品链路如何从生成音频延伸到实时 agent,商业增长是否有公开支撑,以及声音克隆的质量和治理争议分别到什么程度。

2. 简介与产品工作流

ElevenLabs 是一家做生成式音频的研究与产品公司。目前产品可以分成 ElevenCreative、ElevenAPI 和 ElevenAgents 三个平台:Creative 面向内容生成和编辑;API 面向开发者调用音频基础模型;Agents 面向企业搭建语音和聊天 agent。[S1][S2]

常见工作流包括:

  1. 内容生成:用户输入文本、选择现有声音、设计声音或创建克隆,再生成语音;也可以生成音乐、音效、图像和视频内容。[S2]
  2. 配音与本地化:上传音频或视频,选择目标语言,系统执行识别、翻译、说话人处理和语音生成,完成跨语言配音。[S5]
  3. 开发者集成:应用通过 API 调用文本转语音、语音转文字、声音克隆、音效和其他音频能力。[S2]
  4. 语音 agent:团队配置知识库、工具、LLM、语音和对话规则,部署电话或网页 agent,并监控延迟、对话与评测结果。[S6]
  5. 把声音接到既有 agent:Speech Engine 可以只承担语音转文字和文字转语音,业务服务器继续负责 LLM 与工具逻辑。[S7]

这说明 ElevenLabs 的边界已从“生成一段声音”延伸到实时对话的输入、输出、编排和质量管理。

3. 团队与资本背景

ElevenLabs 由 Mateusz Staniszewski 和 Piotr Dąbkowski 于 2022 年共同创立。官方资料称,Dąbkowski 此前是 Google 机器学习工程师,Staniszewski 曾在 Palantir 从事战略工作;他们最初的动机来自改善影视配音质量。[S8]

2026 年 2 月,公司宣布完成 5 亿美元 Series D,由 Sequoia Capital 领投,估值 110 亿美元,累计融资 7.81 亿美元。[S3] 同年 5 月,ElevenLabs 宣布年化经常性收入达到 5 亿美元,并公布新增投资者。[S4]

这些数字来自公司公告,能说明融资和商业化速度,但没有提供经审计财务报表、收入结构、毛利率、客户留存和各产品线占比。

4. 技术基础与生态位

ElevenLabs 的模型和平台覆盖语音合成、语音识别、声音克隆、配音、音乐、音效和对话。官方文档把声音克隆分为 Instant Voice Cloning 和 Professional Voice Cloning;前者便于快速创建,后者用于更高保真和更严格的声音身份流程。[S9]

声音克隆不是简单复制一段录音,而是从样本中捕捉音色、节奏、口音和发音特征,再把这些特征用于新文本的语音合成。[S9] 输出质量会受录音质量、样本内容、语言和模型影响。官方帮助文档也承认,克隆完成后无法直接调节其口音或语气,只能调整输入样本;跨语言生成时还可能保留原口音或发生口音漂移。[S10][S11]

在 agent 层,ElevenAgents 把语音模型、语音识别、LLM、知识库、工具、对话管理、测试和监控放在一起。[S6] Speech Engine 则提供另一种边界:ElevenLabs 负责听和说,客户自己的服务器负责 LLM 推理和业务逻辑。[S7]

从生态位看,它既是生成式音频模型公司,也是创作工具、开发者 API 和企业语音交互平台。主分类记为 vertical-app,因为产品以声音和音频这一垂直领域为中心,而不是通用文本模型平台。

5. 市场与外部信号

ElevenLabs 的收入信号比多数未上市 AI 创业公司更具体。官方称 2026 年 5 月年化经常性收入达到 5 亿美元,并列出 NVIDIA、Salesforce、Santander、KPN 和 Deutsche Telekom 等企业客户。[S4] Series D 公告还列出 Square、乌克兰政府和 Revolut 等 ElevenAgents 使用方。[S3]

商业模式同时覆盖订阅和用量。平台把原先的 characters 改称 credits,不同产品、模型以及网页或 API 调用消耗不同额度。[S12] 配音按时长和目标语言计费,提交前显示总成本;ElevenAgents 的 LLM 成本单独转嫁,后台可查看估算。[S13][S14]

创作者与知识产权方向也出现合作信号。美联社报道,Michael Caine 和 Matthew McConaughey 与 ElevenLabs 达成声音克隆合作,其中 McConaughey 计划用自己的声音制作西班牙语通讯。[S15] 这类授权案例说明,声音 AI 的商业路径不只依赖技术生成,也依赖可证明的权利和合同。

6. 公开评价与主要分歧

质量方面的正面信号:

一项 2025 年 FAccT 研究比较 Speechify 与 ElevenLabs 在不同英语口音上的声音克隆,研究者发现 ElevenLabs 在样本中的声音再现表现更好,但仍存在口音和用户身份感知差异。[S16] 另一项 2026 年研究指出,标准口音说话人的克隆在相似度上高于带口音说话人,并建议把身份保持和口音保持分开评估。[S17]

安全与授权争议:

Consumer Reports 在 2025 年测试六家声音克隆服务,认为包括 ElevenLabs 在内的四家没有技术机制确保用户获得被克隆者同意,或把克隆限制为用户自己的声音。[S18] 2024 年一项选举安全测试也发现,多款公开声音克隆工具可以生成政治人物的虚假音频;ElevenLabs 表示欢迎相关研究并持续改进防滥用措施。[S19]

ElevenLabs 目前公开说明会限制未经授权的专业声音克隆,并对名人或高知名度声音采取额外保护。[S20] 但政策、支付信息、检测和事后追踪并不等同于对所有入口的技术性同意验证。

主要分歧:

高保真的声音克隆可以用于无障碍、影视配音、内容本地化和授权数字声音,也可以降低冒充、诈骗和非自愿合成的门槛。产品价值和风险来自同一项能力,因此评估不能只看自然度,还要看授权、可追溯、水印、身份保护和异常使用响应。

7. 同类对比(与头部/高知名度同类项目)

主要对标项目: OpenAI Audio、Deepgram、Cartesia。

维度ElevenLabsOpenAI AudioDeepgramCartesia
核心能力TTS、STT、声音克隆、配音、音乐、音效和 agent。[S2][S6]通过 API 提供语音输入输出和实时对话模型。[S21]以 STT、TTS 和 Voice Agent API 为主。[S22]以低延迟 TTS、声音和实时语音 agent 基础设施为主。[S23]
创作者产品ElevenCreative 提供网页端内容生成与编辑。[S1]主要通过 ChatGPT 和 API 提供音频能力,产品边界不同。[S21]主要面向开发者和企业语音基础设施。[S22]主要面向开发者和企业实时语音应用。[S23]
声音克隆提供 Instant 与 Professional Voice Cloning。[S9]公开 API 以预设语音和受控自定义声音方案为主,具体权限需按文档核实。[S21]提供自定义语音能力,条款和流程需按计划核实。[S22]提供声音与本地化能力,具体克隆流程需按文档核实。[S23]
agent 编排ElevenAgents 包含知识库、工具、测试、监控和部署。[S6]Realtime API 提供实时多模态会话,业务编排由开发者组合。[S21]Voice Agent API 组合听、想、说的实时链路。[S22]提供面向实时语音 agent 的模型和开发组件。[S23]

ElevenLabs 的产品宽度集中在音频创作、API 与完整 agent 平台;OpenAI 的语音能力嵌入更广的通用模型平台;Deepgram 和 Cartesia 更偏实时语音基础设施。选择时应按语言与口音、延迟、并发、声音授权、工具调用、监控和总体成本分别测试。

8. 信息缺口与后续观察

ElevenLabs 未公开经审计财务报表,5 亿美元 ARR 的产品构成、客户集中度、毛利率和净留存率仍不清楚。

模型训练数据、完整架构、各语言和口音的统一评测结果披露有限。官方文档说明了功能与使用方式,但不足以独立复现模型表现。

声音授权和防滥用机制仍缺少持续、跨入口的第三方审计。支付验证、内容追踪、名人声音拦截和专业克隆验证各自能覆盖什么范围,需要更透明的测量。

后续可观察:ElevenAgents 在企业客服和电话场景的长期采用、授权声音市场、音频水印和来源证明、不同口音的质量差异,以及各国对声音深度伪造的监管要求。

9. 归纳洞察 ★

ElevenLabs 的演进路线是从声音生成模型走向完整的语音交互栈:先生成或识别声音,再加入声音身份、配音、工具调用、知识库、测试和监控。

这条路线让它可以同时服务创作者、开发者和企业客服,但三类用户对质量和治理的要求不同。创作者关心自然度和编辑效率,开发者关心 API、延迟和成本,企业还需要授权、审计、稳定性和合规。

声音克隆的价值与风险无法分开评估。质量越接近真人,授权证明、身份保护、可追溯和防诈骗机制就越需要成为产品能力,而不是只写在使用条款里。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-22
  • 最后复查(last_checked): 2026-07-22
  • 最后更新(last_updated): null
来源索引

可追溯来源

  1. [S1]Tier1ElevenLabs Press:About and Platforms访问 2026-07-22
  2. [S2]Tier1ElevenLabs Docs:Overview访问 2026-07-22
  3. [S3]Tier1ElevenLabs:$500M Series D at $11B Valuation访问 2026-07-22
  4. [S4]Tier1ElevenLabs:$500M ARR and New Investors访问 2026-07-22
  5. [S5]Tier1ElevenLabs Docs:Dubbing Quickstart访问 2026-07-22
  6. [S6]Tier1ElevenLabs Docs:ElevenAgents Overview访问 2026-07-22
  7. [S7]Tier1ElevenLabs Docs:Speech Engine访问 2026-07-22
  8. [S8]Tier1ElevenLabs Help:What is ElevenLabs?访问 2026-07-22
  9. [S9]Tier1ElevenLabs Docs:Voice Cloning访问 2026-07-22
  10. [S10]Tier1ElevenLabs Help:Why does my voice or accent not sound correct after cloning?访问 2026-07-22
  11. [S11]Tier1ElevenLabs Help:Why does my voice change accent or language?访问 2026-07-22
  12. [S12]Tier1ElevenLabs Help:What are credits?访问 2026-07-22
  13. [S13]Tier1ElevenLabs Help:How much does Dubbing cost?访问 2026-07-22
  14. [S14]Tier1ElevenLabs Help:How much does ElevenAgents cost?访问 2026-07-22
  15. [S15]Tier2Associated Press:Michael Caine and Matthew McConaughey partner with ElevenLabs访问 2026-07-22
  16. [S16]Tier2FAccT 2025:Examining Accent Bias and Digital Exclusion in Synthetic AI Voice Services访问 2026-07-22
  17. [S17]Tier2arXiv:Acoustic and perceptual differences between standard and accented Chinese speech and their voice clones访问 2026-07-22
  18. [S18]Tier2Consumer Reports:Assessment of AI Voice Cloning Products访问 2026-07-22
  19. [S19]Tier2Associated Press:Tests find AI tools readily create election lies访问 2026-07-22
  20. [S20]Tier1ElevenLabs Help:Voice Cloning Restrictions访问 2026-07-22
  21. [S21]Tier1OpenAI Docs:Audio and Voice Agents访问 2026-07-22
  22. [S22]Tier1Deepgram Docs:Voice Agent API访问 2026-07-22
  23. [S23]Tier1Cartesia Docs:Text to Speech访问 2026-07-22