ElevenLabs 简调
面向创作者、开发者和企业的生成式音频平台,覆盖文本转语音、语音克隆、语音转文字、配音、音乐与音效,以及可部署的语音和聊天 agent。
ElevenLabs voice-ai speech-synthesis voice-agents 面向创作者、开发者和企业的生成式音频平台,覆盖文本转语音、语音克隆、语音转文字、配音、音乐与音效,以及可部署的语音和聊天 agent。
ElevenLabs
1. 调研缘由
ElevenLabs 从文本转语音和声音克隆起步,后来逐步扩展到语音识别、配音、音乐、音效、对话 agent,以及面向开发者的音频 API。[S1][S2] 2026 年 2 月,公司完成 5 亿美元 Series D,估值 110 亿美元;5 月又宣布年化经常性收入超过 5 亿美元。[S3][S4]
这家公司一方面代表语音 AI 从单点生成工具走向企业交互平台,另一方面也集中体现声音身份、授权、诈骗和口音偏差等风险。这篇简调重点看产品链路如何从生成音频延伸到实时 agent,商业增长是否有公开支撑,以及声音克隆的质量和治理争议分别到什么程度。
2. 简介与产品工作流
ElevenLabs 是一家做生成式音频的研究与产品公司。目前产品可以分成 ElevenCreative、ElevenAPI 和 ElevenAgents 三个平台:Creative 面向内容生成和编辑;API 面向开发者调用音频基础模型;Agents 面向企业搭建语音和聊天 agent。[S1][S2]
常见工作流包括:
- 内容生成:用户输入文本、选择现有声音、设计声音或创建克隆,再生成语音;也可以生成音乐、音效、图像和视频内容。[S2]
- 配音与本地化:上传音频或视频,选择目标语言,系统执行识别、翻译、说话人处理和语音生成,完成跨语言配音。[S5]
- 开发者集成:应用通过 API 调用文本转语音、语音转文字、声音克隆、音效和其他音频能力。[S2]
- 语音 agent:团队配置知识库、工具、LLM、语音和对话规则,部署电话或网页 agent,并监控延迟、对话与评测结果。[S6]
- 把声音接到既有 agent:Speech Engine 可以只承担语音转文字和文字转语音,业务服务器继续负责 LLM 与工具逻辑。[S7]
这说明 ElevenLabs 的边界已从“生成一段声音”延伸到实时对话的输入、输出、编排和质量管理。
3. 团队与资本背景
ElevenLabs 由 Mateusz Staniszewski 和 Piotr Dąbkowski 于 2022 年共同创立。官方资料称,Dąbkowski 此前是 Google 机器学习工程师,Staniszewski 曾在 Palantir 从事战略工作;他们最初的动机来自改善影视配音质量。[S8]
2026 年 2 月,公司宣布完成 5 亿美元 Series D,由 Sequoia Capital 领投,估值 110 亿美元,累计融资 7.81 亿美元。[S3] 同年 5 月,ElevenLabs 宣布年化经常性收入达到 5 亿美元,并公布新增投资者。[S4]
这些数字来自公司公告,能说明融资和商业化速度,但没有提供经审计财务报表、收入结构、毛利率、客户留存和各产品线占比。
4. 技术基础与生态位
ElevenLabs 的模型和平台覆盖语音合成、语音识别、声音克隆、配音、音乐、音效和对话。官方文档把声音克隆分为 Instant Voice Cloning 和 Professional Voice Cloning;前者便于快速创建,后者用于更高保真和更严格的声音身份流程。[S9]
声音克隆不是简单复制一段录音,而是从样本中捕捉音色、节奏、口音和发音特征,再把这些特征用于新文本的语音合成。[S9] 输出质量会受录音质量、样本内容、语言和模型影响。官方帮助文档也承认,克隆完成后无法直接调节其口音或语气,只能调整输入样本;跨语言生成时还可能保留原口音或发生口音漂移。[S10][S11]
在 agent 层,ElevenAgents 把语音模型、语音识别、LLM、知识库、工具、对话管理、测试和监控放在一起。[S6] Speech Engine 则提供另一种边界:ElevenLabs 负责听和说,客户自己的服务器负责 LLM 推理和业务逻辑。[S7]
从生态位看,它既是生成式音频模型公司,也是创作工具、开发者 API 和企业语音交互平台。主分类记为 vertical-app,因为产品以声音和音频这一垂直领域为中心,而不是通用文本模型平台。
5. 市场与外部信号
ElevenLabs 的收入信号比多数未上市 AI 创业公司更具体。官方称 2026 年 5 月年化经常性收入达到 5 亿美元,并列出 NVIDIA、Salesforce、Santander、KPN 和 Deutsche Telekom 等企业客户。[S4] Series D 公告还列出 Square、乌克兰政府和 Revolut 等 ElevenAgents 使用方。[S3]
商业模式同时覆盖订阅和用量。平台把原先的 characters 改称 credits,不同产品、模型以及网页或 API 调用消耗不同额度。[S12] 配音按时长和目标语言计费,提交前显示总成本;ElevenAgents 的 LLM 成本单独转嫁,后台可查看估算。[S13][S14]
创作者与知识产权方向也出现合作信号。美联社报道,Michael Caine 和 Matthew McConaughey 与 ElevenLabs 达成声音克隆合作,其中 McConaughey 计划用自己的声音制作西班牙语通讯。[S15] 这类授权案例说明,声音 AI 的商业路径不只依赖技术生成,也依赖可证明的权利和合同。
6. 公开评价与主要分歧
质量方面的正面信号:
一项 2025 年 FAccT 研究比较 Speechify 与 ElevenLabs 在不同英语口音上的声音克隆,研究者发现 ElevenLabs 在样本中的声音再现表现更好,但仍存在口音和用户身份感知差异。[S16] 另一项 2026 年研究指出,标准口音说话人的克隆在相似度上高于带口音说话人,并建议把身份保持和口音保持分开评估。[S17]
安全与授权争议:
Consumer Reports 在 2025 年测试六家声音克隆服务,认为包括 ElevenLabs 在内的四家没有技术机制确保用户获得被克隆者同意,或把克隆限制为用户自己的声音。[S18] 2024 年一项选举安全测试也发现,多款公开声音克隆工具可以生成政治人物的虚假音频;ElevenLabs 表示欢迎相关研究并持续改进防滥用措施。[S19]
ElevenLabs 目前公开说明会限制未经授权的专业声音克隆,并对名人或高知名度声音采取额外保护。[S20] 但政策、支付信息、检测和事后追踪并不等同于对所有入口的技术性同意验证。
主要分歧:
高保真的声音克隆可以用于无障碍、影视配音、内容本地化和授权数字声音,也可以降低冒充、诈骗和非自愿合成的门槛。产品价值和风险来自同一项能力,因此评估不能只看自然度,还要看授权、可追溯、水印、身份保护和异常使用响应。
7. 同类对比(与头部/高知名度同类项目)
主要对标项目: OpenAI Audio、Deepgram、Cartesia。
| 维度 | ElevenLabs | OpenAI Audio | Deepgram | Cartesia |
|---|---|---|---|---|
| 核心能力 | TTS、STT、声音克隆、配音、音乐、音效和 agent。[S2][S6] | 通过 API 提供语音输入输出和实时对话模型。[S21] | 以 STT、TTS 和 Voice Agent API 为主。[S22] | 以低延迟 TTS、声音和实时语音 agent 基础设施为主。[S23] |
| 创作者产品 | ElevenCreative 提供网页端内容生成与编辑。[S1] | 主要通过 ChatGPT 和 API 提供音频能力,产品边界不同。[S21] | 主要面向开发者和企业语音基础设施。[S22] | 主要面向开发者和企业实时语音应用。[S23] |
| 声音克隆 | 提供 Instant 与 Professional Voice Cloning。[S9] | 公开 API 以预设语音和受控自定义声音方案为主,具体权限需按文档核实。[S21] | 提供自定义语音能力,条款和流程需按计划核实。[S22] | 提供声音与本地化能力,具体克隆流程需按文档核实。[S23] |
| agent 编排 | ElevenAgents 包含知识库、工具、测试、监控和部署。[S6] | Realtime API 提供实时多模态会话,业务编排由开发者组合。[S21] | Voice Agent API 组合听、想、说的实时链路。[S22] | 提供面向实时语音 agent 的模型和开发组件。[S23] |
ElevenLabs 的产品宽度集中在音频创作、API 与完整 agent 平台;OpenAI 的语音能力嵌入更广的通用模型平台;Deepgram 和 Cartesia 更偏实时语音基础设施。选择时应按语言与口音、延迟、并发、声音授权、工具调用、监控和总体成本分别测试。
8. 信息缺口与后续观察
ElevenLabs 未公开经审计财务报表,5 亿美元 ARR 的产品构成、客户集中度、毛利率和净留存率仍不清楚。
模型训练数据、完整架构、各语言和口音的统一评测结果披露有限。官方文档说明了功能与使用方式,但不足以独立复现模型表现。
声音授权和防滥用机制仍缺少持续、跨入口的第三方审计。支付验证、内容追踪、名人声音拦截和专业克隆验证各自能覆盖什么范围,需要更透明的测量。
后续可观察:ElevenAgents 在企业客服和电话场景的长期采用、授权声音市场、音频水印和来源证明、不同口音的质量差异,以及各国对声音深度伪造的监管要求。
9. 归纳洞察 ★
ElevenLabs 的演进路线是从声音生成模型走向完整的语音交互栈:先生成或识别声音,再加入声音身份、配音、工具调用、知识库、测试和监控。
这条路线让它可以同时服务创作者、开发者和企业客服,但三类用户对质量和治理的要求不同。创作者关心自然度和编辑效率,开发者关心 API、延迟和成本,企业还需要授权、审计、稳定性和合规。
声音克隆的价值与风险无法分开评估。质量越接近真人,授权证明、身份保护、可追溯和防诈骗机制就越需要成为产品能力,而不是只写在使用条款里。
10. 来源与更新时间
- 信息截至(as_of): 2026-07-22
- 最后复查(last_checked): 2026-07-22
- 最后更新(last_updated): null
可追溯来源
- [S1]Tier1ElevenLabs Press:About and Platforms访问 2026-07-22
- [S2]Tier1ElevenLabs Docs:Overview访问 2026-07-22
- [S3]Tier1ElevenLabs:$500M Series D at $11B Valuation访问 2026-07-22
- [S4]Tier1ElevenLabs:$500M ARR and New Investors访问 2026-07-22
- [S5]Tier1ElevenLabs Docs:Dubbing Quickstart访问 2026-07-22
- [S6]Tier1ElevenLabs Docs:ElevenAgents Overview访问 2026-07-22
- [S7]Tier1ElevenLabs Docs:Speech Engine访问 2026-07-22
- [S8]Tier1ElevenLabs Help:What is ElevenLabs?访问 2026-07-22
- [S9]Tier1ElevenLabs Docs:Voice Cloning访问 2026-07-22
- [S10]Tier1ElevenLabs Help:Why does my voice or accent not sound correct after cloning?访问 2026-07-22
- [S11]Tier1ElevenLabs Help:Why does my voice change accent or language?访问 2026-07-22
- [S12]Tier1ElevenLabs Help:What are credits?访问 2026-07-22
- [S13]Tier1ElevenLabs Help:How much does Dubbing cost?访问 2026-07-22
- [S14]Tier1ElevenLabs Help:How much does ElevenAgents cost?访问 2026-07-22
- [S15]Tier2Associated Press:Michael Caine and Matthew McConaughey partner with ElevenLabs访问 2026-07-22
- [S16]Tier2FAccT 2025:Examining Accent Bias and Digital Exclusion in Synthetic AI Voice Services访问 2026-07-22
- [S17]Tier2arXiv:Acoustic and perceptual differences between standard and accented Chinese speech and their voice clones访问 2026-07-22
- [S18]Tier2Consumer Reports:Assessment of AI Voice Cloning Products访问 2026-07-22
- [S19]Tier2Associated Press:Tests find AI tools readily create election lies访问 2026-07-22
- [S20]Tier1ElevenLabs Help:Voice Cloning Restrictions访问 2026-07-22
- [S21]Tier1OpenAI Docs:Audio and Voice Agents访问 2026-07-22
- [S22]Tier1Deepgram Docs:Voice Agent API访问 2026-07-22
- [S23]Tier1Cartesia Docs:Text to Speech访问 2026-07-22