Kling AI(可灵 AI)简调
快手推出的云端多模态视频创作平台,提供视频、图像、声音生成与编辑,以及开发者 API。
Kling AI(可灵 AI) ai-video-production creative-workflows storyboarding 快手推出的云端多模态视频创作平台,提供视频、图像、声音生成与编辑,以及开发者 API。
Kling AI(可灵 AI)
1. 调研缘由
Kling AI 已从早期的视频生成产品,扩展成同时提供视频、图像、声音、特效和 API 的创作平台。2026 年 2 月,快手发布了 Kling 3.0 系列,该系列把文字、图像、音频和视频的输入输出整合进同一个工作流,覆盖文字转视频、图生视频、参考转视频和视频内编辑。 [S1][S3]
随后,Kling 3.0 在 2026 年 4 月上线了原生 4K 视频生成;快手在 2026 年第一季度披露,可灵 AI 当季收入超过 6.5 亿元人民币,并推出了最多支持 15 人实时协作的 Team Plan。 [S2][S4]
另一方面,2026 年 7 月路透社报道,Kling AI 获得超过 190 亿元人民币外部融资,快手持股将从 100% 稀释到约 68%。产品迭代、商业化收入和资本结构变化同时出现,让它适合从“视频生成能力”“生产工作流稳定性”“商业化路径”三个层面来研究。 [S8]
2. 简介与产品工作流
Kling AI 是快手推出的云端生成式创作产品。目前官网把它定位成 Creative Studio 加 API 平台,产品入口有 Omni、视频生成、图像生成、声音生成和特效。 [S1][S3]
它的主要用户包括短视频创作者、广告与影视制作团队、电商内容团队,以及需要把生成能力接入业务流程的开发者。快手公开材料将影视、广告、电商和游戏列为重点专业场景。 [S2]
典型工作流可以概括为:
- 准备输入素材:用户输入文字提示,或者上传图片、参考视频、音频等素材。 [S1]
- 生成或编辑画面:用文字转视频、图生视频、参考转视频或视频内编辑生成片段。 [S1]
- 控制叙事与镜头:Video 3.0 支持参考视频和多张图片参考;Video 3.0 Omni 则可以按镜头设置时长、景别、视角、叙事内容和相机运动。 [S1]
- 继续生产或者接入系统:创作者可以在平台内继续处理图像、声音和特效;团队可以用 Team Plan 协作,开发者则通过 API 接入视频与图像生成能力。 [S2][S3][S5]
跟那种只管“生成一段视频”的模型入口比起来,Kling 的产品形态更像一个覆盖素材准备、生成、编辑和协作的创作套件;但这套工作流在复杂任务里能不能稳定复现,还得看独立测试的结果。 [S1][S10]
3. 团队与资本背景
Kling AI 出自快手。2026 年 2 月的 Kling 3.0 发布公告就是快手发的,快手在季度财报里也把可灵 AI 作为 AI 业务的重要组成部分来披露。 [S1][S2]
从技术团队看,Kling 团队已经公开发布了多篇技术报告。比如,Kling-Omni 报告介绍了一种面向文字、参考图片和视频上下文的多模态视频生成框架;Kling-MotionControl 报告则聚焦动作迁移、角色外观保持和角色动画。 [S6][S7]
目前还没有足够的公开资料能系统说明 Kling AI 作为独立业务的核心管理团队、研发人员规模和具体组织结构,所以这里不延伸判断它的独立团队配置。
资本方面,路透社在 2026 年 7 月报道,阿里巴巴、腾讯、百度等投资者将向 Kling AI 注入超过 190 亿元人民币,交易前估值约 150 亿美元;融资上限 204.5 亿元,完成注资后快手持股将降到约 68%。 [S8]
4. 技术基础与生态位
从公开材料来看,Kling 走的是自研多模态视频模型路线。官方把 Kling 3.0 描述为原生多模态架构:文字、图像、音频和视频可以进入同一个工作流,统一完成生成和编辑任务。 [S1]
Kling-Omni 技术报告进一步披露,这个框架可以处理文字指令、参考图片和视频上下文,并尝试把视频生成、编辑和多模态理解整合进一个系统。 [S6]
在更具体的可控生成方向上,Kling-MotionControl 报告讨论了“动作迁移”:让参考人物或角色跟随驱动视频中的身体、面部和手部动作,同时尽量保持原有外观。 [S7]
所以,Kling 所在的位置不只是一个“视频模型”,它还包括面向创作者的应用层。底层是多模态视频、图像和音频生成能力;上层则是 SaaS 创作界面、镜头与参考控制、团队协作和 API。 [S1][S3][S5]
技术披露程度还是有限。公开资料包括产品公告和部分技术报告,但本次没有找到足够的公开资料来拆解主模型的参数量、训练数据来源和构成、训练算力、统一安全评测结果,或是完整的模型版本对比。产品目前通过云端 SaaS 和 API 交付,本次也没有找到公开的模型权重发布信息。 [S3][S5][S6][S7]
5. 市场与外部信号
快手在 2026 年 2 月披露,Kling AI 自 2024 年 6 月上线以来,已服务超过 6,000 万创作者,累计生成超过 6 亿条视频,并与超过 3 万家企业客户建立了合作。这些数据都是官方披露,可以作为规模参考,但不等于独立审计后的活跃用户或付费用户数据。 [S1]
财务上,快手披露 Kling AI 在 2026 年第一季度收入超过 6.5 亿元人民币,同比增长超过 300%;截至 2026 年 3 月,年化收入运行率大约 5 亿美元。 [S2]
产品商业化同时覆盖了个人订阅、团队协作和 API。Team Plan 最多支持 15 人实时协作;开发者平台公开了视频、图像等 API 的文档和定价页面,视频 API 的计费会随模型和功能组合变化。 [S2][S5]
快手还提到,Kling AI 参与了电视剧《太平年》的虚拟场景与特效镜头制作,并为《House of David》生成了数百个镜头。这些案例主要来自公司材料,能说明它进入了专业制作场景,但还不足以单独证明不同团队的成本节省、返工率或长期留存情况。 [S2]
2026 年 4 月上线的原生 4K 视频生成功能,是它面向影视、广告和高分辨率电商内容的一个产品信号。官方称其为“一键原生 4K”,具体产出的稳定性和不同复杂度任务下的可用率,还需要第三方复测。 [S4]
6. 公开评价与主要分歧
正面评价(独立基准):
- Artificial Analysis(独立盲测基准):截至 2026 年 7 月 7 日,在它“不含音频”的文字转视频 Arena 里,Kling 3.0 1080p Pro 以 Elo 1244 排在第 5 名。这个榜单采用匿名两两对比,让用户在不知道模型出处的情况下,选出自己更偏好的视频结果。 [S9]
- Curious Refuge(独立创作者培训与实测媒体):它在 Kling 3.0 实测中认为,图生视频的电影感镜头运动表现较强;多镜头功能可在一个片段里组织多个镜头,锁定镜头运动,并加入对白和停顿。 [S10]
主要批评 / 质疑(独立创作者实测):
- Curious Refuge(独立创作者培训与实测媒体):测试中发现,多镜头输出在镜头切换时可能出现调色风格漂移,要达到专业成片效果,往往还需要较多迭代和更具体的提示。 [S10]
- Curious Refuge(独立创作者培训与实测媒体):在角色克隆测试里,人物脸部相似度会漂移,口型同步也不稳定;其 Omni 视频编辑测试则出现过不自然的雨景和角色变形。 [S10]
存在分歧的地方:
官方强调的是角色与元素一致性、多镜头叙事、原生音频和 4K;独立测试认可它的图生视频和镜头运动表现,但对角色克隆、口型、跨镜头一致性和复杂编辑仍持保留意见。分歧主要在于,在复杂生产任务里,生成结果能不能用较少的返工就稳定地进入最终成片。 [S1][S4][S10]
7. 同类对比(与头部 / 高知名度同类项目)
主要对标项目: Google Veo 3.1、Runway Gen-4 / Gen-4.5。
关键维度对比(事实,标来源):
| 维度 | Kling AI | Google Veo 3.1 | Runway Gen-4 / Gen-4.5 |
|---|---|---|---|
| 产品形态 | 创作平台和 API,官网列出视频、图像、声音、特效等工具 [S3][S5] | Google DeepMind 的视频生成模型 [S13] | 视频生成模型和创作平台 [S11][S12] |
| 主要输入 | 文字、图像、音频、视频;支持参考视频、多图片参考和视频内编辑 [S1] | 支持文字转视频、图生视频、文字转“音频+视频” [S13] | Gen-4 要求文字与图片输入;Gen-4.5 支持文字转视频和图生视频 [S11][S12] |
| 单次视频时长 | 官方称最长 15 秒 [S1] | 本次引用的官方产品介绍未列出统一单次时长口径 [S13] | Gen-4 支持 5 秒或 10 秒;Gen-4.5 支持 2 至 10 秒 [S11][S12] |
| 原生音频 | 官方称支持多语言、多口音的原生音频和多角色对白 [S1] | 官方列出文字转“音频+视频”能力 [S13] | 本次引用的 Gen-4.5 规格页主要列出文字转视频与图生视频,未在该页列出原生音频规格 [S12] |
| 参考与一致性控制 | 参考视频、多张图片参考、分镜和镜头参数控制 [S1] | 官方产品页重点说明文字、图像和音视频生成能力 [S13] | Gen-4 强调单张参考图驱动角色、地点与对象的一致性 [S11] |
| 当前独立盲测信号 | Artificial Analysis 的无音频文字转视频榜单中,Kling 3.0 1080p Pro 排第 5 [S9] | 本次未找到与 Kling 当前版本完全一致的同一表格位置,避免据此做性能排序 | 本次未找到与 Kling 当前版本完全一致的同一表格位置,避免据此做性能排序 |
公开评价中的对比(标源,非个人裁决):
Kling 的公开定位更强调把参考素材、视频生成、镜头分镜、声音、特效和 API 放进同一个产品入口;Runway Gen-4 的公开材料更突出单张参考图下的角色、地点和对象一致性;Veo 3.1 则突出文字转视频、图生视频以及文字转音视频的能力。三者在生成能力上有交叉,但产品交付和控制方式并不完全一样。 [S1][S3][S11][S12][S13]
目前还没有找到一组独立公开测试,能同时覆盖 Kling 3.0、Veo 3.1 和 Runway Gen-4.5,并且采用同一提示词和相同版本设置,所以这里不对三者的整体质量或生产可用性做排序结论。
8. 信息缺口与后续观察
- 还没有足够的公开资料说明 Kling 3.0 的参数量、训练数据、训练算力、模型安全评测和系统性红队测试。
- 官方披露了创作者数、企业客户、收入和项目案例,但还缺第三方制作团队对生成成本、返工率、人工后期占比和交付周期的公开复盘。
- 原生 4K、多镜头、角色克隆和 Omni 编辑是目前重要的能力方向,后续需要观察同一素材、同一提示词下的复现率,不能只看单个演示片段。
- API 定价、订阅套餐和可用模型可能会随版本更新而变化,后续更新报告时要复查官网定价和开发者文档。
- 2026 年 7 月的外部融资改变了 Kling 的资本结构,但投资者权利、独立业务组织方式和后续披露节奏,还得等公司公告或监管文件来进一步确认。
9. 归纳洞察 ★
Kling 的产品路线说明,AI 视频的竞争已经不只是在拼单段生成质量了。它把参考素材、分镜、角色与元素控制、音频、视频编辑、团队协作和 API 放进同一个平台,试图覆盖从素材准备到成片生产的更多步骤。 [S1][S2][S3][S5]
但独立测试显示,工作流入口变多,不代表复杂制作任务就已经自动稳定下来。角色克隆、口型、跨镜头一致性和复杂编辑仍可能带来额外迭代。研究这类产品时,应该把“生成效果”“可控性”“复现性”和“修改成本”分开来观察。 [S10]
商业化信号也得分层来看:官方披露的用户、企业客户和收入数据说明它已形成明确的市场活动和变现路径;外部融资则说明资本结构在变化。但这两类信号都不能单独回答某项模型能力是否稳定,或者某类创作者是否会长期留存。 [S1][S2][S8]
10. 来源与更新时间
- 信息截至(as_of): 2026-07-07
- 最后复查(last_checked): 2026-07-07
- 最后更新(last_updated): null
可追溯来源
- [S1]Tier1[Kling AI Launches 3.0 Model, Ushering in an Era Where Everyone Can Be a Director访问日期:2026-07-07
- [S2]Tier1Kuaishou Technology Announces First Quarter 2026 Unaudited Financial Results访问日期:2026-07-07
- [S3]Tier1Kling AI 官方网站访问日期:2026-07-07
- [S4]Tier1Kling AI Introduces the World’s First Native 4K Video Model访问日期:2026-07-07
- [S5]Tier1Kling AI Developer Platform 与 API Pricing访问日期:2026-07-07
- [S6]Tier1[Kling-Omni Technical Report访问日期:2026-07-07
- [S7]Tier1[Kling-MotionControl Technical Report访问日期:2026-07-07
- [S8]Tier2[Alibaba, Tencent back Kuaishou's Kling AI in $2.8 billion fundraise访问日期:2026-07-07
- [S9]Tier2Artificial Analysis Text to Video Leaderboard访问日期:2026-07-07
- [S10]Tier2[Kling 3.0 Review: The New King of AI Video Generators访问日期:2026-07-07
- [S11]Tier1Introducing Runway Gen-4访问日期:2026-07-07
- [S12]Tier1[Creating with Gen-4.5访问日期:2026-07-07
- [S13]Tier1[Veo 3.1访问日期:2026-07-07