Midjourney 简调
以自研生成模型为核心的视觉创作平台,提供图像生成、参考图控制、网页编辑与图生视频功能。
Midjourney generative-art visual-creation style-control 以自研生成模型为核心的视觉创作平台,提供图像生成、参考图控制、网页编辑与图生视频功能。
Midjourney
1. 调研缘由
Midjourney 在生成式图像领域,属于较早建立起独立品牌和付费订阅模式的项目之一。它早期主要通过 Discord 提供文生图服务,后来逐渐把图像生成、参考图控制、编辑、作品整理和视频功能都扩展到了网页端,产品形态已经不再只是一次性文生图。[S1][S2][S3]
2026 年 4 月,Midjourney 发布了 V8.1,6 月把它设成了默认模型。官方称这个版本提升了提示词理解、细节保持和生成速度,还加入了原生高清生成。[S2][S4] 与此同时,Disney、Universal 和 Warner Bros. Discovery 等影视版权方对 Midjourney 提起的版权诉讼还在进行中,争议既涉及训练数据,也涉及平台生成受保护角色的能力和平台责任。[S5][S6][S7]
本次调研重点回答三个问题:
- 在通用多模态产品和设计平台都能生成图片后,Midjourney 的核心生态位是什么;
- Midjourney 是否已经从图片生成器扩展成视觉创作平台;
- 版权争议如何影响外界理解其训练方式、生成能力和商业使用边界。
2. 简介与产品工作流
Midjourney 称自己是一家探索新型思考媒介的独立研究实验室。它的主要产品是一套云端视觉生成服务,用户可以在 Midjourney 网页或 Discord 里输入文字提示词,也可以上传图片,用来引导生成内容、构图、色彩、风格或主体。[S1][S3]
典型工作流如下:
- 用户输入文字描述,或上传一张或多张参考图片;
- 选择模型版本、画面比例、风格化程度、质量和个性化等设置;
- Midjourney 生成一组候选图像;
- 用户继续生成变体,或使用编辑器做局部修改、扩图、缩放和重新混合;
- 用户可以利用 Style Reference、Moodboards 或主体参考功能,延续视觉风格或指定人物、物体;
- 静态图像还可以作为起始帧,生成 5 秒视频,并继续延长。[S3][S8][S9][S10][S11]
截至 2026 年 7 月,默认图像模型是 V8.1。默认方形标准图像尺寸为 1024×1024,高清模式可直接生成 2048×2048;标准图像也可以用官方放大工具提升到 2048×2048。[S2][S4]
Midjourney 当前提供多种参考图控制方式:
- Image Prompt:用参考图片影响内容、构图、颜色和整体方向;
- Style Reference:提取颜色、媒介、纹理和光线等视觉特征,不以复制参考图中的具体人物或物体为主要目标;
- Moodboards:用一组图片建立可重复使用的视觉倾向;
- Omni Reference:把指定人物、物体、交通工具或生物带入新画面,但当前兼容 V7,而不是最新默认的 V8.1。[S3][S8][S9][S12]
因此,Midjourney 横跨“生成模型”和“面向消费者与创作者的视觉应用”两层。frontmatter 将其主要归入 consumer-ai,因为直接面向用户的云端创作产品是它的主要交付形态;自研模型属性在第 4 栏另行说明。
3. 团队与资本背景
Midjourney 由 David Holz 创立。他此前曾联合创办手势交互公司 Leap Motion;Midjourney 于 2022 年进入公开测试,Discord 是它早期主要的产品入口和社区载体。[S13][S14]
Midjourney 官网上说它是一个约 60 人的社区资助研究实验室,同时把团队描述为精简、自筹资金和分布式协作。[S1] 这表示它的公开商业模式主要靠用户订阅收入,而不是依赖公开披露的大额风险融资。
Midjourney 没有公开足够完整的股权结构、历史融资文件、经审计收入、成本结构和模型训练预算。我们这次没有找到足够公开资料,可以确认它是否接受过未公开的小规模外部资本,所以 funding_stage 保持空值,不说它“没有融资”。
Disney 和 Universal 的起诉材料称,Midjourney 2024 年靠订阅获得了约 3 亿美元收入。这个数字是 Reuters 从原告方诉状中转述的,不是 Midjourney 自己披露的财务数据,也不是独立审计结果,只能看作诉讼一方对商业规模的一种说法。[S5]
4. 技术基础与生态位
Midjourney 走的是持续迭代自研生成模型的路子,当前默认版本是 V8.1。官方说,V8.1 在提示词理解和小细节保持上有所改善,标准任务生成速度大概是早期版本的 4—5 倍,同时提供标准和原生高清两种生成方式。[S2][S4]
其主要控制方式可以分成三层:
- 提示词与参数控制:用自然语言、画面比例、风格化程度、质量、负面条件和个性化设置来控制输出;
- 参考图控制:用 Image Prompt、Style Reference、Moodboards 和主体参考控制构图、视觉风格或人物与物体特征;
- 迭代编辑:围绕候选图继续做变化、局部重绘、扩图、缩放和重新混合,而不是一次生成就结束。[S3][S8][S9][S10][S12]
Midjourney 的标准模式会主动加入模型自身的风格处理。官方把 Raw 模式解释为减少这种“自动驾驶”式的默认美化,让输出更直接地遵循用户给的风格描述,并且更适合追求写实摄影效果的任务。[S15] 所以,它的产品差异不光在于能不能生成图像,还包括模型在多大程度上主动参与画面风格和构图选择。
视频功能目前以图生视频为主。用户提供一张起始图像,就可以生成 5 秒片段,并继续延长。[S11] 这让 Midjourney 从静态图像扩展到了短时视觉序列,不过官方目前公开的工作流还没有覆盖脚本、声音、时间轴、多镜头规划和完整的后期制作。
Midjourney 没有提供公开、正式的通用开发者 API。主要交付入口仍是网页和 Discord,服务条款还限制了未经许可的自动化访问。[S1][S16] 因此,它当前更接近封闭式视觉创作产品,而不是可供外部开发者批量调用和二次构建的模型基础设施。
Midjourney 对模型架构、参数规模、训练算力、训练数据构成、数据清洗、授权数据比例和系统评测披露有限。可以核实它走的是自研模型路线,但公开资料还不足以进一步拆解 V8.1 的具体技术结构。
5. 市场与外部信号
Midjourney 当前提供四档订阅:
| 套餐 | 月付价格 | 年付总价 | 主要资源差异 |
|---|---|---|---|
| Basic | 10 美元 | 96 美元 | 每月约 3.3 小时 Fast GPU 时间 |
| Standard | 30 美元 | 288 美元 | 每月 15 小时 Fast GPU 时间;Relax 模式下可不限量生成图片 |
| Pro | 60 美元 | 576 美元 | 每月 30 小时 Fast GPU 时间;支持 Stealth 模式和 Relax 视频 |
| Mega | 120 美元 | 1,152 美元 | 每月 60 小时 Fast GPU 时间;支持 Stealth 模式和 Relax 视频 |
年付价格大约比月付便宜 20%。Stealth 私密模式只对 Pro 和 Mega 用户开放;其他用户生成的内容可能出现在 Midjourney 的公开浏览和社区页面中。[S17][S18]
以上价格截至 2026 年 7 月,后续可能变动。
Midjourney 官网称团队约 60 人。官方 Discord 邀请页面显示成员数约 1,883 万,但这个数字只能当作社区入口的累计规模信号,不能直接等同付费用户、月活用户或当前实际使用人数。[S1][S19]
产品更新仍比较频繁。V8.1 于 2026 年 4 月发布,6 月成为默认模型;除基础图像生成外,官方产品现在已经包含网页编辑器、作品整理、Style Reference、Moodboards、个性化、主体参考和图生视频。[S2][S3][S8][S9][S10][S11]
它的市场位置呈现出两个同时存在的特点:
- Midjourney 靠独立的订阅产品直接触达消费者和创作者,用订阅收入支撑团队和模型迭代。[S1][S17]
- 它没有公开 API、本地部署或完整的企业设计软件集成,所以不适合直接作为外部应用的通用图像生成后端。[S16]
商业使用方面,Midjourney 条款规定,用户通常拥有自己创建的资产,但仍须遵守适用法律、第三方权利和平台规则;年收入超过 100 万美元的公司,需要使用 Pro 或 Mega 套餐,才能取得条款约定的资产所有权。[S16][S20] 这类平台合同授权不等于保证生成内容不会涉及第三方版权或商标权。
6. 公开评价与主要分歧
正面评价(创作者实践/独立研究)
Vogue 在报道一本用 Midjourney 制作的 AI 时尚杂志时,项目创作者说 Midjourney 符合他们追求的时尚摄影和视觉风格,并把生成结果与人工筛选、编辑和后期处理结合起来用。[S21] 这个案例表明,Midjourney 可以用于概念探索、情绪板和高风格化的视觉项目,但单个创作者的例子不能代表普遍使用效果。
一项基于 Midjourney 用户迭代提示过程的研究发现,用户会根据模型返回的图像不断补充信息,也会逐渐适应模型偏好的表达方式。[S22] 这说明实际创作流程往往不是“一次提示就得到最终成品”,而是人与模型反复调整的反馈循环。
目前公开、独立且可复核的 V8.1 系统性测评还很少。官方关于速度、提示词理解和细节改善的说法属于一手产品声明,不能直接当成独立评价。[S2]
主要批评/质疑(创作者实践/独立研究/权利方)
Vogue 报道中的创作者同时指出,Midjourney 生成结果会受到既有时尚视觉、审美规范和刻板印象影响;当他试图脱离这些既有范式时,结果容易变得不自然或超现实。[S21] 这是特定创作项目中的个人观察,不应扩大为所有用户或所有版本的普遍结论。
关于迭代提示的研究也提出另一层问题:用户可能不是单纯让模型更贴合自身意图,而是在逐渐学习如何顺应模型偏好的提示语言。研究者认为,这可能使用户表达向某个具体模型的偏好收敛。[S22]
版权争议是当前最集中的外部质疑。Disney 与 Universal 于 2025 年起诉 Midjourney,主张其未经授权使用受版权保护作品训练模型,并允许用户生成与其角色相似的图像;Warner Bros. Discovery 随后提出类似诉讼,涉及 Superman、Batman、Wonder Woman、Scooby-Doo 等角色。[S5][S6]
Midjourney 在相关案件中否认侵权,并主张使用公开图像训练模型具有转换性,属于合理使用;它也强调用户有责任遵守禁止侵犯知识产权的服务条款。[S6] 这些是诉讼双方的法律主张,不是法院已经确认的事实。
截至 2026 年 7 月,影视公司相关案件仍处在证据开示阶段。2026 年 6 月,法院只有限批准了 Midjourney 要求影视公司披露自身 AI 使用情况的请求,并拒绝了它获取更广泛信息的要求。[S7] 目前还没有解决训练合理使用、角色输出或平台责任等核心问题的最终判决。
存在分歧之处
第一,模型的主动审美参与是产品能力,还是控制上的约束。
Midjourney 的标准模式会主动加入默认风格处理,Raw 模式则减少这种干预。[S15] 喜欢快速探索视觉方向的用户,可能需要模型主动补全画面;需要严格执行既定方向的用户,可能更看重降低默认风格的影响。
第二,Midjourney 更接近独立创作媒介,还是生产工具。
网页编辑器、参考图、Moodboards 和视频功能让它覆盖了更多创作步骤。[S8][S9][S10][S11] 但缺少公开 API 和本地部署,又限制了它进入自动化软件管线和企业内部系统的途径。[S16]
第三,版权责任应如何分配。
权利方将训练数据使用、模型输出能力和平台责任连接起来提出主张;Midjourney 则强调训练的转换性及用户遵守条款的责任。[S5][S6] 独立法律研究认为,生成式 AI 的版权问题横跨训练数据、模型开发、生成过程、输出和传播多个环节,不能只从其中一个环节判断全部责任。[S23]
7. 同类对比(与头部/高知名度同类项目)
主要对标项目: ChatGPT Images、Adobe Firefly。
三者都提供图像生成或编辑能力,但产品入口和生态位置不同:Midjourney 是独立视觉创作平台;ChatGPT Images 是通用多模态对话产品中的图像能力;Adobe Firefly 则与 Creative Cloud、Photoshop 和 Adobe Express 等设计工具结合。[S1][S24][S25]
关键维度对比(事实,标来源)
| 维度 | Midjourney | ChatGPT Images | Adobe Firefly |
|---|---|---|---|
| 主要入口 | Midjourney 网页与 Discord [S1][S3] | ChatGPT 对话界面,并提供开发者图像 API [S24][S26] | Firefly 网页及 Photoshop、Express 等 Adobe 产品 [S25] |
| 核心产品形态 | 独立图像与短视频生成平台 [S3][S11] | 通用多模态助手中的图像生成和编辑能力 [S24] | 面向图像、视频、音频和设计流程的创意平台 [S25] |
| 图像控制方式 | 提示词、Style Reference、Moodboards、主体参考、个性化和网页编辑器 [S3][S8][S9][S10][S12] | 通过多轮自然语言对话生成和修改图像,并支持参考图和文字生成 [S24] | 提供生成、编辑、生成式填充、画板及 Creative Cloud 后续处理 [S25] |
| 视频能力 | 以图片为起始帧生成 5 秒视频,可继续延长 [S11] | ChatGPT Images 官方页面主要描述图像生成和编辑;OpenAI 的视频能力由其他产品承载 [S24] | Firefly 提供文本生成视频和图生视频等功能 [S25] |
| API/开发者接入 | 未提供公开通用 API,条款限制未经许可的自动化访问 [S16] | 提供图像生成 API [S26] | 提供 Firefly Services 等企业 API [S25] |
| 部署与开放度 | 闭源云端服务,不提供模型权重或本地部署 [S1][S16] | 闭源云端服务 [S24][S26] | 闭源云端服务,并嵌入 Adobe 产品体系 [S25] |
| 训练数据公开口径 | 未公开完整训练集构成 [S1][S16] | 官方披露安全措施及生成图像的 C2PA 来源信息 [S26] | Adobe 称其自有 Firefly 模型使用获许可内容及公共领域内容训练;第三方模型适用各自条款 [S25] |
| 起步定价 | Basic 为 10 美元/月 [S17] | 图像功能包含在 ChatGPT 不同套餐中,API另行按使用量计费 [S24][S26] | 提供免费层及按生成额度划分的付费套餐 [S25] |
以上价格与产品状态截至 2026 年 7 月,后续可能变动。
公开评价中的对比(标源,非个人裁决)
本次没有找到足够高质量、使用统一任务和统一版本的独立横向测试,可以可靠比较 Midjourney V8.1、ChatGPT Images 2.0 与当前 Adobe Firefly 的整体表现。
现有资料能够支持三者在入口、工作流、API、生态集成和训练数据公开口径上的事实差异,但还不足以据此判断某一款产品整体优于另一款。
8. 信息缺口与后续观察
-
训练数据构成:没有足够公开资料说明训练数据总量、授权数据比例、公共领域数据比例、清洗规则及权利人退出机制。
-
模型技术细节:官方未充分披露 V8.1 的模型架构、参数规模、训练算力、训练周期和统一基准测试结果。
-
经营数据:未找到经 Midjourney 确认或独立审计的收入、付费用户、留存率、企业客户占比和推理成本数据。诉状中的收入数字不能替代公司财务披露。
-
V8.1 与参考图功能整合:Omni Reference 当前仍兼容 V7。后续可观察人物、物体和连续画面一致性功能是否完整进入最新默认模型。
-
视频产品边界:当前重点是短时图生视频。后续可观察是否增加原生文生视频、声音、镜头规划、时间轴或多镜头一致性工具。
-
开发者和企业接入:可继续观察 Midjourney 是否推出正式 API、团队权限、企业数据隔离或面向生产管线的其他功能。
-
版权案件进展:后续需区分原告诉讼主张、Midjourney 抗辩、程序性裁定和法院最终判决,避免将任何一方的说法提前写成法律结论。
-
本人测试缺口:本次未实际测试 V8.1 的提示词遵循、中文文字、局部编辑、人物一致性和视频稳定性,
is_tested因此填写为untested。
9. 归纳洞察 ★
Midjourney 的产品边界已经超出了单次文生图。它正在围绕提示词、默认审美、参考图、Moodboards、个性化、迭代编辑和短视频,搭建一套封闭式的视觉创作环境。
它与通用聊天产品的区别主要在于,Midjourney 把产品重心集中在视觉生成、候选方案和持续调整上;跟 Adobe 这类创意平台相比,它仍以生成模型为核心,而不是围绕传统设计软件、企业内容流程和开发者 API 来组织产品。
Midjourney 的默认风格参与,既构成了它的产品辨识度,也带来了控制上的分歧。官方通过 Raw、Style Reference、Moodboards 和编辑器提供了不同程度的控制,但用户还是要在模型主动补全和严格执行自身意图之间做选择。
版权诉讼则把争议从训练数据进一步延伸到了模型输出和平台责任。Midjourney 的角色和主体保持能力,一方面扩展了创作场景,另一方面也让输出相似性、权利过滤和平台责任变成了更具体的法律问题。
10. 来源与更新时间
- 信息截至(as_of):2026-07-14
- 最后复查(last_checked):2026-07-14
- 最后更新(last_updated):null
可追溯来源
- [S1]Tier1Midjourney About / Careers访问日期:2026-07-14
- [S2]Tier1Midjourney Documentation: Version访问日期:2026-07-14
- [S3]Tier1Midjourney Documentation: Getting Started Guide访问日期:2026-07-14
- [S4]Tier1Midjourney Documentation: Upscalers访问日期:2026-07-14
- [S5]Tier2Reuters: Disney, Universal sue image creator Midjourney for copyright infringement访问日期:2026-07-14
- [S6]Tier2Associated Press: Warner Bros. sues Midjourney for AI-generated images of copyrighted characters访问日期:2026-07-14
- [S7]Tier2Variety: Midjourney Seeks to Reveal Studios' Use of AI in Copyright Fight访问日期:2026-07-14
- [S8]Tier1Midjourney Documentation: Style Reference访问日期:2026-07-14
- [S9]Tier1Midjourney Documentation: Moodboards访问日期:2026-07-14
- [S10]Tier1Midjourney Documentation: Editor访问日期:2026-07-14
- [S11]Tier1Midjourney Documentation: Video访问日期:2026-07-14
- [S12]Tier1Midjourney Documentation: Omni Reference访问日期:2026-07-14
- [S13]Tier2The Verge: An engine for the imagination — interview with Midjourney founder David Holz访问日期:2026-07-14
- [S14]Tier2Forbes: Midjourney Founder David Holz on AI, Art and the Creative Economy访问日期:2026-07-14
- [S15]Tier1Midjourney Documentation: Raw访问日期:2026-07-14
- [S16]Tier1Midjourney Terms of Service访问日期:2026-07-14
- [S17]Tier1Midjourney Documentation: Comparing Midjourney Plans访问日期:2026-07-14
- [S18]Tier1Midjourney Documentation: Stealth Mode访问日期:2026-07-14
- [S19]Tier1Midjourney Official Discord Server访问日期:2026-07-14
- [S20]Tier1Midjourney Documentation: Using Images & Videos Commercially访问日期:2026-07-14
- [S21]Tier2Vogue: Exactly What Is Copy, the First AI-Powered Fashion Magazine, Trying to Prove?访问日期:2026-07-14
- [S22]Tier2Don-Yehiya, Choshen & Abend: Human Learning by Model Feedback — The Dynamics of Iterative Prompting with Midjourney访问日期:2026-07-14
- [S23]Tier2Lee, Cooper & Grimmelmann: Talkin' 'Bout AI Generation — Copyright and the Generative-AI Supply Chain访问日期:2026-07-14
- [S24]Tier1OpenAI: Introducing ChatGPT Images 2.0访问日期:2026-07-14
- [S25]Tier1Adobe Firefly Overview and Plans访问日期:2026-07-14
- [S26]Tier1OpenAI: Image generation API访问日期:2026-07-14