垂直应用

Microsoft Muse WHAM:面向游戏创意的世界与人类动作模型

Muse 是微软研究院面向游戏创意探索推出的首个世界与人类动作模型,可生成游戏画面、控制器动作或两者组合。

Microsoft Muse WHAM generative-media world-model creative-workflows open-weight-models Muse 是微软研究院面向游戏创意探索推出的首个世界与人类动作模型,可生成游戏画面、控制器动作或两者组合。

Frontmatter

结构化元信息

实体类型
模型
主分类
垂直应用
产品状态
已上线
开放状态
部分开源
信息截至
2026-08-08

1. 项目定位

Microsoft Muse 是微软研究院在 2025 年 2 月公开的首个 World and Human Action Model(WHAM)。它不是自动制作完整游戏的产品,而是面向玩法构思的研究模型:根据短暂的真实游戏片段和控制输入,继续生成画面、动作或二者组合,帮助创作者探索“如果这样操作,世界会怎样发展”。[S1][S2]

2. 它解决什么问题

玩法原型通常需要先实现规则、角色和交互,再判断一个设想是否值得继续。Muse 尝试把部分探索提前到生成阶段,让设计者通过不同提示快速观察可能的游戏演化。官方强调的目标是支持人的创意过程,因此更适合做构思材料与研究实验,而不是替代可运行、可交付的游戏工程。[S1]

3. 核心能力

WHAM 可以在世界模型模式下预测后续画面,在动作模型模式下生成合理的控制器动作,也可以同时生成两者。官方展示的 WHAM-1.6B 示例以 1 秒、10 帧的真实《Bleeding Edge》玩法作为起点,并能延展出较长且保持一定一致性的序列。这一能力重点在交互世界的演化,不等同于普通文本转视频。[S1][S2]

4. 数据与边界

官方项目页说明,WHAM 使用来自 Ninja Theory《Bleeding Edge》的超过十亿张图像及对应控制器动作训练,约等于七年以上连续人类游玩数据。这个来源让模型能同时学习视觉状态与人的操作,但也意味着公开证据主要来自单一游戏环境;对其他画风、规则和输入设备的迁移能力不能直接推定。[S2]

5. 开放与获取方式

微软公开了模型权重、样本数据和 WHAM Demonstrator 概念原型,并通过 Azure AI Foundry 提供研究者试用入口。这里的“开放”更接近开放研究材料与权重,而非一套已经标准化、可直接嵌入任意商业游戏的完整 SDK。团队应分别核对模型条款、数据许可和 Azure 环境要求。[S1][S2]

6. 适用场景

较合适的场景包括:围绕既有游戏素材试探替代动作路径、研究玩家输入与世界状态之间的关系、为关卡或机制讨论生成可视化参考,以及教学中的世界模型实验。若目标是生成最终美术资产、稳定关卡逻辑或跨平台可执行代码,Muse 当前公开定位并不能直接覆盖这些交付物。[S1][S2]

7. 建议使用流程

先选择一个规则明确、允许使用的短游戏片段,保留其画面与控制序列;再分别测试只预测世界、只生成动作和联合生成三种模式;最后由设计与工程人员标记可用灵感、明显违背规则的片段和无法复现的结果。这样能把模型当作创意探针,而不是把生成视频误认成真实游戏状态。[S2]

8. 主要风险

首要风险是把视觉连贯误判为规则正确:序列看起来合理,并不代表碰撞、资源、敌人状态等底层逻辑真实存在。其次是训练环境集中,外推到新游戏时可能失真。还要关注输入素材权利、模型输出的可追溯性,以及研究原型在版本、可用性和服务形态上的变化。[S1][S2]

9. 验收方法

小规模试验应预先固定输入片段和动作脚本,重复生成并记录四类指标:短期画面一致性、动作与结果的对应关系、关键游戏规则是否被保持、创作者是否获得可执行的新设想。只有当结果能稳定支持具体设计决策,且失败样本被人工复核后,才适合扩大使用范围。[S1][S2]

10. 来源与更新时间

本文依据微软官方材料整理,研究与核对日期为 2026-08-08。项目能力、入口和许可可能变化,实际使用前应重新核对官方页面。

  • [S1] Microsoft Research|Introducing Muse: Our first generative AI model designed for gameplay ideation|链接
  • [S2] Microsoft Research|WHAM: World and Human Action Models|链接