DiffusionGemma:面向本地低并发的文本扩散开放模型
Google 基于 Gemma 4 推出的实验性开放权重文本扩散模型,以并行去噪生成换取本地低并发场景的更低时延。
DiffusionGemma open-weight-models foundation-model model-serving model-customization Google 基于 Gemma 4 推出的实验性开放权重文本扩散模型,以并行去噪生成换取本地低并发场景的更低时延。
1. 项目定位
DiffusionGemma 是 Google 在 2026 年 6 月公开的实验性开放权重模型。它基于 Gemma 4 的 26B 稀疏 MoE 架构,不按传统方式逐 token 向左到右生成,而是对一块 token 画布反复去噪。[S1][S2] 这不是 Gemma 4 的通用替代品,更像用于研究低时延文本生成、代码补全和非线性结构输出的技术分支。
2. 要解决的问题
自回归模型在单用户、本地 GPU 上生成时,常受显存带宽和串行解码约束。DiffusionGemma 把一块文本同时交给加速器计算,希望提高低到中等批量下的硬件利用率。[S1] 适合验证的问题是“固定设备上能否降低交互等待”,而不是脱离硬件、批量和质量条件宣称全面提速。
3. 生成机制
模型以随机占位 token 开始,多轮预测并锁定置信度较高的位置,其余位置继续重采样;每个 256-token 画布内可以使用双向注意力。[S1][S2] 长文本则按块推进,并把已经确定的内容写入缓存。这个机制允许后续轮次修正画布内早先的不稳定位置,但不等于它能自动纠正事实错误。
4. 模型形态
官方资料把它描述为 26B MoE、推理时约激活 4B 参数,并支持文本、图像和视频输入、文本输出;音频输入不在支持范围内。[S2] 量化后可在约 18GB 显存范围内运行,是其面向本地实验的重要前提。部署前仍需核对具体权重版本、量化格式、上下文长度和推理框架兼容性。
5. 性能与取舍
Google 报告在特定独立 GPU 条件下最高可达到约 4 倍文本生成速度,但同时明确指出总体输出质量低于标准 Gemma 4,高并发云服务中的优势也会减弱。[S1][S2] 因此验收必须同时记录质量、首段等待、总耗时、吞吐、显存和功耗,不能只选一个 tokens/s 峰值。
6. 部署路径
官方提供模型权重,并列出 Hugging Face、Kaggle、Vertex 等入口;开发指南还给出 vLLM 服务示例。[S1][S2] 更稳妥的路径是先在隔离工作站固定驱动、框架、权重哈希和采样参数,再用内部非敏感任务试跑。不要直接把实验模型接入对外生产接口或替换现有质量基线。
7. 适用场景
候选场景包括本地代码补全、行内改写、格式受约束的短文本和需要快速迭代的研究原型。选择任务时要让 256-token 块内的双向信息流真正有价值。长篇事实写作、高并发 API 或要求稳定最高质量的应用,应继续与成熟自回归模型对照,而不是只凭架构新颖性迁移。
8. 风险与治理
开放权重并不消除模型输出、许可证、数据和供应链风险。团队应记录权重来源与许可证,限制模型读取的目录和网络,避免把密钥或个人数据放进提示;输出进入代码库或业务系统前仍要人工或自动验证。实验状态、质量取舍和硬件依赖也应写入服务说明,防止使用者误解能力边界。
9. 验收建议
准备一组短文本、代码填空、结构化输出和长上下文任务,在同一设备上与标准 Gemma 4 对比。每组至少重复多次,记录正确率、格式通过率、首 token 或首块时间、总时延、显存峰值和失败样本。只有目标任务的质量达到门槛且时延改善可复现,才进入受限试点;否则保留为研究资产。
10. 来源与更新时间
本简调截至 2026-08-12,重点依据 Google 的发布说明和模型文档。性能数字均保留官方限定条件,未把厂商实验外推为所有设备结论。