模型

Llama 3.2:覆盖端侧文本与视觉理解的开放权重模型家族

Llama 3.2 是 Meta 于 2024 年发布的模型家族,包含面向端侧文本任务的 1B、3B 模型,以及支持图像理解的 11B、90B 视觉模型。

Llama 3.2 open-weight-models multimodal edge-ai meta-ai Llama 3.2 是 Meta 于 2024 年发布的模型家族,包含面向端侧文本任务的 1B、3B 模型,以及支持图像理解的 11B、90B 视觉模型。

Frontmatter

结构化元信息

实体类型
模型
主分类
模型
产品状态
已上线
开放状态
部分开源
信息截至
2026-08-09

1. 项目是什么

Llama 3.2 是 Meta 于 2024-09-25 发布的一组开放权重模型。家族包含 1B、3B 的轻量纯文本模型,以及 11B、90B 的视觉模型;前两者面向边缘与移动设备,后两者接收文本和图像并输出文本。[S1] 它不是单一参数规模,也不能把文本版能力外推给视觉版。

2. 解决什么问题

应用团队往往要在端侧隐私、延迟、硬件容量和多模态理解之间取舍。Llama 3.2 用较小文本模型覆盖摘要、改写与指令跟随等本地任务,同时以更大视觉模型处理图像识别、图表理解和图像问答,减少所有请求都必须交给远程大型模型的依赖。[S1]

3. 核心能力

官方发布页说明,1B 与 3B 模型支持 128K 上下文,并针对 Qualcomm、MediaTek 硬件和 Arm 处理器提供合作或优化路径;11B 与 90B 视觉模型是在对应文本模型基础上加入视觉适配器,可用于图像推理、图像描述和视觉问答。[S1] 家族同时提供预训练与指令微调版本。

4. 典型工作流

团队先按任务选择文本或视觉分支,再根据设备内存、延迟和准确率选择规模与量化方式。获取权重和许可证后,在目标硬件完成推理适配,用本领域样本评测;必要时再微调。生产中应把模型前后处理、提示模板、版本、量化参数和安全过滤一起固定,避免只记录“用了 Llama 3.2”。

5. 适用场景

1B、3B 更适合端侧摘要、分类、改写和有限指令任务;11B、90B 视觉版适合图片描述、文档或图表理解和带图问答。[S1] 但模型是否适用于医疗影像、身份识别、自动决策或高风险内容,必须按具体场景重新验证,发布中的通用能力不能代替行业合规。

6. 部署与接入

Meta 提到可用 torchtune 做定制,并通过 torchchat 做本地部署;轻量模型也与移动硬件生态合作。[S1] 实施时应先在开发机复现官方推理,再转到真实设备测首 token 延迟、总时延、峰值内存、功耗与崩溃率。视觉模型还要核对图像尺寸、预处理和多图输入边界。

7. 主要风险

开放权重不等于无条件开源,使用者仍需阅读 Llama 3.2 许可证、可接受使用政策和分发要求,因此本文标为 partial。端侧运行能减少部分网络传输,却会把模型文件、提示、日志和更新责任交给应用方。模型还可能产生幻觉、偏见、越权建议或对对抗图像作出错误判断。

8. 安全与治理

Meta 的同日安全说明称,Llama 3.2 延续 3.1 的多层安全路径,对微调模型做风险评估,并在预训练数据阶段采用缓解措施。[S2] 这些是开发方披露,不是对所有下游应用的保证。部署团队仍要按地区、用户年龄和任务风险建立红队测试、内容策略、人工升级与事件响应。

9. 验收建议

建立与版本对应的离线测试集,文本版覆盖长输入、指令冲突、隐私信息和拒答;视觉版覆盖小字、旋转、遮挡、图表、无关图片和对抗提示。验收同时记录质量、延迟、内存、功耗、错误恢复与安全违规率,并和一个明确基线比较。任何量化、硬件或提示变更都应重跑测试。

10. 来源与更新时间

本文核对时间为 2026-08-09。Meta 官方发布页用于确认 2024-09-25 的发布时间、四种规模、文本与视觉分支、128K 上下文及部署生态;同日责任 AI 说明用于确认公开的安全评估路径。官方性能主张未被写成独立结论。[S1][S2]

  • [S1] Meta AI|Llama 3.2: Revolutionizing edge AI and vision with open, customizable models|链接
  • [S2] Meta AI|Connect 2024: The responsible approach we’re taking to generative AI|链接