π0 是 Physical Intelligence 发布的通用机器人策略原型,以视觉、语言和机器人状态为输入,通过流匹配生成连续动作。
Tag
vision-language
包含该标签的简调共 3 篇。
Z.ai 开源的多模态模型系列,覆盖文本、图像、视频和文件输入,并加入原生函数调用能力。
Mistral 面向具身导航的 8B 模型,以单个 RGB 摄像头和自然语言指令驱动机器人移动。
Tag
包含该标签的简调共 3 篇。
π0 是 Physical Intelligence 发布的通用机器人策略原型,以视觉、语言和机器人状态为输入,通过流匹配生成连续动作。
Z.ai 开源的多模态模型系列,覆盖文本、图像、视频和文件输入,并加入原生函数调用能力。
Mistral 面向具身导航的 8B 模型,以单个 RGB 摄像头和自然语言指令驱动机器人移动。