英伟达开源面向人形机器人推理与技能基础模型:GR00T-N1.5-3B
NVIDIA Isaac GR00T N1.5-3B 模型
一、模型概述
NVIDIA Isaac GR00T N1.5-3B 是一款面向人形机器人推理与技能的开源基础模型。该模型能够处理多模态输入,包括语言指令和图像数据,在多样化环境中完成操作任务。开发者可以利用真实或合成数据对模型后进行训练,以适配特定的人形机器人或定制化任务。作为中等规模的版本,GR00T N1.5-3B 基于预训练的视觉和语言编码器构建,并采用流匹配动作Transformer来建模基于视觉、语言和本体感知的动作序列。
二、技术架构
(一)核心架构组成
-
视觉与语言编码器
-
视觉方面,模型使用预训练的视觉Transformer(SigLip2)处理来自机器人摄像头的图像帧。这些图像帧可以是可变数量的224×224 uint8格式的RGB图像。
-
语言方面,预训练的T5 Transformer负责编码文本指令。这种架构可以将图像标记嵌入和语言标记嵌入序列化,从而处理每个具象的可变数量视图。
-
-
本体感知与动作处理
-
机器人本体感知数据通过多层感知机(MLP)进行编码,并根据具象ID进行索引。为了处理可变维度的本体输入,在送入MLP之前会将其填充至可配置的最大长度。
-
动作编码和速度预测解码同样由MLP完成,每个独特的具象对应一个MLP。流匹配Transformer(即扩散Transformer - DiT)负责建模基于观测的本体感知和动作序列。在扩散步骤条件中,采用自适应层归一化(AdaLN)实现。
-
-
流匹配Transformer机制
-
在训练阶段,输入动作通过随机插值干净动作向量和高斯噪声向量进行损坏。
-
推理时,策略首先采样高斯噪声向量,然后通过速度预测迭代重建连续值动作。
-
(二)架构改进
在GR00T-N1.5中,视觉 - 语言特征与扩散 - Transformer(DiT)之间的MLP连接器经过修改,以提高在模拟基准测试中的性能。同时,模型与流匹配和世界建模目标联合训练。
三、输入输出规格
(一)输入类型与格式
-
视觉输入
-
类型:图像帧
-
格式:可变数量的224×224 uint8 RGB图像帧,来自机器人摄像头
-
参数:2D - RGB图像,方形
-
-
状态输入
-
类型:机器人本体感知
-
格式:浮点数
-
参数:1D - 浮点数向量
-
-
语言指令输入
-
类型:文本
-
格式:字符串
-
参数:1D - 字符串
-
(二)输出类型与格式
-
输出类型:动作
-
输出格式:连续值向量
-
输出参数:二维(2D)
- 连续值向量对应机器人上的不同电机控制,具体取决于机器人具象的自由度。
四、运行环境与支持
(一)运行引擎与硬件兼容性
-
运行引擎:PyTorch
-
支持的硬件微架构
-
NVIDIA Ampere
-
NVIDIA Blackwell
-
NVIDIA Jetson
-
NVIDIA Hopper
-
NVIDIA Lovelace
-
(二)操作系统支持
优选且支持的操作系统为Linux。
五、应用领域与价值
(一)研究领域
为人工智能驱动的机器人研究和算法开发提供支持,研究人员可利用该模型探索机器人智能的新边界。
(二)开发应用
开发者能够将AI集成并定制到各种机器人应用中,加速机器人技术的落地。
(三)商业价值
初创公司和企业可以利用该模型加速机器人开发进程,降低训练成本,从而在竞争激烈的市场中占据优势。
六、伦理考量与安全实践
NVIDIA强调可信AI是共同责任,并已建立相关政策和实践以支持广泛的人工智能应用开发。开发者在下载或使用该模型时,应与内部模型团队合作,确保模型符合相关行业和应用场景的要求,并解决可能的产品滥用问题。有关该模型的详细伦理考量,请参阅Model Card++(可解释性、偏差、安全与隐私)以及隐私子卡片。若发现安全漏洞或NVIDIA AI相关问题,可通过指定渠道报告。
七、版本演进与资源
当前版本为1.5。之前的版本可通过链接访问:https://huggingface.co/nvidia/GR00T-N1-2B。相关的博客文章发布:在https://nvidianews.nvidia.com/news/foundation-model-isaac-roboticsplatform。社区教程文章(如何在SO100/101上进行微调)可在以下链接查看:https://huggingface.co/blog/nvidia/gr00t-n1-5-so101-tuning。
核心技术汇总

更多推荐


所有评论(0)