Skip to content

RT-2 (Robotics Transformer 2)

模型概览

  • 发布团队:Google DeepMind Robotics
  • 基础架构:PaLI-X (55B) / PaLM-E (12B) → 联合训练动作 Token
  • 输入 / 输出:图像 + 文本指令 → 机器人动作 Token
  • 发布日期:2023 年 7 月

核心机制

动作作为语言

RT-2 把 7-DoF 末端动作离散化为文本 Token,直接复用大语言模型的词表。 模型在 (图像 + 指令 → 动作) 配对上微调,视觉与动作在同一空间

思维链 (Chain-of-Thought)

User: "把可乐递给疲惫的人"
▼ RT-2 推理
"识别可乐罐 → 识别疲惫的人 (闭眼/坐姿) → 规划路径 → 抓取 → 递送"
▼ 输出动作
[Action Tokens 序列]
  • 符号推理能力:可执行「把 X 放到 Y 上」「选最大 / 最小」等逻辑
  • 涌现能力:训练中未出现的新指令组合也能泛化

训练范式

  • 预训练数据集:Open X-Embodiment + 互联网图文
  • 微调数据:机器人遥操作 (RT-1 数据 + 互联网数据)
  • 关键创新:在 VLM 基础上联合训练动作 Token,而非从头训练

局限与改进方向

  • 训练昂贵:55B 模型需 TPU v4 pod 训练数周
  • 闭环控制频率:~1-3 Hz,无法用于高速任务
  • 改进方向:RT-2-X (跨本体)、RT-H (层次化)、OpenVLA (开源版)

⛔ 别这么做 (Anti-patterns)

经验证的坑 —— 跳过 = 至少浪费半天,严重的烧板 / 锁机。

❌ 错误做法💥 后果⚠️ 风险范围
不要在没装 NVIDIA 驱动 555+ 的情况下跑 Isaac Sim 4.2+驱动不匹配 = 启动黑屏。nvidia-smi 查驱动版本。🔴Isaac Sim / Isaac Lab
不要把 OpenVLA / Octo / Pi-0 在没 4-bit 量化的状态下塞进 24GB 40907B 模型 fp16 = 14GB+KV cache → OOM。先 bitsandbytes 4-bit 加载再 fine-tune。🟡OpenVLA / Octo / Pi-0
不要在 Isaac Sim 训练 RL 时不设 num_envs 上限贪心 8192 envs = 24GB 显存瞬间爆。RTX 4090 实测 4096 envs 是甜点。🟡Isaac Lab / RSL-RL / SkyRL
不要在真机部署 VLA 之前跳过仿真域随机化sim-to-real gap 不收敛 = 99% 仿真成功率 + 0% 真机。先 DR 20% (质量 / 摩擦 / 视觉)。🔴任何 VLA 真机部署
不要把 3DGS 训练数据直接用手机 4K 视频4K 60fps 1 小时 ≈ 100GB,且相机畸变 = 训练出来模糊。先 ffmpeg 1080p + 标定。🟡3D Gaussian Splatting
不要在没 GPU 的 Linux 容器里跑 VLA 微调CPU 跑 7B = 1 步 5 分钟,1 epoch = 3 天。最低 1×RTX 4090 或租云。🔴OpenVLA / VLA 微调
不要用 MuJoCo 默认 simulator 跑 Mobile ALOHA 仿真默认 scene 没有双臂 + 移动底盘。要用 aloha_sim 官方 scene 文件。🟡MuJoCo / ALOHA

🚨 风险总览 (Risk Matrix)

风险等级含义例子
🟢 低改错可回滚 / 几分钟恢复pip 全局装包、DHCP IP 写死
🟡 中需要重新刷机 / 重装 / 1-2 小时恢复装错 ROS 2 版本、没 OTA 升级看版本
🔴 高不可逆 / 烧板 / 安全风险电池反接、micro-ROS 没看门狗、刷机中途断电

参考资料