RT-2 (Robotics Transformer 2)
模型概览
- 发布团队:Google DeepMind Robotics
- 基础架构:PaLI-X (55B) / PaLM-E (12B) → 联合训练动作 Token
- 输入 / 输出:图像 + 文本指令 → 机器人动作 Token
- 发布日期:2023 年 7 月
核心机制
动作作为语言
RT-2 把 7-DoF 末端动作离散化为文本 Token,直接复用大语言模型的词表。 模型在 (图像 + 指令 → 动作) 配对上微调,视觉与动作在同一空间。
思维链 (Chain-of-Thought)
User: "把可乐递给疲惫的人" │ ▼ RT-2 推理"识别可乐罐 → 识别疲惫的人 (闭眼/坐姿) → 规划路径 → 抓取 → 递送" │ ▼ 输出动作[Action Tokens 序列]- 符号推理能力:可执行「把 X 放到 Y 上」「选最大 / 最小」等逻辑
- 涌现能力:训练中未出现的新指令组合也能泛化
训练范式
- 预训练数据集:Open X-Embodiment + 互联网图文
- 微调数据:机器人遥操作 (RT-1 数据 + 互联网数据)
- 关键创新:在 VLM 基础上联合训练动作 Token,而非从头训练
局限与改进方向
- 训练昂贵:55B 模型需 TPU v4 pod 训练数周
- 闭环控制频率:~1-3 Hz,无法用于高速任务
- 改进方向:RT-2-X (跨本体)、RT-H (层次化)、OpenVLA (开源版)
⛔ 别这么做 (Anti-patterns)
经验证的坑 —— 跳过 = 至少浪费半天,严重的烧板 / 锁机。
| ❌ 错误做法 | 💥 后果 | ⚠️ 风险 | 范围 |
|---|---|---|---|
| 不要在没装 NVIDIA 驱动 555+ 的情况下跑 Isaac Sim 4.2+ | 驱动不匹配 = 启动黑屏。nvidia-smi 查驱动版本。 | 🔴 | Isaac Sim / Isaac Lab |
| 不要把 OpenVLA / Octo / Pi-0 在没 4-bit 量化的状态下塞进 24GB 4090 | 7B 模型 fp16 = 14GB+KV cache → OOM。先 bitsandbytes 4-bit 加载再 fine-tune。 | 🟡 | OpenVLA / Octo / Pi-0 |
不要在 Isaac Sim 训练 RL 时不设 num_envs 上限 | 贪心 8192 envs = 24GB 显存瞬间爆。RTX 4090 实测 4096 envs 是甜点。 | 🟡 | Isaac Lab / RSL-RL / SkyRL |
| 不要在真机部署 VLA 之前跳过仿真域随机化 | sim-to-real gap 不收敛 = 99% 仿真成功率 + 0% 真机。先 DR 20% (质量 / 摩擦 / 视觉)。 | 🔴 | 任何 VLA 真机部署 |
| 不要把 3DGS 训练数据直接用手机 4K 视频 | 4K 60fps 1 小时 ≈ 100GB,且相机畸变 = 训练出来模糊。先 ffmpeg 1080p + 标定。 | 🟡 | 3D Gaussian Splatting |
| 不要在没 GPU 的 Linux 容器里跑 VLA 微调 | CPU 跑 7B = 1 步 5 分钟,1 epoch = 3 天。最低 1×RTX 4090 或租云。 | 🔴 | OpenVLA / VLA 微调 |
| 不要用 MuJoCo 默认 simulator 跑 Mobile ALOHA 仿真 | 默认 scene 没有双臂 + 移动底盘。要用 aloha_sim 官方 scene 文件。 | 🟡 | MuJoCo / ALOHA |
🚨 风险总览 (Risk Matrix)
| 风险等级 | 含义 | 例子 |
|---|---|---|
| 🟢 低 | 改错可回滚 / 几分钟恢复 | pip 全局装包、DHCP IP 写死 |
| 🟡 中 | 需要重新刷机 / 重装 / 1-2 小时恢复 | 装错 ROS 2 版本、没 OTA 升级看版本 |
| 🔴 高 | 不可逆 / 烧板 / 安全风险 | 电池反接、micro-ROS 没看门狗、刷机中途断电 |