# 为何语言模型先扩展规模——机器人基础模型很可能紧跟其后

*2026-08-15* — Transformer 在静态数据与批处理并行相合的领域改变了机器学习。机器人领域在物理约束的 RL 上滞后——直到 Isaac Lab 等 GPU 原生仿真栈使 Transformer 规模训练变得可行。

URL: https://dylanengelbrecht.dev/zh/insights/transformers-robotics-foundation-models.html

Transformer并未取代每一种机器学习技术——梯度提升在表格上仍居前列，模型预测控制仍在工厂运行——但在大数据与并行算力相合的场景，它成为表示学习的默认主干。视觉、语言、代码与多模态模型现共享一种架构家族：序列上的自注意力、大规模预训练、再微调。这种汇聚让人觉得 Transformer “吞噬”了机器学习，但经典流水线从未消失。

### 为何 LLM 几乎立即采用 Transformer

语言是完美的首个客户。训练语料库已存在——网络文本、书籍、代码——无需环境。目标简单：预测下一个 token。每次训练步在序列上并行得很好；反向传播不被物理引擎阻塞。Kaplan 等人的缩放定律与后来的 Chinchilla 让算力投入可预测：参数与 token 数平衡增加可稳定降低 loss。LLM 训练是在冻结语料库上的离线批训练。这种数据经济学让 Transformer 革命先被大家看到。

### 机器人为何滞后：物理与并行训练

机器人强化学习是另一个问题。策略从交互中学习，而非预先收集的语料库。每一步环境步都依赖物理、接触、驱动器限制与传感器噪声。样本效率极低：PPO 等经典算法需要数千万次转移。真实机器人无法提供这种吞吞量＜遥操作慢且昂贵。

数年间瓶颈在基础设施，而非模型架构。传统循环——CPU 物理仿真、观测拷到 GPU、训练小型 MLP 策略、再拷回动作——限制了可生成的经验量。Isaac Gym（2021）展示了整个循环位于 GPU 时的变化：物理缓存直接饱和 PyTorch 张量，支持数以万计的并行环境，连续控制任务上训练速率提升约两到三个数量级。机器人领域不是缺少对深度学习的关注，而是缺少 LLM 默认便有的并行数据工厂。

### 实践者已熟悉的仿真循环

对在仿真器中训练过智能体的人来说，这种循环很熟悉。Dylan Engelbrecht 著有 Introduction to Unity ML-Agents，围编 Unity ML-Agents——在 Unity 仿真中做强化学习的工具包，不仅限于游戏。制造布局、仓库数字孪生、过程化环境与研究场景共享同一训练契约：回合重置、观测张量、奖励信号、策略更新。ML-Agents 教工程师按循环思考——仿真 tick 与训练回合——而非一次性脚本。机器人领域在 Transformer 规模上的缺口是吞吞量：CPU 物理上的游戏与研究仿真很难达到让大型策略网络可行的并行环境数。

### Isaac Lab 弥补吞吞量缺口

Isaac Lab 是 NVIDIA 定位为 Isaac Gym 后继的开源模块化栈——在 Isaac Sim 上的 GPU 加速机器人学习，支持并行刚体与可变形物理（PhysX）、瓷贴渲染、域随机化与可直接训练的操作与运动环境。设计目标是数据中心规模的 RL 与模仿学习：每 GPU 数千环境、云端部署，以及与可微分 Newton 物理引擎集成以支持梯度方法。它填补了“我们有 Transformer 架构”与“我们能在机器人数据上训练它”之间的缺层。

对确定性要说清楚。Isaac Gym 作者指出，在某些运行时随机化与 GPU 调度下，完全确定性的 rollout 可能失败——数千并行环境上的浮点计算顺序可发散。高吞吞、GPU 位于仿真是关键收益；在每个接触富集场景丫得到位精确可复现仍很难。仿真到真实迁移、安全认证与硬件差异仍是后续问题。快速仿真不能消除它们，但改变了什么在经济上可训练。

### Transformer 已进入机器人领域

机器人领域并未无视 Transformer——只是更晚、数据预算更小地采用。RT-1 在大规真实演示数据上扩展 Transformer 策略。RT-2 将视觉—语言模型与机器人轨迹联合微调，把动作当成 token，使网络规模视觉先验迁移到控制。扩散与流策略另一路径：用高容量序列模型生成动作块。滞后是相较于语言的节奏与规模，而非架构缺失。

### 机器人基础模型很可能紧跟其后

汇聚很直接。Transformer 提供容量与迁移；GPU 仿真提供经验吞吞量；演示数据与遥操作提供物理任务的锚定。合起来就是 LLM 公式——广泛预训练、按身体或任务微调——应用于闭环控制而非下一 token 预测。

机器人基础模型很可能紧跟其后：通用视觉—语言—动作策略与仿真预训练的控制器，在真实机器人日志上微调，类传聊天模型从文本基础微调。“大爆炸”并不能按日历保证——硬件成本、安全与仿真到真实间隙仍限制部署——但训练瓶颈正从“能否跑够多 RL”转为“能否策划多样、高质交互数据”。当并行仿真变得便宜，Transformer 策略就从奇招变为合理选择。

对跨越游戏、仿真与物理 AI 的建设者：你在 ML-Agents 或 Isaac Lab 中已用的心智模型——循环、奖励、并行 rollout——也是机器人基础策略所需的。差别在规模。语言模型先胜，因为数据已在磁盘上。机器人领域现在正在建设数据工厂。
