El transformer no reemplazó cada técnica de machine learning — el gradient boosting sigue ganando tablas, el control predictivo por modelo sigue en fábricas — pero se convirtió en el backbone por defecto para aprendizaje de representaciones donde grandes datasets y cómputo paralelo convergen. Visión, lenguaje, código y modelos multimodales comparten una familia arquitectónica: self-attention sobre secuencias, preentrenamiento a escala, luego fine-tuning. Esa consolidación explica por qué parece que los transformers "devoraron" el ML aunque los pipelines clásicos nunca desaparecieron.
Por qué los LLM adoptaron transformers casi de inmediato
El lenguaje fue el primer cliente perfecto. El corpus de entrenamiento ya existía — texto web, libros, código — sin ambiente requerido. El objetivo es simple: predecir el siguiente token. Cada paso de entrenamiento es embarazosamente paralelo sobre secuencias; ningún motor de física bloquea el backward pass. Las leyes de escalado de Kaplan et al. y luego Chinchilla hicieron predecible el gasto de cómputo: más parámetros y más tokens, en balance, mejoran el loss de forma confiable. El entrenamiento de LLM es aprendizaje por lotes offline sobre corpus congelados. Esa economía de datos hizo visible para todos primero la revolución transformer.
Por qué la robótica quedó rezagada: física y entrenamiento paralelo
El reinforcement learning en robótica es otro problema. Las políticas aprenden de interacción, no de un corpus precolectado. Cada paso del ambiente depende de física, contacto, límites de actuadores y ruido de sensores. La eficiencia de muestras es brutal: algoritmos clásicos como PPO necesitan millones de transiciones. Los robots reales no pueden ofrecer ese throughput; la teleoperación es lenta y costosa.
Por años el cuello de botella fue infraestructura, no arquitectura de modelo. El bucle tradicional — simulador de física en CPU, copiar observaciones a GPU, entrenar una política MLP pequeña, copiar acciones de vuelta — limita cuánta experiencia puedes generar. Isaac Gym (2021) mostró qué cambia cuando el bucle completo permanece en GPU: buffers de física alimentan tensores PyTorch directamente, habilitando decenas de miles de ambientes paralelos y un entrenamiento unas dos o tres órdenes de magnitud más rápido en tareas de control continuo. La robótica no carecía de interés en deep learning; carecía de la fábrica de datos paralela que los LLM disfrutaron por defecto.
Bucles de simulación que los practicantes ya conocen
El bucle conceptual es familiar para quien ha entrenado agentes dentro de un simulador. Dylan Engelbrecht escribió Introduction to Unity ML-Agents sobre Unity ML-Agents — un toolkit de reinforcement learning en simulaciones Unity, no un gimmick solo para juegos. Layouts de manufactura, gemelos digitales de almacenes, ambientes procedurales y escenas de investigación comparten el mismo contrato de entrenamiento: reset de episodio, tensores de observación, señales de recompensa, actualización de política. ML-Agents enseña a pensar en bucles — ticks de simulación y episodios de entrenamiento — en lugar de scripts puntuales. La brecha para robótica a escala transformer fue throughput: sims de juegos e investigación en física CPU rara vez alcanzan los conteos de ambientes paralelos que hacen prácticas las redes de política grandes.
Isaac Lab cierra la brecha de throughput
Isaac Lab es el stack modular abierto que NVIDIA posiciona como sucesor de Isaac Gym — aprendizaje robótico acelerado por GPU en Isaac Sim con física paralela de cuerpos rígidos y deformables (PhysX), renderizado tiled, domain randomization y ambientes listos para entrenar manipulación y locomoción. El objetivo de diseño es RL e imitation learning a escala de datacenter: miles de ambientes por GPU, despliegue en cloud y un camino hacia integración con el motor Newton diferenciable para enfoques basados en gradientes. Es la capa faltante entre "tenemos arquitecturas transformer" y "podemos entrenarlas con datos de robot".
Sea preciso sobre determinismo. Los autores de Isaac Gym señalan que rollouts totalmente deterministas pueden romperse bajo cierta randomización en runtime y orden de scheduling GPU — el orden de punto flotante sobre miles de env paralelos puede divergir. Simulación de alto throughput residente en GPU es la ganancia; reproducibilidad bit-exact en cada escenario rico en contacto sigue siendo difícil. Transfer sim-to-real, certificación de seguridad y varianza de hardware siguen siendo problemas posteriores. Sim rápida no los borra, pero cambia lo que es económicamente entrenable.
Los transformers ya entran en robótica
La robótica no ignoró transformers — los adoptó más tarde y con presupuestos de datos menores. RT-1 escaló una política transformer en grandes datasets de demostración real. RT-2 co-fine-tuned modelos visión-lenguaje en trayectorias de robot, tratando acciones como tokens para transferir priors visuales a escala web al control. Políticas de difusión y flow añaden otro camino: generar chunks de acción con modelos de secuencia de alta capacidad. El retraso es ritmo y escala respecto al lenguaje, no ausencia de la arquitectura.
Los modelos fundacionales de robótica probablemente siguen
La convergencia es directa. Los transformers aportan capacidad y transfer; la sim GPU aporta throughput de experiencia; datasets de demostración y teleoperación aportan anclaje en tareas físicas. Juntos reflejan la fórmula LLM — preentrenar ampliamente, especializar por embodiment o tarea — aplicada a control en bucle cerrado en lugar de predicción de siguiente token.
Los modelos fundacionales de robótica probablemente siguen: políticas visión-lenguaje-acción de propósito general y controladores preentrenados en sim que fine-tunean en logs de robot real, análogo a cómo los modelos de chat fine-tunean desde una foundation de texto. Un "boom masivo" no está garantizado en calendario — costo de hardware, seguridad y brechas sim-to-real siguen limitando despliegue — pero el cuello de botella de entrenamiento pasa de "¿podemos ejecutar suficiente RL?" a "¿podemos curar datos de interacción diversos y de alta calidad?" Cuando sim paralela es barata, las políticas transformer se vuelven racionales, no exóticas.
Para quienes cruzan juegos, simulación y IA física: el modelo mental que ya usas en ML-Agents o Isaac Lab — bucles, recompensas, rollouts paralelos — es el mismo que necesitarán las políticas fundacionales de robot. La diferencia es escala. Los modelos de lenguaje ganaron primero porque los datos ya estaban en disco. La robótica está construyendo la fábrica de datos ahora.