bitbitbla logo
← Volver al blog
RobóticaModelos mundoPolítica de robots

Modelos de mundo: cómo la predicción de dinámica cambia la política de robots

2026-08-04Equipo BitBitBla
Modelos de mundo: cómo la predicción de dinámica cambia la política de robots

El problema que resuelven los WAM

En robótica, entrenar una política que funcione solo en las escenas de demostración es fácil. Que funcione cuando los objetos cambian de forma, posición o iluminación es otra cosa. Un modelo entrenado en una mesa blanca falla en una mesa de madera. Un gripper que aprendió a cerrar sobre un cubo no cierra igual sobre una esfera.

El enfoque estándar hasta ahora ha sido añadir un módulo de acción a un modelo de visión-lenguaje pretrenado, creando un modelo visión-lenguaje-acción (VLA). Funciona bien para entender instrucciones en lenguaje natural y reconocer objetos. Pero ahí está el problema: un VLM aprende a describir el mundo, no a predecir cómo evoluciona. Ese modelo de dinámica que falta es exactamente lo que un robot necesita cuando la tarea depende de anticipar cómo cambiará una escena. Cuando el gripper se cierra, ¿qué pasa con la taza? Cuando se suelta un objeto, ¿dónde cae?

NVIDIA propone reemplazar la columna vertebral de lenguaje con un modelo de mundo basado en video, creando lo que llama World Action Model (WAM). Jim Fan, investigador de NVIDIA, resumió esta transición con una frase: "Los VLA están muertos, larga vida a los World Action Models."

Qué cambia en la práctica

La diferencia no es teórica. Un VLM está optimizado para generar texto sobre imágenes. Los WAM modelan cómo evoluciona una escena. Eso significa que durante el entrenamiento posterior, no hay que enseñar dinámica desde cero: la política se especializa sobre un modelo que ya tiene una comprensión previa de la física.

Según el paper de NVIDIA "World Action Models are Zero-shot Policies", esto se traduce en tres ganancias prácticas: necesitas menos datos para alcanzar una capacidad dada, el comportamiento generaliza mejor fuera de la distribución de entrenamiento, y el camino hacia una nueva plataforma (otro robot, otro gripper) es más corto. Estas propiedades vienen del propio backbone de preentrenamiento, así que aparecen en cualquier política que se especialice a partir de él.

Cosmos 3, la base

NVIDIA presenta Cosmos 3, un modelo de mundo omnimodal basado en una arquitectura Mixture-of-Transformers. El flujo de entrada multimodal pasa por un transformer autoregresivo que genera tokens discretos como texto. Esto guía un transformer de difusión para modalidades continuas: imagen, video, audio y acción. El texto se genera por decodificación token-a-token; todo lo demás, incluidas las acciones, se sintetiza por denoising iterativo.

Cosmos 3 viene en tres tamaños: 4B (Cosmos Edge), 16B (Cosmos Nano) y 64B (Cosmos 3 Super). Lo que lo hace sólido como base para especialización es la amplitud de sus datos de mundo físico: aproximadamente 767 millones de imágenes, 348 millones de videos de dinámica real y 8 millones de muestras de acción que abarcan manipulación robótica, conducción autónoma, movimiento de cámara y movimiento egocéntrico.

NVIDIA ya ofrece políticas post-entrenadas: Cosmos3-Nano-Policy-DROID (16B) para el brazo Franka Panda y Cosmos3-Edge-Policy-DROID (4B) para despliegue en dispositivo. Dada una instrucción en lenguaje y observaciones de múltiples cámaras, ambas generan trayectorias de acción para el robot.

Un cambio de paradigma

Los WAM representan un movimiento conceptual: de "aprender a actuar" a "aprender cómo evoluciona el mundo". El robot no memoriza demostraciones, anticipa consecuencias. Cosmos 3 hace este enfoque práctico ofreciendo tres tamaños que se ajustan a diferentes tiers de despliegue sin forzar un solo compromiso.

Dónde el hardware conversacional entra en juego

En bitbitbla, trabajamos en traducir voz en comandos JSON deterministas que el hardware ejecuta directamente. La plataforma envía la intención detectada, la confianza y los parámetros de la acción por puerto serie o webhooks, listos para ejecución física. El microcontrolador actúa como terminal que recibe órdenes directas, y los triggers de contexto permiten que el agente reaccione a variables del entorno en tiempo real.

En lugar de recargar el microcontrolador con modelos pesados de física o visión, en BitBitBla mantenemos el firmware del dispositivo ligero y determinista. La inteligencia contextual reside en nuestro orquestador en la nube, que procesa la dinámica del entorno y envía al microcontrolador la orden precisa en formato JSON por puerto serie para su ejecución inmediata.

Fuente: NVIDIA Embedded.