Modele de lume: cum predicția dinamicii schimbă politica roboților

Problema pe care o rezolvă WAM-urile
În robotică, antrenarea unei politici care funcționează doar pe scenele de demonstrație este ușoară. Să funcționeze când obiectele își schimbă forma, poziția sau iluminarea este altceva. Un model antrenat pe o masă albă eșuează pe una de lemn. Un gripper care a învățat să se închidă pe un cub nu se închide la fel pe o sferă.
Abordarea standard până acum a fost să adaugi un modul de acțiune la un model viziune-limbaj preantrenat, creând un model viziune-limbaj-acțiune (VLA). Funcționează bine pentru a înțelege instrucțiuni în limbaj natural și a recunoaște obiecte. Dar aici e problema: un VLM învață să descrie lumea, nu să prezică cum evoluează. Modelul de dinamică care lipsește este exact ceea ce are nevoie un robot când sarcina depinde de anticiparea modului în care se va schimba o scenă. Când gripperul se închide, ce se întâmplă cu ceașca? Când se eliberează un obiect, unde cade?
NVIDIA propune înlocuirea coloanei vertebrale de limbaj cu un model de lume bazat pe video, creând ceea ce numește World Action Model (WAM). Jim Fan, cercetător la NVIDIA, a rezumat această tranziție într-o frază: „VLA-urile sunt moarte, trăiască World Action Models.”
Ce se schimbă în practică
Diferența nu este teoretică. Un VLM este optimizat să genereze text despre imagini. WAM-urile modelează cum evoluează o scenă. Asta înseamnă că în timpul post-antrenării nu trebuie să predai dinamica de la zero: politica se specializează pe un model care are deja o înțelegere prealabilă a fizicii.
Conform paperului NVIDIA „World Action Models are Zero-shot Policies”, asta se traduce în trei câștiguri practice: ai nevoie de mai puține date pentru a atinge o capacitate dată, comportamentul generalizează mai bine în afara distribuției de antrenament, iar drumul către o platformă nouă (alt robot, alt gripper) este mai scurt. Aceste proprietăți vin din backbone-ul de preantrenare însuși, deci apar în orice politică care se specializează din el.
Cosmos 3, baza
NVIDIA prezintă Cosmos 3, un model de lume omnimodal bazat pe o arhitectură Mixture-of-Transformers. Fluxul de intrare multimodal trece printr-un transformer autoregresiv care generează tokeni discreți ca text. Acesta ghidează un transformer de difuzie pentru modalități continue: imagine, video, audio și acțiune. Textul este generat prin decodare token cu token; tot restul, inclusiv acțiunile, este sintetizat prin denoising iterativ.
Cosmos 3 vine în trei mărimi: 4B (Cosmos Edge), 16B (Cosmos Nano) și 64B (Cosmos 3 Super). Ce îl face solid ca bază de specializare este amploarea datelor sale despre lumea fizică: aproximativ 767 de milioane de imagini, 348 de milioane de video-uri de dinamică reală și 8 milioane de mostre de acțiune care acoperă manipulare robotică, conducere autonomă, mișcare de cameră și mișcare egocentrică.
NVIDIA oferă deja politici post-antrenate: Cosmos3-Nano-Policy-DROID (16B) pentru brațul Franka Panda și Cosmos3-Edge-Policy-DROID (4B) pentru deploy pe dispozitiv. Având o instrucțiune în limbaj și observații multi-cameră, ambele generează traiectorii de acțiune pentru robot.
O schimbare de paradigmă
WAM-urile reprezintă o mișcare conceptuală: de la „a învăța să acționezi” la „a învăța cum evoluează lumea”. Robotul nu memorează demonstrații, anticipează consecințe. Cosmos 3 face această abordare practică oferind trei mărimi care se potrivesc diferitelor tier-uri de deploy fără a forța un singur compromis.
Unde intră în joc hardware-ul conversațional
La bitbitbla lucrăm la traducerea vocii în comenzi JSON deterministe pe care hardware-ul le execută direct. Platforma trimite intenția detectată, încrederea și parametrii acțiunii pe port serial sau webhook-uri, gata pentru execuție fizică. Microcontrolerul acționează ca un terminal care primește ordine directe, iar trigger-ele de context permit agentului să reacționeze la variabilele mediului în timp real.
În loc să încărcăm microcontrolerul cu modele grele de fizică sau viziune, la BitBitBla menținem firmware-ul dispozitivului ușor și determinist. Inteligența contextuală locuiește în orchestratorul nostru cloud, care procesează dinamica mediului și trimite microcontrolerului ordinul precis în format JSON pe port serial pentru execuție imediată.
Sursă: NVIDIA Embedded.
