bitbitbla logo
← Wróć do bloga
RobotykaModele świataPolityka robotów

Modele świata: jak przewidywanie dynamiki zmienia politykę robotów

2026-08-04Zespół BitBitBla
Modele świata: jak przewidywanie dynamiki zmienia politykę robotów

Problem, który rozwiązują WAM

W robotyce wytrenowanie polityki, która działa tylko w scenach demonstracyjnych, jest łatwe. Sprawienie, by działała, gdy obiekty zmieniają kształt, pozycję lub oświetlenie, to co innego. Model wytrenowany na białym stole zawodzi na drewnianym. Gripper, który nauczył się zamykać na sześcianie, nie zamyka się tak samo na sferze.

Dotychczasowe standardowe podejście polegało na dodaniu modułu akcji do wstępnie wytrenowanego modelu wizja-język, tworząc model wizja-język-akcja (VLA). Dobrze radzi sobie ze zrozumieniem instrukcji w języku naturalnym i rozpoznawaniem obiektów. Ale tu jest problem: VLM uczy się opisywać świat, a nie przewidywać, jak się rozwija. Ten brakujący model dynamiki to dokładnie to, czego robot potrzebuje, gdy zadanie zależy od antycypacji, jak zmieni się scena. Gdy gripper się zamyka — co dzieje się z kubkiem? Gdy wypuszcza się obiekt — gdzie spada?

NVIDIA proponuje zastąpić kręgosłup językowy modelem świata opartym na wideo, tworząc to, co nazywa World Action Model (WAM). Jim Fan, badacz NVIDIA, podsumował tę przejście jednym zdaniem: „VLA są martwe, niech żyją World Action Models.”

Co zmienia się w praktyce

Różnica nie jest teoretyczna. VLM jest zoptymalizowany do generowania tekstu o obrazach. WAM modelują, jak ewoluuje scena. To oznacza, że podczas post-treningu nie trzeba uczyć dynamiki od zera: polityka specjalizuje się na modelu, który już ma wstępne rozumienie fizyki.

Według paperu NVIDIA „World Action Models are Zero-shot Policies” przekłada się to na trzy praktyczne zyski: potrzebujesz mniej danych, by osiągnąć daną zdolność, zachowanie lepiej generalizuje poza rozkładem treningowym, a droga do nowej platformy (inny robot, inny gripper) jest krótsza. Te właściwości pochodzą z samego backbone’u pretreningu, więc pojawiają się w każdej polityce, która się z niego specjalizuje.

Cosmos 3, fundament

NVIDIA prezentuje Cosmos 3 — omnimodalny model świata oparty na architekturze Mixture-of-Transformers. Multimodalny strumień wejściowy przechodzi przez transformer autoregresyjny, który generuje dyskretne tokeny jak tekst. To prowadzi transformer dyfuzyjny dla modalności ciągłych: obraz, wideo, audio i akcja. Tekst generuje się dekodowaniem token po tokenie; wszystko inne, w tym akcje, syntetyzuje się przez iteracyjne denoising.

Cosmos 3 występuje w trzech rozmiarach: 4B (Cosmos Edge), 16B (Cosmos Nano) i 64B (Cosmos 3 Super). Co czyni go solidną bazą specjalizacji, to szerokość danych o świecie fizycznym: około 767 milionów obrazów, 348 milionów wideo rzeczywistej dynamiki i 8 milionów próbek akcji obejmujących manipulację robotyczną, jazdę autonomiczną, ruch kamery i ruch egocentryczny.

NVIDIA oferuje już polityki po post-treningu: Cosmos3-Nano-Policy-DROID (16B) dla ramienia Franka Panda i Cosmos3-Edge-Policy-DROID (4B) do wdrożenia na urządzeniu. Przy instrukcji językowej i obserwacjach z wielu kamer obie generują trajektorie akcji dla robota.

Zmiana paradygmatu

WAM reprezentują ruch koncepcyjny: od „uczenia się działać” do „uczenia się, jak ewoluuje świat”. Robot nie zapamiętuje demonstracji — antycypuje konsekwencje. Cosmos 3 czyni to podejście praktycznym, oferując trzy rozmiary dopasowane do różnych tierów wdrożenia bez wymuszania jednego kompromisu.

Gdzie wchodzi w grę hardware konwersacyjny

W bitbitbla pracujemy nad tłumaczeniem głosu na deterministyczne komendy JSON, które hardware wykonuje bezpośrednio. Platforma wysyła wykrytą intencję, pewność i parametry akcji przez port szeregowy lub webhooki, gotowe do fizycznego wykonania. Mikrokontroler działa jak terminal otrzymujący bezpośrednie polecenia, a triggery kontekstu pozwalają agentowi reagować na zmienne środowiska w czasie rzeczywistym.

Zamiast obciążać mikrokontroler ciężkimi modelami fizyki lub wizji, w BitBitBla utrzymujemy firmware urządzenia lekki i deterministyczny. Inteligencja kontekstowa mieszka w naszym orkiestratorze chmurowym, który przetwarza dynamikę środowiska i wysyła do mikrokontrolera precyzyjne polecenie w formacie JSON przez port szeregowy do natychmiastowego wykonania.

Źródło: NVIDIA Embedded.