Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Autor Dreamera odszedł z DeepMind. Buduje agentów planujących

Pan Robocik11 września 2026 · 3 min czytania
Autor Dreamera odszedł z DeepMind. Buduje agentów planujących

MIT Technology Review opublikował 8 września 2026 sylwetkę Danijara Hafnera — 31-letniego badacza, który jesienią 2025 odszedł z Google DeepMind i prowadzi w San Francisco startup w trybie stealth. Hafner stoi za serią Dreamer, czyli agentami uczącymi się wewnątrz modelu świata zamiast w realnym środowisku.

0Tyle interakcji ze środowiskiem potrzebował Dreamer 4, żeby nauczyć się wydobywać diament — trenował wyłącznie na nagraniach cudzej rozgrywkiMIT Technology Review

Najważniejsze w skrócie

  • Hafner odszedł z Google DeepMind jesienią 2025, startup działa w dzielnicy SoMa w San Francisco
  • PlaNet: agent planujący działania wewnątrz wyuczonego modelu środowiska
  • DreamerV2: pierwszy model świata na poziomie człowieka w Atari 2600
  • DreamerV3: pierwsze samodzielne rozwiązanie wyzwania Minecraft Diamond
  • Dreamer 4: wydobycie diamentu wyuczone wyłącznie z nagrań rozgrywki

Model świata zamiast prób i błędów

Klasyczne uczenie ze wzmocnieniem wymaga milionów prób w środowisku. Model-based RL odwraca tę kolejność.

Pętla uczenia w modelu świata

Obserwacjaagent zbiera dane z realnego środowiska
Model światadane poprawiają wewnętrzną symulację otoczenia
Wyobrażenieagent rozgrywa tysiące wariantów w symulacji
Politykazachowanie trenowane jest na wyobrażonych przebiegach
Działaniewyuczona polityka wraca do realnego środowiska

Realne dane poprawiają symulację, a nie samą politykę działania. Dzięki temu agent potrafi przewidzieć skutek ruchu, którego nigdy nie wykonał. Formalnie model świata uczy się rozkładu kolejnego stanu otoczenia.

Ogólna postać przejścia w modelu świata. To zapis rodziny metod, do której należy Dreamer, a nie dokładne równanie z konkretnej publikacji.
Znaczenie symboli
stan otoczenia w kroku t, w postaci ukrytej reprezentacji
działanie podjęte przez agenta w kroku t
wyuczony model przejścia o parametrach θ

Cztery pokolenia Dreamera

ModelPrzełomCzego dowiódł
PlaNetplanowanie wewnątrz wyuczonego modeluagent może planować, nie tylko reagować
DreamerV2poziom człowieka w Atari 2600model świata dorównuje metodom bez modelu
DreamerV3Minecraft Diamond bez podpowiedziradzi sobie z długą sekwencją przy rzadkiej nagrodzie
Dreamer 4diament z samych nagrańtrening bez żadnej interakcji ze środowiskiem
Co dołożyło każde pokolenie

Najtrudniejszy z tych progów pokonał DreamerV3, bo Minecraft Diamond łączy długi łańcuch zależnych kroków z rzadką nagrodą. Osobny projekt DayDreamer przeniósł te algorytmy na fizyczne roboty.

Kto za tym stoi

Danijar Hafner wychował się na wsi w północno-wschodnich Niemczech, w rodzinie muzyków klasycznych. Programowania nauczył go sąsiad. Etat badacza w Google Brain dostał w 2015 roku, na drugim roku studiów inżynierskich w Hasso Plattner Institute w Poczdamie. Potem przeszedł przez kilkanaście stanowisk w Google Brain i Google DeepMind w Wielkiej Brytanii, Kanadzie i USA, pracując m.in. z Geoffreyem Hintonem i Ashishem Vaswanim.

Spokojnie mieści się w górnej połowie jednego procenta.

Timothy Lillicrap, badacz Google DeepMind i współautor pracy o DreamerV3.

Dlaczego to ważne?

Modele świata są dziś jedyną poważną alternatywą dla skalowania LLM, jeśli celem jest agent działający w fizycznym otoczeniu. Różnica jest praktyczna: model językowy przewiduje następny token, model świata przewiduje następny stan otoczenia.

Dreamer 4 pokazał, że da się to wytrenować z samego wideo, co usuwa najdroższy element robotyki — zbieranie danych na realnym sprzęcie. W biurze startupu stoją humanoidy sprowadzone z Chin, więc kierunek jest czytelny.

Co dalej?

  • Startup pozostaje w trybie stealth — brak nazwy, ujawnionych inwestorów i zapowiedzianego produktu
  • Humanoidy sprowadzone z Chin stojące w biurze wskazują na testy modeli świata na fizycznym sprzęcie, ale firma nie potwierdziła żadnego wdrożenia
  • MIT Technology Review nie podał wielkości zespołu ani terminu jego pierwszej publikacji naukowej

Źródła

Udostępnij ten artykuł