Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Gemini Robotics 2: Google DeepMind daje robotom inteligencję całego ciała

Pan Robocik2 sierpnia 2026 · 4 min czytania
Gemini Robotics 2: Google DeepMind daje robotom inteligencję całego ciała

Google DeepMind zaprezentował 30 lipca 2026 Gemini Robotics 2 — rodzinę trzech modeli, które rozszerzają sterowanie robotem z pojedynczego ramienia na całe ciało humanoida i na koordynację wielu maszyn naraz. To pierwsza generacja, w której model DeepMind planuje zadanie, śledzi jego postęp z obrazu wideo i rozdziela pracę między różne roboty.

Najważniejsze w skrócie

  • Trzy modele: Gemini Robotics 2 (VLA), Gemini Robotics ER 2 (planowanie i rozumowanie), Gemini Robotics On-Device 2 (wersja lokalna).
  • Whole-body intelligence: sterowanie chodem, kucaniem i manipulacją w całym łańcuchu kinematycznym humanoida.
  • ER 2 śledzi zadanie na żywo z wideo: 91,3% trafności w lokalizacji momentu i sub-sekundowe opóźnienie.
  • On-Device 2 adaptuje się do nowego robota w kilka godzin, zwykle na mniej niż 200 przykładach.
  • Roboty testowe: Apptronik Apollo 2 i Franka Duo. ER 2 dostępny w Google AI Studio, modele VLA tylko dla partnerów early-access.

Trzy modele, jeden podział pracy

Rodzina dzieli się na trzy role. Gemini Robotics 2 to model vision-language-action (VLA) — zamienia polecenie i obraz w ruch pełnego humanoida lub robota dwuramiennego. Gemini Robotics ER 2 to model rozumowania (VLM: Model łączący rozumienie obrazu i języka (vision-language model).), który pełni funkcję „mózgu wysokiego poziomu": planuje wielokrokowe zadania, ocenia sytuację przestrzennie i rozdziela pracę między maszyny. Gemini Robotics On-Device 2 to odchudzona wersja VLA działająca lokalnie na robocie, bez połączenia z chmurą.

Nowość, którą DeepMind nazywa whole-body intelligence, to sterowanie całym ciałem robota — nie tylko chwytakiem. Model koordynuje lokomocję (chodzenie, kucanie, sięganie) z manipulacją obiektami w całym łańcuchu kinematycznym. W poprzednich generacjach model odpowiadał głównie za ramię i dłoń, a resztę ciała obsługiwał osobny kontroler.

Śledzenie zadania z wideo na żywo

Największy skok dotyczy ER 2. Model ogląda ciągły strumień wideo i na bieżąco sprawdza, czy zadanie idzie zgodnie z planem — wykrywa błędy, koryguje ruch i rozpoznaje moment zakończenia pracy. W lokalizacji konkretnego momentu w nagraniu osiąga 91,3% trafności przy średnim błędzie 0,96 sekundy, co DeepMind opisuje jako sub-sekundowe opóźnienie potrzebne do bezpiecznej pracy. Ocena postępu zadania w pięciu progach (0–100%) jest trudniejsza — tu trafność spada do 57,4%.

91,3%trafność ER 2 w lokalizacji momentu w nagraniu — przy sub-sekundowym opóźnieniuGoogle DeepMind

Względem poprzedniej wersji ER 1.6 nowy model wygrywa w orkiestracji narzędzi we wszystkich trzech trybach sterowania oraz w benchmarkach bezpieczeństwa i bliskości człowieka. DeepMind podaje, że robi to „za ułamek kosztu obliczeniowego i przy 4-krotnie szybszym wykonaniu".

Manipulacja: gdzie model jest mocny, a gdzie nie

Wyniki manipulacji pokazują realny stan techniki, bez lukru. Widać wyraźny rozrzut zależnie od zadania i użytego chwytaka.

ZadaniePlatforma / dłońSkuteczność
Podnoszenie z półkiApollo 2 + Inspire76,3%
Podnoszenie ze stołuApollo 2 + Inspire68,4%
Podnoszenie z podłogiApollo 2 + Inspire45,7%
Wykręcanie żarówkiApollo 2 + Inspire92%
Wkładanie elementówFranka Duo89,6%
Skuteczność manipulacji Gemini Robotics 2 w testach DeepMind.

W zadaniach wymagających pełnej sprawności palców model przoduje głównie w jednym wąskim zadaniu — wykręcaniu żarówki — a w pozostałych utrzymuje się w przedziale 32–44%. Najlepiej wypada klasyczny chwytak na platformie Franka Duo.

Koordynacja wielu robotów to drugi filar premiery. DeepMind pokazał humanoida Apollo 2 i robota Franka F3 Duo współpracujące nad jednym procesem — zadaniem, którego pojedyncza maszyna nie wykonałaby sama. Rozumowanie przestrzenne działa teraz na surowym wideo, a odczyt przyrządów obejmuje 10 typów wskaźników, w tym wyświetlacze cyfrowe, linijki i termometry.

Dostępność

Dostęp jest stopniowany. ER 2 jest publiczny w Google AI Studio i przez Gemini API, a na platformie Gemini Enterprise Agent w prywatnym preview. Modele VLA oraz On-Device 2 trafiają na razie wyłącznie do partnerów w programie early-access. On-Device 2 wyróżnia szybka adaptacja do nowego robota — według DeepMind wystarczy kilka godzin i zwykle mniej niż 200 przykładów, by przenieść model na inną konstrukcję.

Dlaczego to ważne?

Przejście od sterowania ramieniem do sterowania całym ciałem to zmiana zakresu odpowiedzialności modelu — jeden system łączy lokomocję z manipulacją, co dotąd wymagało osobnych warstw. Równie istotne jest domknięcie pętli percepcji: model, który ogląda własne działanie na wideo i sam ocenia postęp, może korygować błędy bez człowieka w pętli. Umiarkowane wyniki manipulacji poza wąskimi zadaniami pokazują jednak, że uniwersalny humanoid pozostaje celem badawczym, nie gotowym produktem.

Co dalej?

  • Modele VLA i On-Device 2 pozostają w programie early-access — szersza dostępność zależy od decyzji DeepMind, bez podanej daty.
  • ER 2 jest już testowalny w Google AI Studio i przez Gemini API, z przykładami kodu na GitHubie.
  • Niska trafność oceny postępu zadania (57,4%) to zidentyfikowany słaby punkt — obszar do poprawy w kolejnych iteracjach.

Źródła

Udostępnij ten artykuł