Google DeepMind zaprezentował 30 lipca 2026 Gemini Robotics 2 — rodzinę trzech modeli, które rozszerzają sterowanie robotem z pojedynczego ramienia na całe ciało humanoida i na koordynację wielu maszyn naraz. To pierwsza generacja, w której model DeepMind planuje zadanie, śledzi jego postęp z obrazu wideo i rozdziela pracę między różne roboty.
Najważniejsze w skrócie
- Trzy modele: Gemini Robotics 2 (VLA), Gemini Robotics ER 2 (planowanie i rozumowanie), Gemini Robotics On-Device 2 (wersja lokalna).
- Whole-body intelligence: sterowanie chodem, kucaniem i manipulacją w całym łańcuchu kinematycznym humanoida.
- ER 2 śledzi zadanie na żywo z wideo: 91,3% trafności w lokalizacji momentu i sub-sekundowe opóźnienie.
- On-Device 2 adaptuje się do nowego robota w kilka godzin, zwykle na mniej niż 200 przykładach.
- Roboty testowe: Apptronik Apollo 2 i Franka Duo. ER 2 dostępny w Google AI Studio, modele VLA tylko dla partnerów early-access.
Trzy modele, jeden podział pracy
Rodzina dzieli się na trzy role. Gemini Robotics 2 to model vision-language-action (VLA) — zamienia polecenie i obraz w ruch pełnego humanoida lub robota dwuramiennego. Gemini Robotics ER 2 to model rozumowania (VLM?VLM: Model łączący rozumienie obrazu i języka (vision-language model).), który pełni funkcję „mózgu wysokiego poziomu": planuje wielokrokowe zadania, ocenia sytuację przestrzennie i rozdziela pracę między maszyny. Gemini Robotics On-Device 2 to odchudzona wersja VLA działająca lokalnie na robocie, bez połączenia z chmurą.
Nowość, którą DeepMind nazywa whole-body intelligence, to sterowanie całym ciałem robota — nie tylko chwytakiem. Model koordynuje lokomocję (chodzenie, kucanie, sięganie) z manipulacją obiektami w całym łańcuchu kinematycznym. W poprzednich generacjach model odpowiadał głównie za ramię i dłoń, a resztę ciała obsługiwał osobny kontroler.
Śledzenie zadania z wideo na żywo
Największy skok dotyczy ER 2. Model ogląda ciągły strumień wideo i na bieżąco sprawdza, czy zadanie idzie zgodnie z planem — wykrywa błędy, koryguje ruch i rozpoznaje moment zakończenia pracy. W lokalizacji konkretnego momentu w nagraniu osiąga 91,3% trafności przy średnim błędzie 0,96 sekundy, co DeepMind opisuje jako sub-sekundowe opóźnienie potrzebne do bezpiecznej pracy. Ocena postępu zadania w pięciu progach (0–100%) jest trudniejsza — tu trafność spada do 57,4%.
Względem poprzedniej wersji ER 1.6 nowy model wygrywa w orkiestracji narzędzi we wszystkich trzech trybach sterowania oraz w benchmarkach bezpieczeństwa i bliskości człowieka. DeepMind podaje, że robi to „za ułamek kosztu obliczeniowego i przy 4-krotnie szybszym wykonaniu".
Manipulacja: gdzie model jest mocny, a gdzie nie
Wyniki manipulacji pokazują realny stan techniki, bez lukru. Widać wyraźny rozrzut zależnie od zadania i użytego chwytaka.
| Zadanie | Platforma / dłoń | Skuteczność |
|---|---|---|
| Podnoszenie z półki | Apollo 2 + Inspire | 76,3% |
| Podnoszenie ze stołu | Apollo 2 + Inspire | 68,4% |
| Podnoszenie z podłogi | Apollo 2 + Inspire | 45,7% |
| Wykręcanie żarówki | Apollo 2 + Inspire | 92% |
| Wkładanie elementów | Franka Duo | 89,6% |
W zadaniach wymagających pełnej sprawności palców model przoduje głównie w jednym wąskim zadaniu — wykręcaniu żarówki — a w pozostałych utrzymuje się w przedziale 32–44%. Najlepiej wypada klasyczny chwytak na platformie Franka Duo.
Koordynacja wielu robotów to drugi filar premiery. DeepMind pokazał humanoida Apollo 2 i robota Franka F3 Duo współpracujące nad jednym procesem — zadaniem, którego pojedyncza maszyna nie wykonałaby sama. Rozumowanie przestrzenne działa teraz na surowym wideo, a odczyt przyrządów obejmuje 10 typów wskaźników, w tym wyświetlacze cyfrowe, linijki i termometry.
Dostępność
Dostęp jest stopniowany. ER 2 jest publiczny w Google AI Studio i przez Gemini API, a na platformie Gemini Enterprise Agent w prywatnym preview. Modele VLA oraz On-Device 2 trafiają na razie wyłącznie do partnerów w programie early-access. On-Device 2 wyróżnia szybka adaptacja do nowego robota — według DeepMind wystarczy kilka godzin i zwykle mniej niż 200 przykładów, by przenieść model na inną konstrukcję.
Dlaczego to ważne?
Przejście od sterowania ramieniem do sterowania całym ciałem to zmiana zakresu odpowiedzialności modelu — jeden system łączy lokomocję z manipulacją, co dotąd wymagało osobnych warstw. Równie istotne jest domknięcie pętli percepcji: model, który ogląda własne działanie na wideo i sam ocenia postęp, może korygować błędy bez człowieka w pętli. Umiarkowane wyniki manipulacji poza wąskimi zadaniami pokazują jednak, że uniwersalny humanoid pozostaje celem badawczym, nie gotowym produktem.
Co dalej?
- Modele VLA i On-Device 2 pozostają w programie early-access — szersza dostępność zależy od decyzji DeepMind, bez podanej daty.
- ER 2 jest już testowalny w Google AI Studio i przez Gemini API, z przykładami kodu na GitHubie.
- Niska trafność oceny postępu zadania (57,4%) to zidentyfikowany słaby punkt — obszar do poprawy w kolejnych iteracjach.





