Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Gemini Robotics ER 2: „mózg wysokiego poziomu" dla robotów

Pan Robocik3 sierpnia 2026 · 3 min czytania
Gemini Robotics ER 2: „mózg wysokiego poziomu" dla robotów

Google DeepMind udostępniło 30 lipca 2026 roku Gemini Robotics ER 2 — model rozumowania ucieleśnionego (embodied reasoning), który pełni rolę „mózgu wysokiego poziomu" dla robotów. Model planuje wieloetapowe zadania, analizuje strumień wideo w czasie rzeczywistym i koordynuje pracę wielu robotów, a samą motorykę zleca osobnym modelom akcji. To warstwa myślenia towarzysząca zaprezentowanemu dzień później modelowi Gemini Robotics 2 odpowiadającemu za sterowanie ciałem.

Najważniejsze w skrócie

  • Model rozumowania ucieleśnionego pełniący rolę „mózgu wysokiego poziomu" dla robotów
  • Analiza wideo w czasie rzeczywistym: klasyfikacja postępu 57,4%, znajdowanie momentu 91,3% (średni błąd 0,96 s)
  • Deklarowana czterokrotnie wyższa szybkość działania niż większe modele
  • Orkiestracja narzędzi: wywoływanie modeli VLA, API i Google Search
  • Dostępny przez Gemini API, Google AI Studio oraz prywatny preview na Gemini Enterprise Agent Platform

Podział pracy: myślenie osobno, ruch osobno

Gemini Robotics ER 2 nie steruje bezpośrednio silnikami. Model odpowiada za rozumowanie przestrzenne i planowanie, a wykonanie ruchu deleguje do modeli VLA (vision-language-action). To rozdzielenie warstwy „mózgu" od warstwy „mięśni" jest kluczowe — reasoning może działać wolniej i głębiej, a szybka pętla sterowania pozostaje po stronie wyspecjalizowanego modelu akcji.

Model traktuje wideo jako ciągły strumień, a nie serię osobnych klatek. Dzięki temu śledzi postęp zadania, wykrywa sukces lub porażkę i sam się koryguje, gdy coś pójdzie nie tak. Potrafi też odczytywać wskazania przyrządów i odpowiadać na pytania o przestrzeń wokół robota.

Wyniki: szybkość zamiast rozmiaru

Najbardziej wymowna liczba to nie pojedynczy benchmark, lecz szybkość. Google podaje czterokrotnie wyższe tempo działania niż w przypadku większych modeli — przy zachowaniu jakości rozumowania. W analizie wideo model osiąga 91,3% trafności w znajdowaniu właściwego momentu (ze średnim błędem 0,96 sekundy) oraz 57,4% w klasyfikacji postępu na pięciu poziomach. Te wyniki mają sens w kontekście robota, który musi wiedzieć, na jakim etapie zadania się znajduje, zanim wykona kolejny ruch.

Zadanie na wideoWynik
Klasyfikacja postępu (5 poziomów)57,4%
Znajdowanie właściwego momentu91,3% (śr. błąd 0,96 s)
Wyniki analizy wideo Gemini Robotics ER 2
szybsze działanie niż większe modele przy zachowaniu jakości rozumowaniaGoogle DeepMind

ER 2 potrafi też orkiestrować narzędzia — wywołać model VLA do ruchu, sięgnąć po API albo Google Search po informacje. To odróżnia go od poprzednika, modelu Gemini Robotics-ER 1.6, i przesuwa punkt ciężkości z pojedynczego zadania na koordynację wielu kroków i wielu robotów naraz.

Gdzie i jak można go używać

Model jest dostępny publicznie przez Gemini API i Google AI Studio, a w wersji prywatnego preview przez Gemini Enterprise Agent Platform. DeepMind udostępniło też przykłady kodu na GitHubie. Autorami są inżynierowie Steven Hansen i Peng Xu.

Dlaczego to ważne?

Rozdzielenie rozumowania od sterowania to architektoniczny zakład o to, jak będą budowane roboty ogólnego przeznaczenia. Zamiast jednego wielkiego modelu robiącego wszystko, powstaje warstwa „mózgu", która planuje i koryguje, oraz wymienne modele akcji wykonujące ruch. Taki podział ułatwia skalowanie, bo każdą warstwę można rozwijać niezależnie, a jeden model rozumowania może sterować różnymi robotami. Nacisk na szybkość zamiast samego rozmiaru sugeruje, że wąskim gardłem robotyki nie jest już wiedza modelu, lecz to, jak szybko potrafi on reagować na zmieniający się świat.

Co dalej?

  • Model akcji Gemini Robotics 2 (whole-body control) ogłoszony 31 lipca uzupełnia ER 2 o warstwę sterowania ciałem — razem tworzą pełny stos
  • ER 2 jest już dostępny w Gemini API i Google AI Studio, więc deweloperzy mogą testować orkiestrację wielu robotów od razu
  • Prywatny preview na Gemini Enterprise Agent Platform wskazuje na kolejny krok: wdrożenia komercyjne w środowiskach przemysłowych

Źródła

Udostępnij ten artykuł