Robocikowo>ROBOCIKOWO
Gemini 3.8 Flash

Gemini 3.8 Flash

3.8 Flash · Rodzina: Gemini
Model z rodziny Gemini Flash (Google DeepMind) do zadań agentowych, inżynierii oprogramowania i złożonych przepływów pracy; okno kontekstowe 1M tokenów.
✓ Aktywny✓ Publiczny dostępLLMModel multimodalnyModel rozumowaniaModel używający narzędzi📁 Gemini
Okno kontekstowe
1M
tokenów
Max output
64 000
tokenów
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Gemini 3.8 Flash to model z rodziny Gemini Flash opracowany przez Google DeepMind, pozycjonowany jako model klasy workhorse do zadań agentowych, inżynierii oprogramowania i złożonych przepływów pracy w przedsiębiorstwach. Zapewnia zaawansowane wnioskowanie przy latencji i skali charakterystycznej dla modeli Flash. Obsługuje wejście tekstowe, obrazy, wideo, audio oraz pliki PDF, z oknem kontekstowym 1M tokenów i maksymalnym wyjściem 64k tokenów. Wspiera wywoływanie funkcji, wyszukiwanie jako narzędzie oraz obsługę komputera (computer use). Model jest dostępny publicznie (general availability) przez API oraz hostowane interfejsy Google.

Klasyfikacja
LLMModel multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: Gemini
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 1M
✓ Narzędzia
📥 Wejście: tekst, obraz, wideo, audio…

Specyfikacja techniczna

Okno kontekstowe
1M
tokenów
Max output tokens
64 000
tokenów na odpowiedź
Funkcje:✓ Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimagevideoaudiodocuments
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Rozumienie audio
Zdolność modelu do interpretowania dźwięku, mowy, tonów i sygnałów audio.
Kategoria: audio
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność analizy wideo poprzez przetwarzanie sekwencji klatek.
Kategoria: video
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Przeplatane wejście multimodalne
Zdolność do dowolnego łączenia tekstu i obrazu w dowolnej kolejności w ramach jednego polecenia.
Kategoria: reasoning
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Obsługa komputera
Zdolność modelu do obsługi interfejsu komputera poprzez interpretację zrzutów ekranu oraz generowanie akcji takich jak kliknięcia, wpisywanie tekstu i nawigacja po aplikacjach.
Kategoria: planning

Wyniki benchmarków

4 benchmarki
DeepSWE v1.1
success rate
>70%
📄 website
Wysoka skuteczność przy niskim koszcie (dane oficjalne DeepMind).
Vals Finance Agent v2
61.4%%
📄 website
Harvey's Legal Agent Benchmark
10.0%%
📄 website
HLE-Verified
accuracy
54.9%%
📄 website

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)