Robocikowo>ROBOCIKOWO
Gemini 3.7 Flash

Gemini 3.7 Flash

3.7 Flash · Rodzina: Gemini
Najnowszy i najbardziej wydajny model z linii Flash rodziny Gemini (Google DeepMind), zaprojektowany do złożonego kodowania, workflow agentowych i niezawodnego wieloetapowego wykonywania zadań.
✓ Aktywny✓ Publiczny dostępLLMModel multimodalnyModel rozumowaniaModel używający narzędzi📁 Gemini
Okno kontekstowe
1M
tokenów
Max output
65 536
tokenów
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Gemini 3.7 Flash to najnowszy i najbardziej wydajny model z linii Flash rodziny Gemini, opracowany przez Google DeepMind. Oznaczony jako „New Stable”, został zaprojektowany do złożonego kodowania, workflow agentowych oraz niezawodnego, wieloetapowego wykonywania zadań, zachowując przy tym niską latencję i wysoką przepustowość charakterystyczną dla wariantów Flash.

Model przyjmuje wejście tekstowe, obrazy, audio, wideo oraz dokumenty PDF, a na wyjściu generuje tekst i kod. Oferuje okno kontekstu 1 048 576 tokenów wejścia i do 65 536 tokenów wyjścia. Obsługuje regulowane „myślenie” (poziomy low/medium/high), function calling, structured output, wykonywanie kodu (code execution), grounding w wyszukiwarce Google i Mapach Google, przetwarzanie wsadowe (batch) oraz cache’owanie kontekstu. Live API nie jest wspierane. Identyfikator modelu w API to gemini-3.7-flash.

Dostępny m.in. przez Gemini API, Google AI Studio, Vertex AI, Google Antigravity oraz Gemini Enterprise. Ostatnia aktualizacja: sierpień 2026. Data odcięcia wiedzy (knowledge cutoff) nie została podana w oficjalnej dokumentacji.

Klasyfikacja
LLMModel multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: Gemini
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 1M
Narzędzia
📥 Wejście: tekst, obraz, audio, wideo

Specyfikacja techniczna

Okno kontekstowe
1M
tokenów
Max output tokens
65 536
tokenów na odpowiedź
Licencja
proprietary
Wymagania sprzętowe
Dostępny wyłącznie przez infrastrukturę chmurową Google (Gemini API, Vertex AI, Google AI Studio).
Funkcje:Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimageaudiovideodocuments
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Rozumienie audio
Zdolność modelu do interpretowania dźwięku, mowy, tonów i sygnałów audio.
Kategoria: audio
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność analizy wideo poprzez przetwarzanie sekwencji klatek.
Kategoria: video
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Przeplatane wejście multimodalne
Zdolność do dowolnego łączenia tekstu i obrazu w dowolnej kolejności w ramach jednego polecenia.
Kategoria: reasoning

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)