Robocikowo>ROBOCIKOWO
Gemini 1.5 Pro

Gemini 1.5 Pro

Gemini 1.5 Pro · Rodzina: Gemini
Multimodalny model Google DeepMind (2024) z architekturą MoE i oknem kontekstu do 1–2 mln tokenów; natywnie obsługuje tekst, obraz, audio i wideo. Starsza generacja.
⚠ Deprecated⏳ Ograniczony dostępLLMModel multimodalnyModel używający narzędzi📁 Gemini
Okno kontekstowe
1M (do 2M)
tokenów
Data premiery
15 lutego 2024
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Gemini 1.5 Pro to multimodalny model językowy Google DeepMind, zaprezentowany 15 lutego 2024 r. jako flagowy model generacji Gemini 1.5. Wyróżniał się bardzo długim oknem kontekstowym i natywną multimodalnością.

Model wykorzystuje architekturę mieszaniny ekspertów (Mixture-of-Experts, MoE), która selektywnie aktywuje najbardziej odpowiednie ścieżki eksperckie zależnie od danych wejściowych, poprawiając efektywność. Obsługuje okno kontekstowe do 1 mln tokenów (a w wybranych wariantach do 2 mln; w testach nawet 10 mln) — pozwala to przetworzyć m.in. godzinę wideo, 11 godzin audio, ponad 30 000 linii kodu lub ponad 700 000 słów w jednym przebiegu.

Gemini 1.5 Pro jest natywnie multimodalny — przyjmuje tekst, obrazy, audio i wideo (oraz kod), a generuje odpowiedzi tekstowe (w tym kod i dane strukturalne). Osiągał wyniki zbliżone do Gemini 1.0 Ultra przy mniejszym zużyciu zasobów obliczeniowych.

Model był dostępny dla deweloperów i firm przez Gemini API, Google AI Studio oraz Google Vertex AI. Obecnie Gemini 1.5 Pro to model starszej generacji (wycofany), zastąpiony przez nowsze modele Gemini.

Klasyfikacja
LLMModel multimodalnyModel używający narzędzi
Rodzina: Gemini
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 1M (do 2M)
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, audio, wideo
Platformy

Specyfikacja techniczna

Okno kontekstowe
1M (do 2M)
tokenów
Licencja
Proprietary
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
textimageaudiovideodocuments
⬆ Wyjście (Output)
textcodestructured_data

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Rozumienie audio
Zdolność modelu do interpretowania dźwięku, mowy, tonów i sygnałów audio.
Kategoria: audio
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)

Wdrożenie i bezpieczeństwo

☁ Dostępny na platformach
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise

Dostępny dla firm przez Google Vertex AI z kontrolami klasy enterprise (zgodność, prywatność danych, kontrola regionów).

Aktualizacja: 24 lip 2026↗ Dokumentacja security