Model językowy Anthropic z rodziny Claude (5.5, wrzesień 2026) do długotrwałych zadań agentowych: kodowania, obsługi komputera i pracy wiedzowej. Okno kontekstu 1M tokenów.
Okno kontekstowe
1M
tokenów
Max output
128 000
tokenów
Data premiery
22 września 2026
Dostęp:APIHostedWdrożenie:☁ Cloud
Przegląd
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 1M
✓ Narzędzia
📥 Wejście: tekst, obraz
Specyfikacja techniczna
Okno kontekstowe
1M
tokenów
Max output tokens
128 000
tokenów na odpowiedź
Knowledge cutoff
1 cze 2026
Data graniczna wiedzy
Licencja
Proprietary (Anthropic Commercial Terms of Service)
Wymagania sprzętowe
Model zamknięty, dostępny wyłącznie przez chmurę (Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry). Brak wdrożenia lokalnego.
Funkcje:✓ Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
textcode
Możliwości i zastosowania
Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Rozszerzony tryb rozumowania
Wariant modelu rozumującego z dłuższym budżetem inferencji: więcej cykli myślenia, większa precyzja odpowiedzi kosztem czasu odpowiedzi. Wybór między 'standard' a 'extended' thinking pozostawiony użytkownikowi (np. selektor w GPT-5.2 Pro).
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Obsługa komputera
Zdolność modelu do obsługi interfejsu komputera poprzez interpretację zrzutów ekranu oraz generowanie akcji takich jak kliknięcia, wpisywanie tekstu i nawigacja po aplikacjach.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Wyniki benchmarków
8 benchmarków
Terminal-Bench 4.0
accuracy
66.4%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
FrontierCode v1.1
accuracy
54.4%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
CursorBench 4.0
accuracy
57.8%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
GDPval-AA v2.1
Elo
1846Elo
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
AutomationBench
accuracy
40%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
Humanity's Last Exam
accuracy · with tools
67.7%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
OSWorld 2.0
accuracy
81.8%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
Wynik częściowy (partial), wg oficjalnej zapowiedzi.
Chartography
accuracy · with tools
89%
📄 Anthropic – oficjalna zapowiedź (anthropic.com/claude/opus)
Cennik
Architektura techniczna
Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)
Wdrożenie i bezpieczeństwo
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise
Model dostępny w wariantach enterprise przez Claude API, Amazon Bedrock, Google Cloud Vertex AI i Microsoft Foundry, z regionalnymi/globalnymi endpointami i politykami cyklu życia dostawców.
