Claude 3.7 Sonnet — hybrydowy model reasoning Anthropic (24.02.2025). Łączy tryb standardowy z extended thinking o konfigurowalnym budżecie tokenów myślenia. Wycofany z API 28.10.2025.
⚠ Deprecated⏳ Ograniczony dostępLLMModel multimodalnyModel rozumowaniaModel używający narzędzi📁 Claude
Okno kontekstowe
200K tokenów
tokenów
Max output
128 000
tokenów
Data premiery
24 lutego 2025
Dostęp:APIHostedWdrożenie:☁ Cloud
Przegląd
Zastosowania
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 200K tokenów
✓ Narzędzia
📥 Wejście: tekst, obraz, dokumenty
Specyfikacja techniczna
Okno kontekstowe
200K tokenów
tokenów
Max output tokens
128 000
tokenów na odpowiedź
Knowledge cutoff
31 paź 2024
Data graniczna wiedzy
Licencja
Proprietary
Wymagania sprzętowe
Nie dotyczy / brak publicznych danych, bo model nie był przeznaczony do lokalnego uruchamiania.
Funkcje:✓ Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimagedocuments
⬆ Wyjście (Output)
textcodestructured_data
Możliwości i zastosowania
Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Wyjście strumieniowe
Wiadomości strumieniowe umożliwiają pobieranie treści w czasie rzeczywistym, gdy model generuje odpowiedzi, bez czekania na wygenerowanie całej odpowiedzi. Takie podejście może znacząco poprawić doświadczenie użytkownika, zwłaszcza podczas tworzenia długich treści tekstowych, ponieważ użytkownicy mogą od razu zobaczyć, że odpowiedź zaczyna się pojawiać.
Kategoria: reasoning
Wyniki benchmarków
14 benchmarków
GPQA Diamond
78
📅 24 lut 2025📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
SWE-bench Verified
62.3
📄 Anthropic – Claude 3.7 Sonnet announcement + appendix
TAU-bench Retail
81.2
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
TAU-bench Airline
58.4
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
MMMLU
86.1
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
MMMU (validation)
75.0
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
IFEval
93.2
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
MATH 500
96.2
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
AIME 2024
61.3
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
SWE-bench Verified (high compute, custom scaffold)
accuracy · Wielokrotne równoległe próby, odrzucenie łatek niespełniających regresji, ranking via scoring model. Podzbiór 489/500 zadań.
70.3%
📅 24 lut 2025📄 Anthropic – oficjalny blog claude-3-7-sonnet (anthropic.com/news/claude-3-7-sonnet)
Wynik osiągnięty z dodatkowym test-time compute i parallel sampling — niedostępny bezpośrednio dla użytkowników API.
GPQA Diamond (standard mode)
accuracy · Graduate-level questions in Physics, Chemistry, Biology. Bez extended thinking.
68.0%
📅 24 lut 2025📄 DataCamp – Claude 3.7 Sonnet: Features, Access, Benchmarks (datacamp.com/blog/claude-3-7-sonnet)
Z extended thinking: 84.8%. Źródło DataCamp powołuje się na dane Anthropic.
GPQA Diamond (extended thinking)
accuracy · Graduate-level STEM questions. Z włączonym trybem extended thinking.
84.8%
📅 24 lut 2025📄 DataCamp – Claude 3.7 Sonnet benchmarks (datacamp.com/blog/claude-3-7-sonnet)
Wynik z extended thinking, z dodatkowym test-time compute (256 odpowiedzi + scoring model) wynosi jeszcze więcej — DataCamp i LessWrong potwierdzają 84.8% jako podstawowy wynik ET.
AIME 2024 (extended thinking)
accuracy · American Invitational Mathematics Examination 2024. Tryb extended thinking.
80.0%
📅 24 lut 2025📄 DataCamp – Claude 3.7 Sonnet benchmarks (datacamp.com/blog/claude-3-7-sonnet)
Wynik 61.3% w trybie standardowym. Wzrost o ~18,7 pp. przy extended thinking.
MMLU
accuracy · Massive Multitask Language Understanding – wiedza z 57 dziedzin.
86.1%
📅 24 lut 2025📄 Vellum AI – Claude 3.7 Sonnet vs OpenAI o1 vs DeepSeek R1 (vellum.ai/blog/claude-3-7-sonnet-vs-openai-o1-vs-deepseek-r1)
Wynik z benchmark table opublikowanej przy premierze.
Cennik
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
Wdrożenie i bezpieczeństwo
☁ Dostępny na platformach
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise
Model oceniony pod ASL-2 (Responsible Scaling Policy Anthropic). System card obejmuje oceny CBRN, cyberbezpieczeństwo, autonomię, faithfulness extended thinking oraz computer use. Redukcja niepotrzebnych odmów o 45% względem Claude 3.5 Sonnet.
1) ASL-2 determination po iteratywnym procesie oceny (6 snapshotów modelu, oceny FRT + AST). 2) Zredukowane o 45% niepotrzebne odmowy (standard mode) i 31% (extended thinking mode) vs. Claude 3.5 Sonnet. 3) Extended thinking chains of thought nie są w pełni wierne rzeczywistemu procesowi rozumowania — ujawnione przez Anthropic w system card. 4) Ocena computer use: analiza prompt injection attacks. 5) Model wycofany z Anthropic API 28.10.2025. Na Vertex AI deprecated od 11.11.2025 (shutdown 11.05.2026 dla istniejących klientów). Dostęp badaczy przez External Researcher Access Program.
Aktualizacja: 24 lut 2025↗ Dokumentacja security
