Robocikowo>ROBOCIKOWO
Claude 3.7 Sonnet

Claude 3.7 Sonnet

claude-3-7-sonnet-20250219 · Rodzina: Claude
Claude 3.7 Sonnet — hybrydowy model reasoning Anthropic (24.02.2025). Łączy tryb standardowy z extended thinking o konfigurowalnym budżecie tokenów myślenia. Wycofany z API 28.10.2025.
⚠ Deprecated⏳ Ograniczony dostępLLMModel multimodalnyModel rozumowaniaModel używający narzędzi📁 Claude
Okno kontekstowe
200K tokenów
tokenów
Max output
128 000
tokenów
Data premiery
24 lutego 2025
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Claude 3.7 Sonnet to hybrydowy model reasoning firmy Anthropic, wydany 24 lutego 2025 roku. Snapshot w API: claude-3-7-sonnet-20250219. Pierwszy model Anthropic łączący tryb standardowy z trybem extended thinking o konfigurowalnym budżecie tokenów myślenia.

Kluczowe cechy

Okno kontekstowe 200 000 tokenów, maksymalnie 128 000 tokenów wyjściowych (w tym thinking tokens). Graniczna data wiedzy: 31 października 2024. Obsługuje tool use, computer use oraz multimodalne wejście (tekst, obraz, dokumenty). Fine-tuning niedostępny.

Wyniki benchmarków

SWE-bench Verified 62,3% (pass@1, minimal scaffold) i 70,3% z custom scaffold + test-time compute. GPQA Diamond 68,0% w trybie standardowym i 84,8% z extended thinking. AIME 2024: 61,3% (standard) / 80,0% (ET). MATH 500: 96,2% (ET). TAU-bench: Retail 81,2%, Airline 58,4%. IFEval 93,2%. MMLU 86,1%.

Ceny

3 USD/MTok input i 15 USD/MTok output (thinking tokens wliczone w output). Batch API: 50% rabatu. Prompt caching: cache write 3,75 USD/MTok (5 min), cache read 0,30 USD/MTok.

Bezpieczeństwo i status

Model oceniony pod AI Safety Level 2 (ASL-2) w ramach Responsible Scaling Policy Anthropic. Redukcja niepotrzebnych odmów o 45% (standard) i 31% (extended thinking) względem Claude 3.5 Sonnet. Model wycofany z Anthropic API 28 października 2025; na Vertex AI deprecated od 11 listopada 2025 (shutdown 11 maja 2026 dla istniejących klientów).

Klasyfikacja
LLMModel multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: Claude
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 200K tokenów
Narzędzia
📥 Wejście: tekst, obraz, dokumenty

Specyfikacja techniczna

Okno kontekstowe
200K tokenów
tokenów
Max output tokens
128 000
tokenów na odpowiedź
Knowledge cutoff
31 paź 2024
Data graniczna wiedzy
Licencja
Proprietary
Wymagania sprzętowe
Nie dotyczy / brak publicznych danych, bo model nie był przeznaczony do lokalnego uruchamiania.
Funkcje:Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimagedocuments
⬆ Wyjście (Output)
textcodestructured_data

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Wyjście strumieniowe
Wiadomości strumieniowe umożliwiają pobieranie treści w czasie rzeczywistym, gdy model generuje odpowiedzi, bez czekania na wygenerowanie całej odpowiedzi. Takie podejście może znacząco poprawić doświadczenie użytkownika, zwłaszcza podczas tworzenia długich treści tekstowych, ponieważ użytkownicy mogą od razu zobaczyć, że odpowiedź zaczyna się pojawiać.
Kategoria: reasoning

Wyniki benchmarków

14 benchmarków
GPQA Diamond
78
📅 24 lut 2025📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
SWE-bench Verified
62.3
📄 Anthropic – Claude 3.7 Sonnet announcement + appendix
TAU-bench Retail
81.2
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
TAU-bench Airline
58.4
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
MMMLU
86.1
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
MMMU (validation)
75.0
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
IFEval
93.2
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
MATH 500
96.2
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
AIME 2024
61.3
📄 Anthropic – Claude 3.7 Sonnet announcement benchmark table
SWE-bench Verified (high compute, custom scaffold)
accuracy · Wielokrotne równoległe próby, odrzucenie łatek niespełniających regresji, ranking via scoring model. Podzbiór 489/500 zadań.
70.3%
📅 24 lut 2025📄 Anthropic – oficjalny blog claude-3-7-sonnet (anthropic.com/news/claude-3-7-sonnet)
Wynik osiągnięty z dodatkowym test-time compute i parallel sampling — niedostępny bezpośrednio dla użytkowników API.
GPQA Diamond (standard mode)
accuracy · Graduate-level questions in Physics, Chemistry, Biology. Bez extended thinking.
68.0%
📅 24 lut 2025📄 DataCamp – Claude 3.7 Sonnet: Features, Access, Benchmarks (datacamp.com/blog/claude-3-7-sonnet)
Z extended thinking: 84.8%. Źródło DataCamp powołuje się na dane Anthropic.
GPQA Diamond (extended thinking)
accuracy · Graduate-level STEM questions. Z włączonym trybem extended thinking.
84.8%
📅 24 lut 2025📄 DataCamp – Claude 3.7 Sonnet benchmarks (datacamp.com/blog/claude-3-7-sonnet)
Wynik z extended thinking, z dodatkowym test-time compute (256 odpowiedzi + scoring model) wynosi jeszcze więcej — DataCamp i LessWrong potwierdzają 84.8% jako podstawowy wynik ET.
AIME 2024 (extended thinking)
accuracy · American Invitational Mathematics Examination 2024. Tryb extended thinking.
80.0%
📅 24 lut 2025📄 DataCamp – Claude 3.7 Sonnet benchmarks (datacamp.com/blog/claude-3-7-sonnet)
Wynik 61.3% w trybie standardowym. Wzrost o ~18,7 pp. przy extended thinking.
MMLU
accuracy · Massive Multitask Language Understanding – wiedza z 57 dziedzin.
86.1%
📅 24 lut 2025📄 Vellum AI – Claude 3.7 Sonnet vs OpenAI o1 vs DeepSeek R1 (vellum.ai/blog/claude-3-7-sonnet-vs-openai-o1-vs-deepseek-r1)
Wynik z benchmark table opublikowanej przy premierze.

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)

Wdrożenie i bezpieczeństwo

🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise

Model oceniony pod ASL-2 (Responsible Scaling Policy Anthropic). System card obejmuje oceny CBRN, cyberbezpieczeństwo, autonomię, faithfulness extended thinking oraz computer use. Redukcja niepotrzebnych odmów o 45% względem Claude 3.5 Sonnet.

1) ASL-2 determination po iteratywnym procesie oceny (6 snapshotów modelu, oceny FRT + AST). 2) Zredukowane o 45% niepotrzebne odmowy (standard mode) i 31% (extended thinking mode) vs. Claude 3.5 Sonnet. 3) Extended thinking chains of thought nie są w pełni wierne rzeczywistemu procesowi rozumowania — ujawnione przez Anthropic w system card. 4) Ocena computer use: analiza prompt injection attacks. 5) Model wycofany z Anthropic API 28.10.2025. Na Vertex AI deprecated od 11.11.2025 (shutdown 11.05.2026 dla istniejących klientów). Dostęp badaczy przez External Researcher Access Program.
Aktualizacja: 24 lut 2025↗ Dokumentacja security