Robocikowo>ROBOCIKOWO
Mercury 2

Mercury 2

2
Reasoning LLM oparty na dyfuzji (dLLM) od Inception Labs — generuje tokeny równolegle. Okno kontekstu 128K, natywne użycie narzędzi, publiczny cennik.
✓ Aktywny✓ Publiczny dostępModel rozumowaniaLLM
Okno kontekstowe
128K
tokenów
Data premiery
24 lutego 2026
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Mercury 2 to model językowy oparty na architekturze dyfuzyjnej (diffusion LLM, dLLM) opracowany przez Inception Labs. W przeciwieństwie do klasycznych modeli autoregresyjnych, które generują tekst token po tokenie od lewej do prawej, Mercury 2 tworzy odpowiedź równolegle, stopniowo udoskonalając całe bloki tekstu („od zgrubnego do dokładnego"). Pozwala to na znacznie szybsze generowanie przy zachowaniu wysokiej jakości.

Model łączy regulowany poziom rozumowania (tunable reasoning) z oknem kontekstu 128K, natywnym użyciem narzędzi oraz zgodnym ze schematem wyjściem JSON; API jest kompatybilne z OpenAI. Według Inception Labs Mercury 2 osiąga około 1009 tokenów na sekundę na układach NVIDIA Blackwell oraz czas do pierwszego tokena (TTFT) poniżej 300 ms na standardowych GPU NVIDIA.

Mercury 2 należy do rodziny Mercury, opisywanej przez firmę jako pierwsza komercyjnie dostępna rodzina dyfuzyjnych dużych modeli językowych. Premiera odbyła się 24 lutego 2026 roku; model jest dostępny przez API (platform.inceptionlabs.ai) oraz interfejs czatu (chat.inceptionlabs.ai).

Klasyfikacja
Model rozumowaniaLLM
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 128K
✓ Narzędzia
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
128K
tokenów
Funkcje:✓ Używanie narzędzi
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Adaptacyjny wysiłek rozumowania
Model sam decyduje ile 'myślenia' poświęcić na konkretne zapytanie: proste pytania odpowiadane szybko, złożone problemy dostają więcej cykli inferencji. Cecha GPT-5.1 (Instant i Thinking) skracająca czas dla łatwych zadań, wydłużająca dla trudnych.
Kategoria: reasoning

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)