Robocikowo>ROBOCIKOWO
Doubao

Doubao

Doubao Seed 2.0 · Rodzina: Doubao
Rodzina LLM ByteDance napędzająca asystenta Doubao: multimodalne modele MoE (tekst, obraz, mowa) z trybem głębokiego myślenia; najpopularniejszy chatbot AI w Chinach.
✓ Aktywny✓ Publiczny dostępLLMModel multimodalnyModel rozumowaniaModel używający narzędzi📁 Doubao
Data premiery
1 sierpnia 2023
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Doubao (chiń. 豆包, „mała fasolka”) to rodzina dużych modeli językowych rozwijana przez ByteDance, która napędza asystenta AI Doubao — najpopularniejszego chatbota AI w Chinach. Asystent został uruchomiony w sierpniu 2023 r. i do listopada 2024 r. osiągnął ok. 60 mln aktywnych użytkowników miesięcznie, a do maja 2026 r. urósł do 330 mln użytkowników (wtedy też wprowadzono płatne plany subskrypcji).

Modele Doubao budowane są w architekturze mieszaniny ekspertów (MoE) z projektem łączącym trening i inferencję. Według ByteDance model Doubao-1.5-pro z aktywowaną liczbą parametrów równą ok. 1/7 modelu gęstego przewyższył jego jakość; wstępny trening obejmował ok. 9 bilionów tokenów.

Rodzina jest multimodalna: obsługuje tekst, rozumienie obrazu (z natywną, dynamiczną rozdzielczością) oraz mowę w ramach kompleksowego (end-to-end) frameworka Speech2Speech. Modele oferują też „tryb głębokiego myślenia” (rozumowanie) — wariant Doubao-1.5-pro-AS1-Preview przewyższył na benchmarku AIME modele rozumujące pokroju o1-preview.

Najnowszą generacją jest Doubao Seed 2.0 (stabilne wydanie z 14 lutego 2026 r.). Modele udostępniane są przez platformę Volcano Engine (Volcengine) oraz aplikacje ByteDance na iOS, Androida i w przeglądarce; międzynarodowym wariantem asystenta jest Cici/Dola. To modele własnościowe.

Klasyfikacja
LLMModel multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: Doubao
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, audio

Specyfikacja techniczna

Licencja
Proprietary
Wymagania sprzętowe
Model hostowany (chmura), udostępniany jako usługa przez platformę Volcano Engine oraz aplikacje ByteDance; architektura MoE z projektem łączącym trening i inferencję. Bez lokalnego wdrożenia (wagi zamknięte).
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
textimageaudio
⬆ Wyjście (Output)
textaudiocode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozszerzony tryb rozumowania
Wariant modelu rozumującego z dłuższym budżetem inferencji: więcej cykli myślenia, większa precyzja odpowiedzi kosztem czasu odpowiedzi. Wybór między 'standard' a 'extended' thinking pozostawiony użytkownikowi (np. selektor w GPT-5.2 Pro).
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
OCR
Rozpoznawanie tekstu na obrazach i w dokumentach.
Kategoria: vision
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Naturalna konwersacja
Prowadzenie rozmowy tonu bliskiego ludzkiemu: cieplejszy głos, empatia w odpowiedziach emocjonalnych, humor, unikanie sztywnego 'żargonu asystenta AI'. Wprowadzone jako świadome ulepszenie w GPT-5.1 Instant.
Kategoria: language

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)