Robocikowo>ROBOCIKOWO
ERNIE 4.5

ERNIE 4.5

ERNIE 4.5 (do VL-424B-A47B) · Rodzina: ERNIE
Otwarty (Apache 2.0) multimodalny model fundamentowy Baidu: heterogeniczna MoE, warianty do 424B-A47B (VL), kontekst 128K; napędza asystenta Ernie Bot.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLMModel multimodalnyModel wzrokowy📁 ERNIE
Okno kontekstowe
128K
tokenów
Parametry
do 424B (47B aktywne) — VL-424B-A47B; warianty 300B-A47B, 21B-A3B, 28B-A3B, 0.3B
parametrów
Data premiery
16 marca 2025
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

ERNIE 4.5 to multimodalny model fundamentowy opracowany przez Baidu, ogłoszony 16 marca 2025 r. wraz z modelem rozumującym ERNIE X1. Należy do rodziny modeli ERNIE (chiń. 文心, Wenxin) napędzającej asystenta Ernie Bot.

Model zbudowano w heterogenicznej, multimodalnej architekturze mieszaniny ekspertów (MoE), która dzieli parametry pomiędzy modalnościami, jednocześnie przydzielając dedykowane parametry dla każdej z nich. Wersje językowe (LLM) obsługują tekst, a wersje wizyjno-językowe (VL) dodatkowo obraz i wideo; okno kontekstowe wynosi 128K tokenów.

Baidu udostępniło rodzinę ERNIE 4.5 jako otwarte oprogramowanie na licencji Apache 2.0, publikując wagi i kod inferencji na Hugging Face oraz AI Studio. Otwarte warianty obejmują modele językowe ERNIE-4.5-300B-A47B (300 mld / 47 mld aktywnych), 21B-A3B (21 mld / 3 mld) i gęsty 0.3B, a także modele wizyjno-językowe ERNIE-4.5-VL-424B-A47B (424 mld / 47 mld aktywnych) i VL-28B-A3B.

W kwietniu 2025 r., na konferencji Baidu Create 2025, udostępniono też zoptymalizowany wariant ERNIE 4.5 Turbo (szybsze odpowiedzi, niższe koszty). Modele dostępne są przez asystenta Ernie Bot (yiyan.baidu.com, udostępniony bezpłatnie), platformę Baidu AI Cloud (Qianfan) oraz lokalnie dzięki otwartym wagom.

Klasyfikacja
LLMModel multimodalnyModel wzrokowy
Rodzina: ERNIE
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 128K
🧩 Parametry: do 424B (47B aktywne) — VL-424B-A47B; warianty 300B-A47B, 21B-A3B, 28B-A3B, 0.3B
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo

Specyfikacja techniczna

Okno kontekstowe
128K
tokenów
Parametry
do 424B (47B aktywne) — VL-424B-A47B; warianty 300B-A47B, 21B-A3B, 28B-A3B, 0.3B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Rodzina modeli z otwartymi wagami (Apache 2.0) na Hugging Face i AI Studio. Największe warianty MoE (do 424B parametrów łącznie) wymagają klastra GPU o dużej pamięci VRAM; mniejsze warianty (21B-A3B, 0.3B) oraz wersje skwantyzowane (FP8, W4A8C8) umożliwiają lżejsze wdrożenia. Dostępny także przez chmurę Baidu (Qianfan).
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
textimagevideo
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Naturalna konwersacja
Prowadzenie rozmowy tonu bliskiego ludzkiemu: cieplejszy głos, empatia w odpowiedziach emocjonalnych, humor, unikanie sztywnego 'żargonu asystenta AI'. Wprowadzone jako świadome ulepszenie w GPT-5.1 Instant.
Kategoria: language

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)