Robocikowo>ROBOCIKOWO
Moshi

Moshi

Moshi · Rodzina: Moshi
Otwarty model głosowy Kyutai czasu rzeczywistego (mowa-w-mowę, pełny dupleks): backbone Helium 7B + kodek Mimi, opóźnienie ~160 ms.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel audioModel audio📁 Moshi
Parametry
≈8B (backbone Helium 7B)
parametrów
Data premiery
18 września 2024
Dostęp:DownloadHostedWdrożenie:💻 Lokalnie📱 Na urządzeniu☁ Cloud

Przegląd

Moshi to otwarty model głosowej sztucznej inteligencji czasu rzeczywistego, opracowany przez paryskie laboratorium Kyutai i udostępniony jako open source 18 września 2024 r. (pierwsze demo w lipcu 2024 r.). Jest to system dialogu „mowa-w-mowę” (speech-to-speech), który przetwarza mowę bezpośrednio, bez pośredniej konwersji na tekst, i działa w trybie pełnego dupleksu — jednocześnie słucha i mówi.

Architektura łączy językowy backbone Helium (7B parametrów, trenowany na 2,1 bln tokenów), neuronowy streamingowy kodek audio Mimi (12 Hz, 1,1 kbps) oraz metodę „Inner Monologue”, w której model przewiduje tokeny tekstu jako prefiks tokenów audio, co poprawia jakość językową mowy. Model liczy ok. 8 mld parametrów.

Moshi osiąga teoretyczne opóźnienie 160 ms (ok. 200 ms w praktyce), co umożliwia naturalną rozmowę w czasie rzeczywistym; rozumie też emocje i niewerbalne aspekty komunikacji. Na wejściu przyjmuje dźwięk (24 kHz, mono), a na wyjściu generuje mowę oraz zsynchronizowany w czasie tekst. Wytrenowano go na ok. 7 mln godzin audio i 20 tys. godzin dialogów syntetycznych.

Model jest otwarty: wagi na licencji CC-BY-4.0, a kod na Apache-2.0 (GitHub, Hugging Face). Dostępne są warianty Moshiko (głos męski) i Moshika (głos żeński). Kyutai to niedochodowe laboratorium AI z Paryża, finansowane m.in. przez Iliad, CMA CGM i Schmidt Sciences.

Klasyfikacja
Model audioModel audio
Rodzina: Moshi
Dostęp i wdrożenie
PobieranieHostowane
LokalnieNa urządzeniuChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: ≈8B (backbone Helium 7B)
✓ Fine-tuning
📥 Wejście: audio

Specyfikacja techniczna

Parametry
≈8B (backbone Helium 7B)
parametrów
Licencja
Wagi CC-BY-4.0; kod Apache-2.0
Wymagania sprzętowe
Open source; działa na GPU, dostępne też skwantyzowane warianty (MLX) do uruchomienia lokalnie/on-device (np. Apple Silicon).
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
audio
⬆ Wyjście (Output)
audiotext

Możliwości i zastosowania

Natywne możliwości modelu
Konwersacja głosowa
Zdolność prowadzenia wieloturowych rozmów głosowych w czasie rzeczywistym z zachowaniem kontekstu i naturalnym tempem wypowiedzi.
Kategoria: speech
Naturalna konwersacja
Prowadzenie rozmowy tonu bliskiego ludzkiemu: cieplejszy głos, empatia w odpowiedziach emocjonalnych, humor, unikanie sztywnego 'żargonu asystenta AI'. Wprowadzone jako świadome ulepszenie w GPT-5.1 Instant.
Kategoria: language
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Mowa na tekst
Zdolność modelu do transkrypcji mowy do postaci tekstowej.
Kategoria: speech
Tekst na mowę
Zdolność modelu do generowania mowy na podstawie tekstu.
Kategoria: speech
Transkrypcja strumieniowa
Konwersja mowy na tekst w czasie rzeczywistym z natychmiastowym wyprowadzaniem wyników w trakcie trwania wypowiedzi.
Kategoria: speech
Dziedziny zastosowań

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)

Wdrożenie i bezpieczeństwo

☁ Dostępny na platformach