Robocikowo>ROBOCIKOWO
Microsoft MAI

Microsoft MAI

MAI-1-preview, MAI-Voice-1 (2025) · Rodzina: MAI
Rodzina pierwszych własnych modeli AI Microsoftu ogłoszona 28 sierpnia 2025: MAI-1-preview (tekstowy model MoE) i MAI-Voice-1 (model generowania mowy).
⏳ Preview⏳ Ograniczony dostępLLMModel audio📁 MAI
Data premiery
28 sierpnia 2025
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Microsoft MAI to rodzina pierwszych modeli sztucznej inteligencji zbudowanych wewnętrznie przez dział Microsoft AI, zaprezentowana 28 sierpnia 2025 roku. Na premierę złożyły się dwa modele: MAI-1-preview oraz MAI-Voice-1.

MAI-1-preview

MAI-1-preview to model tekstowy oparty na architekturze mixture-of-experts (MoE), wytrenowany (pre-training i post-training) na około 15 000 procesorach graficznych NVIDIA H100. Został zaprojektowany do realizacji codziennych zapytań i podążania za instrukcjami. Model udostępniono do publicznej oceny na platformie LMArena, a Microsoft zapowiedział jego stopniowe wdrażanie w wybranych funkcjach tekstowych Copilota; dostęp przez API wymaga złożenia wniosku.

MAI-Voice-1

MAI-Voice-1 to model generowania mowy. Według Microsoftu potrafi wygenerować minutę dźwięku w czasie poniżej sekundy na pojedynczym GPU i obsługuje scenariusze z jednym oraz wieloma mówcami. Model napędza funkcje Copilot Daily i Podcasts oraz jest dostępny w Copilot Labs.

Kontekst

Modele MAI (nazwa od „Microsoft AI") to element strategii budowania własnych modeli przez Microsoft, obok dotychczasowej współpracy z OpenAI. Za dział Microsoft AI odpowiada Mustafa Suleyman (EVP i CEO Microsoft AI). Microsoft nie ujawnił liczby parametrów ani rozmiaru okna kontekstowego tych modeli.

Klasyfikacja
LLMModel audio
Rodzina: MAI
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: tekst

Specyfikacja techniczna

Licencja
Proprietary (closed weights)
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textaudio

Możliwości i zastosowania

Natywne możliwości modelu
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Tekst na mowę
Zdolność modelu do generowania mowy na podstawie tekstu.
Kategoria: speech
Naturalna konwersacja
Prowadzenie rozmowy tonu bliskiego ludzkiemu: cieplejszy głos, empatia w odpowiedziach emocjonalnych, humor, unikanie sztywnego 'żargonu asystenta AI'. Wprowadzone jako świadome ulepszenie w GPT-5.1 Instant.
Kategoria: language
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)