Startup mimic robotics wspólnie z Black Forest Labs przedstawił FLUX-mimic — model wideo-akcja do trenowania robotów przemysłowych, który skraca czas uczenia pojedynczego zadania z ponad 30 godzin do około 30 minut. Rozwiązanie działa już na linii Audi przy manipulacji miękkimi, elastycznymi elementami. Ogłoszenie padło 27 lipca 2026.
Najważniejsze w skrócie
- FLUX-mimic zbudowano na generatywnym modelu wideo FLUX 3 od Black Forest Labs z dodanym dekoderem akcji.
- Czas treningu zadania: z ponad 30 godzin do około 30 minut, zależnie od trudności.
- Cykl wdrożenia skrócony z miesięcy do tygodni.
- Wdrożenie na żywo w Audi Production Lab — manipulacja miękkimi, elastycznymi częściami.
- To rozwinięcie wcześniejszego modelu mimic-video, który wprowadził koncept modeli wideo-akcja.
Model wideo-akcja zamiast VLA
FLUX-mimic to tak zwany Video-Action Model?Model wideo-akcja: Łączy generatywny model wideo (który „rozumie”, jak wygląda ruch w świecie) z warstwą zamieniającą przewidziane klatki na komendy ruchu robota.. Zamiast uczyć robota fizyki świata od zera z nielicznych demonstracji, bierze generatywny model wideo FLUX 3, wytrenowany wcześniej na ogromnych zbiorach nagrań, który „rozumie” dynamikę otoczenia — jak przedmioty się poruszają, zginają, spadają.
Na tym fundamencie mimic dokłada dekoder akcji?Dekoder akcji: Warstwa modelu tłumacząca przewidywane obrazy (kolejne klatki wideo) na konkretne komendy ruchu ramion i chwytaka robota., który zamienia przewidywane obrazy na konkretne ruchy robota.
Różnica wobec modeli Vision-Language-Action (VLA) jest zasadnicza. VLA uczą się fizyki głównie z rzadkich i kosztownych danych z demonstracji robotycznych. FLUX-mimic dziedziczy wiedzę o dynamice z nagrań wideo, których jest znacznie więcej. Efekt: mniej danych robotycznych potrzebnych, by nauczyć robota nowego zadania.
Trzydzieści godzin do trzydziestu minut
Najmocniejsza liczba to skrócenie treningu pojedynczego zadania z ponad 30 godzin do około 30 minut, zależnie od złożoności. W skali przemysłowej to różnica między wdrożeniem trwającym miesiące a tygodnie.
Firma podkreśla, że kluczowe są tu zadania dotąd trudne dla robotów: manipulacja miękkimi, odkształcalnymi elementami. Sztywne przedmioty są przewidywalne, ale kabel, tkanina czy uszczelka zmieniają kształt w chwycie. Model wideo, który widział, jak takie obiekty się zachowują, radzi sobie z nimi lepiej niż podejście oparte na sztywnych regułach.
Test na linii Audi
FLUX-mimic nie jest tylko demem. Rozwiązanie działa w Audi Production Lab przy złożonej manipulacji miękkimi elementami w produkcji motoryzacyjnej — zadaniach, które wcześniej wymagały pracy ręcznej.
Nad wdrożeniem współpracują Stephan-Daniel Gravert, współzałożyciel i chief product officer mimic robotics, Robin Rombach, współzałożyciel i CEO Black Forest Labs (twórcy modeli FLUX), oraz Christoph Schneider z Audi Production Lab.
To rozwinięcie wcześniejszej pracy mimic — modelu mimic-video, który wprowadził samą koncepcję modeli wideo-akcja. FLUX-mimic przenosi ją na mocniejszy model bazowy i pokazuje działanie w realnej fabryce, a nie tylko w laboratorium.
Dlaczego to ważne?
Największym wąskim gardłem uczenia robotów są dane. Demonstracje robotyczne są drogie i wolne w zbieraniu, a modele VLA potrzebują ich dużo. Pomysł, by fundamentem uczynić generatywny model wideo, odwraca ten problem: nagrań świata jest w internecie ogromna ilość, a model, który już rozumie fizykę ruchu, potrzebuje znacznie mniej przykładów robotycznych do dostrojenia.
Ciekawy jest też podział ról. Black Forest Labs dostarcza model bazowy (FLUX), mimic dokłada warstwę sterowania robotem. To ten sam wzorzec, który widać w całej robotyce użytkowej — twórca foundation modelu i integrator robotyczny działają osobno. Jeśli obietnica skrócenia treningu potwierdzi się poza Audi, podejście wideo-akcja może stać się realną alternatywą dla dominujących dziś modeli VLA.
Co dalej?
- Wyniki wdrożenia w Audi Production Lab pokażą, czy skrócenie treningu do minut utrzyma się przy różnych zadaniach z miękkimi elementami.
- Rozwój modelu bazowego FLUX przez Black Forest Labs będzie bezpośrednio wpływać na możliwości kolejnych wersji FLUX-mimic.
- Otwartą kwestią pozostaje, czy podejście wideo-akcja skaluje się poza manipulację miękkimi częściami na szersze zadania przemysłowe.
Źródła
- Robotics Business News — mimic robotics Introduces FLUX-mimic for Faster Industrial Robot Learning
- mimic robotics — Strona oficjalna (Video-Action Models)





