Robocikowo>ROBOCIKOWO
Helix
Generalistyczny model Vision-Language-Action (VLA) firmy Figure AI, łączący percepcję, rozumienie języka i sterowanie robotem humanoidalnym w czasie rzeczywistym.
✓ Aktywny🔬 Research onlyLLMModel sterowania robotemModel multimodalny
Parametry
System 2: 7B + System 1: 80M
parametrów
Data premiery
20 lutego 2025
Dostęp:HostedWdrożenie:📱 Na urządzeniu

Przegląd

Helix to generalistyczny model Vision-Language-Action (VLA) opracowany przez Figure AI, który łączy percepcję, rozumienie języka i wyuczone sterowanie robotem humanoidalnym. Jest pierwszym VLA generującym ciągłe sterowanie całą górną częścią ciała humanoida z częstotliwością 200 Hz — w tym nadgarstkami, tułowiem, głową i pojedynczymi palcami. Umożliwia generalizację zero-shot (chwytanie tysięcy nowych przedmiotów bez wcześniejszego treningu na nich), współpracę wielu robotów na tych samych wagach sieci oraz sterowanie językiem naturalnym. Architektura wykorzystuje projekt „System 1, System 2”: System 2 (7 mld parametrów) to wstępnie wytrenowany na danych z internetu model VLM działający z częstotliwością 7–9 Hz na potrzeby rozumienia sceny, a System 1 (80 mln parametrów) to oparta na transformerze polityka wizuomotoryczna działająca z częstotliwością 200 Hz. Model uruchamiany jest w całości na wbudowanych, energooszczędnych GPU i został wytrenowany na ok. 500 godzinach wysokiej jakości danych z teleoperacji.

Klasyfikacja
LLMLLMLLM
Dostęp i wdrożenie
Hostowane
Na urządzeniu
Wagi: Zamknięte
Kluczowe parametry
🧩 Parametry: System 2: 7B + System 1: 80M
📥 Wejście: obraz, tekst, sensory robota, dane stanu robota

Specyfikacja techniczna

Parametry
System 2: 7B + System 1: 80M
parametrów
Modalności
⬇ Wejście (Input)
imagetextrobot_sensorsrobot_state_data
⬆ Wyjście (Output)
robot_actionsmanipulator_controlmotion_trajectories