Wszystkie artykuły

Raven 0.2.0: EverMind orkiestruje Claude Code i Codex
EverMind wydał Ravena 0.2.0 — otwartoźródłowy framework, w którym AI przepisuje własną warstwę sterującą zamiast wag modelu. Raven spina Claude Code, Codeksa i jedenaście innych agentów w jeden zespół.

LIFT uczy modele VLA siły dopiero na etapie post-treningu
Zespół Shanghai Jiao Tong University pokazał LIFT — metodę, która dodaje pretrenowanej polityce VLA reakcję na siłę kontaktu dopiero w post-treningu, bez ani jednej etykiety siły w pretreningu.

Claude bije ośmiopętlowy rekord fizyki. Ludzie zdążyli równolegle
Anthropic ogłosił, że Claude wyliczył dziewięciopętlową amplitudę w teorii N=4 super Yang-Millsa za ok. 1000–2000 dolarów. Tydzień wcześniej ten sam wynik opublikował niezależnie zespół z Chińskiej Akademii Nauk.

GPT-6 Astra poprowadził prawdziwe auto. Jedyny z czterech modeli na mecie
Niezależny projekt DrivingBench dał czterem czołowym modelom językowym kontrolę nad prawdziwą Toyotą Corollą. Tor z pachołków na parkingu ukończył tylko GPT-6 Astra: 134,7 metra w 5 minut i 22 sekundy, w drugim podejściu.

Gemini 4 Pro w testach społeczności. Co Google faktycznie potwierdził
Deweloperzy testują w LMArena checkpointy, które uznają za wczesne Gemini 4 Pro. Google potwierdza jedno: model jest w post-treningu, a premiera ma być „znacznie wcześniej” niż koniec 2026 roku.

Sygnały z mózgu poprawiają rozumowanie LLM-ów o 13 pkt procentowych
Zespół z Peking University i Tsinghua University pokazał w Nature Machine Intelligence, że sygnały fMRI z ludzkiego mózgu mogą bezpośrednio sterować reprezentacjami LLM-ów. Zysk sięga 13 punktów procentowych dokładności w rozumowaniu dedukcyjnym.

Grok 4.7: dwa punkty w rankingu za 2,25 raza więcej tokenów
Grok 4.7 poprawia wynik w indeksie Artificial Analysis z 44 do 46 punktów, ale zużywa 2,25 raza więcej tokenów wyjścia niż poprzednik. Jedyna wyraźna przewaga — cena — zniknęła dzień po premierze.

Toyota: 400 tys. robotów w fabrykach, uczonych przez weteranów
Toyota szacuje, że automatyzacja jej fabryk będzie wymagać 400 tys. robotów, i od 2028 roku chce wydawać na to bilion jenów rocznie. Kołowego ELEY-a uczy 18 tys. doświadczonych pracowników z 60 zakładów.

Psi-R2.5 uczy robota z jednej demonstracji zamiast pięćdziesięciu
PsiBot pokazał Psi-R2.5 — model, któremu zadanie manipulacyjne pokazuje się raz zamiast kilkudziesięciu razy. Firma odwróciła pipeline: generuje dane ludzkie z danych robota, nie odwrotnie.

GPT-6 Astra steruje ramieniem robota. 95% tylko w łatwym teście
GPT-6 Astra zaliczyła 19 z 20 prób przenoszenia klocka wobec 8 dla Claude Fable 5.1, przy sześciokrotnie mniejszym zużyciu tokenów. Na zadaniu precyzyjnym oba modele mają po 2/20, a RoboDojo przerwał testy po uszkodzeniach sprzętu.

GPT-6 Sol i Luna: OpenAI tnie ceny API o połowę
OpenAI wypuściło GPT-6 Sol (2/10 USD za milion tokenów) i Luna (0,10/0,50 USD) — o połowę taniej niż seria 5.6. Na AutomationBench Sol bije Claude Opus 5 przy koszcie jedenaście razy niższym.

Faraday Future wchodzi w roboty: dziewięć modeli od 9990 dolarów
Faraday Future ogłosiło dziewięć konfiguracji robotów w cenach od 9990 do 137 900 dolarów. Specyfikacje wskazują na sprzęt Boostera i AGIBOT-a pod własną marką, a FF dokłada warstwę software'ową.