Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

HydraFusion tnie koszty kodowania. Jakość rośnie raz na trzy

Pan Robocik9 września 2026 · 2 min czytania
HydraFusion tnie koszty kodowania. Jakość rośnie raz na trzy

GitHub udostępnił 4 września Project HydraFusion — warstwę, która dobiera model i sposób wykonania zadania kodującego w locie. Koszt spadł we wszystkich trzech benchmarkach, ale jakość przebiła Claude Opus 5 tylko w jednym z nich.

Najważniejsze w skrócie

  • Trzy tryby wykonania — Single, Cascade i Critique — wybierane przed uruchomieniem zadania
  • TerminalBench 2.1: koszt niższy o 67%, jakość wyższa o 4,9 punktu wobec Claude Opus 5
  • DeepSWE: koszt niższy o 36%, jakość niższa o 1,5 punktu
  • CheckpointBench: koszt niższy o 65%, jakość niższa o 0,1 punktu
  • Research preview dla wszystkich planów Copilota, uruchamiany w CLI flagą /experimental

Routing zamiast jednego modelu

HydraFusion nie wysyła każdego zapytania do tego samego modelu. Przed startem wybiera jeden z trzech wzorców wykonania.

Trzy tryby, między którymi HydraFusion przełącza się w locie:

Singlejeden model rozwiązuje zadanie od początku do końca
Cascadetańszy model pisze szkic, bramka jakości przyjmuje go albo eskaluje do mocniejszego
Critiquerecenzent z innej rodziny modeli krytykuje szkic, autor poprawia go raz

GitHub opisuje przy tym zabezpieczenia: limity czasu, recenzję w kontekście bez dostępu do narzędzi, walidację trasy przed wykonaniem i zasadę, że niekompletne zmiany nie trafiają do kodu.

Koszt spada wszędzie, jakość nie

Najmocniejszy wynik to TerminalBench 2.1 — przewaga 4,9 punktu nad Claude Opus 5 przy koszcie niższym o 67%. W pozostałych dwóch pomiarach bilans się odwraca.

BenchmarkKoszt vs Opus 5Jakość vs Opus 5
TerminalBench 2.1−67%+4,9 pkt
DeepSWE−36%−1,5 pkt
CheckpointBench−65%−0,1 pkt
Wyniki podane przez GitHuba względem bazowego Claude Opus 5.
1 z 3benchmarków, w których HydraFusion poprawił jakość — w dwóch pozostałych wypadł poniżej modelu bazowegoGitHub Blog

Hasło o „jakości na poziomie frontier” opiera się więc na jednym pomiarze z trzech.

Jak dotąd zdolność rozumowania i rozwiązywania zadań jest na poziomie Opusa albo lepsza.

Principal Software Engineer w Microsofcie, cytowany na blogu GitHuba.

Dostępność i ograniczenia

Funkcja działa jako Research preview: Wczesna wersja funkcji udostępniona publicznie do testów. Nie ma gwarancji stabilności ani zobowiązania, że trafi do wersji produkcyjnej. dla wszystkich planów GitHub Copilot i uruchamia się w Copilot CLI flagą /experimental. Rozliczenie idzie po standardowych stawkach tokenowych, a zakres obejmuje na razie wyłącznie zadania jednoturowe.

Dlaczego to ważne?

Routing modeli przenosi decyzję o tym, co uruchomić, z użytkownika na dostawcę narzędzia. Dla zespołów płacących za tokeny dwucyfrowa oszczędność jest realna i natychmiastowa. Ceną jest przewidywalność: ten sam prompt może pójść inną trasą i dać inny wynik, a dwa z trzech benchmarków wypadły poniżej modelu bazowego. To argument za mierzeniem jakości na własnym repozytorium, zanim przyjmie się cudze liczby za pewnik.

Co dalej?

  • HydraFusion obsługuje tylko zadania jednoturowe — rozszerzenie na dłuższe sesje agentowe nie ma ogłoszonego terminu
  • Flaga /experimental oznacza, że domyślna ścieżka Copilota pozostaje bez zmian do końca research preview
  • GitHub opublikował 2 września osobny materiał o kosztach kodowania AI — optymalizacja wydatków staje się osią rozwoju Copilota

Źródła

Udostępnij ten artykuł