GitHub udostępnił 4 września Project HydraFusion — warstwę, która dobiera model i sposób wykonania zadania kodującego w locie. Koszt spadł we wszystkich trzech benchmarkach, ale jakość przebiła Claude Opus 5 tylko w jednym z nich.
Najważniejsze w skrócie
- Trzy tryby wykonania — Single, Cascade i Critique — wybierane przed uruchomieniem zadania
- TerminalBench 2.1: koszt niższy o 67%, jakość wyższa o 4,9 punktu wobec Claude Opus 5
- DeepSWE: koszt niższy o 36%, jakość niższa o 1,5 punktu
- CheckpointBench: koszt niższy o 65%, jakość niższa o 0,1 punktu
- Research preview dla wszystkich planów Copilota, uruchamiany w CLI flagą /experimental
Routing zamiast jednego modelu
HydraFusion nie wysyła każdego zapytania do tego samego modelu. Przed startem wybiera jeden z trzech wzorców wykonania.
Trzy tryby, między którymi HydraFusion przełącza się w locie:
GitHub opisuje przy tym zabezpieczenia: limity czasu, recenzję w kontekście bez dostępu do narzędzi, walidację trasy przed wykonaniem i zasadę, że niekompletne zmiany nie trafiają do kodu.
Koszt spada wszędzie, jakość nie
Najmocniejszy wynik to TerminalBench 2.1 — przewaga 4,9 punktu nad Claude Opus 5 przy koszcie niższym o 67%. W pozostałych dwóch pomiarach bilans się odwraca.
| Benchmark | Koszt vs Opus 5 | Jakość vs Opus 5 |
|---|---|---|
| TerminalBench 2.1 | −67% | +4,9 pkt |
| DeepSWE | −36% | −1,5 pkt |
| CheckpointBench | −65% | −0,1 pkt |
Hasło o „jakości na poziomie frontier” opiera się więc na jednym pomiarze z trzech.
Jak dotąd zdolność rozumowania i rozwiązywania zadań jest na poziomie Opusa albo lepsza.
Principal Software Engineer w Microsofcie, cytowany na blogu GitHuba.
Dostępność i ograniczenia
Funkcja działa jako research preview?Research preview: Wczesna wersja funkcji udostępniona publicznie do testów. Nie ma gwarancji stabilności ani zobowiązania, że trafi do wersji produkcyjnej. dla wszystkich planów GitHub Copilot i uruchamia się w Copilot CLI flagą /experimental. Rozliczenie idzie po standardowych stawkach tokenowych, a zakres obejmuje na razie wyłącznie zadania jednoturowe.
Dlaczego to ważne?
Routing modeli przenosi decyzję o tym, co uruchomić, z użytkownika na dostawcę narzędzia. Dla zespołów płacących za tokeny dwucyfrowa oszczędność jest realna i natychmiastowa. Ceną jest przewidywalność: ten sam prompt może pójść inną trasą i dać inny wynik, a dwa z trzech benchmarków wypadły poniżej modelu bazowego. To argument za mierzeniem jakości na własnym repozytorium, zanim przyjmie się cudze liczby za pewnik.
Co dalej?
- HydraFusion obsługuje tylko zadania jednoturowe — rozszerzenie na dłuższe sesje agentowe nie ma ogłoszonego terminu
- Flaga /experimental oznacza, że domyślna ścieżka Copilota pozostaje bez zmian do końca research preview
- GitHub opublikował 2 września osobny materiał o kosztach kodowania AI — optymalizacja wydatków staje się osią rozwoju Copilota





