Model otrzymuje narzędzie 'wykonaj kod' (zwykle przez tool/function calling). Gdy zadanie wymaga obliczeń, generuje kod (najczęściej Python), który jest wysyłany do izolowanego środowiska (sandbox: kontener/maszyna wirtualna z limitami CPU/RAM/czasu i kontrolą sieci). Środowisko uruchamia kod, przechwytuje standardowe wyjście, błędy oraz artefakty (pliki, wykresy) i zwraca je modelowi. Model interpretuje wynik: jeśli wystąpił błąd, poprawia kod i próbuje ponownie (pętla iteracyjna), a gdy sukces — używa wyniku w odpowiedzi. Stan (zmienne, wgrane pliki) może być zachowywany między wywołaniami w ramach jednej sesji.
LLM-y są zawodne w precyzyjnych obliczeniach (arytmetyka, przetwarzanie danych, manipulacja plikami) i nie mają dostępu do deterministycznego środowiska. Code Execution rozwiązuje ten problem, delegując takie zadania do faktycznego interpretera i zwracając zweryfikowany wynik.
Model tworzący kod (zwykle Python) do wykonania zadania.
Izolowany kontener/VM z limitami zasobów i kontrolą sieci uruchamiający kod modelu.
Oficjalna
Przechwytuje stdout, błędy oraz pliki/wykresy i zwraca je do modelu.
Oficjalna
Kod pochodzi z modelu i może być złośliwy lub błędny; bez izolacji grozi to naruszeniem systemu.
Nieskończone pętle, wyczerpanie pamięci, próby wyjścia poza izolację.
Brak pakietów, różne wersje bibliotek czy losowość dają niestabilne wyniki.
Duże lub wrażliwe wyniki dołączane do kontekstu zwiększają koszt i ryzyko.
Modele generują kod, którego wykonanie daje odpowiedź, poprawiając dokładność w matematyce.
Masowe udostępnienie wykonywania kodu w asystencie: analiza danych, pliki, wykresy.
Powstają otwarte środowiska do bezpiecznego wykonywania kodu generowanego przez LLM.
Wykonywanie kodu staje się standardowym narzędziem w API czołowych dostawców i podstawą agentów kodujących.
Złożoność czasowa: O(kod). Złożoność przestrzenna: O(stan_sesji + artefakty).
Język i środowisko wykonania kodu.
Czy sandbox ma dostęp do internetu.
Limity CPU, pamięci i czasu wykonania.
Kod uruchamiany tylko wtedy, gdy zadanie tego wymaga (decyzja modelu).
Wiele niezależnych sandboxów/wywołań może działać równolegle; pojedyncza pętla generacja→wykonanie→poprawka jest sekwencyjna.
Kod (np. analiza danych) wykonywany na CPU w kontenerach/VM.
Wzorzec niezależny od sprzętu; zależy od środowiska sandbox.