System działa jako agent (lub zespół wyspecjalizowanych agentów) sterowany LLM-em. Typowy potok: (1) generowanie pomysłów — model proponuje nowe kierunki i weryfikuje ich nowość względem literatury (np. przez Semantic Scholar); (2) iteracja eksperymentalna — agent pisze i uruchamia kod, zbiera metryki, generuje wykresy; (3) redakcja artykułu — system tworzy manuskrypt (np. w LaTeX) z cytowaniami; (4) automatyczna recenzja — osobny agent-recenzent ocenia pracę i przekazuje feedback do kolejnej iteracji. Systemy multi-agentowe (np. Google AI co-scientist) rozdzielają role na agentów Generation, Reflection, Ranking (turnieje Elo), Evolution, Proximity i Meta-review, wykorzystując debatę typu self-play i skalowanie compute w czasie inferencji.
Badania naukowe — szczególnie w ML — są wąskim gardłem ograniczonym liczbą wykwalifikowanych badaczy oraz czasem potrzebnym na iterację hipoteza→eksperyment→analiza→publikacja. Koncept dąży do skalowania i przyspieszenia odkryć naukowych przez automatyzację tej pętli, obniżając koszt i zwiększając liczbę równolegle testowanych pomysłów.
Moduł LLM proponujący nowatorskie kierunki badań i weryfikujący ich nowość względem literatury.
Oficjalna
Agent piszący i wykonujący kod, zbierający metryki i generujący wizualizacje.
Oficjalna
Generuje manuskrypt naukowy (np. LaTeX) wraz z automatycznym cytowaniem źródeł.
Oficjalna
Osobny agent LLM oceniający jakość pracy i dostarczający feedback do iteracji.
Oficjalna
Systemy potrafią raportować nieprawdziwe wyniki lub przeceniać oryginalność, co wymaga weryfikacji przez człowieka.
Agent uruchamiający dowolny kod może modyfikować środowisko lub podejmować niezamierzone działania — konieczne sandboxowanie.
Publikowanie prac generowanych przez AI budzi nierozstrzygnięte pytania o autorstwo i przeciążenie systemu recenzji.
Pierwszy szeroko nagłośniony w pełni zautomatyzowany potok badawczy generujący kompletne artykuły ML kosztem ~15 USD za pracę.
Multi-agentowy system oparty na Gemini 2.0 (agenci Generation, Reflection, Ranking, Evolution, Proximity, Meta-review) do generowania hipotez biomedycznych; ogłoszony 19 lutego 2025.
W pełni wygenerowany manuskrypt uzyskał oceny 6/7/6 na warsztacie ICBINB (ICLR 2025) i został dobrowolnie wycofany przed publikacją; ogłoszono 12 marca 2025.
Wykonanie jest sekwencyjno-iteracyjne z pętlą sprzężenia zwrotnego recenzent→generator.
Zadania kierowane są do wyspecjalizowanych agentów (generacja, eksperyment, redakcja, recenzja) zależnie od etapu potoku badawczego.
Wiele pomysłów/eksperymentów można badać równolegle, ale pojedyncza pętla badawcza jest w dużej mierze sekwencyjna.
Inferencja LLM sterujących agentami oraz uruchamiane eksperymenty ML wymagają akceleratorów GPU.
Warstwa orkiestracji agentów jest niezależna od sprzętu; zależność od GPU wynika z modeli bazowych i eksperymentów.