Uczeń i nauczyciel (albo grupa równorzędnych modeli) trenują jednocześnie na tych samych danych. W trakcie treningu uczeń dopasowuje swoje wyjścia do miękkich predykcji nauczyciela (lub uśrednionych predykcji zespołu), co przenosi wiedzę bez oddzielnej fazy destylacji.
Klasyczna destylacja wymaga osobnego, w pełni wytrenowanego nauczyciela, co jest kosztowne i wolne. Online distillation łączy te etapy.