Punktem wyjścia są prawdziwe rozmowy klinicystów, z których lekarze wybrali 525 zadań. Do każdego zadania powstaje rubryka: zestaw kryteriów opisujących, co odpowiedź powinna zawierać i czego zawierać nie może. Rubryki nie są dziełem pojedynczej osoby — pisze je i uzgadnia co najmniej trzech lekarzy, w trzech fazach, z jawnie oznaczoną trudnością na skali Likerta od 1 do 7. Odpowiedź modelu punktowana jest względem rubryki w skali ciągłej od 0 do 1, więc częściowa poprawność jest widoczna. Zadania rozkładają się na trzy zastosowania kliniczne — konsultację opiekuńczą, pisanie i dokumentację oraz badania medyczne — a mniej więcej jedna trzecia pochodzi z red teamingu, czyli została skonstruowana po to, by model zawiódł.
Modele oceniane na pytaniach egzaminacyjnych z medycyny wypadają świetnie, co nie mówi nic o tym, jak poradzą sobie w rozmowie z pacjentem albo przy sporządzaniu dokumentacji. HealthBench Professional przenosi ocenę na materiał pochodzący z prawdziwej praktyki i na kryteria, które lekarze uznali za istotne.
Zadania wybrane przez lekarzy, rozłożone na konsultację opiekuńczą, pisanie i dokumentację oraz badania medyczne.
Pisane i uzgadniane przez co najmniej trzech lekarzy w trzech fazach, z trudnością na skali Likerta 1–7.
Około jedna trzecia przykładów została skonstruowana tak, by wywołać błąd modelu.
26 specjalizacji, 52 języki używane zawodowo; każdy przykład przeszedł trzyfazowy przegląd.
Wysoki wynik na benchmarku nie oznacza, że model nadaje się do samodzielnego użycia klinicznego ani że spełnia wymogi regulacyjne wyrobu medycznego.
Jedna trzecia zestawu pochodzi z red teamingu, więc wyniki bezwzględne są niższe niż na benchmarkach z materiałem typowym.
OpenAI udostępnia w kwietniu 2026 zestaw 525 zadań klinicznych z rubrykami lekarskimi, zbudowany przez 190 lekarzy z 50 krajów.