Pięć narzędzi AI dostało to samo zadanie: zbudować po trzy strony zgodne z WCAG na poziomie AA. Żadna z 15 powstałych stron nie spełniła nawet poziomu A, najniższego z trzech. Test opisano 30 września w VentureBeat, a przeprowadziła go firma sprzedająca narzędzia do usuwania barier dostępności.
Najważniejsze w skrócie
- Przetestowane narzędzia: OpenAI, Anthropic, Google, xAI i Lovable
- 15 stron, wszystkie poniżej poziomu A — najniższego progu WCAG
- Średnio 55 błędów na stronę, 91 procent o średniej lub wysokiej wadze
- 81 procent programistów uważa, że kod generowany przez AI spełnia zasady dostępności
- Tekst podpisała prezeska AudioEye, firmy sprzedającej narzędzia do dostępności
Trzy poziomy, żaden osiągnięty
Zadanie dostały narzędzia OpenAI, Anthropic, Google, xAI i Lovable. Specyfikacja W3C — WCAG — porządkuje wymagania dostępności według mierzalnych kryteriów sukcesu.
Specyfikacja W3C układa wymagania w trzy progi:
Wynik: 15 stron na 15 nie spełniło nawet poziomu A. Średnia to 55 błędów na stronę, z czego 91 procent zaklasyfikowano jako średnie lub wysokie. To nie są usterki kosmetyczne — poziom A jest absolutnym minimum dostępności.
Przekonanie kontra pomiar
Najciekawsza liczba nie dotyczy kodu, lecz ludzi. 81 procent programistów uważa, że kod generowany przez AI spełnia wymagania dostępności. Pomiar mówi co innego.
| Wskaźnik | Wartość |
|---|---|
| Średnia liczba błędów na stronę | 55 |
| Udział błędów o średniej lub wysokiej wadze | 91% |
| Programiści przekonani, że kod AI spełnia zasady dostępności | 81% |
| Organizacje ze skargą, wezwaniem lub pozwem w ciągu dwóch lat | 46% |
| Z tego sprawy dotyczące stron pisanych przez AI | 71% |
| Zespoły, które zauważyły więcej błędów po wdrożeniu AI | 50% |
To nie jest spór o jakość kodu. To rozjazd między tym, co zespoły zakładają, a tym, co widać w audycie — i zaczyna on kosztować, bo kończy się wezwaniem albo pozwem.
Kto to policzył
Tekst podpisała Kelly Georgevich, prezeska AudioEye — firmy sprzedającej narzędzia, które wykrywają i usuwają bariery dostępności. To nie unieważnia pomiaru, ale ustawia go w kontekście: badanie prowadzi strona zainteresowana wynikiem. Artykuł powołuje się też na dane WebAIM, według których liczba błędów dostępności na milionie najpopularniejszych stron głównych wzrosła o 10 procent rok do roku.
Dlaczego to ważne?
Dostępność to jeden z niewielu obszarów pracy front-endowej, gdzie błąd ma bezpośrednie skutki prawne. Generatory kodu przyspieszają produkcję stron, ale nie przejmują odpowiedzialności — ta zostaje po stronie wydawcy. Rozziew między 81 procentami pewności a wynikiem 15 na 15 pokazuje, gdzie leży realne ryzyko: nie w jakości kodu jako takiej, lecz w tym, że nikt tego nie sprawdza.
Co dalej?
- Specyfikacja W3C WCAG 2.2 pozostaje punktem odniesienia i definiuje trzy poziomy zgodności: A, AA i AAA
- WCAG 2.2 dodało dziewięć nowych kryteriów sukcesu wobec wersji 2.1, trzy z nich na poziomie AA
- Tekst nie podaje adresów badanych stron ani surowych raportów, więc wyniku nie da się dziś odtworzyć





