Pomiary, nie obietnice

Ostatnia aktualizacja: wrzesień 2026

VAYS uruchamia swoje AI domyślnie na Twoim urządzeniu. Takie deklaracje łatwo składać, a trudno sprawdzić, dlatego ta strona pokazuje, jak testujemy: prawdziwe benchmarki, na dokładnie tych buildach, które trafiają do użytkowników, z zastrzeżeniami wypisanymi wprost.

Polska mowa medyczna: najtrudniejszy test, jaki znaleźliśmy

ADMEDVOICE to publiczny korpus polskiego dyktowania medycznego opublikowany w Nature Scientific Data (2025, DOI 10.1038/s41597-025-05776-1, CC BY 4.0): opisy radiologiczne, notatki onkologiczne, skierowania, protokoły resuscytacji. Mowa medyczna to najgorszy przypadek dla każdego systemu rozpoznawania: specjalistyczne słownictwo, nazwy leków, dawki i jednostki.

Zmierzyliśmy dokładnie ten stos mowy, na którym działa VAYS (NVIDIA Parakeet v3, w pełni offline przez CoreML na Apple Silicon), na naturalnej części korpusu. Liczby poniżej pochodzą z zaktualizowanego silnika, który działa w wydanych już wersjach iOS 1.9 i Mac 2.8. Według naszej wiedzy to pierwszy opublikowany pomiar tego silnika na polskiej mowie medycznej.

Metryka Stos VAYS na urządzeniu
Nagrania9 797
Audio16,3 h
Współczynnik błędów słów (WER)21,4%
WER z normalizacją liczb20,1%
Współczynnik błędów znaków (CER)9,4%
Szybkość na Macu z Apple Silicon65 razy szybciej niż w czasie rzeczywistym

Trudność mocno zależy od specjalności: skierowania i zalecenia są blisko 10% WER, a kardiologia sięga 44% (dawki, parametry, jednostki). Część tego ogona to sam korpus: zidentyfikowaliśmy 80 nagrań z niedopasowanym audio i tekstem referencyjnym w danych źródłowych; po ich odfiltrowaniu kardiologia poprawia się do około 37%.

Punkty odniesienia

Dla kontekstu: wyniki na polskiej mowie medycznej raportowane przez innych. Protokoły się różnią, więc traktuj to jako orientację, nie ranking.

System WER Uwagi
VAYS (na urządzeniu, ten pomiar)21,4%Działa offline na Twoim Macu lub iPhonie
Whisper-medium dostrojony przez autorów korpusu9,0%Nasz pomiar ich modelu na naszej próbce; widział część tych danych w treningu, traktuj jako najlepszy przypadek
ElevenLabs Scribe10,6%Usługa chmurowa, audio opuszcza urządzenie (arXiv:2603.02246)
Whisper large bez dostrajania42,3%Baseline raportowany w tej samej pracy

Silnik cały czas się poprawia

W sierpniu 2026 zaktualizowaliśmy silnik mowy i przed wydaniem przeprowadziliśmy pełny benchmark od nowa. Dokładność się utrzymała (WER 21,43% vs 21,47%), szybkość wzrosła o 28%, a jedna klasa błędów zniknęła całkowicie: krótkie polskie wypowiedzi wracały czasem z przypadkowymi znakami cyrylicy. Na starym silniku zdarzyło się to w korpusie 22 razy, na nowym zero.

Metoda i uczciwość

Ciekawi Cię, co to znaczy dla dokumentacji medycznej? Przeczytaj o VAYS MED.