Pomiary, nie obietnice
Ostatnia aktualizacja: wrzesień 2026
VAYS uruchamia swoje AI domyślnie na Twoim urządzeniu. Takie deklaracje łatwo składać, a trudno sprawdzić, dlatego ta strona pokazuje, jak testujemy: prawdziwe benchmarki, na dokładnie tych buildach, które trafiają do użytkowników, z zastrzeżeniami wypisanymi wprost.
Polska mowa medyczna: najtrudniejszy test, jaki znaleźliśmy
ADMEDVOICE to publiczny korpus polskiego dyktowania medycznego opublikowany w Nature Scientific Data (2025, DOI 10.1038/s41597-025-05776-1, CC BY 4.0): opisy radiologiczne, notatki onkologiczne, skierowania, protokoły resuscytacji. Mowa medyczna to najgorszy przypadek dla każdego systemu rozpoznawania: specjalistyczne słownictwo, nazwy leków, dawki i jednostki.
Zmierzyliśmy dokładnie ten stos mowy, na którym działa VAYS (NVIDIA Parakeet v3, w pełni offline przez CoreML na Apple Silicon), na naturalnej części korpusu. Liczby poniżej pochodzą z zaktualizowanego silnika, który działa w wydanych już wersjach iOS 1.9 i Mac 2.8. Według naszej wiedzy to pierwszy opublikowany pomiar tego silnika na polskiej mowie medycznej.
| Metryka | Stos VAYS na urządzeniu |
|---|---|
| Nagrania | 9 797 |
| Audio | 16,3 h |
| Współczynnik błędów słów (WER) | 21,4% |
| WER z normalizacją liczb | 20,1% |
| Współczynnik błędów znaków (CER) | 9,4% |
| Szybkość na Macu z Apple Silicon | 65 razy szybciej niż w czasie rzeczywistym |
Trudność mocno zależy od specjalności: skierowania i zalecenia są blisko 10% WER, a kardiologia sięga 44% (dawki, parametry, jednostki). Część tego ogona to sam korpus: zidentyfikowaliśmy 80 nagrań z niedopasowanym audio i tekstem referencyjnym w danych źródłowych; po ich odfiltrowaniu kardiologia poprawia się do około 37%.
Punkty odniesienia
Dla kontekstu: wyniki na polskiej mowie medycznej raportowane przez innych. Protokoły się różnią, więc traktuj to jako orientację, nie ranking.
| System | WER | Uwagi |
|---|---|---|
| VAYS (na urządzeniu, ten pomiar) | 21,4% | Działa offline na Twoim Macu lub iPhonie |
| Whisper-medium dostrojony przez autorów korpusu | 9,0% | Nasz pomiar ich modelu na naszej próbce; widział część tych danych w treningu, traktuj jako najlepszy przypadek |
| ElevenLabs Scribe | 10,6% | Usługa chmurowa, audio opuszcza urządzenie (arXiv:2603.02246) |
| Whisper large bez dostrajania | 42,3% | Baseline raportowany w tej samej pracy |
Silnik cały czas się poprawia
W sierpniu 2026 zaktualizowaliśmy silnik mowy i przed wydaniem przeprowadziliśmy pełny benchmark od nowa. Dokładność się utrzymała (WER 21,43% vs 21,47%), szybkość wzrosła o 28%, a jedna klasa błędów zniknęła całkowicie: krótkie polskie wypowiedzi wracały czasem z przypadkowymi znakami cyrylicy. Na starym silniku zdarzyło się to w korpusie 22 razy, na nowym zero.
Metoda i uczciwość
- Mierzymy prawdziwy stos CoreML na sprzęcie Apple, nie referencyjny build na GPU. Wynik szybkości pochodzi z jednej konfiguracji Apple Silicon; starsze maszyny będą wolniejsze.
- ADMEDVOICE to dyktowanie jednego mówcy. Rozmowy, spotkania i głośne pomieszczenia wypadną inaczej.
- WER liczy każde wstawione, brakujące lub zmienione słowo. Tekst z WER 21% jest niedoskonały, ale bardzo użyteczny jako szkic, i tak VAYS traktuje transkrypty: jako materiał do przejrzenia, nie prawdę objawioną.
- Korpus jest publiczny (CC BY 4.0). Szczegóły protokołu i nasze skrypty pomiarowe udostępniamy na życzenie.
Ciekawi Cię, co to znaczy dla dokumentacji medycznej? Przeczytaj o VAYS MED.