Najlepsze polskie głosy TTS 2026 (5 głosów Piper offline + neuronowe Edge)

Opublikowano

Polski nie ma najgłębszego katalogu neuronowych głosów w chmurze — trzy głosy Edge Online, mniej niż niemiecki czy włoski. Za to offline wypada dobrze: projekt Piper ma pięć polskich głosów (Quick TTS udostępnia z nich dwa), a od 27 lipca 2026 doszedł Supertonic HD — polski głos 44,1 kHz liczony lokalnie na GPU. Ten artykuł analizuje wszystkie darmowe polskie głosy — Piper, Supertonic, Edge Online, Apple i klasyczne Microsoft — jeden po drugim, bez marketingu, i mówi wprost, które z nich faktycznie da się tu kliknąć.

Krajobraz polskiego TTS w 2026

Trzy fakty definiują polską sytuację w 2026 roku:

Po pierwsze: mocną stroną polskiego jest offline, nie chmura. Katalog projektu Piper ma pięć polskich głosów — więcej niż większość języków nieanglojęzycznych — choć w Quick TTS wybierzesz z nich dwa. Wszystko, co dostępne, działa w całości w przeglądarce przez WebAssembly, bez wysyłania tekstu do żadnego serwera.

Po drugie: w chmurze polski ma trzy neuronowe głosy Edge Online (Zofia, Marek, Agnieszka), syntetyzowane na serwerach Azure i dostępne przez Web Speech w przeglądarce Edge. To mniej niż niemiecki (19) czy włoski (14), ale w praktyce trzy dobrze zróżnicowane głosy neuronowe pokrywają większość zastosowań — kobiecy domyślny, męski poważny i kobiecy alternatywny.

Po trzecie: klasyczne głosy systemowe (Paulina i Adam na Windows, Zosia na macOS) są nadal dostępne i nadal brzmią „staro". Mają swoją niszę — krótkie powiadomienia, podstawowa dostępność — ale do jakiegokolwiek tekstu dłuższego niż trzy zdania istnieje dziś wyraźnie lepsza alternatywa. Jednej rzeczy polski nie ma: głosów Kokoro. Model Kokoro-82M nie obejmuje polskiego, więc do neuronowego TTS offline rekomendacją jest Piper.

Polskie głosy Piper: katalog projektu, a co z tego działa tutaj

Korekta z 1 sierpnia 2026. Ta sekcja opisywała pięć głosów tak, jakby wszystkie dało się wybrać w Quick TTS. To nieprawda: w naszej przeglądarkowej wersji do wyboru jest jedenpl_PL-gosia-medium. Silnik ma jeszcze pl_PL-mls_6892-low, ale nie ma go w menu: przełącza się na niego sam, gdy urządzenie ma za mało pamięci. Poniżej katalog projektu Piper z uczciwym oznaczeniem każdej pozycji.

Praktyczny wniosek: po stronie Pipera wybierasz gosia-medium. Męskiego głosu Piper tutaj nie ma — po męski timbr sięgnij po Edge Online (Marek Online) albo głosy systemowe. Po najwyższą lokalną jakość: Supertonic HD (sekcja niżej).

Trzy neuronowe głosy Online w Edge

W chmurze polski ma trzy głosy Edge Online (syntetyzowane na serwerach Azure, dostępne przez Web Speech w przeglądarce Edge). Każdy z uczciwą oceną:

Rekomendacja: Zofia Online jako bezpieczny domyślny, Marek Online do tekstu formalnego, Agnieszka Online jako druga barwa kobieca. Trzy głosy to mniej niż w innych językach, ale jakość każdego z nich dorównuje najlepszym głosom neuronowym Edge.

Istotne ograniczenie: głosy Edge Online działają tylko w przeglądarce Microsoft Edge i wymagają połączenia z internetem — synteza odbywa się na serwerach Azure. Do tekstów wrażliwych (dane medyczne, prawne, RODO) wybierz zamiast tego Piper.

Microsoft Paulina i Adam: klasyczne głosy Windows

Na każdym Windowsie dwa klasyczne głosy SAPI pozostają dostępne we wszystkich przeglądarkach (Edge nie jest wymagany):

Realny przypadek użycia tych głosów w 2026: czytnik ekranu offline na niestabilnym łączu, krótkie powiadomienia w kioskach, dostępność na starszych systemach. Do wszystkiego innego lepszy będzie Edge Online albo Piper.

Apple: Zosia, Krzysztof i Ewa

Na macOS i iOS dostępne są trzy polskie głosy (wersje Premium pobiera się z Ustawienia → Dostępność → Treść mówiona):

Na Apple kompromis jest korzystny: jakość niemal jak Edge Online, ale z syntezą lokalną. Dla osób korzystających z iPhone'a/Maca i dbających o prywatność, Zosia Premium lub Krzysztof to właściwy punkt między jakością a przetwarzaniem offline.

Dlaczego brakuje Kokoro (i co zamiast niego)

Kokoro-82M to znakomity, lekki model neuronowy działający na WebGPU — ale nie obejmuje języka polskiego. W przeciwieństwie do włoskiego czy hiszpańskiego, nie ma polskich głosów Kokoro.

Do 27 lipca 2026 polska mocna strona offline opierała się w całości na Piperze. Od tego dnia jest lepsza odpowiedź: Supertonic HD — polski głos 44,1 kHz liczony przez WebGPU na twojej karcie graficznej, w całości w przeglądarce, więc tekst nie opuszcza urządzenia. Jednorazowo około 380 MB, potem działa offline; bez WebGPU opcja się nie pojawia i nie ma wariantu awaryjnego na WebAssembly, więc na telefonie zostaje Piper pl_PL-gosia-medium. Kokoro nie jest tu żadną opcją: jest wyłącznie anglojęzyczne i na polskich stronach w ogóle się nie pokazuje.

Głos do zastosowania: audiobooki, narracja, powiadomienia, tekst techniczny

Praktyczna decyzja według przypadku:

Wypróbuj sam

Otwórz Quick TTS, wklej akapit po polsku i porównaj silnik przeglądarki (Edge Online lub Apple), Piper oraz — na komputerze stacjonarnym — Supertonic HD na tym samym tekście. W obrębie jednego silnika możesz zmienić głos w trakcie czytania: Quick TTS odczytuje bieżący fragment ponownie nowym głosem, więc porównasz Zofia → Paulina na tym samym zdaniu. Zmiana silnika natomiast zatrzymuje odtwarzanie — trzeba ponownie nacisnąć play. To jedyny uczciwy sposób porównania kilkunastu głosów: ludzkie ucho, ten sam materiał.

Więcej kontekstu w przewodniku (dziesięć praktycznych zastosowań TTS), w najczęściej zadawanych pytaniach oraz na stronie O nas, która wyjaśnia, dlaczego Quick TTS przetwarza wszystko lokalnie — łącznie z kwestią RODO przy treściach wrażliwych.