Najlepsze polskie głosy TTS 2026 (5 głosów Piper offline + neuronowe Edge)
Polski nie ma najgłębszego katalogu neuronowych głosów w chmurze — trzy głosy Edge Online, mniej niż niemiecki czy włoski. Za to offline wypada dobrze: projekt Piper ma pięć polskich głosów (Quick TTS udostępnia z nich dwa), a od 27 lipca 2026 doszedł Supertonic HD — polski głos 44,1 kHz liczony lokalnie na GPU. Ten artykuł analizuje wszystkie darmowe polskie głosy — Piper, Supertonic, Edge Online, Apple i klasyczne Microsoft — jeden po drugim, bez marketingu, i mówi wprost, które z nich faktycznie da się tu kliknąć.
Krajobraz polskiego TTS w 2026
Trzy fakty definiują polską sytuację w 2026 roku:
Po pierwsze: mocną stroną polskiego jest offline, nie chmura. Katalog projektu Piper ma pięć polskich głosów — więcej niż większość języków nieanglojęzycznych — choć w Quick TTS wybierzesz z nich dwa. Wszystko, co dostępne, działa w całości w przeglądarce przez WebAssembly, bez wysyłania tekstu do żadnego serwera.
Po drugie: w chmurze polski ma trzy neuronowe głosy Edge Online (Zofia, Marek, Agnieszka), syntetyzowane na serwerach Azure i dostępne przez Web Speech w przeglądarce Edge. To mniej niż niemiecki (19) czy włoski (14), ale w praktyce trzy dobrze zróżnicowane głosy neuronowe pokrywają większość zastosowań — kobiecy domyślny, męski poważny i kobiecy alternatywny.
Po trzecie: klasyczne głosy systemowe (Paulina i Adam na Windows, Zosia na macOS) są nadal dostępne i nadal brzmią „staro". Mają swoją niszę — krótkie powiadomienia, podstawowa dostępność — ale do jakiegokolwiek tekstu dłuższego niż trzy zdania istnieje dziś wyraźnie lepsza alternatywa. Jednej rzeczy polski nie ma: głosów Kokoro. Model Kokoro-82M nie obejmuje polskiego, więc do neuronowego TTS offline rekomendacją jest Piper.
Polskie głosy Piper: katalog projektu, a co z tego działa tutaj
Korekta z 1 sierpnia 2026. Ta sekcja opisywała pięć głosów tak, jakby wszystkie dało się wybrać w Quick TTS. To nieprawda: w naszej przeglądarkowej wersji do wyboru jest jeden — pl_PL-gosia-medium. Silnik ma jeszcze pl_PL-mls_6892-low, ale nie ma go w menu: przełącza się na niego sam, gdy urządzenie ma za mało pamięci. Poniżej katalog projektu Piper z uczciwym oznaczeniem każdej pozycji.
pl_PL-gosia-medium— głos żeński, jakość medium. Dostępny w Quick TTS. Domyślny wybór offline: czysty timbr, spokojna artykulacja. Najlepszy do audiobooków i długich tekstów bez chmury.pl_PL-mls_6892-low— jakość low, mniejszy model, szybsza inferencja. Nie do wyboru w Quick TTS: silnik sięga po niego automatycznie na sprzęcie z małą ilością pamięci. Słychać artefakty na dłuższych samogłoskach.pl_PL-bass-high— męski głos w jakości „high", rzadkość poza angielskim. Nie do wyboru w Quick TTS.pl_PL-darkman-medium— głos męski, jakość medium, ciemniejszy ton. Nie do wyboru w Quick TTS.pl_PL-mc_speech-medium— głos męski/neutralny, jakość medium. Nie do wyboru w Quick TTS.
Praktyczny wniosek: po stronie Pipera wybierasz gosia-medium. Męskiego głosu Piper tutaj nie ma — po męski timbr sięgnij po Edge Online (Marek Online) albo głosy systemowe. Po najwyższą lokalną jakość: Supertonic HD (sekcja niżej).
Trzy neuronowe głosy Online w Edge
W chmurze polski ma trzy głosy Edge Online (syntetyzowane na serwerach Azure, dostępne przez Web Speech w przeglądarce Edge). Każdy z uczciwą oceną:
- Microsoft Zofia Online — domyślny głos żeński dla polskiego. Czysty, neutralny timbr, stabilna prozodia na długich zdaniach. To wybór „domyślny", gdy nie chcesz się nad tym zastanawiać.
- Microsoft Marek Online — standardowy odpowiednik męski. Poważny, lekko formalny ton. Świetny do treści informacyjnych lub technicznych.
- Microsoft Agnieszka Online — głos żeński, alternatywa dla Zofii. Nieco cieplejszy rejestr — przydatny, gdy Zofia zaczyna męczyć ucho przy długim słuchaniu.
Rekomendacja: Zofia Online jako bezpieczny domyślny, Marek Online do tekstu formalnego, Agnieszka Online jako druga barwa kobieca. Trzy głosy to mniej niż w innych językach, ale jakość każdego z nich dorównuje najlepszym głosom neuronowym Edge.
Istotne ograniczenie: głosy Edge Online działają tylko w przeglądarce Microsoft Edge i wymagają połączenia z internetem — synteza odbywa się na serwerach Azure. Do tekstów wrażliwych (dane medyczne, prawne, RODO) wybierz zamiast tego Piper.
Microsoft Paulina i Adam: klasyczne głosy Windows
Na każdym Windowsie dwa klasyczne głosy SAPI pozostają dostępne we wszystkich przeglądarkach (Edge nie jest wymagany):
- Microsoft Paulina — historyczny systemowy głos żeński. Brzmi dokładnie tak, jak pamiętasz z Windows 7. Przydatny, gdy nie ma internetu.
- Microsoft Adam — klasyczny głos męski. Ta sama rodzina technologiczna, te same ograniczenia.
Realny przypadek użycia tych głosów w 2026: czytnik ekranu offline na niestabilnym łączu, krótkie powiadomienia w kioskach, dostępność na starszych systemach. Do wszystkiego innego lepszy będzie Edge Online albo Piper.
Apple: Zosia, Krzysztof i Ewa
Na macOS i iOS dostępne są trzy polskie głosy (wersje Premium pobiera się z Ustawienia → Dostępność → Treść mówiona):
- Zosia — domyślny głos żeński (pl-PL). Wersja Premium jest wyraźnie neuronowa, jakością porównywalna z najlepszymi głosami Edge Online. Działa w 100% lokalnie — nic nie trafia do chmury.
- Krzysztof (Siri) — głos męski Siri. Naturalny ton, dobrze wyważona prozodia na dłuższych zdaniach.
- Ewa (Siri) — drugi głos żeński Siri. Alternatywa dla Zosii, nieco jaśniejsza.
Na Apple kompromis jest korzystny: jakość niemal jak Edge Online, ale z syntezą lokalną. Dla osób korzystających z iPhone'a/Maca i dbających o prywatność, Zosia Premium lub Krzysztof to właściwy punkt między jakością a przetwarzaniem offline.
Dlaczego brakuje Kokoro (i co zamiast niego)
Kokoro-82M to znakomity, lekki model neuronowy działający na WebGPU — ale nie obejmuje języka polskiego. W przeciwieństwie do włoskiego czy hiszpańskiego, nie ma polskich głosów Kokoro.
Do 27 lipca 2026 polska mocna strona offline opierała się w całości na Piperze. Od tego dnia jest lepsza odpowiedź: Supertonic HD — polski głos 44,1 kHz liczony przez WebGPU na twojej karcie graficznej, w całości w przeglądarce, więc tekst nie opuszcza urządzenia. Jednorazowo około 380 MB, potem działa offline; bez WebGPU opcja się nie pojawia i nie ma wariantu awaryjnego na WebAssembly, więc na telefonie zostaje Piper pl_PL-gosia-medium. Kokoro nie jest tu żadną opcją: jest wyłącznie anglojęzyczne i na polskich stronach w ogóle się nie pokazuje.
Głos do zastosowania: audiobooki, narracja, powiadomienia, tekst techniczny
Praktyczna decyzja według przypadku:
- Długi audiobook (1+ godzina): Supertonic HD (desktop z WebGPU, najlepsza lokalna jakość) lub Piper
pl_PL-gosia-medium(offline, wszędzie). Stabilność prozodii jest tu kluczowa — oba utrzymują ton przez całe rozdziały. W chmurze: Edge Zofia Online. - Narracja informacyjna / podcast: Edge Marek Online — to zarazem sposób na męski timbr, którego polski Piper tutaj nie oferuje.
- Treść nieformalna / film na YouTube: Edge Agnieszka Online lub Piper
pl_PL-gosia-medium. - Tekst techniczny / informacyjny: Edge Marek Online jako neutralny, „niewidzialny" narrator; offline — Supertonic HD albo Piper
pl_PL-gosia-medium. - Krótkie powiadomienia, system offline: Microsoft Paulina/Adam SAPI lub Piper
pl_PL-gosia-medium(jedyny głos do wyboru w Quick TTS). - Dostępność czytnika ekranu: domyślny głos systemowy (Apple Zosia, Microsoft Paulina) — tu liczy się minimalne opóźnienie.
- Tekst wrażliwy pod kątem RODO: Piper offline (bass-high, gosia, darkman) lub Apple Zosia — synteza lokalna, tekst nie opuszcza urządzenia.
- Najlepsza jakość bez chmury: Supertonic HD na desktopie z WebGPU; wszędzie indziej Piper
pl_PL-gosia-medium, który działa praktycznie w każdej przeglądarce. - iPhone / Mac, bez tarcia: Apple Zosia Premium. Pobierasz, instalujesz, zapominasz.
Wypróbuj sam
Otwórz Quick TTS, wklej akapit po polsku i porównaj silnik przeglądarki (Edge Online lub Apple), Piper oraz — na komputerze stacjonarnym — Supertonic HD na tym samym tekście. W obrębie jednego silnika możesz zmienić głos w trakcie czytania: Quick TTS odczytuje bieżący fragment ponownie nowym głosem, więc porównasz Zofia → Paulina na tym samym zdaniu. Zmiana silnika natomiast zatrzymuje odtwarzanie — trzeba ponownie nacisnąć play. To jedyny uczciwy sposób porównania kilkunastu głosów: ludzkie ucho, ten sam materiał.
Więcej kontekstu w przewodniku (dziesięć praktycznych zastosowań TTS), w najczęściej zadawanych pytaniach oraz na stronie O nas, która wyjaśnia, dlaczego Quick TTS przetwarza wszystko lokalnie — łącznie z kwestią RODO przy treściach wrażliwych.