Darmowy TTS HD w przeglądarce — bez chmury i wysyłania
Quick TTS zyskał trzeci neuronowy silnik mowy: Supertonic HD. To jakość studyjna, dźwięk 44 kHz, a całość działa na Twojej własnej karcie graficznej przez WebGPU — nic, co wklejasz, nigdzie nie trafia. Sprawdzamy, czym to jest, jak brzmi i gdzie ma realne ograniczenia.
Czym jest Supertonic HD
Supertonic HD to darmowy neuronowy głos oparty na Supertonic 3, modelu z otwartymi wagami wydanym przez Supertone Inc. Działa w przeglądarce przez WebGPU i onnxruntime-web — ten sam model „działa na Twoim urządzeniu, nie na naszych serwerach", który Quick TTS już stosuje w Kokoro. To nasz silnik o najwyższej jakości dźwięku: 44 kHz wobec 24 kHz w Kokoro — różnica między „wyraźnie syntetycznym, ale przyjemnym" brzmieniem a dźwiękiem bliższym profesjonalnemu lektorowi.
Dołącza do Web Speech (systemowe głosy Twojego OS), Pipera (mały, WASM, działa wszędzie) i Kokoro (WebGPU, tylko angielski) jako czwarta opcja na liście silników — nie zastępując żadnej z nich. Uczciwe porównanie, kiedy sięgać po który silnik, znajdziesz w naszym artykule Web Speech vs Piper vs Kokoro (EN): Supertonic wypada wyżej od Kokoro pod względem jakości i niżej pod względem kompatybilności urządzeń.
Jak to działa bez serwera
Model pobiera się raz — około 380 MB, prosto z Hugging Face — a potem jest buforowany przez przeglądarkę. Od tego momentu synteza odbywa się wyłącznie na Twojej karcie graficznej. Żaden tekst, który wklejasz, wgrywasz albo z którego generujesz dźwięk, nie opuszcza urządzenia — nie ma czego logować, bo w łańcuchu nie ma żadnego serwera.
- ~99 mln parametrów — mniej więcej ta sama klasa wielkości co Kokoro-82M, ale model wytrenowano do generowania pełnego 44 kHz zamiast 24 kHz.
- Tylko WebGPU. Nie ma ścieżki WASM — zmierzyliśmy wydajność Supertonic przez WASM na wydajnym procesorze desktopowym na poziomie zbliżonym do czasu rzeczywistego, co jest bezużyteczne na czymkolwiek słabszym, więc jej nie wdrożyliśmy. Potrzebna jest nowoczesna przeglądarka desktopowa: Chrome lub Edge 113+ z działającą kartą graficzną.
- Brak WebGPU to nie problem. Urządzenia bez niego — większość telefonów, starsze laptopy, dzisiejsze Firefox i Safari — nadal mają Pipera i Web Speech dokładnie tak jak wcześniej. Istniejące silniki się nie zmieniają.
Dziesięć głosów, bez klonowania
Supertonic dostarcza dziesięć gotowych głosów — pięć męskich (M1–M5) i pięć żeńskich (F1–F5) — wybieranych z tej samej listy głosów co Kokoro i Piper. Nie ma klonowania głosu ani możliwości wgrania próbki referencyjnej: dostajesz dokładnie to, co jest w modelu. Jeśli spójność brzmienia postaci w długim projekcie liczy się bardziej niż surowa jakość — to realne ograniczenie, o którym warto wiedzieć od razu.
Automatyczny język: jeden głos, tekst mieszany
Funkcja, której nie ma nigdzie indziej w Quick TTS: przełącznik „Auto language (mixed text)". Włącz go, a Supertonic przeczyta dokument, w którym język zmienia się w środku akapitu — polski artykuł z angielskim cytatem, e-mail z obcojęzyczną nazwą produktu — wymawiając każdą część poprawnie, bez żadnego oznaczania z Twojej strony. Każdy inny silnik, który oferujemy, zakłada jeden język na przebieg; temu naprawdę nie robi różnicy, gdzie przebiega granica językowa.
To wąski przypadek użycia, ale dla każdego, kto czyta na głos wielojęzyczne notatki, dwujęzyczne materiały do nauki albo posty z mieszaniem języków w jednym zdaniu, to jedyna rzecz na tej stronie, której nie robi żadne konkurencyjne darmowe narzędzie.
Szybkość: jakość HD bez czekania
Kompromis, którego można by się spodziewać przy wyższej jakości dźwięku, to wolniejsza generacja — i tutaj to się właściwie nie sprawdza. Na maszynie z obsługą WebGPU zmierzyliśmy realny współczynnik czasu rzeczywistego (RTF) na poziomie mniej więcej 0,02–0,07 — w jednym teście fragment tekstu o długości 13-minutowego audiobooka wygenerował się w około 13 sekund. Samo odtwarzanie zaczyna się w mniej niż sekundę, a długie dokumenty są dzielone na fragmenty i przetwarzane potokowo tak samo jak w Kokoro — więc cały rozdział nie oznacza czekania na cały rozdział, zanim cokolwiek usłyszysz.
Polski wśród 15 języków
Supertonic HD jest dostępny w Quick TTS w 15 językach: angielskim, hiszpańskim, francuskim, niemieckim, portugalskim, włoskim, rosyjskim, polskim, niderlandzkim, tureckim, arabskim, wietnamskim, hindi, japońskim i koreańskim. Polski jest w tym gronie — a to nie jest oczywiste: model Kokoro-82M nigdy nie obsługiwał polskiego, więc do tej pory jedynym neuronowym silnikiem offline dla polskiego był Piper (pl_PL-bass-high, pl_PL-gosia-medium, pl_PL-darkman-medium). Supertonic HD to pierwszy silnik klasy HD, który w ogóle mówi po polsku w Quick TTS.
Obsługuje te same formaty i scenariusze pracy co reszta serwisu: PDF, DOCX, EPUB, odtwarzanie długich dokumentów w częściach oraz pobieranie w WAV/MP3, z eksportem do ZIP dla bardzo długich tekstów. Jedynym językiem, którego nie obsługuje, jest chiński — dla niego głos huayan w Piperze pozostaje neuronową opcją offline.
Ograniczenia
Uczciwa lista, nie marketingowa:
- 380 MB to realne pobieranie. Na wolnym lub limitowanym łączu to największy koszt wypróbowania Supertonic — więcej niż ~80 MB ścieżki WASM Kokoro czy ~60 MB głosów Pipera.
- WebGPU jest wymagane, bez wyjątków. Ten silnik nie ma ścieżki zapasowej, w przeciwieństwie do Kokoro, który automatycznie przełącza się na Pipera lub Web Speech, gdy karta graficzna sobie nie radzi.
- Przede wszystkim desktop. Obsługa WebGPU na mobilnych kartach graficznych i w mobilnych przeglądarkach jest na razie na tyle niespójna, że nie polecamy tam tego silnika.
- Dziesięć stałych głosów, bez klonowania. Jeśli potrzebujesz konkretnej tożsamości głosowej, to nie jest odpowiednie narzędzie.
- Projekt źródłowy rozwija się szybko, a potem się zatrzymuje. Referencyjna implementacja Supertone Inc. na GitHubie została zarchiwizowana wkrótce po tym, jak ją zintegrowaliśmy. Wagi modelu i kod inferencji, które dostarczamy, są przypięte do konkretnej rewizji i przez nas zweryfikowane — a nie po cichu podążają za źródłem, które może już nie otrzymywać aktualizacji.
Kwestia licencji, dla każdego, kto chce na tym budować: kod inferencji jest na licencji MIT (przeniesiony z przykładowego kodu Supertone), a wagi modelu są na licencji OpenRAIL-M — osobnej, bardziej restrykcyjnej licencji z ograniczeniami użycia. Pełny tekst publikujemy pod adresem /licenses/supertonic-openrail-m.txt, a strona Regulamin opisuje dopuszczalne użycie, jeśli generujesz dźwięk do dalszej dystrybucji.
Wypróbuj sam
Otwórz Quick TTS na komputerze w Chrome lub Edge, przełącz listę silników na Supertonic HD i wklej dowolny tekst. Pierwsze pobranie ~380 MB następuje raz; potem model jest buforowany i działa offline tak samo jak Kokoro. Jeśli Twoja przeglądarka lub urządzenie nie obsługuje WebGPU, lista silników po prostu nie zaproponuje tej opcji — Piper i Web Speech będą działać dokładnie tak jak wczoraj.