Darmowy TTS HD w przeglądarce — bez chmury i wysyłania

Opublikowano

Quick TTS zyskał trzeci neuronowy silnik mowy: Supertonic HD. To jakość studyjna, dźwięk 44 kHz, a całość działa na Twojej własnej karcie graficznej przez WebGPU — nic, co wklejasz, nigdzie nie trafia. Sprawdzamy, czym to jest, jak brzmi i gdzie ma realne ograniczenia.

Czym jest Supertonic HD

Supertonic HD to darmowy neuronowy głos oparty na Supertonic 3, modelu z otwartymi wagami wydanym przez Supertone Inc. Działa w przeglądarce przez WebGPU i onnxruntime-web — ten sam model „działa na Twoim urządzeniu, nie na naszych serwerach", który Quick TTS już stosuje w Kokoro. To nasz silnik o najwyższej jakości dźwięku: 44 kHz wobec 24 kHz w Kokoro — różnica między „wyraźnie syntetycznym, ale przyjemnym" brzmieniem a dźwiękiem bliższym profesjonalnemu lektorowi.

Dołącza do Web Speech (systemowe głosy Twojego OS), Pipera (mały, WASM, działa wszędzie) i Kokoro (WebGPU, tylko angielski) jako czwarta opcja na liście silników — nie zastępując żadnej z nich. Uczciwe porównanie, kiedy sięgać po który silnik, znajdziesz w naszym artykule Web Speech vs Piper vs Kokoro (EN): Supertonic wypada wyżej od Kokoro pod względem jakości i niżej pod względem kompatybilności urządzeń.

Jak to działa bez serwera

Model pobiera się raz — około 380 MB, prosto z Hugging Face — a potem jest buforowany przez przeglądarkę. Od tego momentu synteza odbywa się wyłącznie na Twojej karcie graficznej. Żaden tekst, który wklejasz, wgrywasz albo z którego generujesz dźwięk, nie opuszcza urządzenia — nie ma czego logować, bo w łańcuchu nie ma żadnego serwera.

Dziesięć głosów, bez klonowania

Supertonic dostarcza dziesięć gotowych głosów — pięć męskich (M1–M5) i pięć żeńskich (F1–F5) — wybieranych z tej samej listy głosów co Kokoro i Piper. Nie ma klonowania głosu ani możliwości wgrania próbki referencyjnej: dostajesz dokładnie to, co jest w modelu. Jeśli spójność brzmienia postaci w długim projekcie liczy się bardziej niż surowa jakość — to realne ograniczenie, o którym warto wiedzieć od razu.

Automatyczny język: jeden głos, tekst mieszany

Funkcja, której nie ma nigdzie indziej w Quick TTS: przełącznik „Auto language (mixed text)". Włącz go, a Supertonic przeczyta dokument, w którym język zmienia się w środku akapitu — polski artykuł z angielskim cytatem, e-mail z obcojęzyczną nazwą produktu — wymawiając każdą część poprawnie, bez żadnego oznaczania z Twojej strony. Każdy inny silnik, który oferujemy, zakłada jeden język na przebieg; temu naprawdę nie robi różnicy, gdzie przebiega granica językowa.

To wąski przypadek użycia, ale dla każdego, kto czyta na głos wielojęzyczne notatki, dwujęzyczne materiały do nauki albo posty z mieszaniem języków w jednym zdaniu, to jedyna rzecz na tej stronie, której nie robi żadne konkurencyjne darmowe narzędzie.

Szybkość: jakość HD bez czekania

Kompromis, którego można by się spodziewać przy wyższej jakości dźwięku, to wolniejsza generacja — i tutaj to się właściwie nie sprawdza. Na maszynie z obsługą WebGPU zmierzyliśmy realny współczynnik czasu rzeczywistego (RTF) na poziomie mniej więcej 0,02–0,07 — w jednym teście fragment tekstu o długości 13-minutowego audiobooka wygenerował się w około 13 sekund. Samo odtwarzanie zaczyna się w mniej niż sekundę, a długie dokumenty są dzielone na fragmenty i przetwarzane potokowo tak samo jak w Kokoro — więc cały rozdział nie oznacza czekania na cały rozdział, zanim cokolwiek usłyszysz.

Polski wśród 15 języków

Supertonic HD jest dostępny w Quick TTS w 15 językach: angielskim, hiszpańskim, francuskim, niemieckim, portugalskim, włoskim, rosyjskim, polskim, niderlandzkim, tureckim, arabskim, wietnamskim, hindi, japońskim i koreańskim. Polski jest w tym gronie — a to nie jest oczywiste: model Kokoro-82M nigdy nie obsługiwał polskiego, więc do tej pory jedynym neuronowym silnikiem offline dla polskiego był Piper (pl_PL-bass-high, pl_PL-gosia-medium, pl_PL-darkman-medium). Supertonic HD to pierwszy silnik klasy HD, który w ogóle mówi po polsku w Quick TTS.

Obsługuje te same formaty i scenariusze pracy co reszta serwisu: PDF, DOCX, EPUB, odtwarzanie długich dokumentów w częściach oraz pobieranie w WAV/MP3, z eksportem do ZIP dla bardzo długich tekstów. Jedynym językiem, którego nie obsługuje, jest chiński — dla niego głos huayan w Piperze pozostaje neuronową opcją offline.

Ograniczenia

Uczciwa lista, nie marketingowa:

Kwestia licencji, dla każdego, kto chce na tym budować: kod inferencji jest na licencji MIT (przeniesiony z przykładowego kodu Supertone), a wagi modelu są na licencji OpenRAIL-M — osobnej, bardziej restrykcyjnej licencji z ograniczeniami użycia. Pełny tekst publikujemy pod adresem /licenses/supertonic-openrail-m.txt, a strona Regulamin opisuje dopuszczalne użycie, jeśli generujesz dźwięk do dalszej dystrybucji.

Wypróbuj sam

Otwórz Quick TTS na komputerze w Chrome lub Edge, przełącz listę silników na Supertonic HD i wklej dowolny tekst. Pierwsze pobranie ~380 MB następuje raz; potem model jest buforowany i działa offline tak samo jak Kokoro. Jeśli Twoja przeglądarka lub urządzenie nie obsługuje WebGPU, lista silników po prostu nie zaproponuje tej opcji — Piper i Web Speech będą działać dokładnie tak jak wczoraj.