Gratis HD tekst-naar-spraak in je browser — geen cloud

Gepubliceerd op

Quick TTS heeft er een derde neurale spraak-engine bij: Supertonic HD. Studiokwaliteit, 44kHz audio, en hij draait volledig op je eigen GPU via WebGPU — niets wat je plakt wordt ooit ergens naartoe gestuurd. Hier lees je wat het is, hoe het klinkt en waar het nog tekortschiet.

Wat Supertonic HD is

Supertonic HD is een gratis neurale tekst-naar-spraak-stem gebaseerd op Supertonic 3, een open-weight model uitgebracht door Supertone Inc. Het draait in de browser via WebGPU en onnxruntime-web — hetzelfde "draait op jouw machine, niet op onze servers"-model dat Quick TTS al gebruikt voor Kokoro. Het is de engine met de hoogste geluidskwaliteit die we aanbieden: 44kHz output tegenover 24kHz bij Kokoro, het verschil tussen "duidelijk synthetisch maar prettig" en audio die dichter bij een geproduceerde voice-over komt.

Hij voegt zich bij Web Speech (de ingebouwde stemmen van je besturingssysteem), Piper (klein, WASM, draait overal) en Kokoro (WebGPU, alleen Engels) als vierde optie in de engine-lijst — geen vervanging voor een van de andere. Voor een eerlijk overzicht van wanneer je welke kiest, blijft ons artikel Web Speech vs Piper vs Kokoro (EN) geldig: Supertonic zit qua kwaliteit boven Kokoro en qua apparaatcompatibiliteit eronder.

Hoe het werkt zonder server

Het model wordt één keer gedownload — ongeveer 380MB, rechtstreeks van Hugging Face — en daarna door de browser gecached. Vanaf dat moment gebeurt alle synthese volledig op je GPU. Geen tekst die je plakt, uploadt of waaruit je audio genereert, verlaat ooit je apparaat; er is niets om te loggen, omdat er helemaal geen server in het spel is.

Tien stemmen, geen kloning

Supertonic levert tien vaste stemmen — vijf mannelijk (M1–M5) en vijf vrouwelijk (F1–F5) — te kiezen uit dezelfde stemkiezer als Kokoro en Piper. Er is geen stemkloning en geen manier om een referentiesample te uploaden: je krijgt wat er in het model zit. Als karakterconsistentie over een lang project belangrijker is dan pure geluidskwaliteit, is dat een reële beperking om vooraf te weten.

Automatische taal: één stem, gemengde tekst

De functie die nergens anders in Quick TTS bestaat: een schakelaar "Auto language (mixed text)". Zet hem aan en Supertonic leest een document dat halverwege een alinea van taal wisselt — een Nederlands artikel met een Engels citaat, een e-mail met een buitenlandse productnaam — en spreekt elk onderdeel correct uit zonder dat jij iets hoeft te markeren. Elke andere engine die we aanbieden gaat uit van één taal per keer; deze maakt het echt niet uit waar de taalgrens ligt.

Het is een smal gebruiksgeval, maar voor iedereen die meertalige notities, tweetalig studiemateriaal of berichten met taalwisselingen hardop laat voorlezen, is het het enige op deze pagina dat geen enkel concurrerend gratis hulpmiddel doet.

Snelheid: HD-kwaliteit zonder wachten

De afweging die je zou verwachten bij audio van hogere kwaliteit is tragere generatie, en dat blijkt hier niet echt te kloppen. Op een machine met WebGPU-ondersteuning maten we een real-time factor van ongeveer 0,02–0,07 — in één test genereerde een tekstfragment ter grootte van een dertien minuten durend audioboek in ongeveer 13 seconden. Het afspelen zelf begint in ruim minder dan een seconde, en lange documenten worden net als bij Kokoro in stukken verdeeld en pipelined, zodat een heel hoofdstuk niet betekent dat je een heel hoofdstuk moet wachten voor je iets hoort.

Nederlands tussen de 15 talen

Supertonic HD is bij Quick TTS beschikbaar in 15 talen: Engels, Spaans, Frans, Duits, Portugees, Italiaans, Russisch, Pools, Nederlands, Turks, Arabisch, Vietnamees, Hindi, Japans en Koreaans. Nederlands zit daarbij: het model Kokoro-82M ondersteunt geen Nederlands, dus tot nu toe was Piper de enige neurale offline-optie voor deze taal. Supertonic HD is de eerste engine op HD-niveau die in Quick TTS überhaupt Nederlands spreekt.

Hij ondersteunt dezelfde bestandsformaten en workflows als de rest van de site: PDF, DOCX, EPUB, gefaseerde weergave van lange documenten, en downloaden als WAV/MP3, met een ZIP-export voor zeer lange teksten. De ene taal die hij niet dekt is Chinees; daarvoor blijft de huayan-stem van Piper de neurale optie.

Beperkingen

De eerlijke lijst, niet de marketinglijst:

Over licenties, voor wie hierop wil voortbouwen: de inference-code is MIT (overgezet van de voorbeeldcode van Supertone), en de modelgewichten zijn OpenRAIL-M — een aparte, restrictievere licentie met gebruiksbeperkingen. We publiceren de volledige tekst op /licenses/supertonic-openrail-m.txt, en onze pagina Voorwaarden behandelt toegestaan gebruik als je audio genereert voor verspreiding.

Probeer het zelf

Open Quick TTS op een desktop met Chrome of Edge, zet de engine-lijst op Supertonic HD en plak iets. De eerste download van ~380MB gebeurt één keer; daarna is hij gecached en offline bruikbaar, net als Kokoro. Als je browser of apparaat geen WebGPU ondersteunt, biedt de lijst deze optie simpelweg niet aan — Piper en Web Speech blijven precies zo werken als gisteren.