Gratis HD tekst-naar-spraak in je browser — geen cloud
Quick TTS heeft er een derde neurale spraak-engine bij: Supertonic HD. Studiokwaliteit, 44kHz audio, en hij draait volledig op je eigen GPU via WebGPU — niets wat je plakt wordt ooit ergens naartoe gestuurd. Hier lees je wat het is, hoe het klinkt en waar het nog tekortschiet.
Wat Supertonic HD is
Supertonic HD is een gratis neurale tekst-naar-spraak-stem gebaseerd op Supertonic 3, een open-weight model uitgebracht door Supertone Inc. Het draait in de browser via WebGPU en onnxruntime-web — hetzelfde "draait op jouw machine, niet op onze servers"-model dat Quick TTS al gebruikt voor Kokoro. Het is de engine met de hoogste geluidskwaliteit die we aanbieden: 44kHz output tegenover 24kHz bij Kokoro, het verschil tussen "duidelijk synthetisch maar prettig" en audio die dichter bij een geproduceerde voice-over komt.
Hij voegt zich bij Web Speech (de ingebouwde stemmen van je besturingssysteem), Piper (klein, WASM, draait overal) en Kokoro (WebGPU, alleen Engels) als vierde optie in de engine-lijst — geen vervanging voor een van de andere. Voor een eerlijk overzicht van wanneer je welke kiest, blijft ons artikel Web Speech vs Piper vs Kokoro (EN) geldig: Supertonic zit qua kwaliteit boven Kokoro en qua apparaatcompatibiliteit eronder.
Hoe het werkt zonder server
Het model wordt één keer gedownload — ongeveer 380MB, rechtstreeks van Hugging Face — en daarna door de browser gecached. Vanaf dat moment gebeurt alle synthese volledig op je GPU. Geen tekst die je plakt, uploadt of waaruit je audio genereert, verlaat ooit je apparaat; er is niets om te loggen, omdat er helemaal geen server in het spel is.
- ~99M parameters, ongeveer dezelfde grootteklasse als Kokoro-82M, maar getraind om volledige 44kHz audio te produceren in plaats van 24kHz.
- Alleen WebGPU. Er is geen WASM-fallback — we hebben het WASM-pad van Supertonic gemeten op ongeveer realtime snelheid op een krachtige desktop-CPU, wat onbruikbaar is op alles wat zwakker is, dus hebben we het niet uitgebracht. Dat betekent een moderne desktopbrowser: Chrome of Edge 113+ met een werkende GPU.
- Geen WebGPU, geen probleem. Apparaten zonder WebGPU — de meeste telefoons, oudere laptops, Firefox en Safari vandaag — behouden Piper en Web Speech precies zoals voorheen. Aan de bestaande engines verandert niets.
Tien stemmen, geen kloning
Supertonic levert tien vaste stemmen — vijf mannelijk (M1–M5) en vijf vrouwelijk (F1–F5) — te kiezen uit dezelfde stemkiezer als Kokoro en Piper. Er is geen stemkloning en geen manier om een referentiesample te uploaden: je krijgt wat er in het model zit. Als karakterconsistentie over een lang project belangrijker is dan pure geluidskwaliteit, is dat een reële beperking om vooraf te weten.
Automatische taal: één stem, gemengde tekst
De functie die nergens anders in Quick TTS bestaat: een schakelaar "Auto language (mixed text)". Zet hem aan en Supertonic leest een document dat halverwege een alinea van taal wisselt — een Nederlands artikel met een Engels citaat, een e-mail met een buitenlandse productnaam — en spreekt elk onderdeel correct uit zonder dat jij iets hoeft te markeren. Elke andere engine die we aanbieden gaat uit van één taal per keer; deze maakt het echt niet uit waar de taalgrens ligt.
Het is een smal gebruiksgeval, maar voor iedereen die meertalige notities, tweetalig studiemateriaal of berichten met taalwisselingen hardop laat voorlezen, is het het enige op deze pagina dat geen enkel concurrerend gratis hulpmiddel doet.
Snelheid: HD-kwaliteit zonder wachten
De afweging die je zou verwachten bij audio van hogere kwaliteit is tragere generatie, en dat blijkt hier niet echt te kloppen. Op een machine met WebGPU-ondersteuning maten we een real-time factor van ongeveer 0,02–0,07 — in één test genereerde een tekstfragment ter grootte van een dertien minuten durend audioboek in ongeveer 13 seconden. Het afspelen zelf begint in ruim minder dan een seconde, en lange documenten worden net als bij Kokoro in stukken verdeeld en pipelined, zodat een heel hoofdstuk niet betekent dat je een heel hoofdstuk moet wachten voor je iets hoort.
Nederlands tussen de 15 talen
Supertonic HD is bij Quick TTS beschikbaar in 15 talen: Engels, Spaans, Frans, Duits, Portugees, Italiaans, Russisch, Pools, Nederlands, Turks, Arabisch, Vietnamees, Hindi, Japans en Koreaans. Nederlands zit daarbij: het model Kokoro-82M ondersteunt geen Nederlands, dus tot nu toe was Piper de enige neurale offline-optie voor deze taal. Supertonic HD is de eerste engine op HD-niveau die in Quick TTS überhaupt Nederlands spreekt.
Hij ondersteunt dezelfde bestandsformaten en workflows als de rest van de site: PDF, DOCX, EPUB, gefaseerde weergave van lange documenten, en downloaden als WAV/MP3, met een ZIP-export voor zeer lange teksten. De ene taal die hij niet dekt is Chinees; daarvoor blijft de huayan-stem van Piper de neurale optie.
Beperkingen
De eerlijke lijst, niet de marketinglijst:
- 380MB is een echte download. Op een langzame of gelimiteerde verbinding is dat de grootste kostenpost om Supertonic te proberen — meer dan de ~80MB van het WASM-pad van Kokoro of de ~60MB van de stemmen van Piper.
- WebGPU is verplicht, zonder uitzondering. Er bestaat voor deze engine specifiek geen fallback-pad, anders dan bij Kokoro, dat automatisch terugvalt op Piper/Web Speech als de GPU het niet aankan.
- Vooral voor desktop. Mobiele GPU's en WebGPU-ondersteuning in mobiele browsers zijn nu nog inconsistent genoeg dat we het daar niet aanraden.
- Tien vaste stemmen, geen kloning. Als je een specifieke stemidentiteit nodig hebt, is dit niet het hulpmiddel.
- Het bovenliggende project gaat snel, en stopt dan. De referentie-implementatie van Supertone Inc. op GitHub werd kort na onze integratie gearchiveerd. De modelgewichten en inference-code die we aanbieden zijn vastgepind op een specifieke revisie en door ons geverifieerd — ze volgen niet stilzwijgend een upstream die misschien geen updates meer krijgt.
Over licenties, voor wie hierop wil voortbouwen: de inference-code is MIT (overgezet van de voorbeeldcode van Supertone), en de modelgewichten zijn OpenRAIL-M — een aparte, restrictievere licentie met gebruiksbeperkingen. We publiceren de volledige tekst op /licenses/supertonic-openrail-m.txt, en onze pagina Voorwaarden behandelt toegestaan gebruik als je audio genereert voor verspreiding.
Probeer het zelf
Open Quick TTS op een desktop met Chrome of Edge, zet de engine-lijst op Supertonic HD en plak iets. De eerste download van ~380MB gebeurt één keer; daarna is hij gecached en offline bruikbaar, net als Kokoro. Als je browser of apparaat geen WebGPU ondersteunt, biedt de lijst deze optie simpelweg niet aan — Piper en Web Speech blijven precies zo werken als gisteren.