Kostenlose HD-Sprachausgabe im Browser — ganz ohne Cloud
Quick TTS hat gerade eine dritte neuronale Sprach-Engine bekommen: Supertonic HD. Studioqualität, 44kHz-Audio, und sie läuft komplett auf deiner eigenen GPU per WebGPU — nichts, was du einfügst, wird jemals irgendwohin gesendet. Hier ist, was das ist, wie es klingt, und wo es noch an Grenzen stößt.
Was Supertonic HD ist
Supertonic HD ist eine kostenlose neuronale Text-zu-Sprache-Stimme auf Basis von Supertonic 3, einem offen lizenzierten Modell von Supertone Inc. Sie läuft im Browser per WebGPU und onnxruntime-web — demselben Prinzip von "läuft auf deinem Gerät, nicht auf unseren Servern", das Quick TTS bereits für Kokoro nutzt. Es ist die hochwertigste Engine, die wir anbieten: 44kHz-Ausgabe gegenüber 24kHz bei Kokoro — der Unterschied zwischen "eindeutig synthetisch, aber angenehm" und Audio, das einer produzierten Sprachaufnahme deutlich näherkommt.
Sie ergänzt Web Speech (die Systemstimmen deines Betriebssystems), Piper (klein, WASM, läuft überall) und Kokoro (WebGPU, nur Englisch) als vierte Option im Engine-Auswahlmenü — kein Ersatz für die anderen. Supertonic liegt bei der Qualität über Kokoro und bei der Gerätekompatibilität darunter.
Wie es ganz ohne Server läuft
Das Modell wird einmalig heruntergeladen — rund 380MB, direkt von Hugging Face — und danach vom Browser zwischengespeichert. Ab diesem Punkt läuft die Sprachsynthese vollständig auf deiner GPU. Kein Text, den du einfügst, hochlädst oder in Audio umwandelst, verlässt jemals dein Gerät; es gibt keine Anfrage zu protokollieren, weil überhaupt kein Server im Spiel ist.
- Rund 99M Parameter, ungefähr in derselben Größenklasse wie Kokoro-82M, aber trainiert auf volle 44kHz-Audioausgabe statt 24kHz.
- Nur WebGPU. Es gibt keinen WASM-Fallback — wir haben Supertonics WASM-Pfad auf einer starken Desktop-CPU bei etwa Echtzeitgeschwindigkeit gemessen, was auf schwächerer Hardware unbrauchbar ist, also haben wir ihn nicht ausgeliefert. Das heißt: ein moderner Desktop-Browser, Chrome oder Edge 113+, mit funktionierender GPU.
- Kein WebGPU, kein Problem. Geräte ohne WebGPU — die meisten Smartphones, ältere Laptops, aktuell Firefox und Safari — behalten Piper und Web Speech genau wie zuvor. An den bestehenden Engines ändert sich nichts.
Zehn Stimmen, kein Klonen
Supertonic liefert zehn feste Stimmen — fünf männliche (M1–M5) und fünf weibliche (F1–F5) —, auswählbar über dieselbe Stimmenauswahl wie bei Kokoro und Piper. Es gibt kein Stimmklonen und keine Möglichkeit, eine Referenzaufnahme hochzuladen; was im Modell steckt, ist das, was du bekommst. Wenn dir eine gleichbleibende Stimmidentität über ein langes Projekt hinweg wichtiger ist als reine Klangtreue, ist das eine Einschränkung, die man vorher kennen sollte.
Automatische Sprache: ein Text, mehrere Sprachen
Die Funktion, die es sonst nirgends bei Quick TTS gibt: ein Schalter "Automatische Sprache (gemischter Text)". Aktiviere ihn, und Supertonic liest ein Dokument vor, das mitten im Absatz die Sprache wechselt — ein deutscher Artikel, der einen englischen Dialog zitiert, eine französische E-Mail mit einem deutschen Produktnamen — und spricht jeden Teil korrekt aus, ohne dass du irgendetwas markieren musst. Jede andere Engine, die wir anbieten, geht von genau einer Sprache pro Durchgang aus; diese hier kümmert sich schlicht nicht darum, wo die Sprachgrenze liegt.
Das ist ein schmaler Anwendungsfall, aber für alle, die mehrsprachige Notizen, zweisprachiges Lernmaterial oder Code-Switching-Beiträge in sozialen Medien vorlesen lassen, ist es das Einzige auf dieser Seite, das kein anderes kostenloses Tool bietet.
Geschwindigkeit: HD-Qualität ohne Wartezeit
Den erwartbaren Kompromiss bei hochwertigerem Audio — langsamere Generierung — gibt es hier so eigentlich nicht. Auf einem WebGPU-fähigen Rechner haben wir einen Real-Time-Faktor von etwa 0,02–0,07 gemessen; in einem Test wurde ein Textabschnitt von der Länge eines 13-minütigen Hörbuchkapitels in rund 13 Sekunden erzeugt. Die Wiedergabe selbst startet in deutlich unter einer Sekunde, und lange Dokumente werden genau wie bei Kokoro in Blöcke zerlegt und parallel verarbeitet — ein ganzes Kapitel bedeutet also nicht, ein ganzes Kapitel lang zu warten, bevor überhaupt etwas zu hören ist.
Welche Sprachen abgedeckt sind (und welche nicht)
Supertonic HD steht bei Quick TTS in 15 Sprachen zur Verfügung: Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Russisch, Polnisch, Niederländisch, Türkisch, Arabisch, Vietnamesisch, Hindi, Japanisch und Koreanisch. Deutsch ist mit dabei — wer sich Texte auf Deutsch vorlesen lässt, bekommt hier HD-Sprachsynthese in der eigenen Sprache, kostenlos, direkt im Browser. Es funktioniert mit allen Dateiformaten und Abläufen, die der Rest der Seite bietet — PDF, DOCX, EPUB, blockweise Wiedergabe langer Dokumente sowie WAV/MP3-Download mit ZIP-Export für sehr lange Texte.
Chinesisch deckt Supertonic HD nicht ab. Das sollte man klar sagen: Für zh-cn bleibt Pipers huayan-Stimme die verfügbare neuronale Option.
Grenzen
Die ehrliche Liste, nicht die Marketingversion:
- 380MB sind ein echter Download. Bei einer langsamen oder gedrosselten Verbindung ist das die größte Hürde beim Ausprobieren von Supertonic — mehr als Kokoros ~80MB-WASM-Pfad oder Pipers ~60MB-Stimmen.
- WebGPU ist Pflicht, ohne Ausnahme. Es gibt für diese Engine speziell keinen Fallback-Pfad, anders als bei Kokoro, das automatisch auf Piper/Web Speech ausweicht, wenn die GPU nicht mitkommt.
- Vor allem für den Desktop gedacht. Mobile GPUs und WebGPU-Unterstützung in mobilen Browsern sind noch uneinheitlich genug, dass wir es dort aktuell nicht empfehlen.
- Zehn feste Stimmen, kein Klonen. Wer eine bestimmte Stimmidentität braucht, ist hier falsch.
- Das Upstream-Projekt entwickelt sich schnell — und stoppt dann. Die Referenzimplementierung von Supertone Inc. auf GitHub wurde kurz nach unserer Integration archiviert. Die Modellgewichte und der Inferenzcode, die wir ausliefern, sind auf eine konkrete Revision festgelegt und von uns selbst geprüft — sie folgen nicht stillschweigend einem Upstream, der möglicherweise keine weiteren Updates mehr bekommt.
Zur Lizenzierung, für alle, die darauf aufbauen wollen: Der Inferenzcode steht unter MIT (portiert aus Supertones Beispielcode), die Modellgewichte unter OpenRAIL-M — einer eigenständigen, restriktiveren Lizenz als MIT mit Nutzungseinschränkungen. Den vollständigen Text stellen wir unter /licenses/supertonic-openrail-m.txt bereit, und unsere Nutzungsbedingungen regeln die zulässige Verwendung, falls du Audio zur Weiterverbreitung erzeugst.
Jetzt ausprobieren
Öffne Quick TTS auf einem Desktop-Rechner mit Chrome oder Edge, stelle im Engine-Menü auf Supertonic HD um und füge einen beliebigen Text ein. Der erste Download von rund 380MB passiert einmalig; danach ist alles zwischengespeichert und offline nutzbar, genau wie bei Kokoro. Unterstützt dein Browser oder Gerät kein WebGPU, bietet das Menü die Option einfach nicht an — Piper und Web Speech funktionieren weiterhin genau wie gestern.
Die englische Fassung dieses Artikels mit mehr technischen Details und Benchmarks findest du unter HD Text-to-Speech in Your Browser in unserem Blog.