Kostenlose HD-Sprachausgabe im Browser — ganz ohne Cloud

Veröffentlicht am

Quick TTS hat gerade eine dritte neuronale Sprach-Engine bekommen: Supertonic HD. Studioqualität, 44kHz-Audio, und sie läuft komplett auf deiner eigenen GPU per WebGPU — nichts, was du einfügst, wird jemals irgendwohin gesendet. Hier ist, was das ist, wie es klingt, und wo es noch an Grenzen stößt.

Was Supertonic HD ist

Supertonic HD ist eine kostenlose neuronale Text-zu-Sprache-Stimme auf Basis von Supertonic 3, einem offen lizenzierten Modell von Supertone Inc. Sie läuft im Browser per WebGPU und onnxruntime-web — demselben Prinzip von "läuft auf deinem Gerät, nicht auf unseren Servern", das Quick TTS bereits für Kokoro nutzt. Es ist die hochwertigste Engine, die wir anbieten: 44kHz-Ausgabe gegenüber 24kHz bei Kokoro — der Unterschied zwischen "eindeutig synthetisch, aber angenehm" und Audio, das einer produzierten Sprachaufnahme deutlich näherkommt.

Sie ergänzt Web Speech (die Systemstimmen deines Betriebssystems), Piper (klein, WASM, läuft überall) und Kokoro (WebGPU, nur Englisch) als vierte Option im Engine-Auswahlmenü — kein Ersatz für die anderen. Supertonic liegt bei der Qualität über Kokoro und bei der Gerätekompatibilität darunter.

Wie es ganz ohne Server läuft

Das Modell wird einmalig heruntergeladen — rund 380MB, direkt von Hugging Face — und danach vom Browser zwischengespeichert. Ab diesem Punkt läuft die Sprachsynthese vollständig auf deiner GPU. Kein Text, den du einfügst, hochlädst oder in Audio umwandelst, verlässt jemals dein Gerät; es gibt keine Anfrage zu protokollieren, weil überhaupt kein Server im Spiel ist.

Zehn Stimmen, kein Klonen

Supertonic liefert zehn feste Stimmen — fünf männliche (M1–M5) und fünf weibliche (F1–F5) —, auswählbar über dieselbe Stimmenauswahl wie bei Kokoro und Piper. Es gibt kein Stimmklonen und keine Möglichkeit, eine Referenzaufnahme hochzuladen; was im Modell steckt, ist das, was du bekommst. Wenn dir eine gleichbleibende Stimmidentität über ein langes Projekt hinweg wichtiger ist als reine Klangtreue, ist das eine Einschränkung, die man vorher kennen sollte.

Automatische Sprache: ein Text, mehrere Sprachen

Die Funktion, die es sonst nirgends bei Quick TTS gibt: ein Schalter "Automatische Sprache (gemischter Text)". Aktiviere ihn, und Supertonic liest ein Dokument vor, das mitten im Absatz die Sprache wechselt — ein deutscher Artikel, der einen englischen Dialog zitiert, eine französische E-Mail mit einem deutschen Produktnamen — und spricht jeden Teil korrekt aus, ohne dass du irgendetwas markieren musst. Jede andere Engine, die wir anbieten, geht von genau einer Sprache pro Durchgang aus; diese hier kümmert sich schlicht nicht darum, wo die Sprachgrenze liegt.

Das ist ein schmaler Anwendungsfall, aber für alle, die mehrsprachige Notizen, zweisprachiges Lernmaterial oder Code-Switching-Beiträge in sozialen Medien vorlesen lassen, ist es das Einzige auf dieser Seite, das kein anderes kostenloses Tool bietet.

Geschwindigkeit: HD-Qualität ohne Wartezeit

Den erwartbaren Kompromiss bei hochwertigerem Audio — langsamere Generierung — gibt es hier so eigentlich nicht. Auf einem WebGPU-fähigen Rechner haben wir einen Real-Time-Faktor von etwa 0,02–0,07 gemessen; in einem Test wurde ein Textabschnitt von der Länge eines 13-minütigen Hörbuchkapitels in rund 13 Sekunden erzeugt. Die Wiedergabe selbst startet in deutlich unter einer Sekunde, und lange Dokumente werden genau wie bei Kokoro in Blöcke zerlegt und parallel verarbeitet — ein ganzes Kapitel bedeutet also nicht, ein ganzes Kapitel lang zu warten, bevor überhaupt etwas zu hören ist.

Welche Sprachen abgedeckt sind (und welche nicht)

Supertonic HD steht bei Quick TTS in 15 Sprachen zur Verfügung: Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Russisch, Polnisch, Niederländisch, Türkisch, Arabisch, Vietnamesisch, Hindi, Japanisch und Koreanisch. Deutsch ist mit dabei — wer sich Texte auf Deutsch vorlesen lässt, bekommt hier HD-Sprachsynthese in der eigenen Sprache, kostenlos, direkt im Browser. Es funktioniert mit allen Dateiformaten und Abläufen, die der Rest der Seite bietet — PDF, DOCX, EPUB, blockweise Wiedergabe langer Dokumente sowie WAV/MP3-Download mit ZIP-Export für sehr lange Texte.

Chinesisch deckt Supertonic HD nicht ab. Das sollte man klar sagen: Für zh-cn bleibt Pipers huayan-Stimme die verfügbare neuronale Option.

Grenzen

Die ehrliche Liste, nicht die Marketingversion:

Zur Lizenzierung, für alle, die darauf aufbauen wollen: Der Inferenzcode steht unter MIT (portiert aus Supertones Beispielcode), die Modellgewichte unter OpenRAIL-M — einer eigenständigen, restriktiveren Lizenz als MIT mit Nutzungseinschränkungen. Den vollständigen Text stellen wir unter /licenses/supertonic-openrail-m.txt bereit, und unsere Nutzungsbedingungen regeln die zulässige Verwendung, falls du Audio zur Weiterverbreitung erzeugst.

Jetzt ausprobieren

Öffne Quick TTS auf einem Desktop-Rechner mit Chrome oder Edge, stelle im Engine-Menü auf Supertonic HD um und füge einen beliebigen Text ein. Der erste Download von rund 380MB passiert einmalig; danach ist alles zwischengespeichert und offline nutzbar, genau wie bei Kokoro. Unterstützt dein Browser oder Gerät kein WebGPU, bietet das Menü die Option einfach nicht an — Piper und Web Speech funktionieren weiterhin genau wie gestern.

Die englische Fassung dieses Artikels mit mehr technischen Details und Benchmarks findest du unter HD Text-to-Speech in Your Browser in unserem Blog.