Die besten deutschen TTS-Stimmen 2026: Hedda, Thorsten & Edge Online im Vergleich

Veröffentlicht

Wer 2026 nach einer wirklich gut klingenden deutschen Text-to-Speech-Stimme sucht, muss zwischen drei Welten wählen: den alten SAPI-Klassikern, die jeder Windows-Rechner hat; den neuronalen Online-Stimmen von Edge; und der wachsenden Piper-Familie um Thorsten. Eine vierte Welt — Kokoro — kann derzeit noch kein Deutsch. Dieser Artikel ordnet ein, was du wann nehmen solltest.

Was sich 2026 geändert hat

Drei Verschiebungen sind für deutschsprachige Hörer relevant. Erstens: Microsoft hat die Edge-Online-Stimmen (Azure Neural) auf inzwischen 19 deutsche Varianten ausgebaut — Deutschland, Österreich, Schweiz — und sie klingen, ehrlich gesagt, besser als die meisten kostenpflichtigen TTS-Anbieter vor zwei Jahren. Zweitens: die Piper-Community hat das Thorsten-Korpus auf low/medium/high-Qualitätsstufen ausgefahren und mit thorsten_emotional-medium sogar Emotionsmarker im Text ergänzt — ein offline lauffähiges Feature, das es sonst nirgends frei gibt. Drittens, und das ist die schlechte Nachricht: Kokoro-82M, das aktuell beste freie englische Modell, kann noch kein Deutsch. Wer Kokoro-Qualität auf Deutsch will, muss aktuell warten oder sich mit Piper Thorsten high begnügen — was näher dran ist, als die meisten denken.

Microsoft Hedda und die alte Garde

Wer ein Windows-System älter als Windows 11 22H2 nutzt oder unter Chrome arbeitet (das die Edge-Online-Stimmen nicht durchreicht), bekommt die SAPI-Klassiker zu hören:

Die SAPI-Stimmen haben einen sinnvollen Anwendungsfall: sofortige Wiedergabe ohne Modell-Download, ohne GPU, ohne Internet — also Bedienungshilfen, kurze Bestätigungen, Push-Vorlesen aus einer Webview. Für Lese-Sessions länger als zwei, drei Sätze sind die neueren Optionen schlicht überlegen.

Edge Online: Katja, Conrad, Amala und 16 weitere

Die mit Abstand größte Auswahl an freien deutschen Neural-Stimmen kommt aus Microsofts Azure-Cloud, ausgeliefert über den Edge-Browser. Insgesamt 19 Varianten, davon 15 für Deutschland, 2 für Österreich und 2 für die Schweiz:

Persönliche Top 3 für allgemeines Vorlesen: Amala Online für Erzähltexte, Conrad Online für Nachrichten und Sachtexte, Klaus Online wenn die Stimme richtig autoritär klingen soll. Die Edge-Online-Stimmen funktionieren nur in Microsoft Edge und benötigen eine Internetverbindung — der Synthese-Aufruf läuft live gegen Azure. Für Datenschutz-sensible Texte ist das ein Tradeoff: hervorragende Qualität, aber dein Text geht durch die Microsoft-Cloud. Wenn das ein Problem ist, ist Piper unten die richtige Antwort.

Apple Anna, Helena, Markus

Auf macOS und iOS bekommt man eine kuratierte, kleinere Auswahl deutscher Stimmen, die alle in der Voreinstellung „Premium" als Sprachpaket nachladbar sind:

Apple-Stimmen sind via Web Speech in jedem Browser auf dem Gerät verfügbar — Safari, Chrome, Firefox. Im Gegensatz zu Edge Online wird hier nichts an die Cloud gesendet, die Synthese läuft komplett lokal mit dem nachgeladenen Sprachpaket. Wer auf einem Mac sitzt und Datenschutz priorisiert: Helena oder Markus sind die beste Mischung aus Qualität und lokaler Verarbeitung, die du ohne weiteren Setup-Aufwand bekommst.

Piper Thorsten — die beste freie deutsche neuronale Stimme

Wer offline arbeitet, Datenschutz zur Priorität macht oder einfach die freieste, transparenteste Lösung will, kommt 2026 um Piper nicht herum. Die Piper-Modelle laufen als WebAssembly im Browser, einmal ~60 MB heruntergeladen, danach komplett offline. Bei Quick TTS werden sie über die Engine-Auswahl aktiviert.

Korrektur vom 1. August 2026. Dieser Abschnitt listete den kompletten deutschen Piper-Katalog so auf, als wäre jedes Modell hier auswählbar. Das stimmt nicht: Quick TTS liefert genau eine deutsche Piper-Stimme aus, de_DE-thorsten-medium. Die Liste unten ist der Katalog des Piper-Projekts, jeweils ehrlich markiert.

Das Highlight des deutschen Piper-Katalogs ist die Thorsten-Familie:

Der weitere deutsche Piper-Katalog — vollständigkeitshalber, keines dieser Modelle ist in Quick TTS auswählbar:

Praxis-Tipp: Für Piper gibt es hier nichts zu entscheiden — de_DE-thorsten-medium ist die deutsche Stimme, und sie ist ein guter Default. Wenn du mehr Qualität willst, ist die Frage nicht „welches Piper-Modell", sondern „Supertonic HD oder Edge Online".

Was Kokoro nicht kann

Ehrlich: Kokoro-82M, das aktuell beeindruckendste freie offene Neural-TTS-Modell, hat 2026 noch keinen deutschen Sprachsatz. Die offizielle VOICES.md listet Englisch (US/UK), Spanisch, Portugiesisch, Französisch, Italienisch, Hindi, Mandarin und Japanisch — aber kein Deutsch. Es gibt Community-Versuche, ein deutsches Voicepack zu trainieren, aber bis dato nichts produktionsreifes.

Hinzu kommt: Kokoro ist bei uns ohnehin rein englischsprachig — Stimmkatalog und Phonemisierung — und wird auf den deutschen Seiten gar nicht erst angezeigt. Die frühere Fassung dieses Absatzes nannte Piper Thorsten high als Qualitätsmaximum für Deutsch im Browser; das war schon deshalb falsch, weil dieses Modell hier nicht auswählbar ist.

Die korrekte Antwort seit dem 27. Juli 2026 heißt Supertonic HD: eine deutsche 44,1-kHz-Stimme, die per WebGPU auf deiner Grafikkarte läuft. Die Synthese passiert vollständig im Browser, der Text verlässt das Gerät also nicht — genau das, was DSGVO-relevante Dokumente brauchen. Einmalig rund 380 MB Download, danach offline nutzbar. Voraussetzung ist WebGPU (Desktop-Chrome oder Edge mit vernünftiger GPU); einen WebAssembly-Rückfall gibt es nicht, ohne WebGPU erscheint die Option also gar nicht im Menü. Damit gilt: Supertonic HD für maximale lokale Qualität, Edge Online für maximale Qualität mit Cloud-Tradeoff, Piper de_DE-thorsten-medium als überall lauffähiger Default.

Welche solltest du wählen?

Eine kurze Entscheidungsmatrix, gegliedert nach Anwendungsfall:

Selbst hören

Öffne Quick TTS, füge einen deutschen Absatz ein und vergleiche Browser-TTS, Piper und — am Desktop — Supertonic HD. Innerhalb einer Engine kannst du die Stimme mitten im Vorlesen wechseln: Quick TTS liest den aktuellen Abschnitt mit der neuen Stimme noch einmal, sodass du dieselbe Passage direkt vergleichen kannst. Ein Wechsel der Engine stoppt dagegen die Wiedergabe — dafür musst du erneut auf Play drücken. Das ist die einzige seriöse Art, deutsche TTS-Stimmen zu vergleichen: gleicher Text, gleiches Gerät, gleiche Lautstärke.

Mehr Hintergrund findest du im Anwendungs-Guide (zehn Anwendungsfälle für TTS), in der FAQ (Antworten auf typische Fragen) und auf der Über-Seite, die erklärt, warum Quick TTS lokal arbeitet und keinen Text an Server schickt.