Die besten deutschen TTS-Stimmen 2026: Hedda, Thorsten & Edge Online im Vergleich
Wer 2026 nach einer wirklich gut klingenden deutschen Text-to-Speech-Stimme sucht, muss zwischen drei Welten wählen: den alten SAPI-Klassikern, die jeder Windows-Rechner hat; den neuronalen Online-Stimmen von Edge; und der wachsenden Piper-Familie um Thorsten. Eine vierte Welt — Kokoro — kann derzeit noch kein Deutsch. Dieser Artikel ordnet ein, was du wann nehmen solltest.
Was sich 2026 geändert hat
Drei Verschiebungen sind für deutschsprachige Hörer relevant. Erstens: Microsoft hat die Edge-Online-Stimmen (Azure Neural) auf inzwischen 19 deutsche Varianten ausgebaut — Deutschland, Österreich, Schweiz — und sie klingen, ehrlich gesagt, besser als die meisten kostenpflichtigen TTS-Anbieter vor zwei Jahren. Zweitens: die Piper-Community hat das Thorsten-Korpus auf low/medium/high-Qualitätsstufen ausgefahren und mit thorsten_emotional-medium sogar Emotionsmarker im Text ergänzt — ein offline lauffähiges Feature, das es sonst nirgends frei gibt. Drittens, und das ist die schlechte Nachricht: Kokoro-82M, das aktuell beste freie englische Modell, kann noch kein Deutsch. Wer Kokoro-Qualität auf Deutsch will, muss aktuell warten oder sich mit Piper Thorsten high begnügen — was näher dran ist, als die meisten denken.
Microsoft Hedda und die alte Garde
Wer ein Windows-System älter als Windows 11 22H2 nutzt oder unter Chrome arbeitet (das die Edge-Online-Stimmen nicht durchreicht), bekommt die SAPI-Klassiker zu hören:
- Microsoft Hedda — die Standard-Frauenstimme, seit Windows 7 unverändert. Nüchtern, klar, leicht mechanisch. Für kurze Systemmeldungen brauchbar, für ein Hörbuch nicht.
- Microsoft Stefan — das männliche Pendant zu Hedda. Etwas tieferer Frequenzgang, gleicher Charakter. Die Aussprache ist solide, die Prosodie flach.
- Microsoft Katja (klassisch, nicht zu verwechseln mit der neueren Katja Online) — die zweite Frauenstimme aus der gleichen Generation. Etwas wärmer als Hedda, aber im selben Robotik-Bereich.
- Microsoft Michael (de-AT) und Microsoft Karsten (de-CH) — österreichische und schweizerische SAPI-Stimmen. Wer für eine Zielgruppe in Wien oder Zürich produziert, wird sie kurz testen und dann doch zur Edge-Online-Variante greifen, weil der Akzent dort sauberer sitzt.
Die SAPI-Stimmen haben einen sinnvollen Anwendungsfall: sofortige Wiedergabe ohne Modell-Download, ohne GPU, ohne Internet — also Bedienungshilfen, kurze Bestätigungen, Push-Vorlesen aus einer Webview. Für Lese-Sessions länger als zwei, drei Sätze sind die neueren Optionen schlicht überlegen.
Edge Online: Katja, Conrad, Amala und 16 weitere
Die mit Abstand größte Auswahl an freien deutschen Neural-Stimmen kommt aus Microsofts Azure-Cloud, ausgeliefert über den Edge-Browser. Insgesamt 19 Varianten, davon 15 für Deutschland, 2 für Österreich und 2 für die Schweiz:
- Microsoft Katja Online — die neue Standardstimme. Hellere Färbung als die alte Katja, deutlich natürlichere Satzmelodie. Erste Wahl für allgemeines Vorlesen.
- Microsoft Conrad Online — die männliche Standard-Edge-Stimme. Trocken, klar, gut artikuliert. Nachrichtensprecher-Feeling.
- Microsoft Amala Online — wärmer als Katja, leicht dunklere Färbung. Gut für Erzähltexte und längere Artikel.
- Microsoft Bernd, Christoph, Kasper, Killian, Klaus, Ralf — sechs zusätzliche männliche Online-Stimmen. Bernd und Klaus sind die beiden „seriösesten" — geeignet für Sachtexte. Killian und Kasper haben mehr Energie, taugen für Marketing- und Werbe-Skripte. Ralf liegt dazwischen.
- Microsoft Elke, Klarissa, Louisa, Maja, Tanja — fünf zusätzliche weibliche Stimmen. Maja ist die jugendlichste, Louisa die ruhigste, Tanja die professionellste.
- Microsoft Gisela Online — eine Kinderstimme. Nützlich für Hörbücher mit kindlichen Erzählern, aber unbrauchbar für Erwachsenentexte.
- Microsoft Ingrid Online und Jonas Online (de-AT) — die einzigen halbwegs natürlich klingenden österreichischen Neural-Stimmen, die kostenlos in einem Browser laufen.
- Microsoft Leni Online und Jan Online (de-CH) — analog für Schweizerdeutsch (genauer: Schweizer Hochdeutsch — kein Dialekt).
Persönliche Top 3 für allgemeines Vorlesen: Amala Online für Erzähltexte, Conrad Online für Nachrichten und Sachtexte, Klaus Online wenn die Stimme richtig autoritär klingen soll. Die Edge-Online-Stimmen funktionieren nur in Microsoft Edge und benötigen eine Internetverbindung — der Synthese-Aufruf läuft live gegen Azure. Für Datenschutz-sensible Texte ist das ein Tradeoff: hervorragende Qualität, aber dein Text geht durch die Microsoft-Cloud. Wenn das ein Problem ist, ist Piper unten die richtige Antwort.
Apple Anna, Helena, Markus
Auf macOS und iOS bekommt man eine kuratierte, kleinere Auswahl deutscher Stimmen, die alle in der Voreinstellung „Premium" als Sprachpaket nachladbar sind:
- Anna — die langjährige Standard-Stimme auf macOS und iOS. In der Premium-Variante deutlich wärmer als jede SAPI-Stimme; in der Standard-Variante eher mit den alten Microsoft-Stimmen vergleichbar.
- Helena (Siri) — die modernere Siri-Frauenstimme. Eindeutig der Apple-Schritt in Richtung Neural. Sehr glatt, leicht generisch.
- Markus (Siri) — das männliche Siri-Pendant. Gut für längere Lese-Sessions, weil die Prosodie über Sätze hinweg konsistent bleibt.
- Petra (Enhanced) — eine ältere Premium-Stimme, weiblicher und etwas dunkler als Anna. Wer auf einem älteren macOS-System unterwegs ist, sollte sie ausprobieren.
Apple-Stimmen sind via Web Speech in jedem Browser auf dem Gerät verfügbar — Safari, Chrome, Firefox. Im Gegensatz zu Edge Online wird hier nichts an die Cloud gesendet, die Synthese läuft komplett lokal mit dem nachgeladenen Sprachpaket. Wer auf einem Mac sitzt und Datenschutz priorisiert: Helena oder Markus sind die beste Mischung aus Qualität und lokaler Verarbeitung, die du ohne weiteren Setup-Aufwand bekommst.
Piper Thorsten — die beste freie deutsche neuronale Stimme
Wer offline arbeitet, Datenschutz zur Priorität macht oder einfach die freieste, transparenteste Lösung will, kommt 2026 um Piper nicht herum. Die Piper-Modelle laufen als WebAssembly im Browser, einmal ~60 MB heruntergeladen, danach komplett offline. Bei Quick TTS werden sie über die Engine-Auswahl aktiviert.
Korrektur vom 1. August 2026. Dieser Abschnitt listete den kompletten deutschen Piper-Katalog so auf, als wäre jedes Modell hier auswählbar. Das stimmt nicht: Quick TTS liefert genau eine deutsche Piper-Stimme aus, de_DE-thorsten-medium. Die Liste unten ist der Katalog des Piper-Projekts, jeweils ehrlich markiert.
Das Highlight des deutschen Piper-Katalogs ist die Thorsten-Familie:
de_DE-thorsten-medium— die einzige in Quick TTS auswählbare deutsche Piper-Stimme. Der vernünftige Default: spürbar wärmer als die low-Variante, kaum längere Inferenzzeit.de_DE-thorsten-low— kleinstes Modell, schnellste Inferenz. Hier nicht auswählbar.de_DE-thorsten-high— größeres Modell, sauberere Konsonanten, weniger VITS-Artefakte auf langen Sätzen. Hier nicht auswählbar — für lange Kapitel ist Supertonic HD (unten) der Weg.de_DE-thorsten_emotional-medium— eine Variante mit Emotionsmarkern, ein Forschungs-Feature. Hier nicht auswählbar.
Der weitere deutsche Piper-Katalog — vollständigkeitshalber, keines dieser Modelle ist in Quick TTS auswählbar:
de_DE-eva_k-x_low— die einzige weibliche deutsche Piper-Stimme. „x_low" heißt: kleines Modell, hörbare Synthese-Spuren.de_DE-karlsson-low,de_DE-kerstin-low,de_DE-ramona-low— drei kleinere Community-Stimmen. Karlsson hat eine etwas knurrigere Färbung, Kerstin ist die hellste, Ramona die ruhigste.de_DE-pavoque-low— eine ältere Community-Stimme aus dem PAVOQUE-Korpus. Historisch interessant, qualitativ inzwischen überholt.de_DE-mls-medium— aus dem Multilingual LibriSpeech-Korpus. Etwas neutraler, aber auch flacher als Thorsten.
Praxis-Tipp: Für Piper gibt es hier nichts zu entscheiden — de_DE-thorsten-medium ist die deutsche Stimme, und sie ist ein guter Default. Wenn du mehr Qualität willst, ist die Frage nicht „welches Piper-Modell", sondern „Supertonic HD oder Edge Online".
Was Kokoro nicht kann
Ehrlich: Kokoro-82M, das aktuell beeindruckendste freie offene Neural-TTS-Modell, hat 2026 noch keinen deutschen Sprachsatz. Die offizielle VOICES.md listet Englisch (US/UK), Spanisch, Portugiesisch, Französisch, Italienisch, Hindi, Mandarin und Japanisch — aber kein Deutsch. Es gibt Community-Versuche, ein deutsches Voicepack zu trainieren, aber bis dato nichts produktionsreifes.
Hinzu kommt: Kokoro ist bei uns ohnehin rein englischsprachig — Stimmkatalog und Phonemisierung — und wird auf den deutschen Seiten gar nicht erst angezeigt. Die frühere Fassung dieses Absatzes nannte Piper Thorsten high als Qualitätsmaximum für Deutsch im Browser; das war schon deshalb falsch, weil dieses Modell hier nicht auswählbar ist.
Die korrekte Antwort seit dem 27. Juli 2026 heißt Supertonic HD: eine deutsche 44,1-kHz-Stimme, die per WebGPU auf deiner Grafikkarte läuft. Die Synthese passiert vollständig im Browser, der Text verlässt das Gerät also nicht — genau das, was DSGVO-relevante Dokumente brauchen. Einmalig rund 380 MB Download, danach offline nutzbar. Voraussetzung ist WebGPU (Desktop-Chrome oder Edge mit vernünftiger GPU); einen WebAssembly-Rückfall gibt es nicht, ohne WebGPU erscheint die Option also gar nicht im Menü. Damit gilt: Supertonic HD für maximale lokale Qualität, Edge Online für maximale Qualität mit Cloud-Tradeoff, Piper de_DE-thorsten-medium als überall lauffähiger Default.
Welche solltest du wählen?
Eine kurze Entscheidungsmatrix, gegliedert nach Anwendungsfall:
- Kurze Texte vorlesen, Edge-Browser verfügbar: Edge Online — Katja Online oder Amala Online. Höchste Qualität, sofort spielbereit, kein Modell-Download.
- Vertrauliche oder DSGVO-relevante Texte: Supertonic HD (Desktop mit WebGPU) oder Piper
de_DE-thorsten-medium. Läuft komplett offline, der Text verlässt dein Gerät nie. - Hörbuch oder langes Kapitel produzieren: Supertonic HD — beste lokale deutsche Vorlesequalität, gleichbleibend über Stunden. Ohne WebGPU: Edge Online Katja Online.
- Österreichisches oder Schweizer Hochdeutsch: Edge Online — Ingrid, Jonas (AT) bzw. Leni, Jan (CH). Piper hat keine AT-/CH-Stimmen, Apple/Microsoft SAPI sind die einzigen Alternativen.
- Mac oder iPhone, „soll einfach funktionieren": Browser-TTS mit Helena oder Markus. Lokale Synthese, sofort.
- Hörspiel oder Charakter-Vorlesung: hier hat Quick TTS nichts Passendes — das einzige freie Modell mit Emotionsmarkern (
de_DE-thorsten_emotional-medium) ist nicht Teil unseres Katalogs. Wer Emotionsmarker braucht, fährt Piper lokal außerhalb des Browsers. - Linux ohne neuronale System-Stimmen: Piper —
de_DE-thorsten-mediumals sauberer Default.
Selbst hören
Öffne Quick TTS, füge einen deutschen Absatz ein und vergleiche Browser-TTS, Piper und — am Desktop — Supertonic HD. Innerhalb einer Engine kannst du die Stimme mitten im Vorlesen wechseln: Quick TTS liest den aktuellen Abschnitt mit der neuen Stimme noch einmal, sodass du dieselbe Passage direkt vergleichen kannst. Ein Wechsel der Engine stoppt dagegen die Wiedergabe — dafür musst du erneut auf Play drücken. Das ist die einzige seriöse Art, deutsche TTS-Stimmen zu vergleichen: gleicher Text, gleiches Gerät, gleiche Lautstärke.
Mehr Hintergrund findest du im Anwendungs-Guide (zehn Anwendungsfälle für TTS), in der FAQ (Antworten auf typische Fragen) und auf der Über-Seite, die erklärt, warum Quick TTS lokal arbeitet und keinen Text an Server schickt.