Synthèse vocale HD gratuite dans le navigateur, sans cloud
Quick TTS vient d'ajouter un troisième moteur de voix neuronale : Supertonic HD. Qualité studio, audio 44kHz, et il tourne entièrement sur votre propre GPU via WebGPU — rien de ce que vous collez n'est jamais envoyé où que ce soit. Voici ce que c'est, à quoi ça ressemble, et où ça montre encore ses limites.
Ce qu'est Supertonic HD
Supertonic HD est une voix de synthèse vocale gratuite basée sur Supertonic 3, un modèle à poids ouverts publié par Supertone Inc. Il tourne dans le navigateur via WebGPU et onnxruntime-web, le même principe « ça tourne sur votre machine, pas sur nos serveurs » que Quick TTS utilise déjà pour Kokoro. C'est le moteur le plus fidèle que nous proposons : sortie à 44kHz contre 24kHz pour Kokoro, soit la différence entre « clairement synthétique mais agréable » et un rendu qui se rapproche d'une voix off produite en studio.
Il rejoint Web Speech, Piper et Kokoro comme quatrième option dans le menu des moteurs — sans remplacer aucun des trois. Il se place au-dessus de Kokoro en qualité et en dessous en compatibilité matérielle.
Comment ça tourne sans serveur
Le modèle se télécharge une seule fois — environ 380 Mo, directement depuis Hugging Face — puis le navigateur le met en cache. À partir de là, la synthèse se fait entièrement sur votre GPU. Aucun texte que vous collez, importez ou transformez en audio ne quitte jamais votre appareil ; il n'y a aucune requête à journaliser, puisqu'aucun serveur n'intervient.
- Environ 99M de paramètres, dans la même catégorie de taille que Kokoro-82M, mais entraîné pour produire de l'audio 44kHz plutôt que 24kHz.
- WebGPU uniquement. Il n'existe pas de repli WASM — nous avons mesuré la voie WASM de Supertonic à une vitesse proche du temps réel sur un CPU de bureau haut de gamme, ce qui est inutilisable sur tout matériel plus modeste ; nous ne l'avons donc pas déployée. Il faut un navigateur de bureau récent : Chrome ou Edge 113+ avec un GPU fonctionnel.
- Pas de WebGPU, pas de problème. Les appareils qui n'en disposent pas — la plupart des téléphones, les ordinateurs plus anciens, Firefox et Safari aujourd'hui — conservent Piper et Web Speech exactement comme avant. Rien ne change pour les moteurs existants.
Dix voix, aucun clonage
Supertonic propose dix voix prédéfinies — cinq masculines (M1–M5) et cinq féminines (F1–F5) — sélectionnables depuis le même menu de voix que Kokoro et Piper. Aucun clonage de voix, aucun moyen d'importer un échantillon de référence : ce qui est dans le modèle est ce que vous obtenez. Si la cohérence d'une identité vocale sur un long projet compte plus que la fidélité brute, c'est une vraie contrainte à connaître dès le départ.
Langue automatique : un texte, plusieurs langues
La fonctionnalité qui n'existe nulle part ailleurs chez Quick TTS : un interrupteur « Langue automatique (texte mixte) ». Activez-le et Supertonic lit un document qui change de langue en plein paragraphe — un article français citant un dialogue en anglais, un e-mail en anglais avec un nom de produit allemand — en prononçant correctement chaque partie sans que vous ayez à taguer quoi que ce soit. Tous les autres moteurs que nous proposons supposent une seule langue par lecture ; celui-ci se moque de l'endroit où tombe la frontière linguistique.
C'est un usage de niche, mais pour quiconque lit à voix haute des notes multilingues, du matériel d'étude bilingue ou des publications mêlant plusieurs langues, c'est la seule chose sur cette page qu'aucun autre outil gratuit ne fait.
Vitesse : la qualité HD sans l'attente
Le compromis attendu d'un audio plus fidèle serait une génération plus lente, et ce n'est pas vraiment le cas ici. Sur une machine compatible WebGPU, nous avons mesuré un facteur temps réel d'environ 0,02 à 0,07 — un texte équivalant à 13 minutes d'audiobook a été généré en environ 13 secondes. La lecture démarre en moins d'une seconde, et les documents longs sont découpés et enchaînés comme chez Kokoro.
Les langues couvertes (et celle qui ne l'est pas)
Supertonic HD est disponible en 15 langues sur Quick TTS : anglais, espagnol, français, allemand, portugais, italien, russe, polonais, néerlandais, turc, arabe, vietnamien, hindi, japonais et coréen. Le français en fait partie : si vous lisez à voix haute en français, c'est une voix neuronale HD dans votre propre langue, gratuite, directement dans votre navigateur. Ça gère tous les formats et flux de travail du reste du site — PDF, DOCX, EPUB, lecture séquencée des longs documents, et téléchargement WAV/MP3 avec export ZIP pour les textes très longs.
Ça ne couvre pas le chinois. Autant le dire clairement : pour le zh-cn, la voix huayan de Piper reste l'option neuronale disponible.
Limites
La liste honnête, pas celle du marketing :
- 380 Mo, c'est un vrai téléchargement. Sur une connexion lente ou limitée, c'est le coût principal d'essayer Supertonic — plus lourd que les ~80 Mo de la voie WASM de Kokoro ou les ~60 Mo des voix Piper.
- WebGPU est obligatoire, sans exception. Aucun repli n'existe spécifiquement pour ce moteur, contrairement à Kokoro qui bascule automatiquement vers Piper/Web Speech quand le GPU ne suit pas.
- Pensé d'abord pour le bureau. Les GPU mobiles et le support WebGPU des navigateurs mobiles restent trop inégaux pour qu'on le recommande là pour l'instant.
- Dix voix fixes, aucun clonage. Si vous avez besoin d'une identité vocale précise, ce n'est pas l'outil.
- Le projet en amont avance vite, puis s'arrête. L'implémentation de référence sur GitHub a été archivée peu après notre intégration. Les poids et le code que nous fournissons sont figés à une révision précise et vérifiés par nos soins.
Côté licences : le code d'inférence est en MIT (adapté du code d'exemple de Supertone), et les poids du modèle sont sous OpenRAIL-M — une licence distincte et plus restrictive, avec des restrictions d'usage. Texte complet à l'adresse /licenses/supertonic-openrail-m.txt, et notre page Conditions couvre l'usage acceptable si vous redistribuez l'audio généré.
Essayez-le
Ouvrez Quick TTS sur un ordinateur de bureau avec Chrome ou Edge, basculez le menu des moteurs sur Supertonic HD, et collez n'importe quel texte. Le premier téléchargement d'environ 380 Mo n'a lieu qu'une fois ; ensuite, c'est mis en cache et utilisable hors ligne, comme Kokoro. Si votre navigateur ou appareil ne prend pas en charge WebGPU, le menu ne le proposera simplement pas — Piper et Web Speech continuent de fonctionner exactement comme hier.
Pour la version anglaise de cet article, avec plus de détails techniques et des benchmarks, voir HD Text-to-Speech in Your Browser sur notre blog.