Synthèse vocale HD gratuite dans le navigateur, sans cloud

Publié le

Quick TTS vient d'ajouter un troisième moteur de voix neuronale : Supertonic HD. Qualité studio, audio 44kHz, et il tourne entièrement sur votre propre GPU via WebGPU — rien de ce que vous collez n'est jamais envoyé où que ce soit. Voici ce que c'est, à quoi ça ressemble, et où ça montre encore ses limites.

Ce qu'est Supertonic HD

Supertonic HD est une voix de synthèse vocale gratuite basée sur Supertonic 3, un modèle à poids ouverts publié par Supertone Inc. Il tourne dans le navigateur via WebGPU et onnxruntime-web, le même principe « ça tourne sur votre machine, pas sur nos serveurs » que Quick TTS utilise déjà pour Kokoro. C'est le moteur le plus fidèle que nous proposons : sortie à 44kHz contre 24kHz pour Kokoro, soit la différence entre « clairement synthétique mais agréable » et un rendu qui se rapproche d'une voix off produite en studio.

Il rejoint Web Speech, Piper et Kokoro comme quatrième option dans le menu des moteurs — sans remplacer aucun des trois. Il se place au-dessus de Kokoro en qualité et en dessous en compatibilité matérielle.

Comment ça tourne sans serveur

Le modèle se télécharge une seule fois — environ 380 Mo, directement depuis Hugging Face — puis le navigateur le met en cache. À partir de là, la synthèse se fait entièrement sur votre GPU. Aucun texte que vous collez, importez ou transformez en audio ne quitte jamais votre appareil ; il n'y a aucune requête à journaliser, puisqu'aucun serveur n'intervient.

Dix voix, aucun clonage

Supertonic propose dix voix prédéfinies — cinq masculines (M1–M5) et cinq féminines (F1–F5) — sélectionnables depuis le même menu de voix que Kokoro et Piper. Aucun clonage de voix, aucun moyen d'importer un échantillon de référence : ce qui est dans le modèle est ce que vous obtenez. Si la cohérence d'une identité vocale sur un long projet compte plus que la fidélité brute, c'est une vraie contrainte à connaître dès le départ.

Langue automatique : un texte, plusieurs langues

La fonctionnalité qui n'existe nulle part ailleurs chez Quick TTS : un interrupteur « Langue automatique (texte mixte) ». Activez-le et Supertonic lit un document qui change de langue en plein paragraphe — un article français citant un dialogue en anglais, un e-mail en anglais avec un nom de produit allemand — en prononçant correctement chaque partie sans que vous ayez à taguer quoi que ce soit. Tous les autres moteurs que nous proposons supposent une seule langue par lecture ; celui-ci se moque de l'endroit où tombe la frontière linguistique.

C'est un usage de niche, mais pour quiconque lit à voix haute des notes multilingues, du matériel d'étude bilingue ou des publications mêlant plusieurs langues, c'est la seule chose sur cette page qu'aucun autre outil gratuit ne fait.

Vitesse : la qualité HD sans l'attente

Le compromis attendu d'un audio plus fidèle serait une génération plus lente, et ce n'est pas vraiment le cas ici. Sur une machine compatible WebGPU, nous avons mesuré un facteur temps réel d'environ 0,02 à 0,07 — un texte équivalant à 13 minutes d'audiobook a été généré en environ 13 secondes. La lecture démarre en moins d'une seconde, et les documents longs sont découpés et enchaînés comme chez Kokoro.

Les langues couvertes (et celle qui ne l'est pas)

Supertonic HD est disponible en 15 langues sur Quick TTS : anglais, espagnol, français, allemand, portugais, italien, russe, polonais, néerlandais, turc, arabe, vietnamien, hindi, japonais et coréen. Le français en fait partie : si vous lisez à voix haute en français, c'est une voix neuronale HD dans votre propre langue, gratuite, directement dans votre navigateur. Ça gère tous les formats et flux de travail du reste du site — PDF, DOCX, EPUB, lecture séquencée des longs documents, et téléchargement WAV/MP3 avec export ZIP pour les textes très longs.

Ça ne couvre pas le chinois. Autant le dire clairement : pour le zh-cn, la voix huayan de Piper reste l'option neuronale disponible.

Limites

La liste honnête, pas celle du marketing :

Côté licences : le code d'inférence est en MIT (adapté du code d'exemple de Supertone), et les poids du modèle sont sous OpenRAIL-M — une licence distincte et plus restrictive, avec des restrictions d'usage. Texte complet à l'adresse /licenses/supertonic-openrail-m.txt, et notre page Conditions couvre l'usage acceptable si vous redistribuez l'audio généré.

Essayez-le

Ouvrez Quick TTS sur un ordinateur de bureau avec Chrome ou Edge, basculez le menu des moteurs sur Supertonic HD, et collez n'importe quel texte. Le premier téléchargement d'environ 380 Mo n'a lieu qu'une fois ; ensuite, c'est mis en cache et utilisable hors ligne, comme Kokoro. Si votre navigateur ou appareil ne prend pas en charge WebGPU, le menu ne le proposera simplement pas — Piper et Web Speech continuent de fonctionner exactement comme hier.

Pour la version anglaise de cet article, avec plus de détails techniques et des benchmarks, voir HD Text-to-Speech in Your Browser sur notre blog.