Sintesi vocale HD gratis nel browser: niente cloud
Quick TTS ha appena aggiunto un terzo motore vocale neurale: Supertonic HD. Qualità da studio, audio a 44kHz, e gira interamente sulla tua GPU tramite WebGPU — niente di ciò che incolli viene mai inviato altrove. Ecco cos'è, come suona e dove mostra ancora i suoi limiti.
Cos'è Supertonic HD
Supertonic HD è una voce di sintesi vocale gratuita basata su Supertonic 3, un modello a pesi aperti rilasciato da Supertone Inc. Gira nel browser tramite WebGPU e onnxruntime-web, lo stesso schema "gira sul tuo dispositivo, non sui nostri server" che Quick TTS usa già per Kokoro. È il motore con la fedeltà più alta che offriamo: output a 44kHz contro i 24kHz di Kokoro, la differenza tra "chiaramente sintetico ma piacevole" e un audio che si avvicina a una voce fuori campo prodotta in studio.
Si aggiunge a Web Speech, Piper e Kokoro come quarta opzione nel menu del motore — senza sostituire nessuno dei tre. Si colloca sopra Kokoro per qualità e sotto per compatibilità con i dispositivi.
Come funziona senza un server
Il modello si scarica una sola volta — circa 380MB, direttamente da Hugging Face — e da lì in poi il browser lo mette in cache. Da quel momento, la sintesi avviene interamente sulla tua GPU. Nessun testo che incolli, carichi o trasformi in audio lascia mai il tuo dispositivo; non c'è nessuna richiesta da registrare, perché non c'è alcun server nel mezzo.
- Circa 99M di parametri, più o meno nella stessa classe dimensionale di Kokoro-82M, ma addestrato per produrre audio a 44kHz invece che a 24kHz.
- Solo WebGPU. Non esiste un percorso WASM di riserva — abbiamo misurato il percorso WASM di Supertonic a una velocità vicina al tempo reale su una CPU desktop di fascia alta, il che lo rende inutilizzabile su qualsiasi hardware più modesto, quindi non l'abbiamo rilasciato. Serve un browser desktop moderno: Chrome o Edge 113+ con una GPU funzionante.
- Niente WebGPU, nessun problema. I dispositivi che non ce l'hanno — la maggior parte degli smartphone, i laptop più datati, oggi Firefox e Safari — mantengono Piper e Web Speech esattamente come prima. Sui motori esistenti non cambia nulla.
Dieci voci, nessuna clonazione
Supertonic offre dieci voci preimpostate — cinque maschili (M1–M5) e cinque femminili (F1–F5) — selezionabili dallo stesso menu voci di Kokoro e Piper. Non c'è clonazione vocale né modo di caricare un campione di riferimento: quello che è nel modello è quello che ottieni. Se mantenere la stessa identità vocale lungo un progetto lungo conta più della fedeltà pura, è un vincolo reale da conoscere in anticipo.
Lingua automatica: un testo, più lingue
La funzione che non esiste altrove in Quick TTS: un interruttore "Lingua automatica (testo misto)". Attivalo e Supertonic legge un documento che cambia lingua a metà paragrafo — un articolo italiano che cita un dialogo in inglese, un'email in inglese con il nome di un prodotto tedesco — pronunciando correttamente ogni parte senza che tu debba etichettare nulla. Ogni altro motore che offriamo presume una sola lingua per lettura; questo semplicemente non si preoccupa di dove cada il confine linguistico.
È un caso d'uso di nicchia, ma per chi legge ad alta voce appunti multilingue, materiale di studio bilingue o post con cambio di codice linguistico, è l'unica cosa in questa pagina che nessun altro strumento gratuito fa.
Velocità: qualità HD senza l'attesa
Il compromesso atteso di un audio più fedele sarebbe una generazione più lenta, e qui non è proprio così. Su una macchina compatibile con WebGPU abbiamo misurato un fattore di tempo reale di circa 0,02–0,07 — un testo equivalente a 13 minuti di audiolibro è stato generato in circa 13 secondi. La riproduzione parte in meno di un secondo, e i documenti lunghi vengono suddivisi ed elaborati in pipeline come per Kokoro.
Le lingue coperte (e quella che manca)
Supertonic HD è disponibile in 15 lingue su Quick TTS: inglese, spagnolo, francese, tedesco, portoghese, italiano, russo, polacco, olandese, turco, arabo, vietnamita, hindi, giapponese e coreano. L'italiano è tra queste: se ascolti testi letti in italiano, questa è sintesi vocale neurale HD nella tua lingua, gratis, direttamente nel browser. Funziona con tutti i formati e i flussi di lavoro del resto del sito — PDF, DOCX, EPUB, riproduzione a blocchi dei documenti lunghi, e download in WAV/MP3 con esportazione ZIP per i testi molto lunghi.
Non copre il cinese. Meglio dirlo chiaramente: per lo zh-cn, la voce huayan di Piper resta l'opzione neurale disponibile.
Limiti
La lista onesta, non quella da marketing:
- 380MB è un download vero. Con una connessione lenta o limitata, è il costo più grande di provare Supertonic — più degli ~80MB del percorso WASM di Kokoro o dei ~60MB delle voci di Piper.
- WebGPU è obbligatorio, senza eccezioni. Non esiste un percorso di riserva specifico per questo motore, a differenza di Kokoro, che degrada automaticamente a Piper/Web Speech quando la GPU non ce la fa.
- Pensato prima di tutto per il desktop. Le GPU mobili e il supporto WebGPU nei browser mobili sono ancora abbastanza incostanti da farci evitare di consigliarlo lì, per ora.
- Dieci voci fisse, nessuna clonazione. Se ti serve un'identità vocale specifica, questo non è lo strumento giusto.
- Il progetto a monte va veloce, poi si ferma. L'implementazione di riferimento su GitHub è stata archiviata poco dopo la nostra integrazione. Pesi e codice che distribuiamo sono fissati a una revisione precisa e verificati da noi.
Sul fronte delle licenze, per chi volesse costruirci sopra: il codice di inferenza è MIT (adattato dal codice di esempio di Supertone), mentre i pesi del modello sono OpenRAIL-M — una licenza distinta e più restrittiva della MIT, con restrizioni d'uso. Pubblichiamo il testo completo su /licenses/supertonic-openrail-m.txt, e la nostra pagina Termini copre l'uso consentito se generi audio destinato alla redistribuzione.
Provalo
Apri Quick TTS su un desktop con Chrome o Edge, cambia il menu del motore su Supertonic HD e incolla un testo qualsiasi. Il primo download di circa 380MB avviene una sola volta; dopo, resta in cache ed è utilizzabile offline, proprio come Kokoro. Se il tuo browser o dispositivo non supporta WebGPU, il menu semplicemente non la offre — Piper e Web Speech continuano a funzionare esattamente come ieri.
Per la versione in inglese di questo articolo, con più dettagli tecnici e benchmark, vedi HD Text-to-Speech in Your Browser sul nostro blog.