Sintesi vocale HD gratis nel browser: niente cloud

Pubblicato il

Quick TTS ha appena aggiunto un terzo motore vocale neurale: Supertonic HD. Qualità da studio, audio a 44kHz, e gira interamente sulla tua GPU tramite WebGPU — niente di ciò che incolli viene mai inviato altrove. Ecco cos'è, come suona e dove mostra ancora i suoi limiti.

Cos'è Supertonic HD

Supertonic HD è una voce di sintesi vocale gratuita basata su Supertonic 3, un modello a pesi aperti rilasciato da Supertone Inc. Gira nel browser tramite WebGPU e onnxruntime-web, lo stesso schema "gira sul tuo dispositivo, non sui nostri server" che Quick TTS usa già per Kokoro. È il motore con la fedeltà più alta che offriamo: output a 44kHz contro i 24kHz di Kokoro, la differenza tra "chiaramente sintetico ma piacevole" e un audio che si avvicina a una voce fuori campo prodotta in studio.

Si aggiunge a Web Speech, Piper e Kokoro come quarta opzione nel menu del motore — senza sostituire nessuno dei tre. Si colloca sopra Kokoro per qualità e sotto per compatibilità con i dispositivi.

Come funziona senza un server

Il modello si scarica una sola volta — circa 380MB, direttamente da Hugging Face — e da lì in poi il browser lo mette in cache. Da quel momento, la sintesi avviene interamente sulla tua GPU. Nessun testo che incolli, carichi o trasformi in audio lascia mai il tuo dispositivo; non c'è nessuna richiesta da registrare, perché non c'è alcun server nel mezzo.

Dieci voci, nessuna clonazione

Supertonic offre dieci voci preimpostate — cinque maschili (M1–M5) e cinque femminili (F1–F5) — selezionabili dallo stesso menu voci di Kokoro e Piper. Non c'è clonazione vocale né modo di caricare un campione di riferimento: quello che è nel modello è quello che ottieni. Se mantenere la stessa identità vocale lungo un progetto lungo conta più della fedeltà pura, è un vincolo reale da conoscere in anticipo.

Lingua automatica: un testo, più lingue

La funzione che non esiste altrove in Quick TTS: un interruttore "Lingua automatica (testo misto)". Attivalo e Supertonic legge un documento che cambia lingua a metà paragrafo — un articolo italiano che cita un dialogo in inglese, un'email in inglese con il nome di un prodotto tedesco — pronunciando correttamente ogni parte senza che tu debba etichettare nulla. Ogni altro motore che offriamo presume una sola lingua per lettura; questo semplicemente non si preoccupa di dove cada il confine linguistico.

È un caso d'uso di nicchia, ma per chi legge ad alta voce appunti multilingue, materiale di studio bilingue o post con cambio di codice linguistico, è l'unica cosa in questa pagina che nessun altro strumento gratuito fa.

Velocità: qualità HD senza l'attesa

Il compromesso atteso di un audio più fedele sarebbe una generazione più lenta, e qui non è proprio così. Su una macchina compatibile con WebGPU abbiamo misurato un fattore di tempo reale di circa 0,02–0,07 — un testo equivalente a 13 minuti di audiolibro è stato generato in circa 13 secondi. La riproduzione parte in meno di un secondo, e i documenti lunghi vengono suddivisi ed elaborati in pipeline come per Kokoro.

Le lingue coperte (e quella che manca)

Supertonic HD è disponibile in 15 lingue su Quick TTS: inglese, spagnolo, francese, tedesco, portoghese, italiano, russo, polacco, olandese, turco, arabo, vietnamita, hindi, giapponese e coreano. L'italiano è tra queste: se ascolti testi letti in italiano, questa è sintesi vocale neurale HD nella tua lingua, gratis, direttamente nel browser. Funziona con tutti i formati e i flussi di lavoro del resto del sito — PDF, DOCX, EPUB, riproduzione a blocchi dei documenti lunghi, e download in WAV/MP3 con esportazione ZIP per i testi molto lunghi.

Non copre il cinese. Meglio dirlo chiaramente: per lo zh-cn, la voce huayan di Piper resta l'opzione neurale disponibile.

Limiti

La lista onesta, non quella da marketing:

Sul fronte delle licenze, per chi volesse costruirci sopra: il codice di inferenza è MIT (adattato dal codice di esempio di Supertone), mentre i pesi del modello sono OpenRAIL-M — una licenza distinta e più restrittiva della MIT, con restrizioni d'uso. Pubblichiamo il testo completo su /licenses/supertonic-openrail-m.txt, e la nostra pagina Termini copre l'uso consentito se generi audio destinato alla redistribuzione.

Provalo

Apri Quick TTS su un desktop con Chrome o Edge, cambia il menu del motore su Supertonic HD e incolla un testo qualsiasi. Il primo download di circa 380MB avviene una sola volta; dopo, resta in cache ed è utilizzabile offline, proprio come Kokoro. Se il tuo browser o dispositivo non supporta WebGPU, il menu semplicemente non la offre — Piper e Web Speech continuano a funzionare esattamente come ieri.

Per la versione in inglese di questo articolo, con più dettagli tecnici e benchmark, vedi HD Text-to-Speech in Your Browser sul nostro blog.