Texto para voz HD grátis no navegador: sem nuvem

Publicado em

O Quick TTS acabou de ganhar um terceiro motor de voz neural: o Supertonic HD. É qualidade de estúdio, áudio a 44kHz, e roda inteiramente na sua própria GPU via WebGPU — nada do que você cola sai do seu dispositivo. Aqui está o que é, como soa e onde ainda deixa a desejar.

O que é o Supertonic HD

O Supertonic HD é uma voz de texto para voz gratuita baseada no Supertonic 3, um modelo de pesos abertos lançado pela Supertone Inc. Ele roda no navegador via WebGPU e onnxruntime-web, o mesmo modelo de "roda no seu dispositivo, não nos nossos servidores" que o Quick TTS já usa para o Kokoro. É o motor de maior fidelidade que oferecemos: saída a 44kHz contra os 24kHz do Kokoro, a diferença entre "claramente sintético, mas agradável" e um áudio que chega perto de uma locução produzida em estúdio.

Ele se junta ao Web Speech, ao Piper e ao Kokoro como a quarta opção no menu de motores — sem substituir nenhum deles. Fica acima do Kokoro em qualidade e abaixo em compatibilidade de dispositivos.

Como ele roda sem servidor

O modelo é baixado uma única vez — cerca de 380MB, direto do Hugging Face — e depois fica em cache no navegador. A partir daí, a síntese acontece inteiramente na sua GPU. Nenhum texto que você cole, envie ou transforme em áudio sai do seu dispositivo em nenhum momento; não há nenhuma requisição para registrar, porque não há servidor algum no meio do caminho.

Dez vozes, sem clonagem

O Supertonic vem com dez vozes predefinidas — cinco masculinas (M1–M5) e cinco femininas (F1–F5) — selecionáveis no mesmo seletor de voz do Kokoro e do Piper. Não há clonagem de voz nem forma de enviar uma amostra de referência: o que está no modelo é o que você tem. Se manter a mesma identidade vocal ao longo de um projeto longo importa mais do que a fidelidade bruta, essa é uma limitação real que vale a pena conhecer antes de começar.

Idioma automático: um texto, vários idiomas

O recurso que não existe em nenhum outro lugar do Quick TTS: um interruptor de "Idioma automático (texto misto)". Ative e o Supertonic lê um documento que muda de idioma no meio do parágrafo — um artigo em português citando uma fala em inglês, um e-mail em inglês com o nome de um produto em espanhol — pronunciando cada parte corretamente sem que você precise marcar nada. Todos os outros motores que oferecemos presumem um único idioma por leitura; este simplesmente não se importa onde cai a fronteira entre os idiomas.

É um caso de uso bem específico, mas para quem lê em voz alta anotações multilíngues, material de estudo bilíngue ou posts com mistura de idiomas, é a única coisa nesta página que nenhuma outra ferramenta gratuita faz.

Velocidade: qualidade HD sem a espera

O trade-off esperado de um áudio de maior fidelidade seria uma geração mais lenta, e isso não se confirma muito bem aqui. Numa máquina compatível com WebGPU, medimos um fator de tempo real de aproximadamente 0,02–0,07 — um trecho equivalente a 13 minutos de audiolivro foi gerado em cerca de 13 segundos. A reprodução começa em menos de um segundo, e documentos longos são divididos em blocos e processados em pipeline igual ao Kokoro.

Quais idiomas ele cobre (e o que falta)

O Supertonic HD está disponível em 15 idiomas no Quick TTS: inglês, espanhol, francês, alemão, português, italiano, russo, polonês, holandês, turco, árabe, vietnamita, hindi, japonês e coreano. O português está entre eles: se você ouve textos em português, isso é síntese neural HD no seu próprio idioma, de graça, direto no navegador. Funciona com todos os formatos e fluxos de trabalho do resto do site — PDF, DOCX, EPUB, reprodução em blocos de documentos longos e download em WAV/MP3 com exportação em ZIP para textos muito longos.

Ele não cobre chinês. Vale deixar isso claro: para zh-cn, a voz huayan do Piper continua sendo a opção neural disponível.

Limitações

A lista honesta, não a de marketing:

Sobre licenciamento: o código de inferência é MIT (adaptado do código de exemplo da Supertone), e os pesos do modelo são OpenRAIL-M — uma licença separada e mais restritiva, com restrições de uso. Texto completo em /licenses/supertonic-openrail-m.txt, e nossa página de Termos cobre o uso aceitável se você redistribuir o áudio gerado.

Experimente

Abra o Quick TTS num desktop com Chrome ou Edge, mude o menu de motores para Supertonic HD e cole qualquer texto. O primeiro download de ~380MB acontece uma única vez; depois disso, fica em cache e funciona offline, igual ao Kokoro. Se o seu navegador ou dispositivo não suportar WebGPU, o menu simplesmente não vai oferecer essa opção — Piper e Web Speech continuam funcionando exatamente como ontem.

Para a versão em inglês deste artigo, com mais detalhes técnicos e benchmarks, veja HD Text-to-Speech in Your Browser no nosso blog.