Texto para voz HD grátis no navegador: sem nuvem
O Quick TTS acabou de ganhar um terceiro motor de voz neural: o Supertonic HD. É qualidade de estúdio, áudio a 44kHz, e roda inteiramente na sua própria GPU via WebGPU — nada do que você cola sai do seu dispositivo. Aqui está o que é, como soa e onde ainda deixa a desejar.
O que é o Supertonic HD
O Supertonic HD é uma voz de texto para voz gratuita baseada no Supertonic 3, um modelo de pesos abertos lançado pela Supertone Inc. Ele roda no navegador via WebGPU e onnxruntime-web, o mesmo modelo de "roda no seu dispositivo, não nos nossos servidores" que o Quick TTS já usa para o Kokoro. É o motor de maior fidelidade que oferecemos: saída a 44kHz contra os 24kHz do Kokoro, a diferença entre "claramente sintético, mas agradável" e um áudio que chega perto de uma locução produzida em estúdio.
Ele se junta ao Web Speech, ao Piper e ao Kokoro como a quarta opção no menu de motores — sem substituir nenhum deles. Fica acima do Kokoro em qualidade e abaixo em compatibilidade de dispositivos.
Como ele roda sem servidor
O modelo é baixado uma única vez — cerca de 380MB, direto do Hugging Face — e depois fica em cache no navegador. A partir daí, a síntese acontece inteiramente na sua GPU. Nenhum texto que você cole, envie ou transforme em áudio sai do seu dispositivo em nenhum momento; não há nenhuma requisição para registrar, porque não há servidor algum no meio do caminho.
- Cerca de 99M de parâmetros, mais ou menos na mesma classe de tamanho do Kokoro-82M, mas treinado para gerar áudio a 44kHz em vez de 24kHz.
- Só WebGPU. Não existe um caminho WASM de reserva — medimos o caminho WASM do Supertonic em velocidade próxima do tempo real numa CPU de desktop de ponta, o que é inutilizável em qualquer hardware mais modesto, então não lançamos essa opção. Isso significa um navegador desktop moderno: Chrome ou Edge 113+ com uma GPU funcionando.
- Sem WebGPU, sem problema. Os dispositivos que não têm — a maioria dos celulares, notebooks mais antigos, Firefox e Safari hoje — continuam com Piper e Web Speech exatamente como antes. Nada muda nos motores existentes.
Dez vozes, sem clonagem
O Supertonic vem com dez vozes predefinidas — cinco masculinas (M1–M5) e cinco femininas (F1–F5) — selecionáveis no mesmo seletor de voz do Kokoro e do Piper. Não há clonagem de voz nem forma de enviar uma amostra de referência: o que está no modelo é o que você tem. Se manter a mesma identidade vocal ao longo de um projeto longo importa mais do que a fidelidade bruta, essa é uma limitação real que vale a pena conhecer antes de começar.
Idioma automático: um texto, vários idiomas
O recurso que não existe em nenhum outro lugar do Quick TTS: um interruptor de "Idioma automático (texto misto)". Ative e o Supertonic lê um documento que muda de idioma no meio do parágrafo — um artigo em português citando uma fala em inglês, um e-mail em inglês com o nome de um produto em espanhol — pronunciando cada parte corretamente sem que você precise marcar nada. Todos os outros motores que oferecemos presumem um único idioma por leitura; este simplesmente não se importa onde cai a fronteira entre os idiomas.
É um caso de uso bem específico, mas para quem lê em voz alta anotações multilíngues, material de estudo bilíngue ou posts com mistura de idiomas, é a única coisa nesta página que nenhuma outra ferramenta gratuita faz.
Velocidade: qualidade HD sem a espera
O trade-off esperado de um áudio de maior fidelidade seria uma geração mais lenta, e isso não se confirma muito bem aqui. Numa máquina compatível com WebGPU, medimos um fator de tempo real de aproximadamente 0,02–0,07 — um trecho equivalente a 13 minutos de audiolivro foi gerado em cerca de 13 segundos. A reprodução começa em menos de um segundo, e documentos longos são divididos em blocos e processados em pipeline igual ao Kokoro.
Quais idiomas ele cobre (e o que falta)
O Supertonic HD está disponível em 15 idiomas no Quick TTS: inglês, espanhol, francês, alemão, português, italiano, russo, polonês, holandês, turco, árabe, vietnamita, hindi, japonês e coreano. O português está entre eles: se você ouve textos em português, isso é síntese neural HD no seu próprio idioma, de graça, direto no navegador. Funciona com todos os formatos e fluxos de trabalho do resto do site — PDF, DOCX, EPUB, reprodução em blocos de documentos longos e download em WAV/MP3 com exportação em ZIP para textos muito longos.
Ele não cobre chinês. Vale deixar isso claro: para zh-cn, a voz huayan do Piper continua sendo a opção neural disponível.
Limitações
A lista honesta, não a de marketing:
- 380MB é um download de verdade. Numa conexão lenta ou limitada, esse é o maior custo de experimentar o Supertonic — mais do que os ~80MB do caminho WASM do Kokoro ou os ~60MB das vozes do Piper.
- WebGPU é obrigatório, sem exceções. Não existe um caminho de reserva específico para este motor, diferente do Kokoro, que degrada automaticamente para Piper/Web Speech quando a GPU não dá conta.
- Pensado primeiro para desktop. As GPUs móveis e o suporte a WebGPU em navegadores móveis ainda são inconsistentes o bastante para não recomendarmos por lá, por enquanto.
- Dez vozes fixas, sem clonagem. Se você precisa de uma identidade vocal específica, essa não é a ferramenta certa.
- O projeto original avança rápido, depois para. A implementação de referência no GitHub foi arquivada pouco depois de a integrarmos. Os pesos e o código que distribuímos estão fixados numa revisão específica e verificados por nós.
Sobre licenciamento: o código de inferência é MIT (adaptado do código de exemplo da Supertone), e os pesos do modelo são OpenRAIL-M — uma licença separada e mais restritiva, com restrições de uso. Texto completo em /licenses/supertonic-openrail-m.txt, e nossa página de Termos cobre o uso aceitável se você redistribuir o áudio gerado.
Experimente
Abra o Quick TTS num desktop com Chrome ou Edge, mude o menu de motores para Supertonic HD e cole qualquer texto. O primeiro download de ~380MB acontece uma única vez; depois disso, fica em cache e funciona offline, igual ao Kokoro. Se o seu navegador ou dispositivo não suportar WebGPU, o menu simplesmente não vai oferecer essa opção — Piper e Web Speech continuam funcionando exatamente como ontem.
Para a versão em inglês deste artigo, com mais detalhes técnicos e benchmarks, veja HD Text-to-Speech in Your Browser no nosso blog.