FAQ
Respostas rápidas para as dúvidas mais comuns.
É mesmo grátis e sem limite de palavras?
Sim. Sem cadastro, sem limite de caracteres e sem plano pago. Cole um tweet ou cole um romance: a ferramenta é a mesma. Mantemos tudo grátis com anúncios.
Vocês guardam o texto que eu colo?
Não. O Quick TTS roda inteiramente no lado do cliente. O texto que você cola é processado pelo seu navegador e nunca é enviado para nenhum servidor nosso. Não temos registro disso porque ele nunca chega até aqui.
Seu texto mais recente fica salvo no localStorage do navegador para continuar lá caso você feche a aba sem querer, mas isso é só no seu dispositivo. Limpe os dados do site para apagar.
Qual a diferença entre a voz padrão e a "AI Voice"?
Padrão (Browser TTS): o motor de fala nativo do seu navegador (Web Speech API). É instantâneo, funciona em qualquer dispositivo e soa como uma voz TTS comum. As vozes disponíveis dependem do seu sistema operacional — Mac tem a Samantha, Windows tem Zira e Natasha, Android e iOS têm as suas próprias.
AI Voice são três motores neurais que você pode ativar; nas páginas em português dois deles aparecem. Os dois rodam localmente no seu dispositivo depois de um download único — seu texto nunca sai do navegador.
- Piper — download de ~60MB, roda em WebAssembly. Funciona em
qualquer navegador desktop e agora também no celular. Soa muito mais natural que
o Browser TTS. Modelo em português:
pt_BR-faber-medium. - Supertonic HD — a melhor qualidade local para português: 44,1 kHz, roda na sua GPU via WebGPU. Cerca de 380 MB uma única vez e depois funciona offline. Exige WebGPU — não há alternativa em WebAssembly, então sem WebGPU a opção simplesmente não aparece no menu.
- Kokoro HQ — ~80MB, roda via WebGPU, mas é somente em inglês (tanto o catálogo de vozes quanto a fonemização). Por isso o motor não é exibido nas páginas em português.
A voz IA envia meu texto para algum servidor?
Não. Tanto o Piper quanto o Supertonic HD rodam inteiramente dentro do seu navegador — Piper via WebAssembly, Supertonic HD via WebGPU. As únicas requisições de rede são os downloads iniciais da biblioteca e do modelo no jsDelivr e no Hugging Face. Depois disso, toda a síntese de texto em áudio acontece no seu dispositivo.
Funciona no celular?
No celular você tem Browser TTS — funciona em qualquer lugar usando as vozes nativas do seu celular. O Piper agora também roda no celular: os problemas que ele tinha no iOS foram resolvidos por atualizações do Safari e do Chrome.
Kokoro HQ e Supertonic HD continuam exclusivos do desktop — os dois precisam de WebGPU, que as GPUs móveis ainda não rodam de forma confiável.
Posso usar o áudio comercialmente (YouTube, podcasts, produtos)?
Pode, com uma ressalva: é boa prática creditar o modelo de voz nos créditos ou na descrição do seu projeto.
- Voz do navegador: usa as vozes nativas do sistema operacional. A Microsoft, a Apple e o Google publicam termos próprios para uso comercial das vozes do sistema — em geral é permitido para uso incidental e em pequena escala, mas confira a documentação da voz alvo se você for distribuir em larga escala.
- Piper: o motor tem licença MIT. Enviamos um conjunto curado de vozes: LibriTTS-R e VCTK são CC-BY 4.0 (uso comercial liberado com atribuição) e Joe é CC0 / domínio público (sem restrições). A atribuição das vozes CC-BY normalmente é cumprida com uma linha na descrição do vídeo/podcast no estilo "Voz por Piper TTS — LibriTTS-R / VCTK, CC-BY 4.0".
- Kokoro HQ: o modelo tem licença Apache 2.0 — uso comercial é permitido. Apache 2.0 não exige atribuição em sentido estrito, mas recomendamos creditar o Kokoro-82M nos créditos como boa prática.
- Supertonic HD: diferente dos demais — os pesos do modelo estão sob a OpenRAIL-M da BigScience, que não é uma licença permissiva. O uso comercial é permitido e nenhum direito é reivindicado sobre o áudio que você gera, mas a OpenRAIL-M acrescenta restrições de uso que você precisa seguir e repassar a qualquer pessoa com quem compartilhe o modelo ou sua saída. O código de inferência é MIT.
Não reivindicamos nenhum direito sobre o áudio que você gerar. É sua responsabilidade cumprir as licenças dos modelos no seu caso de uso específico.
Qual o tamanho máximo do texto?
O que você quiser. Dividimos o texto em pedaços e fazemos streaming da reprodução, então colar um documento de 50.000 palavras funciona igual a colar uma frase: só demora mais para terminar. No fluxo da AI Voice, geração e reprodução acontecem em paralelo, sem espera longa no início.
Por que a primeira reprodução com AI Voice demora tanto?
Na primeira vez que você ativa um motor de IA, o navegador precisa baixar o modelo — ~60MB para o Piper, ~80MB para o Kokoro HQ. Isso leva de poucos segundos a um minuto, dependendo da sua conexão. Depois fica em cache no navegador e os próximos usos começam instantaneamente. O Supertonic HD é a exceção: cerca de 380 MB na primeira vez — considere isso em conexão limitada.
Estou no computador do trabalho e o AI Voice trava em "Baixando..."
Algumas redes corporativas bloqueiam o jsDelivr ou o Hugging Face — os CDNs que hospedam o Piper e o Supertonic HD. Se nenhum dos motores de IA termina de inicializar, é quase sempre essa a causa. O Browser TTS funciona sem nenhum download externo, então é uma boa alternativa em ambientes restritos.
Por que vejo anúncios?
Os anúncios é que pagam o domínio, a hospedagem e o tempo de manutenção da ferramenta. É a troca por mantê-la grátis e sem limite. Se você odeia anúncios, tem todo o nosso respeito — e um bloqueador de anúncios à mão. Não vamos te fazer sentir culpa.
Vocês monitoram minhas digitações?
Não. Não rodamos analytics nem keylogger. Veja a Política de Privacidade para os detalhes.
Algo quebrou / tenho feedback
Manda um e-mail para hello@quick-tts.com. Inclua seu navegador e sistema operacional.