Preguntas frecuentes
Respuestas rápidas a las dudas más habituales.
¿Es realmente gratis y sin límite de palabras?
Sí. No hay registro, ni tope de caracteres, ni plan de pago. Pega un tuit o pega una novela: la herramienta es la misma. La mantenemos gratis con publicidad.
¿Guardáis el texto que pego?
No. Quick TTS funciona íntegramente en el lado del cliente. El texto que pegas lo procesa tu navegador y nunca se envía a un servidor nuestro. No tenemos registros de él porque jamás llega hasta nosotros.
Tu texto más reciente se guarda en el localStorage de tu navegador para que siga ahí si cierras la pestaña por accidente, pero eso queda solo en tu dispositivo. Para borrarlo, limpia los datos del sitio.
¿Qué diferencia hay entre la voz por defecto y la "AI Voice"?
Por defecto (Browser TTS): el motor de voz integrado de tu navegador (Web Speech API). Instantáneo, funciona en cualquier dispositivo y suena como una voz TTS estándar. Las voces concretas dependen de tu sistema operativo: Mac trae a Samantha, Windows tiene a Zira y Natasha, y Android e iOS llevan las suyas propias.
AI Voice son tres motores neuronales que puedes activar; en las páginas en español se muestran dos de ellos. Ambos se ejecutan localmente en tu dispositivo tras una descarga única — tu texto nunca sale de tu navegador.
- Piper — descarga de ~60MB, se ejecuta en WebAssembly. Funciona
en cualquier navegador de escritorio y ya también en el móvil. Suena muchísimo
más natural que Browser TTS. Modelos en español:
es_ES-davefx-mediumyes_MX-claude-high. - Supertonic HD — la mejor calidad local para el español: 44,1 kHz, se ejecuta en tu tarjeta gráfica mediante WebGPU. Unos 380 MB una sola vez y después funciona sin conexión. Exige WebGPU — no hay alternativa en WebAssembly, así que sin WebGPU la opción no aparece en el menú.
- Kokoro HQ — ~80MB, se ejecuta mediante WebGPU, pero es solo en inglés (tanto el catálogo de voces como la fonemización). Por eso este motor no se muestra en las páginas en español.
¿La voz IA envía mi texto a algún servidor?
No. Tanto Piper como Supertonic HD funcionan enteramente en tu navegador — Piper mediante WebAssembly, Supertonic HD mediante WebGPU. Las únicas peticiones de red son las descargas iniciales de la librería y del modelo desde jsDelivr y Hugging Face. Después, toda la síntesis de texto a audio ocurre en tu dispositivo.
¿Funciona en el móvil?
En el móvil tienes Browser TTS — funciona en todas partes usando las voces integradas de tu teléfono. Piper ya funciona también en el móvil: los problemas que tenía en iOS se resolvieron con las actualizaciones de Safari y Chrome.
Kokoro HQ y Supertonic HD siguen siendo exclusivos de escritorio — ambos necesitan WebGPU, que las GPU móviles todavía no ejecutan de forma fiable.
¿Puedo usar el audio con fines comerciales (YouTube, podcasts, productos)?
Sí, con un matiz: conviene acreditar el modelo de voz utilizado en los créditos o la descripción de tu proyecto.
- Voz del navegador: usa las voces integradas del sistema operativo. Microsoft, Apple y Google publican sus propios términos para el uso comercial de las voces del sistema; en general se permite el uso accesorio y a pequeña escala, pero revisa su documentación si vas a usarla a gran escala.
- Piper: el motor tiene licencia MIT. Enviamos un conjunto seleccionado de voces: LibriTTS-R y VCTK son CC-BY 4.0 (uso comercial permitido con atribución) y Joe es CC0 / dominio público (sin restricciones). La atribución de las voces CC-BY suele cumplirse con una línea en la descripción del vídeo o podcast del tipo "Voz de Piper TTS — LibriTTS-R / VCTK, CC-BY 4.0".
- Kokoro HQ: el modelo tiene licencia Apache 2.0; el uso comercial está permitido. Apache 2.0 no exige estrictamente atribución, pero recomendamos acreditar Kokoro-82M en los créditos como buena práctica.
- Supertonic HD: se diferencia del resto — los pesos del modelo están bajo OpenRAIL-M de BigScience, que no es una licencia permisiva. El uso comercial está permitido y no se reclama ningún derecho sobre el audio que generes, pero OpenRAIL-M añade restricciones de uso que debes cumplir y trasladar a cualquier persona con quien compartas el modelo o su salida. El código de inferencia es MIT.
No reclamamos ningún derecho sobre el audio que generes. Tú eres el responsable de cumplir con las licencias de los modelos subyacentes en tu caso de uso concreto.
¿Qué longitud puede tener mi texto?
La que quieras. Dividimos el texto en bloques y emitimos la reproducción en streaming, así que pegar un documento de 50.000 palabras funciona igual que pegar una sola frase: solo tarda más. En la ruta AI Voice, la generación se solapa con la reproducción para que no haya una espera larga al inicio.
¿Por qué tarda tanto en arrancar la primera reproducción con AI Voice?
La primera vez que activas un motor de IA, tu navegador tiene que descargar el modelo — ~60MB para Piper, ~80MB para Kokoro HQ. Eso lleva entre unos segundos y un minuto, según tu conexión. Después queda en caché en el navegador y los usos siguientes son instantáneos. Supertonic HD es la excepción: unos 380 MB la primera vez — tenlo en cuenta con datos limitados.
Estoy en un ordenador del trabajo y AI Voice se queda en "Descargando..."
Algunas redes corporativas bloquean jsDelivr o Hugging Face — los CDN que alojan Piper y Supertonic HD. Si ninguno de los motores de IA termina de inicializarse, esa suele ser la causa. Browser TTS funciona sin descargas externas, así que es una buena alternativa en entornos restringidos.
¿Por qué veo anuncios?
Los anuncios son lo que paga el dominio, el alojamiento y el tiempo de mantener la herramienta. Es el trato a cambio de mantenerla gratis y sin límites. Si los detestas, te entendemos: tienes un bloqueador de anuncios al alcance. No vamos a hacerte sentir mal por usarlo.
¿Rastreáis lo que escribo con el teclado?
No. No usamos analítica ni registramos pulsaciones de teclas. Consulta la política de privacidad para todos los detalles.
Algo se ha roto / tengo comentarios
Escribe a hello@quick-tts.com. Incluye tu navegador y sistema operativo.