Voz HD gratis en el navegador: sin nube, sin subir texto
Quick TTS acaba de sumar un tercer motor de voz neuronal: Supertonic HD. Es calidad de estudio, audio a 44kHz, y corre entero en tu propia GPU a través de WebGPU — nada de lo que pegas sale nunca de tu dispositivo. Esto es lo que es, cómo suena, y dónde todavía se queda corto.
Qué es Supertonic HD
Supertonic HD es una voz de texto a voz gratuita basada en Supertonic 3, un modelo de pesos abiertos publicado por Supertone Inc. Corre en el navegador vía WebGPU y onnxruntime-web, el mismo esquema de "se ejecuta en tu máquina, no en nuestros servidores" que Quick TTS ya usa para Kokoro. Es el motor de mayor fidelidad que ofrecemos: salida a 44kHz frente a los 24kHz de Kokoro, la diferencia entre "claramente sintético pero agradable" y un audio que se acerca a una locución producida.
Se suma a Web Speech, Piper y Kokoro como cuarta opción en el selector de motor — no sustituye a ninguno. Se sitúa por encima de Kokoro en calidad y por debajo en compatibilidad de dispositivos.
Cómo funciona sin servidor
El modelo se descarga una sola vez — unos 380MB, directamente desde Hugging Face — y el navegador lo guarda en caché después. A partir de ahí, la síntesis ocurre íntegramente en tu GPU. Ningún texto que pegues, subas o conviertas en audio sale jamás de tu dispositivo; no hay ninguna petición que registrar, porque no hay ningún servidor de por medio.
- Unos 99M de parámetros, en la misma escala que Kokoro-82M, pero entrenado para producir audio a 44kHz en vez de 24kHz.
- Solo WebGPU. No hay ruta WASM de respaldo — medimos la ruta WASM de Supertonic a velocidad aproximadamente real en una CPU de escritorio potente, lo cual es inutilizable en cualquier equipo más modesto, así que no la publicamos. Eso significa un navegador de escritorio moderno: Chrome o Edge 113+ con una GPU que funcione.
- Sin WebGPU, sin problema. Los dispositivos que no lo tienen — la mayoría de móviles, portátiles antiguos, Firefox y Safari hoy — conservan Piper y Web Speech exactamente igual que antes. Nada cambia en los motores existentes.
Diez voces, sin clonación
Supertonic incluye diez voces preestablecidas — cinco masculinas (M1–M5) y cinco femeninas (F1–F5) — seleccionables desde el mismo selector de voz que Kokoro y Piper. No hay clonación de voz ni forma de subir una muestra de referencia; lo que hay en el modelo es lo que obtienes. Si mantener la misma identidad de voz a lo largo de un proyecto largo importa más que la fidelidad bruta, es una limitación real que conviene conocer de antemano.
Idioma automático: un texto, varios idiomas
La función que no existe en ningún otro sitio de Quick TTS: un interruptor de "Idioma automático (texto mixto)". Actívalo y Supertonic lee un documento que cambia de idioma a mitad de párrafo — un artículo en español que cita un diálogo en japonés, un correo en inglés con un nombre de producto en alemán — pronunciando cada parte correctamente sin que tengas que etiquetar nada. Todos los demás motores que ofrecemos asumen un idioma por pasada; este no distingue dónde cae el límite entre idiomas.
Es un caso de uso concreto, pero para quien lee en voz alta apuntes multilingües, material de estudio bilingüe o publicaciones con cambio de código, es lo único en esta página que ninguna otra herramienta gratuita hace.
Velocidad: calidad HD sin la espera
La contrapartida esperable de un audio de mayor fidelidad es una generación más lenta, y aquí no se cumple del todo. En un equipo compatible con WebGPU medimos un factor de tiempo real de aproximadamente 0.02–0.07 — un fragmento equivalente a 13 minutos de audiolibro se generó en unos 13 segundos. La reproducción arranca en menos de un segundo, y los documentos largos se dividen y encadenan igual que en Kokoro.
Los idiomas que cubre (y el que no)
Supertonic HD está disponible en 15 idiomas en Quick TTS: inglés, español, francés, alemán, portugués, italiano, ruso, polaco, neerlandés, turco, árabe, vietnamita, hindi, japonés y coreano. El español está entre ellos, así que si lees en voz alta en español, esto es HD neuronal en tu propio idioma, gratis y en tu navegador. Funciona con todos los formatos y flujos de trabajo del resto del sitio — PDF, DOCX, EPUB, reproducción por fragmentos de documentos largos, y descarga en WAV/MP3 con exportación ZIP para textos muy largos.
No cubre chino. Vale la pena decirlo con claridad: para zh-cn, la voz huayan de Piper sigue siendo la opción neuronal disponible.
Limitaciones
La lista honesta, no la de marketing:
- 380MB es una descarga real. Con conexión lenta o limitada, es el mayor coste de probar Supertonic — más que los ~80MB de la ruta WASM de Kokoro o los ~60MB de las voces de Piper.
- WebGPU es obligatorio, sin excepciones. No existe ruta de respaldo específica para este motor, a diferencia de Kokoro, que degrada automáticamente a Piper/Web Speech cuando la GPU no da la talla.
- Pensado primero para escritorio. Las GPU móviles y el soporte de WebGPU en navegadores móviles son todavía lo bastante irregulares como para no recomendarlo ahí por ahora.
- Diez voces fijas, sin clonación. Si necesitas una identidad de voz específica, esta no es la herramienta.
- El proyecto original avanza rápido y luego se detiene. La implementación de referencia en GitHub se archivó poco después de que la integráramos. Los pesos y el código que publicamos están fijados a una revisión concreta y verificados por nosotros.
En materia de licencias, para quien construya sobre esto: el código de inferencia es MIT (adaptado del código de ejemplo de Supertone), y los pesos del modelo son OpenRAIL-M — una licencia distinta y más restrictiva que MIT, con restricciones de uso. Publicamos el texto completo en /licenses/supertonic-openrail-m.txt, y nuestros Términos cubren el uso aceptable si generas audio para redistribuir.
Pruébalo
Abre Quick TTS en un equipo de escritorio con Chrome o Edge, cambia el selector de motor a Supertonic HD, y pega cualquier texto. La primera descarga de ~380MB ocurre una sola vez; después queda en caché y funciona sin conexión, igual que Kokoro. Si tu navegador o dispositivo no soporta WebGPU, el selector simplemente no lo ofrece — Piper y Web Speech siguen funcionando exactamente igual que ayer.
Para la versión en inglés de este artículo, con más detalle técnico y benchmarks, consulta HD Text-to-Speech in Your Browser en nuestro blog.