Бесплатный HD TTS в браузере — без облака и загрузки

Опубликовано

В Quick TTS появился третий нейросетевой движок: Supertonic HD. Это студийное качество, 44 кГц звук, и он работает целиком на вашей собственной видеокарте через WebGPU — ничто из того, что вы вставляете в поле ввода, никуда не отправляется. Разбираем, что это такое, как звучит и где у него есть реальные ограничения.

Что такое Supertonic HD

Supertonic HD — бесплатный нейросетевой голос на основе Supertonic 3, модели с открытыми весами от Supertone Inc. Он работает в браузере через WebGPU и onnxruntime-web — ту же схему «выполняется на вашем устройстве, а не на наших серверах», которую Quick TTS уже использует для Kokoro. Это наш движок с самым высоким качеством звука: 44 кГц против 24 кГц у Kokoro — разница между «явно синтетическим, но приятным» голосом и звуком, который приближается к профессиональной озвучке.

Он встаёт рядом с Web Speech (системными голосами вашей ОС), Piper (маленький, WASM, работает везде) и Kokoro (WebGPU, только английский) как четвёртый вариант в списке движков — не замена ни одному из них. Честный разбор того, какой движок выбрать в какой ситуации, есть в нашей статье Web Speech vs Piper vs Kokoro (EN): Supertonic встаёт по качеству выше Kokoro и ниже него по совместимости с устройствами.

Как это работает без сервера

Модель скачивается один раз — около 380 МБ, напрямую с Hugging Face — и затем кэшируется браузером. С этого момента синтез происходит целиком на вашей видеокарте. Никакой текст, который вы вставляете, загружаете или из которого генерируете аудио, не покидает устройство; логировать запросы нечего, потому что сервера в цепочке попросту нет.

Десять голосов, без клонирования

Supertonic поставляется с десятью предустановленными голосами — пять мужских (M1–M5) и пять женских (F1–F5), — выбираемых из того же списка голосов, что у Kokoro и Piper. Клонирования голоса нет, и нет способа загрузить эталонный образец: вы получаете ровно то, что заложено в модели. Если постоянство голоса на протяжении длинного проекта важнее максимальной точности звучания — это реальное ограничение, которое стоит учитывать заранее.

Автоматический язык: один голос, смешанный текст

Функция, которой больше нигде в Quick TTS нет: переключатель «Auto language (mixed text)» — автоматическое определение языка. Включите его, и Supertonic прочитает документ, где язык меняется прямо посреди абзаца — русскую статью с английской цитатой, письмо с иностранным названием продукта, — правильно произнося каждую часть без какой-либо разметки от вас. Все остальные движки, которые мы поставляем, рассчитаны на один язык за проход; этому по-настоящему всё равно, где проходит языковая граница.

Это узкий сценарий, но для тех, кто читает вслух многоязычные заметки, двуязычные учебные материалы или посты с переключением языков внутри предложения, это единственная вещь на этой странице, которую не делает ни один конкурирующий бесплатный инструмент.

Скорость: HD-качество без ожидания

Ожидаемый компромисс за более высокое качество звука — более медленная генерация, и здесь это почти не так. На машине с поддержкой WebGPU мы замерили real-time factor примерно 0,02–0,07 — в одном тесте фрагмент текста длиной в 13-минутную аудиокнигу сгенерировался примерно за 13 секунд. Само воспроизведение начинается меньше чем за секунду, а длинные документы разбиваются на части и обрабатываются в конвейере так же, как у Kokoro — так что целая глава не означает ожидания всей главы целиком, прежде чем вы что-то услышите.

Русский — среди 15 языков, и без Kokoro

Supertonic HD доступен в Quick TTS на 15 языках: английский, испанский, французский, немецкий, португальский, итальянский, русский, польский, нидерландский, турецкий, арабский, вьетнамский, хинди, японский и корейский. Русский — в этом списке, и это важно: модель Kokoro-82M никогда не поддерживала русский язык, поэтому до сих пор единственным нейросетевым вариантом для офлайн-синтеза оставался Piper. Supertonic HD — первый движок HD-уровня, который вообще заговорил по-русски в Quick TTS.

Он поддерживает все те же форматы и сценарии работы, что и остальной сайт: PDF, DOCX, EPUB, воспроизведение длинных документов по частям и загрузку в WAV/MP3, с экспортом в ZIP для очень длинных текстов. Единственный язык, который он не покрывает — китайский; если вам это интересно, в нашей статье Лучшие русские голоса TTS 2026 подробно разобраны все офлайн- и облачные варианты именно для русского, включая четыре голоса Piper, которые остаются в деле и после появления Supertonic.

Ограничения

Честный список, а не рекламный:

Про лицензии, если вы строите что-то поверх этого: код инференса — MIT (портирован из примеров кода Supertone), а веса модели — OpenRAIL-M, отдельная, более ограничительная лицензия с оговорками об использовании. Полный текст мы публикуем по адресу /licenses/supertonic-openrail-m.txt, а страница Условия использования описывает допустимое применение, если вы генерируете аудио для дальнейшего распространения.

Попробуйте сами

Откройте Quick TTS на десктопе в Chrome или Edge, переключите список движков на Supertonic HD и вставьте любой текст. Первая загрузка ~380 МБ происходит один раз; после этого модель кэшируется и работает офлайн так же, как Kokoro. Если ваш браузер или устройство не поддерживает WebGPU, список движков просто не предложит этот вариант — Piper и Web Speech продолжат работать так же, как вчера.