Бесплатный HD TTS в браузере — без облака и загрузки
В Quick TTS появился третий нейросетевой движок: Supertonic HD. Это студийное качество, 44 кГц звук, и он работает целиком на вашей собственной видеокарте через WebGPU — ничто из того, что вы вставляете в поле ввода, никуда не отправляется. Разбираем, что это такое, как звучит и где у него есть реальные ограничения.
Что такое Supertonic HD
Supertonic HD — бесплатный нейросетевой голос на основе Supertonic 3, модели с открытыми весами от Supertone Inc. Он работает в браузере через WebGPU и onnxruntime-web — ту же схему «выполняется на вашем устройстве, а не на наших серверах», которую Quick TTS уже использует для Kokoro. Это наш движок с самым высоким качеством звука: 44 кГц против 24 кГц у Kokoro — разница между «явно синтетическим, но приятным» голосом и звуком, который приближается к профессиональной озвучке.
Он встаёт рядом с Web Speech (системными голосами вашей ОС), Piper (маленький, WASM, работает везде) и Kokoro (WebGPU, только английский) как четвёртый вариант в списке движков — не замена ни одному из них. Честный разбор того, какой движок выбрать в какой ситуации, есть в нашей статье Web Speech vs Piper vs Kokoro (EN): Supertonic встаёт по качеству выше Kokoro и ниже него по совместимости с устройствами.
Как это работает без сервера
Модель скачивается один раз — около 380 МБ, напрямую с Hugging Face — и затем кэшируется браузером. С этого момента синтез происходит целиком на вашей видеокарте. Никакой текст, который вы вставляете, загружаете или из которого генерируете аудио, не покидает устройство; логировать запросы нечего, потому что сервера в цепочке попросту нет.
- ~99 млн параметров — примерно тот же класс размера, что и Kokoro-82M, но модель обучена выдавать полноценные 44 кГц вместо 24 кГц.
- Только WebGPU. WASM-версии нет: мы замерили путь Supertonic через WASM — на мощном настольном процессоре он работает примерно в реальном времени, что непригодно на чём-то слабее, поэтому мы не стали его поставлять. Нужен современный настольный браузер: Chrome или Edge 113+ с рабочей видеокартой.
- Нет WebGPU — не проблема. На устройствах без него — большинство телефонов, старые ноутбуки, сегодняшние Firefox и Safari — Piper и Web Speech работают ровно как раньше. В существующих движках ничего не меняется.
Десять голосов, без клонирования
Supertonic поставляется с десятью предустановленными голосами — пять мужских (M1–M5) и пять женских (F1–F5), — выбираемых из того же списка голосов, что у Kokoro и Piper. Клонирования голоса нет, и нет способа загрузить эталонный образец: вы получаете ровно то, что заложено в модели. Если постоянство голоса на протяжении длинного проекта важнее максимальной точности звучания — это реальное ограничение, которое стоит учитывать заранее.
Автоматический язык: один голос, смешанный текст
Функция, которой больше нигде в Quick TTS нет: переключатель «Auto language (mixed text)» — автоматическое определение языка. Включите его, и Supertonic прочитает документ, где язык меняется прямо посреди абзаца — русскую статью с английской цитатой, письмо с иностранным названием продукта, — правильно произнося каждую часть без какой-либо разметки от вас. Все остальные движки, которые мы поставляем, рассчитаны на один язык за проход; этому по-настоящему всё равно, где проходит языковая граница.
Это узкий сценарий, но для тех, кто читает вслух многоязычные заметки, двуязычные учебные материалы или посты с переключением языков внутри предложения, это единственная вещь на этой странице, которую не делает ни один конкурирующий бесплатный инструмент.
Скорость: HD-качество без ожидания
Ожидаемый компромисс за более высокое качество звука — более медленная генерация, и здесь это почти не так. На машине с поддержкой WebGPU мы замерили real-time factor примерно 0,02–0,07 — в одном тесте фрагмент текста длиной в 13-минутную аудиокнигу сгенерировался примерно за 13 секунд. Само воспроизведение начинается меньше чем за секунду, а длинные документы разбиваются на части и обрабатываются в конвейере так же, как у Kokoro — так что целая глава не означает ожидания всей главы целиком, прежде чем вы что-то услышите.
Русский — среди 15 языков, и без Kokoro
Supertonic HD доступен в Quick TTS на 15 языках: английский, испанский, французский, немецкий, португальский, итальянский, русский, польский, нидерландский, турецкий, арабский, вьетнамский, хинди, японский и корейский. Русский — в этом списке, и это важно: модель Kokoro-82M никогда не поддерживала русский язык, поэтому до сих пор единственным нейросетевым вариантом для офлайн-синтеза оставался Piper. Supertonic HD — первый движок HD-уровня, который вообще заговорил по-русски в Quick TTS.
Он поддерживает все те же форматы и сценарии работы, что и остальной сайт: PDF, DOCX, EPUB, воспроизведение длинных документов по частям и загрузку в WAV/MP3, с экспортом в ZIP для очень длинных текстов. Единственный язык, который он не покрывает — китайский; если вам это интересно, в нашей статье Лучшие русские голоса TTS 2026 подробно разобраны все офлайн- и облачные варианты именно для русского, включая четыре голоса Piper, которые остаются в деле и после появления Supertonic.
Ограничения
Честный список, а не рекламный:
- 380 МБ — это реальная загрузка. На медленном или лимитированном соединении это главная цена входа в Supertonic — больше, чем ~80 МБ WASM-пути Kokoro или ~60 МБ голосов Piper.
- WebGPU обязателен, без исключений. У этого движка нет запасного пути, в отличие от Kokoro, который автоматически переключается на Piper/Web Speech, когда видеокарта не справляется.
- В первую очередь для десктопа. Поддержка WebGPU в мобильных браузерах и на мобильных GPU пока настолько неровная, что мы не рекомендуем его там.
- Десять фиксированных голосов, без клонирования. Если вам нужен конкретный голос — это не тот инструмент.
- Проект выше по течению развивается быстро, а потом останавливается. Референсная реализация Supertone Inc. на GitHub была заархивирована вскоре после того, как мы её интегрировали. Веса модели и код инференса, которые мы поставляем, закреплены на конкретной ревизии и проверены нами — а не молча следуют за апстримом, который может больше не обновляться.
Про лицензии, если вы строите что-то поверх этого: код инференса — MIT (портирован из примеров кода Supertone), а веса модели — OpenRAIL-M, отдельная, более ограничительная лицензия с оговорками об использовании. Полный текст мы публикуем по адресу /licenses/supertonic-openrail-m.txt, а страница Условия использования описывает допустимое применение, если вы генерируете аудио для дальнейшего распространения.
Попробуйте сами
Откройте Quick TTS на десктопе в Chrome или Edge, переключите список движков на Supertonic HD и вставьте любой текст. Первая загрузка ~380 МБ происходит один раз; после этого модель кэшируется и работает офлайн так же, как Kokoro. Если ваш браузер или устройство не поддерживает WebGPU, список движков просто не предложит этот вариант — Piper и Web Speech продолжат работать так же, как вчера.