브라우저에서 완결되는 무료 HD 음성 읽기 — 업로드·클라우드 없이

게시일

Quick TTS에 세 번째 신경망 음성 엔진, Supertonic HD가 추가되었습니다. 스튜디오급 44kHz 음질이고, 동작은 전부 사용자 본인의 GPU에서 WebGPU를 통해 이루어집니다 — 붙여넣은 텍스트가 어딘가로 전송되는 일은 없습니다. 그리고 한국어에게 이것은 특히 의미가 큽니다: Piper와 Kokoro 모두 아직 한국어를 지원하지 않는 가운데, Supertonic HD가 이 사이트에서 한국어를 지원하는 첫 신경망 음성 엔진이기 때문입니다.

Supertonic HD란

Supertonic HD는 Supertonic 3를 기반으로 한 무료 신경망 TTS 음성입니다. Supertone Inc.가 공개한 오픈웨이트 모델로, WebGPU와 onnxruntime-web을 통해 브라우저 안에서 동작합니다 — Quick TTS가 Kokoro에 이미 적용해 온 "서버가 아니라 사용자 기기에서 동작한다"는 방식 그대로입니다. 저희가 제공하는 엔진 중 가장 고음질로, 출력이 44kHz입니다. Kokoro의 24kHz와 비교하면 "누가 봐도 합성음이지만 듣기 좋은 소리"와 실제 스튜디오 내레이션에 가까운 소리의 차이라고 보면 됩니다.

한국어 입장에서 이건 단순한 음질 업그레이드가 아닙니다. 지금까지 Quick TTS의 신경망 엔진인 Piper와 Kokoro는 모두 한국어를 지원하지 않았습니다. 한국어 사용자가 쓸 수 있었던 것은 OS 내장 음성(macOS/iOS의 SoYoung·Yuna, Windows의 Heami·InJoon)과 인터넷이 필요한 Edge Online 신경망 음성(SunHi Online, InJoon Online 등 8종)뿐이었습니다. Supertonic HD는 이 사이트에서 한국어를 지원하는 첫 신경망 음성 엔진이며, 그것도 오프라인으로 동작하는 방식입니다.

서버 없이 동작하는 방식

모델은 한 번만 다운로드됩니다 — 약 380MB, Hugging Face에서 직접 받아오며 이후로는 브라우저가 캐시합니다. 그 다음부터는 음성 합성이 전부 사용자의 GPU에서 일어납니다. 붙여넣거나 업로드하거나 음성으로 변환한 어떤 텍스트도 기기 밖으로 나가지 않습니다. 로그를 남길 서버 자체가 이 과정에 존재하지 않기 때문입니다.

10가지 음성, 클로닝은 없음

Supertonic은 10가지 프리셋 음성을 제공합니다 — 남성 5종(M1~M5), 여성 5종(F1~F5) — Kokoro, Piper와 같은 음성 선택 메뉴에서 고를 수 있습니다. 음성 클로닝 기능은 없고, 참조 샘플을 업로드하는 방법도 없습니다. 모델에 들어 있는 목소리가 곧 결과물입니다. 긴 프로젝트에서 캐릭터의 일관성이 원음의 완성도보다 중요하다면, 이는 미리 알아둘 만한 실질적인 제약입니다.

자동 언어 모드: 하나의 음성으로 다국어 혼합 텍스트 읽기

Quick TTS 어디에도 없는 기능입니다: "자동 언어(혼합 텍스트)" 토글. 이걸 켜면 Supertonic은 문단 중간에 언어가 바뀌는 문서 — 한국어 글에 섞인 영어 인용문, 영어 기술 용어가 들어간 메모 — 를 태그 없이도 각 부분을 올바르게 발음하며 읽어줍니다. 다른 모든 엔진은 한 번의 읽기에 하나의 언어를 전제로 하지만, 이 기능은 언어 경계가 어디에 있든 신경 쓰지 않습니다.

영어 자료를 자주 접하는 한국어 사용자에게 특히 실용적입니다. 이중언어 노트, 영어 인용이 섞인 학습 자료, 코드 스위칭된 SNS 글을 소리 내어 듣고 싶은 사람에게는 다른 어떤 무료 도구도 하지 않는 유일한 기능입니다.

속도: HD 품질인데 기다림은 짧습니다

고음질이면 생성이 느릴 거라 예상하기 쉽지만, 실제로는 그렇지 않습니다. WebGPU를 지원하는 기기에서 실시간 계수(RTF)를 측정한 결과 대략 0.02~0.07이 나왔습니다 — 한 테스트에서는 오디오북 13분 분량의 텍스트가 약 13초 만에 생성되었습니다. 재생 자체는 1초도 안 되어 시작되고, 긴 문서는 Kokoro와 같은 방식으로 청크 분할·파이프라인 처리되므로 한 챕터를 듣기 위해 챕터 전체가 처리되기를 기다릴 필요가 없습니다.

지원 언어(그리고 아직 지원하지 않는 언어)

Supertonic HD는 Quick TTS에서 15개 언어를 지원합니다: 영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 러시아어, 폴란드어, 네덜란드어, 터키어, 아랍어, 베트남어, 힌디어, 일본어, 한국어. 긴 문서는 한국어 문장 경계를 인식해 청크로 나뉘기 때문에 문장 중간이 어색하게 끊기지 않습니다. PDF, DOCX, EPUB을 포함해 사이트의 다른 기능도 동일하게 동작하며, WAV/MP3 다운로드와 매우 긴 텍스트를 위한 ZIP 내보내기도 지원합니다.

한계

홍보 문구가 아니라 솔직한 목록입니다:

라이선스와 관련해, 이를 활용해 무언가를 만들고자 하는 분들을 위해 덧붙입니다. 추론 코드는 MIT(Supertone의 샘플 코드를 이식)이고, 모델 가중치는 OpenRAIL-M — MIT보다 제한이 많고 사용 제한 조항이 포함된 별도의 라이선스입니다. 전문은 /licenses/supertonic-openrail-m.txt에서 공개하고 있으며, 재배포 목적으로 오디오를 생성하는 경우의 허용 범위는 이용약관 페이지에 정리되어 있습니다.

직접 사용해 보기

데스크톱의 Chrome 또는 Edge에서 Quick TTS를 열고, 엔진 드롭다운을 Supertonic HD로 바꾼 뒤 아무 텍스트나 붙여넣어 보세요. 처음 약 380MB 다운로드는 한 번뿐이고, 이후로는 캐시되어 Kokoro처럼 오프라인에서도 사용할 수 있습니다. 브라우저나 기기가 WebGPU를 지원하지 않으면 드롭다운에 이 옵션 자체가 나타나지 않을 뿐이며, Browser TTS는 지금까지와 똑같이 동작합니다.

속도 측정 방법 등 더 자세한 기술 내용은 영문판 HD Text-to-Speech in Your Browser에서 확인할 수 있습니다.