브라우저에서 완결되는 무료 HD 음성 읽기 — 업로드·클라우드 없이
Quick TTS에 세 번째 신경망 음성 엔진, Supertonic HD가 추가되었습니다. 스튜디오급 44kHz 음질이고, 동작은 전부 사용자 본인의 GPU에서 WebGPU를 통해 이루어집니다 — 붙여넣은 텍스트가 어딘가로 전송되는 일은 없습니다. 그리고 한국어에게 이것은 특히 의미가 큽니다: Piper와 Kokoro 모두 아직 한국어를 지원하지 않는 가운데, Supertonic HD가 이 사이트에서 한국어를 지원하는 첫 신경망 음성 엔진이기 때문입니다.
Supertonic HD란
Supertonic HD는 Supertonic 3를 기반으로 한 무료 신경망 TTS 음성입니다. Supertone Inc.가 공개한 오픈웨이트 모델로, WebGPU와 onnxruntime-web을 통해 브라우저 안에서 동작합니다 — Quick TTS가 Kokoro에 이미 적용해 온 "서버가 아니라 사용자 기기에서 동작한다"는 방식 그대로입니다. 저희가 제공하는 엔진 중 가장 고음질로, 출력이 44kHz입니다. Kokoro의 24kHz와 비교하면 "누가 봐도 합성음이지만 듣기 좋은 소리"와 실제 스튜디오 내레이션에 가까운 소리의 차이라고 보면 됩니다.
한국어 입장에서 이건 단순한 음질 업그레이드가 아닙니다. 지금까지 Quick TTS의 신경망 엔진인 Piper와 Kokoro는 모두 한국어를 지원하지 않았습니다. 한국어 사용자가 쓸 수 있었던 것은 OS 내장 음성(macOS/iOS의 SoYoung·Yuna, Windows의 Heami·InJoon)과 인터넷이 필요한 Edge Online 신경망 음성(SunHi Online, InJoon Online 등 8종)뿐이었습니다. Supertonic HD는 이 사이트에서 한국어를 지원하는 첫 신경망 음성 엔진이며, 그것도 오프라인으로 동작하는 방식입니다.
서버 없이 동작하는 방식
모델은 한 번만 다운로드됩니다 — 약 380MB, Hugging Face에서 직접 받아오며 이후로는 브라우저가 캐시합니다. 그 다음부터는 음성 합성이 전부 사용자의 GPU에서 일어납니다. 붙여넣거나 업로드하거나 음성으로 변환한 어떤 텍스트도 기기 밖으로 나가지 않습니다. 로그를 남길 서버 자체가 이 과정에 존재하지 않기 때문입니다.
- 약 9,900만 개 매개변수. Kokoro-82M과 비슷한 규모지만, 24kHz가 아닌 풀 44kHz 음성을 만들도록 학습되었습니다.
- WebGPU 전용입니다. WASM 대체 경로는 없습니다 — 고사양 데스크톱 CPU에서 Supertonic의 WASM 경로를 측정했을 때 대략 실시간 속도가 나왔지만, 그보다 약한 기기에서는 쓸 수 없는 수준이라 제공하지 않기로 했습니다. 즉 최신 데스크톱 브라우저가 필요합니다: Chrome 또는 Edge 113 이상, 정상 동작하는 GPU와 함께.
- WebGPU가 없어도 괜찮습니다. WebGPU가 없는 기기 — 대부분의 스마트폰, 오래된 노트북, 현재의 Firefox와 Safari — 에서는 Browser TTS가 그대로 동작합니다. 다만 한국어의 경우 Kokoro도 어차피 지원하지 않았으므로, WebGPU가 없으면 신경망 음성 자체를 선택할 수 없다는 점은 이전과 같습니다.
10가지 음성, 클로닝은 없음
Supertonic은 10가지 프리셋 음성을 제공합니다 — 남성 5종(M1~M5), 여성 5종(F1~F5) — Kokoro, Piper와 같은 음성 선택 메뉴에서 고를 수 있습니다. 음성 클로닝 기능은 없고, 참조 샘플을 업로드하는 방법도 없습니다. 모델에 들어 있는 목소리가 곧 결과물입니다. 긴 프로젝트에서 캐릭터의 일관성이 원음의 완성도보다 중요하다면, 이는 미리 알아둘 만한 실질적인 제약입니다.
자동 언어 모드: 하나의 음성으로 다국어 혼합 텍스트 읽기
Quick TTS 어디에도 없는 기능입니다: "자동 언어(혼합 텍스트)" 토글. 이걸 켜면 Supertonic은 문단 중간에 언어가 바뀌는 문서 — 한국어 글에 섞인 영어 인용문, 영어 기술 용어가 들어간 메모 — 를 태그 없이도 각 부분을 올바르게 발음하며 읽어줍니다. 다른 모든 엔진은 한 번의 읽기에 하나의 언어를 전제로 하지만, 이 기능은 언어 경계가 어디에 있든 신경 쓰지 않습니다.
영어 자료를 자주 접하는 한국어 사용자에게 특히 실용적입니다. 이중언어 노트, 영어 인용이 섞인 학습 자료, 코드 스위칭된 SNS 글을 소리 내어 듣고 싶은 사람에게는 다른 어떤 무료 도구도 하지 않는 유일한 기능입니다.
속도: HD 품질인데 기다림은 짧습니다
고음질이면 생성이 느릴 거라 예상하기 쉽지만, 실제로는 그렇지 않습니다. WebGPU를 지원하는 기기에서 실시간 계수(RTF)를 측정한 결과 대략 0.02~0.07이 나왔습니다 — 한 테스트에서는 오디오북 13분 분량의 텍스트가 약 13초 만에 생성되었습니다. 재생 자체는 1초도 안 되어 시작되고, 긴 문서는 Kokoro와 같은 방식으로 청크 분할·파이프라인 처리되므로 한 챕터를 듣기 위해 챕터 전체가 처리되기를 기다릴 필요가 없습니다.
지원 언어(그리고 아직 지원하지 않는 언어)
Supertonic HD는 Quick TTS에서 15개 언어를 지원합니다: 영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 러시아어, 폴란드어, 네덜란드어, 터키어, 아랍어, 베트남어, 힌디어, 일본어, 한국어. 긴 문서는 한국어 문장 경계를 인식해 청크로 나뉘기 때문에 문장 중간이 어색하게 끊기지 않습니다. PDF, DOCX, EPUB을 포함해 사이트의 다른 기능도 동일하게 동작하며, WAV/MP3 다운로드와 매우 긴 텍스트를 위한 ZIP 내보내기도 지원합니다.
한계
홍보 문구가 아니라 솔직한 목록입니다:
- 380MB는 실제로 큰 다운로드입니다. 느리거나 종량제인 연결에서는 이것이 Supertonic을 써보는 데 가장 큰 비용입니다 — Kokoro의 약 80MB WASM 경로나 Piper의 약 60MB 음성보다 큽니다.
- WebGPU가 필수이며 예외는 없습니다. GPU가 감당하지 못하면 Piper/Browser TTS로 자동 전환되는 Kokoro와 달리, 이 엔진 전용의 대체 경로는 존재하지 않습니다.
- 데스크톱 우선입니다. 모바일 GPU와 모바일 브라우저의 WebGPU 지원이 아직 충분히 안정적이지 않아, 현재로서는 모바일 사용을 권장하지 않습니다.
- 고정된 10가지 음성, 클로닝 없음. 특정 음성 정체성이 필요하다면 이 도구는 맞지 않습니다.
- 원본 프로젝트는 빠르게 진행되다 멈췄습니다. Supertone Inc.의 GitHub 레퍼런스 구현은 저희가 통합한 직후 보관(archive) 처리되었습니다. 저희가 제공하는 모델 가중치와 추론 코드는 특정 리비전에 고정되어 있고 저희가 직접 검증한 것입니다 — 앞으로 업데이트될지 알 수 없는 원본을 조용히 그대로 따라가지 않습니다.
라이선스와 관련해, 이를 활용해 무언가를 만들고자 하는 분들을 위해 덧붙입니다. 추론 코드는 MIT(Supertone의 샘플 코드를 이식)이고, 모델 가중치는 OpenRAIL-M — MIT보다 제한이 많고 사용 제한 조항이 포함된 별도의 라이선스입니다. 전문은 /licenses/supertonic-openrail-m.txt에서 공개하고 있으며, 재배포 목적으로 오디오를 생성하는 경우의 허용 범위는 이용약관 페이지에 정리되어 있습니다.
직접 사용해 보기
데스크톱의 Chrome 또는 Edge에서 Quick TTS를 열고, 엔진 드롭다운을 Supertonic HD로 바꾼 뒤 아무 텍스트나 붙여넣어 보세요. 처음 약 380MB 다운로드는 한 번뿐이고, 이후로는 캐시되어 Kokoro처럼 오프라인에서도 사용할 수 있습니다. 브라우저나 기기가 WebGPU를 지원하지 않으면 드롭다운에 이 옵션 자체가 나타나지 않을 뿐이며, Browser TTS는 지금까지와 똑같이 동작합니다.
속도 측정 방법 등 더 자세한 기술 내용은 영문판 HD Text-to-Speech in Your Browser에서 확인할 수 있습니다.