2026년 최고의 무료 한국어 TTS 음성 (브라우저, 가입 없이)
한국어 무료 음성 합성은 2026년에 와서야 선택지가 생겼습니다. Edge의 온라인 신경망 음성은 사람 목소리에 근접했고, Supertonic HD는 44.1kHz 신경망 음성을 브라우저 안에서 로컬로 돌립니다. 이 글은 실제로 써 본 결과를 그대로 적은 것이고, 시작부터 한 가지는 분명히 해 두겠습니다 — Quick TTS에서 한국어로 쓸 수 있는 신경망 엔진은 Supertonic 하나뿐입니다. Piper와 Kokoro는 한국어 음성이 아예 없어서 한국어 페이지에서는 선택지에 나타나지도 않습니다.
2026년 한국어 TTS, 세 가지 사실
지금 한국어 TTS 지형을 정하는 것은 이 세 가지입니다.
첫째, 가장 좋은 무료 한국어 음성은 Edge의 온라인 신경망 음성입니다. Microsoft Azure 서버에서 합성되어 Edge의 Web Speech 인터페이스로 노출됩니다. 음질은 상용 서비스와 같은 급입니다. 대신 Edge에서만 쓸 수 있고, 인터넷이 필요하며, 텍스트가 Azure 서버로 전송됩니다.
둘째, 로컬 신경망 음성도 드디어 한국어에 도달했습니다. Supertonic HD는 44.1kHz 신경망 음성을 WebGPU로 여러분의 그래픽카드 위에서 직접 돌립니다. 최초 1회 약 380MB를 내려받고 나면 이후에는 텍스트가 기기 밖으로 나가지 않습니다. 한국어에서 이런 선택지가 생긴 것은 최근의 일입니다.
셋째, 시스템 기본 음성은 여전히 살아 있지만 확실히 낡았습니다. Windows의 헤미, Apple의 유나가 여기에 해당합니다. 짧은 알림이나 기본적인 접근성 용도에는 자리가 있지만, 세 문장을 넘어가면 오늘날 더 나은 선택지가 분명히 존재합니다.
Edge 온라인 신경망 음성 (가장 좋은 무료 선택지)
제목의 "최고"는 여기서 나옵니다. Edge에서 쓸 수 있는 한국어 온라인 신경망 음성과 솔직한 인상입니다.
- 선희(SunHi) — 한국어 기본 여성 음성이자 가장 무난한 선택. 발음이 깨끗하고 긴 문장에서도 억양이 흔들리지 않습니다. 고민하기 싫다면 이것으로 시작하세요.
- 인준(InJoon) — 남성 음성, 중간 음역. 차분하고 신뢰감 있는 톤이라 내레이션과 설명 영상에 잘 맞습니다.
- 현수(Hyunsu) — 다국어 지원 음성. 한국어와 영어가 섞인 문장을 자연스럽게 넘어가므로, 영어 용어가 자주 등장하는 IT·업무 문서에 특히 유리합니다.
- 봉진(BongJin)·국민(GookMin) — 남성 음성. 좀 더 단단하고 공적인 톤이라 공지·뉴스형 콘텐츠에 어울립니다.
- 지민(JiMin)·서현(SeoHyeon)·유진(YuJin) — 여성 음성. 선희보다 밝거나 부드러운 결이라, 같은 원고를 여러 톤으로 시험해 볼 때 쓸 만합니다.
개인적인 추천 세 가지: 선희(기본값으로 가장 안정적), 인준(남성 내레이션), 현수(한영 혼용 문서). 한국어 TTS를 한 번도 안 들어봤다면 이 셋부터 듣고 나머지를 비교하세요.
중요한 한계: Edge 온라인 신경망 음성은 Microsoft Edge에서만 동작하고 인터넷 연결이 필요합니다. 합성은 Azure 서버에서 일어납니다. 진료 기록, 계약서 초안, 사내 문서처럼 밖으로 나가면 안 되는 텍스트라면 아래의 로컬 방식을 쓰세요.
Windows 기본 음성: 헤미(Heami)
Windows에는 한국어 SAPI 음성 헤미가 기본 포함되어 있고, Edge가 아닌 브라우저에서도 동작합니다.
솔직하게 말하면 소리는 확실히 구세대입니다. 억양이 평평하고 문장 끝 처리가 기계적입니다. 그래도 쓸모가 남아 있는 지점은 분명합니다 — 인터넷이 없을 때, 아주 짧은 안내 문구를 읽을 때, 그리고 오래된 PC에서 기본적인 화면 낭독이 필요할 때입니다. 그 외의 경우에는 Edge 온라인이나 Supertonic이 모든 면에서 낫습니다.
Apple: 유나(Yuna)와 Siri 한국어 음성
macOS와 iOS에서는 한국어 Apple 음성을 쓸 수 있습니다. 고품질 버전은 설정 → 손쉬운 사용 → 콘텐츠 말하기 → 음성에서 내려받습니다.
- 유나(Yuna) — 한국어 기본 여성 음성. 고품질(향상된/프리미엄) 버전을 내려받으면 체감 품질이 크게 달라집니다. 핵심은 합성이 기기 안에서 일어난다는 점입니다.
- Siri 한국어 음성 — 긴 문장을 읽을 때 억양이 자연스럽고, 남성·여성 모두 선택할 수 있습니다.
Apple 쪽의 거래 조건은 꽤 좋습니다. Edge 온라인에 근접한 품질을 로컬 처리로 얻습니다. iPhone이나 Mac을 쓰면서 개인정보가 신경 쓰인다면, 고품질 유나가 품질과 로컬 처리 사이의 가장 현실적인 절충점입니다.
Supertonic HD: 한국어에서 유일하게 로컬로 도는 신경망 음성
신경망 음질이면서 동시에 완전히 로컬인 한국어 음성을 원한다면, 오늘 Quick TTS에서의 답은 Supertonic HD 하나입니다.
- 44.1kHz 출력 — 이 사이트의 다른 어떤 엔진보다 높은 샘플레이트입니다. 이어폰으로 들으면 차이가 바로 들립니다.
- 10가지 프리셋 음성 — 남성 M1–M5, 여성 F1–F5. 엔진을 고른 뒤 같은 음성 선택기에서 바꿉니다.
- 자동 언어 감지 — 한국어 문서에 영어 용어와 고유명사가 섞여 있을 때 특히 유용합니다. 켜 두면 섞인 구간을 각 언어의 발음으로 읽습니다. 한국어 실무 문서에서는 이게 생각보다 큰 차이를 만듭니다.
- 업로드 없음 — 모델을 한 번 내려받은 뒤에는 텍스트가 브라우저를 벗어나지 않습니다.
솔직한 조건도 그대로 적습니다. Supertonic은 WebGPU가 필요합니다 — 현실적으로 데스크톱 Chrome 또는 Edge입니다. WASM 대체 경로는 없습니다. CPU에서 돌려본 결과가 실시간을 겨우 넘기는 수준이라 대체 경로를 넣지 않기로 한 것이고, 그래서 WebGPU가 없는 기기에서는 이 옵션이 아예 회색으로 표시됩니다. 최초 다운로드는 약 380MB이며 이후 캐시됩니다. 음성 복제나 참조 음성 업로드 기능은 없습니다 — 모델에 들어 있는 10개가 전부입니다. 가중치는 OpenRAIL-M 라이선스이므로, 결과물을 상업적으로 쓸 계획이라면 사용 제한 조항을 먼저 확인하세요.
Piper와 Kokoro가 한국어를 읽지 못하는 이유 (솔직한 설명)
다른 언어 소개 글에서 Piper나 Kokoro를 보셨을 수 있습니다. 한국어에서의 사정은 이렇습니다.
- Piper에는 한국어 음성이 없습니다. 업스트림 음성 카탈로그에 한국어 항목 자체가 존재하지 않습니다. 영어 음성으로 한국어를 읽히는 것은 알아들을 수 없는 결과를 낼 뿐이라, 한국어 페이지에서는 Piper 옵션을 표시하지 않습니다.
- Kokoro는 현재 영어 전용입니다. 지금 고정해 쓰는 버전은 음성 목록과 발음 변환 양쪽 모두 영어만 지원합니다. 그래서 영어 이외 페이지에서는 숨겨져 있습니다.
결론적으로 한국어에서 "로컬 신경망 음성" 자리는 Supertonic이 혼자 맡고 있습니다. 있지도 않은 선택지를 있는 것처럼 적지는 않겠습니다. Piper에 한국어 음성이 추가되면 그때 넣고 이 글도 갱신하겠습니다.
문서를 그대로 읽히기
붙여넣기만 되는 것이 아닙니다. PDF, DOCX, EPUB, ODT, RTF, HTML, TXT, MD 파일을 그대로 열어 본문만 추출해 읽힐 수 있습니다. 추출은 브라우저 안에서 이루어지므로 파일이 서버로 업로드되지 않습니다. 논문 PDF나 전자책 한 권을 통째로 듣는 용도로 쓰기 좋고, 경쟁 서비스들이 대체로 유료로 파는 기능입니다. 자세한 사용법은 사용 가이드(10가지 실용 시나리오)에 정리되어 있습니다.
용도별 추천
- 긴 오디오북·전자책(1시간 이상): Supertonic HD(로컬, 44.1kHz) 또는 Edge 온라인 선희. 관건은 긴 텍스트에서의 억양 안정성이고 둘 다 한 챕터를 버팁니다.
- 한영 혼용 업무 문서: Supertonic의 자동 언어 감지, 또는 Edge 온라인 현수. 이 조합이 영어 용어를 한글 발음으로 뭉개지 않습니다.
- 공지·뉴스형 콘텐츠: Edge 온라인 봉진 또는 국민.
- 내레이션·설명 영상: Edge 온라인 인준(남) 또는 선희(여).
- 민감한 텍스트(진료 기록·계약서·사내 문서): Supertonic HD 또는 Apple 유나. 로컬 합성이라 텍스트가 기기를 벗어나지 않습니다.
- 글 교정(직접 쓴 원고 점검): 아무 음성이나 괜찮습니다. 여기서는 음질보다 "눈으로 놓친 문장을 귀가 잡아낸다"는 원리가 핵심입니다.
- 접근성 화면 낭독: 시스템 기본 음성(Apple 유나, Windows 헤미) — 이 용도에서는 지연 시간이 가장 중요합니다.
- WebGPU가 없는 노트북·구형 PC: Edge 온라인 음성. Supertonic은 이 기기에서 실행되지 않습니다.
직접 해보기
Quick TTS를 열고 한국어 문단을 붙여넣은 뒤, 같은 텍스트로 브라우저 엔진(Edge 온라인 또는 Apple)과 Supertonic HD를 비교해 보세요. 같은 엔진 안에서는 재생 중에 음성을 바꿔도 됩니다 — 현재 구간을 새 음성으로 다시 읽어 주므로 같은 문장에서 선희 → 인준을 바로 비교할 수 있습니다. 다만 엔진을 바꾸면 재생이 멈추므로 재생 버튼을 다시 눌러야 합니다. 여러 음성을 정직하게 비교하는 방법은 결국 이것 하나입니다 — 같은 원고를 자기 귀로 듣는 것.
더 자세한 내용은 사용 가이드, 자주 묻는 질문, 그리고 Supertonic HD 출시 글인 브라우저에서 완결되는 무료 HD 음성 읽기를 참고하세요. 이 사이트가 왜 모든 처리를 로컬에서 하는지는 소개 페이지에 적어 두었습니다.