Đọc To Giọng HD Miễn Phí Ngay Trong Trình Duyệt
Quick TTS vừa thêm một bộ máy giọng nói nơ-ron thứ ba: Supertonic HD. Chất lượng phòng thu, âm thanh 44kHz, và chạy hoàn toàn trên GPU của chính bạn qua WebGPU — không có đoạn văn bản nào bạn dán vào được gửi đi đâu cả. Đây là nó hoạt động thế nào, nghe ra sao, và vẫn còn thiếu gì cho tiếng Việt.
Supertonic HD là gì
Supertonic HD là giọng đọc nơ-ron miễn phí dựa trên Supertonic 3, một mô hình mã nguồn mở do Supertone Inc. phát hành. Nó chạy trong trình duyệt qua WebGPU và onnxruntime-web — cùng cơ chế "chạy trên máy bạn, không phải máy chủ của chúng tôi" mà Quick TTS đã dùng cho Kokoro. Đây là bộ máy chất lượng cao nhất chúng tôi cung cấp: đầu ra 44kHz, so với 24kHz của Kokoro — khác biệt giữa "rõ ràng là giọng máy nhưng dễ nghe" và âm thanh gần với một bản lồng tiếng chuyên nghiệp.
Nó gia nhập cùng Browser TTS (giọng có sẵn của hệ điều hành), Piper (nhỏ gọn, WASM, chạy được ở hầu hết mọi nơi) và Kokoro (WebGPU, chỉ tiếng Anh) thành lựa chọn thứ tư trong danh sách bộ máy — không thay thế bất kỳ cái nào. Với tiếng Việt cụ thể, đây là bộ máy nơ-ron thứ hai thực sự tồn tại: Kokoro hiện chưa hỗ trợ tiếng Việt, nên trước Supertonic, Piper là lựa chọn nơ-ron duy nhất.
Chạy mà không cần máy chủ
Mô hình được tải về một lần — khoảng 380MB, lấy trực tiếp từ Hugging Face — rồi được trình duyệt lưu cache. Từ đó trở đi, việc tổng hợp giọng nói diễn ra hoàn toàn trên GPU của bạn. Không văn bản nào bạn dán, tải lên, hay tạo giọng đọc từ đó rời khỏi thiết bị — không có yêu cầu nào để ghi log, vì đơn giản là không có máy chủ nào tham gia vào quá trình này.
- Khoảng 99 triệu tham số, tương đương kích thước với Kokoro-82M, nhưng được huấn luyện để tạo ra âm thanh 44kHz đầy đủ thay vì 24kHz.
- Chỉ chạy trên WebGPU. Không có phương án dự phòng WASM — chúng tôi đo tốc độ đường WASM của Supertonic ở mức xấp xỉ thời gian thực trên CPU máy tính để bàn cao cấp, không dùng được trên máy yếu hơn, nên chúng tôi không phát hành nó. Nghĩa là bạn cần trình duyệt desktop hiện đại: Chrome hoặc Edge 113 trở lên với GPU hoạt động tốt.
- Không có WebGPU cũng không sao. Các thiết bị không có nó — hầu hết điện thoại, laptop cũ, Firefox và Safari hiện tại — vẫn giữ nguyên Piper và Browser TTS như trước. Không có gì thay đổi với các bộ máy hiện có.
Mười giọng, không nhân bản
Supertonic đi kèm mười giọng có sẵn — năm nam (M1–M5) và năm nữ (F1–F5) — chọn được từ cùng bộ chọn giọng như Kokoro và Piper. Không có tính năng nhân bản giọng, không có cách tải lên mẫu tham chiếu; bạn có gì thì dùng nấy trong mô hình. Nếu tính nhất quán của một nhân vật xuyên suốt một dự án dài quan trọng hơn độ trung thực thô, đây là một giới hạn thật sự cần biết trước.
Chế độ Tự động ngôn ngữ: một giọng, văn bản đa ngôn ngữ
Tính năng không tồn tại ở bất kỳ đâu khác trong Quick TTS: nút chuyển "Tự động ngôn ngữ (văn bản trộn)". Bật nó lên, Supertonic đọc một tài liệu đổi ngôn ngữ giữa chừng một đoạn — bài viết tiếng Việt trích dẫn một câu tiếng Anh, ghi chú công việc lẫn thuật ngữ kỹ thuật tiếng Anh — phát âm đúng từng phần mà bạn không cần đánh dấu gì cả. Mọi bộ máy khác chúng tôi cung cấp đều giả định một ngôn ngữ cho mỗi lượt đọc; cái này thì thực sự không quan tâm ranh giới ngôn ngữ nằm ở đâu.
Đây là trường hợp dùng khá hẹp, nhưng với ai đọc ghi chú song ngữ, tài liệu học tiếng Anh xen tiếng Việt, hay bài đăng mạng xã hội pha trộn ngôn ngữ, đây là điều duy nhất trên trang này mà không công cụ miễn phí nào khác làm được.
Tốc độ: chất lượng HD không phải chờ lâu
Đánh đổi mà bạn nghĩ sẽ đi kèm âm thanh chất lượng cao hơn là tạo giọng chậm hơn, và điều đó không thực sự đúng ở đây. Trên máy hỗ trợ WebGPU, chúng tôi đo được hệ số thời gian thực (real-time factor) khoảng 0,02–0,07 — trong một lần thử, một đoạn văn bản dài tương đương 13 phút sách nói được tạo ra trong khoảng 13 giây. Việc phát lại bắt đầu trong chưa đầy một giây, và tài liệu dài được chia nhỏ và xử lý song song giống hệt cách Kokoro làm, nên đọc cả một chương không có nghĩa là phải chờ cả chương trước khi nghe được gì.
Tiếng Việt trong 15 ngôn ngữ hỗ trợ
Supertonic HD có mặt trong 15 ngôn ngữ trên Quick TTS: tiếng Anh, Tây Ban Nha, Pháp, Đức, Bồ Đào Nha, Ý, Nga, Ba Lan, Hà Lan, Thổ Nhĩ Kỳ, Ả Rập, Việt Nam, Hindi, Nhật và Hàn. Với tiếng Việt cụ thể, trước Supertonic bạn đã có giọng hệ thống (Linh trên Windows, An trên macOS/iOS), giọng cloud Edge Online chất lượng cao (HoaiMy, NamMinh — cần internet, văn bản gửi lên máy chủ Microsoft), và giọng nơ-ron Piper chạy offline. Supertonic không thay thế những lựa chọn đó — nó thêm một tầng chất lượng HD, chạy cục bộ sau lần tải đầu, cho ai muốn âm thanh gần với thu âm phòng thu hơn giọng WASM của Piper.
Nó xử lý mọi định dạng tệp và quy trình làm việc như phần còn lại của trang — PDF, DOCX, EPUB, phát theo từng đoạn cho tài liệu dài, và tải xuống WAV/MP3, kèm xuất ZIP cho văn bản rất dài.
Giới hạn
Danh sách thành thật, không phải bản quảng cáo:
- 380MB là một lần tải thật sự lớn. Với kết nối chậm hoặc giới hạn dung lượng, đây là chi phí lớn nhất khi thử Supertonic — lớn hơn đường WASM ~80MB của Kokoro hoặc các giọng ~60MB của Piper.
- Bắt buộc phải có WebGPU, không ngoại lệ. Không có phương án dự phòng nào cho riêng bộ máy này, khác với Kokoro tự động chuyển về Piper/Browser TTS khi GPU không đáp ứng được.
- Ưu tiên máy tính để bàn. GPU di động và hỗ trợ WebGPU trên trình duyệt di động vẫn chưa đủ ổn định nên chúng tôi chưa khuyến nghị dùng ở đó.
- Mười giọng cố định, không nhân bản. Nếu bạn cần một giọng nói cụ thể, đây không phải công cụ phù hợp.
- Dự án gốc phát triển nhanh rồi dừng lại. Bản triển khai tham chiếu trên GitHub của Supertone Inc. đã được lưu trữ (archived) ngay sau khi chúng tôi tích hợp nó. Trọng số mô hình và mã suy luận chúng tôi phát hành được cố định ở một phiên bản cụ thể và đã được chúng tôi kiểm chứng — không âm thầm chạy theo một bản gốc có thể không còn được cập nhật nữa.
Về giấy phép, dành cho ai muốn xây dựng dựa trên nó: mã suy luận theo giấy phép MIT (chuyển thể từ mã mẫu của Supertone), còn trọng số mô hình theo giấy phép OpenRAIL-M — một giấy phép riêng, hạn chế hơn MIT, có kèm các điều kiện sử dụng. Chúng tôi công bố toàn văn tại /licenses/supertonic-openrail-m.txt, và trang Điều khoản của chúng tôi nói rõ về việc sử dụng hợp lệ nếu bạn tạo âm thanh để phân phối lại.
Tự trải nghiệm
Mở Quick TTS trên máy tính để bàn dùng Chrome hoặc Edge, chuyển danh sách bộ máy sang Supertonic HD, rồi dán bất kỳ văn bản nào vào. Lần tải ~380MB đầu tiên chỉ diễn ra một lần; sau đó nó được cache và hoạt động được cả khi ngoại tuyến, giống Kokoro. Nếu trình duyệt hoặc thiết bị của bạn không hỗ trợ WebGPU, danh sách đơn giản là sẽ không hiện tùy chọn này — Piper và Browser TTS vẫn hoạt động y như hôm qua.
Để hiểu sâu hơn về kỹ thuật đằng sau các bộ máy giọng nói của Quick TTS, bản gốc tiếng Anh HD Text-to-Speech in Your Browser có thêm chi tiết về phương pháp đo tốc độ và benchmark.