Đọc To Giọng HD Miễn Phí Ngay Trong Trình Duyệt

Đăng ngày

Quick TTS vừa thêm một bộ máy giọng nói nơ-ron thứ ba: Supertonic HD. Chất lượng phòng thu, âm thanh 44kHz, và chạy hoàn toàn trên GPU của chính bạn qua WebGPU — không có đoạn văn bản nào bạn dán vào được gửi đi đâu cả. Đây là nó hoạt động thế nào, nghe ra sao, và vẫn còn thiếu gì cho tiếng Việt.

Supertonic HD là gì

Supertonic HD là giọng đọc nơ-ron miễn phí dựa trên Supertonic 3, một mô hình mã nguồn mở do Supertone Inc. phát hành. Nó chạy trong trình duyệt qua WebGPU và onnxruntime-web — cùng cơ chế "chạy trên máy bạn, không phải máy chủ của chúng tôi" mà Quick TTS đã dùng cho Kokoro. Đây là bộ máy chất lượng cao nhất chúng tôi cung cấp: đầu ra 44kHz, so với 24kHz của Kokoro — khác biệt giữa "rõ ràng là giọng máy nhưng dễ nghe" và âm thanh gần với một bản lồng tiếng chuyên nghiệp.

Nó gia nhập cùng Browser TTS (giọng có sẵn của hệ điều hành), Piper (nhỏ gọn, WASM, chạy được ở hầu hết mọi nơi) và Kokoro (WebGPU, chỉ tiếng Anh) thành lựa chọn thứ tư trong danh sách bộ máy — không thay thế bất kỳ cái nào. Với tiếng Việt cụ thể, đây là bộ máy nơ-ron thứ hai thực sự tồn tại: Kokoro hiện chưa hỗ trợ tiếng Việt, nên trước Supertonic, Piper là lựa chọn nơ-ron duy nhất.

Chạy mà không cần máy chủ

Mô hình được tải về một lần — khoảng 380MB, lấy trực tiếp từ Hugging Face — rồi được trình duyệt lưu cache. Từ đó trở đi, việc tổng hợp giọng nói diễn ra hoàn toàn trên GPU của bạn. Không văn bản nào bạn dán, tải lên, hay tạo giọng đọc từ đó rời khỏi thiết bị — không có yêu cầu nào để ghi log, vì đơn giản là không có máy chủ nào tham gia vào quá trình này.

Mười giọng, không nhân bản

Supertonic đi kèm mười giọng có sẵn — năm nam (M1–M5) và năm nữ (F1–F5) — chọn được từ cùng bộ chọn giọng như Kokoro và Piper. Không có tính năng nhân bản giọng, không có cách tải lên mẫu tham chiếu; bạn có gì thì dùng nấy trong mô hình. Nếu tính nhất quán của một nhân vật xuyên suốt một dự án dài quan trọng hơn độ trung thực thô, đây là một giới hạn thật sự cần biết trước.

Chế độ Tự động ngôn ngữ: một giọng, văn bản đa ngôn ngữ

Tính năng không tồn tại ở bất kỳ đâu khác trong Quick TTS: nút chuyển "Tự động ngôn ngữ (văn bản trộn)". Bật nó lên, Supertonic đọc một tài liệu đổi ngôn ngữ giữa chừng một đoạn — bài viết tiếng Việt trích dẫn một câu tiếng Anh, ghi chú công việc lẫn thuật ngữ kỹ thuật tiếng Anh — phát âm đúng từng phần mà bạn không cần đánh dấu gì cả. Mọi bộ máy khác chúng tôi cung cấp đều giả định một ngôn ngữ cho mỗi lượt đọc; cái này thì thực sự không quan tâm ranh giới ngôn ngữ nằm ở đâu.

Đây là trường hợp dùng khá hẹp, nhưng với ai đọc ghi chú song ngữ, tài liệu học tiếng Anh xen tiếng Việt, hay bài đăng mạng xã hội pha trộn ngôn ngữ, đây là điều duy nhất trên trang này mà không công cụ miễn phí nào khác làm được.

Tốc độ: chất lượng HD không phải chờ lâu

Đánh đổi mà bạn nghĩ sẽ đi kèm âm thanh chất lượng cao hơn là tạo giọng chậm hơn, và điều đó không thực sự đúng ở đây. Trên máy hỗ trợ WebGPU, chúng tôi đo được hệ số thời gian thực (real-time factor) khoảng 0,02–0,07 — trong một lần thử, một đoạn văn bản dài tương đương 13 phút sách nói được tạo ra trong khoảng 13 giây. Việc phát lại bắt đầu trong chưa đầy một giây, và tài liệu dài được chia nhỏ và xử lý song song giống hệt cách Kokoro làm, nên đọc cả một chương không có nghĩa là phải chờ cả chương trước khi nghe được gì.

Tiếng Việt trong 15 ngôn ngữ hỗ trợ

Supertonic HD có mặt trong 15 ngôn ngữ trên Quick TTS: tiếng Anh, Tây Ban Nha, Pháp, Đức, Bồ Đào Nha, Ý, Nga, Ba Lan, Hà Lan, Thổ Nhĩ Kỳ, Ả Rập, Việt Nam, Hindi, Nhật và Hàn. Với tiếng Việt cụ thể, trước Supertonic bạn đã có giọng hệ thống (Linh trên Windows, An trên macOS/iOS), giọng cloud Edge Online chất lượng cao (HoaiMy, NamMinh — cần internet, văn bản gửi lên máy chủ Microsoft), và giọng nơ-ron Piper chạy offline. Supertonic không thay thế những lựa chọn đó — nó thêm một tầng chất lượng HD, chạy cục bộ sau lần tải đầu, cho ai muốn âm thanh gần với thu âm phòng thu hơn giọng WASM của Piper.

Nó xử lý mọi định dạng tệp và quy trình làm việc như phần còn lại của trang — PDF, DOCX, EPUB, phát theo từng đoạn cho tài liệu dài, và tải xuống WAV/MP3, kèm xuất ZIP cho văn bản rất dài.

Giới hạn

Danh sách thành thật, không phải bản quảng cáo:

Về giấy phép, dành cho ai muốn xây dựng dựa trên nó: mã suy luận theo giấy phép MIT (chuyển thể từ mã mẫu của Supertone), còn trọng số mô hình theo giấy phép OpenRAIL-M — một giấy phép riêng, hạn chế hơn MIT, có kèm các điều kiện sử dụng. Chúng tôi công bố toàn văn tại /licenses/supertonic-openrail-m.txt, và trang Điều khoản của chúng tôi nói rõ về việc sử dụng hợp lệ nếu bạn tạo âm thanh để phân phối lại.

Tự trải nghiệm

Mở Quick TTS trên máy tính để bàn dùng Chrome hoặc Edge, chuyển danh sách bộ máy sang Supertonic HD, rồi dán bất kỳ văn bản nào vào. Lần tải ~380MB đầu tiên chỉ diễn ra một lần; sau đó nó được cache và hoạt động được cả khi ngoại tuyến, giống Kokoro. Nếu trình duyệt hoặc thiết bị của bạn không hỗ trợ WebGPU, danh sách đơn giản là sẽ không hiện tùy chọn này — Piper và Browser TTS vẫn hoạt động y như hôm qua.

Để hiểu sâu hơn về kỹ thuật đằng sau các bộ máy giọng nói của Quick TTS, bản gốc tiếng Anh HD Text-to-Speech in Your Browser có thêm chi tiết về phương pháp đo tốc độ và benchmark.