Praktický návod na převod textu na řeč
Deset reálných věcí, ve kterých je převod textu na řeč opravdu dobrý — a pár, ve kterých ne. Vše zde funguje s bezplatným nástrojem na této stránce.
1. Korektura vlastního textu
Toto je nejpodceňovanější způsob využití TTS. Když čtete vlastní text potichu, mozek si domýšlí, co jste chtěli napsat. Když ho slyšíte přečtený nahlas, chyby vyplynou okamžitě: zdvojená slova, těžkopádné formulace, věty, které byly v hlavě v pořádku, ale nahlas nedávají smysl.
Postup: dokončete koncept, vložte ho do Quick TTS, stiskněte přehrát a sledujte očima původní dokument. Kdykoli zvuk vysloví něco, co zní divně — i když nedokážete říct proč — zastavte se a podívejte se na tu řádku. V devíti z deseti případů se najde něco k opravě.
Obzvlášť to funguje u delších textů (eseje, motivační dopisy, zprávy, blogové příspěvky), na které jste se dívali tak dlouho, že jste přestali vnímat jednotlivá slova. Deset minut s TTS často odhalí, co hodina tichého čtení přehlédla.
2. Poslech článků při jiné činnosti
Uložili jste si dlouhý článek, ale nikdy nemáte 20 minut v kuse na jeho přečtení? Vložte text (na většině stránek stačí označit vše a zkopírovat), stiskněte přehrát a poslouchejte při vaření, chůzi, řízení nebo mytí nádobí. Užitečný trik je zvýšit rychlost na 1,4× nebo 1,5× — po dni nebo dvou se mozek přizpůsobí a projdete obsah o třetinu rychleji než při tichém čtení.
Stojí za zmínku, že to funguje i pro váš vlastní seznam ke čtení ze služeb jako Instapaper nebo Pocket. Exportujte text článku a máte bezplatnou zvukovou verzi všeho, co jste chtěli přečíst.
3. Učení jazyků (výslovnost)
Když se učíte nový jazyk, přečtení slova vám neřekne nic o tom, jak se vyslovuje. TTS ano. Vložte větu, kterou se učíte, v cílovém jazyce, přepněte hlas na ten, který daný jazyk mluví (rozbalovací nabídka prohlížeče jich obvykle má několik), a poslouchejte.
Můžete to použít i obráceně — napište, jak si myslíte, že by fráze měla znít, poslechněte si to a porovnejte s nahrávkou rodilého mluvčího. Rozdíl mezi oběma vám ukáže, co procvičovat.
Vestavěné hlasy prohlížeče jsou často v cizích jazycích lepší, než by anglicky mluvící uživatelé čekali. Zvlášť Mac a iOS mají silné hlasy pro francouzštinu, španělštinu, němčinu, italštinu a japonštinu. Windows a Android jsou nevyrovnané.
Na počítači s WebGPU se dá dosáhnout lepšího výsledku než u systémových hlasů. Supertonic HD generuje při 44,1 kHz ve 31 jazycích včetně češtiny, což je znatelně lepší model přirozené prozódie než většina vestavěných hlasů OS — a pro češtinu je to jediný neuronový hlas, který zde vůbec je. Piper i Kokoro pro češtinu žádný hlas nemají: Piper v základní katalogu český model neobsahuje a Kokoro-82M je jen pro angličtinu.
4. Studium (převod poznámek na zvuk)
Pro sluchové typy nebo pro každého, kdo dojíždí na hodinu či zkoušku, je vložení studijních poznámek do TTS a jejich zpětný poslech legitimní studijní metoda. Funguje to dobře i na memorování — rytmus nahlas přečteného textu se do hlavy ukládá jinak než tiché čtení.
Kombinujte to s posuvníkem rychlosti: první průchod poslouchejte na 1×, abyste vstřebali látku, pak na 1,5× nebo 1,7× pro rychlá opakování.
5. Přístupnost pro lidi s dyslexií
TTS je opravdu hodnotný nástroj přístupnosti pro lidi s dyslexií. Poslech textu při čtení — nebo místo čtení — obchází krok „dekódování", který dělá tradiční čtení namáhavým. Existuje solidní výzkum ukazující, že to pomáhá jak porozumění textu, tak únavě.
Quick TTS funguje i na mobilu, což je důležité, protože to znamená, že student nebo dospělý s dyslexií si může otevřít webovou stránku, zkopírovat odstavec a nechat si ho přečíst — bez speciálního softwaru, bez registrace, zdarma.
6. Uživatelé se zhoršeným zrakem nebo nevidomí
Plnohodnotné čtečky obrazovky jako NVDA, JAWS nebo VoiceOver jsou výkonnější pro navigaci po celé stránce, ale nástroje jako tento jsou užitečné pro čtení konkrétních úseků textu — e-maily, formuláře, odstavce vložené odjinud — aniž byste museli spouštět celý kontext čtečky obrazovky. Textové pole je označeno pro čtečky obrazovky a tlačítko přehrát oznamuje svou klávesovou zkratku (Ctrl+Enter nebo ⌘+Enter).
7. Procvičování angličtiny jako cizího jazyka
Pro studenty angličtiny je poslech anglického textu čteného nahlas při současném sledování očima jedním z nejrychlejších způsobů, jak zlepšit porozumění. Vložte cokoli — zpravodajský článek, e-mail od kolegy, stránku na Wikipedii na téma, které vás zajímá — a poslouchejte při rychlosti, která vám vyhovuje. Pro nejpřirozenější výslovnost a rytmus zkuste možnost AI hlasu.
8. Nahrávání provizorního komentáře k videím nebo prezentacím
Pokud tvoříte krátké vysvětlující video, ukázku produktu nebo prezentaci a nechcete nahrávat vlastní hlas, TTS vám dá provizorního (a v případě AI hlasu často dostatečně dobrého finálního) vypravěče. Nahrajte obrazovku, zatímco zvuk hraje, a synchronizujte ho s videem.
Upozornění: komerční užití je povolené na každém enginu, ale licenční podmínky se liší podle enginu — na „AI hlas" jako celek neexistuje jedna odpověď. Vestavěné hlasy prohlížeče se řídí podmínkami systémových hlasů Microsoftu, Applu a Googlu. Piperovy hlasy LibriTTS-R a VCTK jsou CC-BY 4.0 (vyžadují uvedení autorství), Joe je CC0. Kokoro HQ je Apache 2.0. Supertonic HD je výjimkou — jeho váhy jsou pod licencí BigScience OpenRAIL-M, která není permisivní: komerční užití je povolené a na vygenerovaný zvuk se nenárokují žádná práva, ale přidává omezení užití, která musíte dodržet a předat dál každému, s kým model nebo jeho výstup sdílíte. Kód pro inferenci je MIT. Úplný přehled podle jednotlivých enginů je ve FAQ.
9. Čtení pohádky na dobrou noc dítěti, když nemáte hlas
Nemocný den, ztracený hlas, ale spát se přece jde. Vložte kapitolu knihy a stiskněte přehrát. Není to jako skutečné čtení, ale je to mnohem lepší než nic. Možnost AI hlasu na to zní překvapivě vřele.
10. Poslech e-knih (EPUB)
Přetáhněte soubor EPUB do textového pole a celá kniha se zpracuje přímo v prohlížeči, ve správném pořadí čtení, bez nutnosti obcházet DRM u běžných e-knih bez DRM, které už vlastníte. Standard Ebooks, Project Gutenberg a většina nezávislých vydavatelů nabízí obyčejné soubory EPUB, které fungují přímo. Calibre umí exportovat EPUB bez DRM i z knih koupených jinde.
Toto je nejbližší věc bezplatné audioknize pro jakoukoli e-knihu bez DRM, kterou vlastníte. Zejména hlas Supertonic HD zní dostatečně blízko skutečnému vypravěči na to, aby obstál i při čtení pro zábavu, ne jen jako pomůcka — generuje při 44,1 kHz a je tou volbou pro dlouhou knihu, na jazycích, které pokrývá. E-kniha v rozsahu románu se na moderním notebooku zpracuje během pár vteřin a pak přehrávání začne okamžitě, zatímco zbytek se generuje na pozadí.
Totéž platí pro PDF učebnice, DOCX rukopisy a ODT dokumenty — všechny se zpracovávají lokálně, bez nahrávání na server, bez potřeby konverzní služby. Naskenované PDF stránky Quick TTS umí přečíst i díky vestavěnému OCR, které rozpozná text přímo v prohlížeči.
V čem TTS (zatím) není dobré
- Emoční nuance. AI hlas je před tradičním TTS na míle napřed, ale dialogy stále čte plošeji než člověk. U audioknih beletrie s velkým podílem dialogů profesionální vypravěč stále vítězí.
- Vlastní jména a neobvyklá slova. Jakýkoli TTS engine občas špatně vysloví název firmy, technický termín nebo méně běžné slovo. Pokud záleží na přesnosti, projděte si je před přehráním.
- Kód, vzorce a strukturovaná data. Vložení bloku kódu vytvoří nesmysl. TTS čte interpunkci jako „tečka" a „čárka", což je občas užitečné (při korektuře), ale obvykle to není to, co chcete.
- Velmi dlouhý zvuk v jednom kuse. Můžete vložit dokument o 100 000 slovech a nástroj ho přečte celý, ale poslech celého románu bez přerušení je pro zvukovou pipeline prohlížeče velký nápor. Lepší je vkládat text po kapitolách.
Poznámky k prohlížečům a zařízením
Výchozí hlas používá vestavěný hlasový engine prohlížeče, takže dostupné hlasy závisí na vašem OS.
- Windows: klasický hlas Jakub je součástí Windows už roky. V Edgi navíc najdete kvalitnější Online neuronové hlasy Vlasta a Antonín — ty zní výrazně přirozeněji.
- macOS / iOS: výchozí hlas je Zuzana. V Předvolbách systému → Přístupnost → Mluvený obsah → Systémový hlas najdete i vylepšenou verzi ke stažení.
- Android: výchozím enginem je Google TTS s českým hlasem. Doplňkové hlasy lze nainstalovat v nastavení systému — viz odkaz „Změnit hlas" na hlavní stránce, když jste na zařízení s Androidem.
Rozbalovací nabídka AI hlasu obsahuje neuronové enginy, a které se zobrazí, závisí na zařízení a jazyce stránky:
- Piper — běží ve WebAssembly, takže funguje v jakémkoli moderním prohlížeči včetně telefonů, ale český hlas nenabízí, takže se na této stránce nezobrazuje.
- Supertonic HD — jediný neuronový hlas pro češtinu, 44,1 kHz, nejvyšší kvalita, kterou nabízíme. Vyžaduje počítačový Chrome nebo Edge s WebGPU. Jednorázové stažení ~380MB.
- Kokoro HQ — jen pro angličtinu, takže se na české stránce nezobrazuje vůbec.
Supertonic HD běží celý v prohlížeči a po prvním stažení funguje dál offline. Na notebooku s novější integrovanou GPU nebo lepší běží generování přes WebGPU téměř v reálném čase.
Proč je to zdarma
Quick TTS vydělává na zobrazované reklamě. Neexistuje placená úroveň, žádné prémiové hlasy, žádné limity znaků. Pokud vám reklamy vadí, blokovač reklam v prohlížeči je legitimní řešení — raději ať nástroj používáte, než abyste ho nepoužívali. Více na stránce O nás.