تحويل النص إلى كلام HD مجانًا في المتصفح — بدون سحابة

نُشر في

أضاف Quick TTS محرك صوت ذكاء اصطناعي ثالثًا: Supertonic HD. جودته استوديو حقيقية، بصوت 44kHz، ويعمل بالكامل على بطاقة الرسومات الخاصة بجهازك عبر WebGPU — أي نص تلصقه لا يُرسل إلى أي مكان. إليك ما هو، وكيف يبدو صوته، وأين لا يزال قاصرًا.

ما هو Supertonic HD

Supertonic HD صوت ذكاء اصطناعي مجاني لتحويل النص إلى كلام، مبني على Supertonic 3، وهو نموذج مفتوح الأوزان أصدرته Supertone Inc. يعمل في المتصفح عبر WebGPU وonnxruntime-web، وهو نفس نموذج "يعمل على جهازك، لا على خوادمنا" الذي يستخدمه Quick TTS بالفعل مع Kokoro. إنه المحرك الأعلى جودة لدينا: إخراج بـ44kHz مقابل 24kHz في Kokoro، وهو الفرق بين صوت "اصطناعي بوضوح لكنه لطيف" وصوت أقرب إلى تعليق صوتي احترافي.

ينضم Supertonic إلى Web Speech (أصوات نظام التشغيل المدمجة)، وPiper (صغير، WASM، يعمل في كل مكان)، وKokoro (WebGPU، الإنجليزية فقط) كخيار رابع في قائمة المحركات — وليس بديلًا لأي منها. للحصول على تفصيل صادق حول متى تختار كل محرك، مقالنا Web Speech vs Piper vs Kokoro (EN) لا يزال صالحًا: يتفوق Supertonic على Kokoro في الجودة ويقل عنه في توافق الأجهزة.

كيف يعمل بدون خادم

يُنزَّل النموذج مرة واحدة فقط — نحو 380 ميغابايت، مباشرة من Hugging Face — ثم يخزّنه المتصفح مؤقتًا. من تلك اللحظة، تتم عملية التوليد بالكامل على بطاقة الرسومات لديك. أي نص تلصقه أو ترفعه أو تولّد منه صوتًا لا يغادر جهازك أبدًا؛ ولا يوجد طلب يُسجَّل لأنه لا يوجد خادم في السلسلة أصلًا.

عشرة أصوات، بلا استنساخ

يقدّم Supertonic عشرة أصوات جاهزة — خمسة ذكور (M1–M5) وخمسة إناث (F1–F5) — يمكن اختيارها من نفس قائمة الأصوات المستخدمة في Kokoro وPiper. لا يوجد استنساخ للصوت ولا طريقة لرفع عيّنة مرجعية: ما تحصل عليه هو ما هو موجود في النموذج فقط. إذا كان ثبات هوية الصوت عبر مشروع طويل أهم لديك من أعلى دقة ممكنة، فهذا قيد حقيقي يستحق معرفته مسبقًا.

اللغة التلقائية: صوت واحد، نص متعدد اللغات

الميزة التي لا توجد في أي مكان آخر في Quick TTS: مفتاح "Auto language (mixed text)" أي اللغة التلقائية للنصوص المختلطة. فعِّله، وسيقرأ Supertonic مستندًا يبدّل اللغة في منتصف الفقرة — مقال عربي يتضمن اقتباسًا إنجليزيًا، أو رسالة بريد إلكتروني تحتوي اسم منتج أجنبي — وينطق كل جزء بشكل صحيح دون أن تضع أي علامات بنفسك. كل محرك آخر نقدّمه يفترض لغة واحدة لكل قراءة؛ هذا المحرك وحده لا يهتم حقًا أين تقع حدود اللغة.

إنه استخدام محدود النطاق، لكن لمن يقرأ بصوت عالٍ ملاحظات متعددة اللغات، أو مواد دراسية ثنائية اللغة، أو منشورات تتبدل فيها اللغة داخل الجملة الواحدة، فهذا هو الشيء الوحيد في هذه الصفحة الذي لا تقدّمه أي أداة مجانية منافسة.

السرعة: جودة HD بلا انتظار

المقايضة المتوقعة مقابل صوت أعلى جودة هي توليد أبطأ، وهذا غير صحيح إلى حد كبير هنا. على جهاز يدعم WebGPU قسنا معامل زمن حقيقي (RTF) يتراوح تقريبًا بين 0.02 و0.07 — وفي أحد الاختبارات، تم توليد مقطع نص بطول كتاب صوتي مدته 13 دقيقة في نحو 13 ثانية فقط. يبدأ التشغيل نفسه في أقل من ثانية بكثير، وتُقسَّم المستندات الطويلة وتُعالَج على التوالي (pipelined) بنفس طريقة Kokoro، لذا فصل كامل لا يعني انتظار الفصل كاملًا قبل أن تسمع أي شيء.

العربية ضمن 15 لغة

Supertonic HD متوفر في Quick TTS بـ15 لغة: الإنجليزية والإسبانية والفرنسية والألمانية والبرتغالية والإيطالية والروسية والبولندية والهولندية والتركية والعربية والفيتنامية والهندية واليابانية والكورية. العربية ضمن هذه القائمة: نموذج Kokoro-82M لا يدعم العربية إطلاقًا، لذا كان Piper حتى الآن الخيار الوحيد للتحويل العصبي إلى كلام دون اتصال. Supertonic HD هو أول محرك بمستوى HD يتحدث العربية في Quick TTS.

يدعم نفس صيغ الملفات وسير العمل المتوفرة في باقي الموقع: PDF وDOCX وEPUB، وتشغيل المستندات الطويلة على أجزاء متتابعة، وتنزيل الصوت بصيغة WAV/MP3، مع تصدير إلى ZIP للنصوص الطويلة جدًا. اللغة الوحيدة التي لا يغطيها هي الصينية؛ ولهذه اللغة يبقى صوت huayan في Piper هو الخيار العصبي المتاح.

القيود

القائمة الصادقة، لا القائمة التسويقية:

بخصوص التراخيص، لمن يريد البناء على هذا: كود الاستدلال مرخّص بموجب MIT (منقول من الكود التوضيحي لشركة Supertone)، بينما أوزان النموذج مرخّصة بموجب OpenRAIL-M — وهو ترخيص منفصل وأكثر تقييدًا يتضمن قيودًا على الاستخدام. ننشر النص الكامل على /licenses/supertonic-openrail-m.txt، وصفحة الشروط لدينا توضح الاستخدام المسموح به إذا كنت تولّد صوتًا لإعادة التوزيع.

جرّبه بنفسك

افتح Quick TTS على حاسوب مكتبي بمتصفح Chrome أو Edge، بدّل قائمة المحركات إلى Supertonic HD، والصق أي نص. يحدث التنزيل الأول البالغ نحو 380 ميغابايت مرة واحدة فقط؛ بعدها يُخزَّن مؤقتًا ويعمل دون اتصال بالإنترنت مثل Kokoro تمامًا. إذا كان متصفحك أو جهازك لا يدعم WebGPU، فببساطة لن تقترحه القائمة كخيار — وسيستمر Piper وWeb Speech في العمل تمامًا كما كانا بالأمس.