انتقل إلى المحتوى
أعمال مختارة
004/دراسة الحالة

القارئ بصوت عالٍ

كتب صوتية متعددة الأصوات تُنتج بالكامل على GPU واحد بسعة 12 غيغابايت، بكلفة صفر.

PL.004 · 2026
منجز2026
السنة
2026
الحالة
منجز
الأدوات
Python · FastAPI · IndexTTS2 · Qwen3

المشكلة

إنتاج كتاب صوتي بعدة أصوات يعني إما استوديو وإما خدمة TTS سحابية تحاسبك بالحرف، وكلاهما بعيد عن متناول أكثر من يريده. فكان الشرط أن يعمل المسار كله على جهاز يملكه صاحبه أصلاً.

الجزء الصعب

تشغيل تمييز المتحدثين بنموذج LLM مع استنساخ الصوت العاطفي داخل 12 غيغابايت من VRAM لا يحتمل إبقاء النماذج مقيمة في الذاكرة، فصار كل نموذج يُحمَّل حين يُطلب ويُفرَّغ بعده. ولا شيء يغادر الجهاز: لا فاتورة TTS، ولا نص مفرّغ يبقى على خادم شخص آخر.