القارئ بصوت عالٍ
كتب صوتية متعددة الأصوات تُنتج بالكامل على GPU واحد بسعة 12 غيغابايت، بكلفة صفر.
المشكلة
إنتاج كتاب صوتي بعدة أصوات يعني إما استوديو وإما خدمة TTS سحابية تحاسبك بالحرف، وكلاهما بعيد عن متناول أكثر من يريده. فكان الشرط أن يعمل المسار كله على جهاز يملكه صاحبه أصلاً.
الجزء الصعب
تشغيل تمييز المتحدثين بنموذج LLM مع استنساخ الصوت العاطفي داخل 12 غيغابايت من VRAM لا يحتمل إبقاء النماذج مقيمة في الذاكرة، فصار كل نموذج يُحمَّل حين يُطلب ويُفرَّغ بعده. ولا شيء يغادر الجهاز: لا فاتورة TTS، ولا نص مفرّغ يبقى على خادم شخص آخر.
