
Nunchaku Lite يجلب تكميم 4 بت إلى Diffusers
يدعم Diffusers تحميل نقاط Nunchaku Lite المكممة مباشرة؛ الوفر المعلن في الذاكرة والسرعة يعتمد على العتاد والنموذج والإعداد.
أضاف Diffusers مسارًا أصليًا لتحميل نقاط Nunchaku Lite المكممة، ما يسمح باستخدام نموذج مهيأ مسبقًا عبر from_pretrained بدل بناء مسار استدلال منفصل. يعتمد Nunchaku على SVDQuant لتشغيل أجزاء رئيسية من محول الانتشار بأوزان وتنشيطات 4 بت، مع فرع منخفض الرتبة للحفاظ على المعلومات الحساسة للتكميم.
وفق اختبار Hugging Face المنشور على RTX PRO 6000، خفض إعداد Nunchaku Lite ذاكرة الذروة من 31.1 إلى 20.6 غيغابايت، وتحسن زمن المسار الكامل من 3.00 إلى 2.27 ثانية. ومع torch.compile وصل الزمن إلى 1.68 ثانية. هذه نتائج لحمل وعتاد محددين، وليست ضمانًا لكل نموذج أو بطاقة.
حدود يجب معرفتها
المسار العام لا يضم كل عمليات الدمج الخاصة بالبنية التي يستخدمها محرك Nunchaku الأصلي، ولذلك قد لا يحقق السرعة نفسها. كما يختلف دعم النواة حسب جيل البطاقة ونوع الدقة؛ يوضح التوثيق أن NVFP4 يستهدف Blackwell، بينما تتوفر مسارات INT4 لأجيال أخرى محددة، ولا تدعم النوى المعروضة كل بطاقات مراكز البيانات.
تنبه وثائق Diffusers أيضًا إلى أن حزمة kernels قد تنزّل شيفرة محسنة من مستودع على Hugging Face Hub، ويتطلب تشغيلها موافقة صريحة. في بيئة الإنتاج يجب تثبيت الإصدارات، ومراجعة مصدر النواة، وعدم تمكين الثقة في شيفرة بعيدة بصورة عمياء.
اختبار اعتماد مناسب
استخدم نموذجك ومطالبات ثابتة وبذورًا متطابقة، ثم قس ذاكرة الذروة والزمن وجودة المخرجات. افصل زمن التحميل عن زمن التوليد، واختبر التشغيل بعد التحديث البارد. راقب أيضًا توافق LoRA والتفريغ إلى المعالج وtorch.compile إذا كانت ضمن المسار الفعلي.
Nunchaku Lite يخفض عتبة تجربة التكميم داخل Diffusers، لكن قرار الإنتاج يحتاج قياسًا على العتاد المستهدف وفحصًا للجودة وسلسلة توريد النوى.
المصادر
- [شرح Nunchaku Lite واختباراته على مدونة Hugging Face](https://huggingface.co/blog/nunchaku-diffusers) - [توثيق Nunchaku Lite في Diffusers](https://huggingface.co/docs/diffusers/main/en/quantization/nunchaku)
تم التعديل


