مادة تحريرية
شرح

Knowledge Distillation: كيف يتعلم نموذج أصغر من نموذج أكبر؟

Distillation تدرب نموذجًا أصغر Student على تقليد إشارات أو مخرجات نموذج Teacher بهدف خفض تكلفة التشغيل مع الاحتفاظ بجزء من الجودة.

الإجابة السريعة

Distillation تدرب نموذجًا أصغر Student على تقليد إشارات أو مخرجات نموذج Teacher بهدف خفض تكلفة التشغيل مع الاحتفاظ بجزء من الجودة.

  • Knowledge distillation تستخدم مخرجات أو تمثيلات teacher كإشارة تدريب إضافية.
  • النموذج الأصغر قد يكون أسرع وأقل استهلاكًا للذاكرة.
  • النتيجة لا تضمن نقل كل قدرات teacher، لذلك يجب تقييم المهمة المستهدفة.

أكثر من نسخ الإجابة النهائية

يمكن للطالب أن يتعلم من توزيع احتمالات أو logits أو تمثيلات داخلية، ما يعطي إشارة أغنى من label واحد في بعض الإعدادات.

متى تكون الفكرة مناسبة؟

عندما يكون لديك نموذج قوي لكنه مكلف جدًا لخدمة عالية الحجم أو جهاز محدود، يمكن لتقطير نموذج متخصص أن يكون خيارًا اقتصاديًا إذا اجتاز اختبارات الجودة.

بعد هذه المادة

تابع القراءة

من نفس القسم04
  1. 02
  2. 03
  3. 04
اختيار القراء

الأكثر قراءة

الترتيب الكامل
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
يتجدد مع النشر

أحدث المواد

  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
شارك رأيك

التعليقات

0

كن أول من يكتب تعليقًا.