مادة تحريرية
شرح

Mixture of Experts: لماذا لا تستخدم بعض النماذج كل المعاملات في كل Token؟

نماذج Mixture of Experts تستخدم router لاختيار مجموعة فرعية من الخبراء لكل token، ما يسمح بسعة كبيرة مع تكلفة حسابية أقل من تشغيل كل المعاملات دائمًا.

الإجابة السريعة

نماذج Mixture of Experts تستخدم router لاختيار مجموعة فرعية من الخبراء لكل token، ما يسمح بسعة كبيرة مع تكلفة حسابية أقل من تشغيل كل المعاملات دائمًا.

  • MoE تجمع عدة expert networks مع آلية routing.
  • Sparse activation تعني أن جزءًا من الخبراء فقط يعمل لكل token.
  • التحديات تشمل موازنة الحمل والاتصال بين الأجهزة واستقرار التدريب.

السعة ليست نفس تكلفة التنفيذ

يمكن أن يحتوي النموذج على عدد كبير من المعاملات إجمالًا، بينما يستخدم جزءًا منها فقط لكل خطوة، لذلك يجب التفريق بين total parameters وactive parameters.

لماذا البنية أصعب تشغيليًا؟

إذا اختار router نفس الخبراء بكثرة تظهر مشكلة imbalance، كما أن توزيع experts على accelerators يجعل حركة البيانات والتواصل جزءًا مهمًا من الأداء.

بعد هذه المادة

تابع القراءة

من نفس القسم04
  1. 02
  2. 03
  3. 04
اختيار القراء

الأكثر قراءة

الترتيب الكامل
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
يتجدد مع النشر

أحدث المواد

  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
شارك رأيك

التعليقات

0

كن أول من يكتب تعليقًا.