Mixture of Experts Mimarisi ve Seyrek Yönlendirme
Mixture of Experts, bir yönlendirici ağ aracılığıyla her token için yalnızca az sayıda uzman katmanı seçer; böylece toplam parametre sayısı artarken token başına etkin hesaplama maliyeti yaklaşık sabit kalır.
Temel fikir
Yoğun bir modelde her token, tüm parametrelerden geçirilir. Bu, hesabı pahalı hâle getirir ve kapasite arttıkça maliyeti doğrusal biçimde büyütür.
MoE ise ağı bir dizi uzman ağa böler ve her token için yalnızca birkaç uzmanı seçer. Seçimi yapan küçük bir yönlendirici ağdır.
Neden seyrek?
Parametre sayısı modelin kapasitesini belirler. Ancak hesaplama maliyeti, yalnızca o token için gerçekten kullanılan parametrelerle orantılıdır.
Bu ayrım, toplam parametreleri büyütürken token başına maliyeti büyütmemeyi mümkün kılar. Sonuç, belirli bir hesaplama bütçesiyle daha geniş bir bilgi tabanı kapsayan modellerdir.
Yönlendirme stratejileri
En yaygın strateji, yönlendirici çıktısından en yüksek puanı alan birkaç uzmanı seçmektir. Bu, seyrek bir aktivasyon sağlar.
Yönlendirme sırasında bir kayıp fonksiyonu da eklenir. Bu, uzmanların aşırı yüklenmesini ve bazı uzmanların hiç kullanılmamasını önlemeye çalışır.
Uzmanlaşma meselesi
Uzmanlar kendi çalışma biçimlerine özgü işler üzerinde uzmanlaşır. Ancak bu uzmanlaşmanın keskin ve insan tarafından okunabilir olması beklenmez.
Çoğu modelde uzmanlar dilbilimsel açıdan anlamlı bölünmeler göstermez. Bu, yönlendirmenin bir uzmanlık değil, daha çok bir hesaplama yükü dağıtım mekanizması olduğunu düşündürüyor.
Altyapı zorluğu
Uzmanlar dağıtık sistemlerde farklı cihazlara yerleştirildiğinde, her token için doğru cihaza iletişim gerekir. Bu iletişim, MoEnin kazancını azaltabilir.
Bu nedenle verimli MoE çıkarımı için özel sunucu tasarımı gerekir. Ağ üzerinden uzmanlara dağıtım, bazı kurulumlarda darboğaz hâline gelebilir.
- Yoğun modelde her token tüm parametrelerden geçer
- MoE yalnızca birkaç uzmanı seçerek maliyeti sabit tutar
- Yönlendirici küçük, uzman ağlar büyüktür
- Dağıtık çalışmada ağ trafiği önemli bir darboğaz olabilir
Sık sorulan sorular
MoE neden daha az hesapla daha güçlü?
Çünkü token başına maliyet, toplam parametre sayısı değil o token için seçilen uzmanların parametreleridir. Bu, kapasiteyi artırırken maliyeti büyütmemeyi sağlıyor.
Uzmanlar gerçekten belirli konularda mı uzmanlaşıyor?
Bazı ölçüde, ancak çoğu modelde uzmanlaşma keskin ve insan tarafından yorumlanabilir değil. Yönlendirme, uzmanlıktan çok bir hesaplama yükü dağıtımı işlevi görüyor.
MoEnin en büyük mühendislik sorunu nedir?
Uzmanların farklı cihazlarda çalışması durumunda ağ trafiğinin yönetimi. Bu, özellikle çok düğümlü kurulumlarda hesap kazancını aşındırabiliyor.
Yoğun modellerden ne zaman iyidir?
Parametre sayısı çok büyük ancak hesaplama bütçesi sınırlı olan durumlarda. Ölçeklenebilir kapasite arayan tasarımlarda MoE doğal bir seçimdir.
Kaynakça
Bu konuyla ilgili haberler
- Açık Kaynakta 1 Trilyon Parametre Eşiği: Xiaomi MiMo-V2.6 Serisi Multimodal Zekâyı Yeniden Tanımlıyor
- Apple Vision Pro 2 ve Siri Spatial Tanıtıldı: Çevreyi Anlayan 3 Boyutlu Mekânsal Asistan
- Samsung Galaxy S27 AI Çipli 7B Yerel Modeli Cihaza Gömüyor: Bulut Devri Bitiyor mu?
- Açık Kaynakta Trilyon Parametre Eşiği: Meta Llama 4 Scout, Maverick ve Behemoth ile Çok Modlu MoE Devrimi