RoPE ve YaRN ile Uzun Bağlam Ölçekleme
RoPE, konumsal bilgiyi frekanslara gömerek uzak konumlar arasındaki benzerliğin bozulmasına yol açar; YaRN, frekansları farklı ölçeklerle çarparak düşük frekanslarda bağlamı uzatırken yüksek frekanslarda yerel çözünürlüğü korur.
Konum bilgisi neden gerekli?
Dikkat mekanizması, varsayılan olarak tokenların sırasını görmez. Aynı kelimeler farklı sıralarda geçtiğinde anlam değişebildiği için konum bilgisinin eklenmesi zorunludur.
Mutlak konum gömme yerine göreli konumları ifade eden yöntemler kullanılabilir. Döndürmeli kodlama bunların en yaygın ve verimli olanıdır.
RoPE nasıl çalışıyor?
RoPE, sorgu ve anahtar vektörlerini konuma bağlı açılarla döndürür. Bu dönüş, farklı konumlardaki tokenlar arasındaki iç çarpımın doğal biçimde göreli mesafeye bağlı olmasını sağlar.
Yöntemin gücü, mevcut dikkat hesabına küçük bir değişiklikle eklenebilmesidir. Ayrı bir konum tablosu veya ek öğrenilen parametre gerekmez.
Uzunluk artınca ne bozulur?
Eğitimde görülmemiş konumlara genellendiğinde model, beklenmeyen benzerlik değerleri üretir. Dikkat dağılımı bozulur ve model uzun bağlamda odağını kaybeder.
Ayrıca eğitilen bağlamın ötesindeki konumlar için iç çarpım değerleri kalibrasyondan çıkabilir. Bu, uzun bağlam performansının hızla bozulmasına yol açar.
YaRN yaklaşımı
YaRN, frekansları farklı ölçeklerle çarparak iki hedefi aynı anda taşımaya çalışır. Yüksek frekanslar yerel çözünürlüğü korumak için değişmezken, düşük frekanslar bağlamı uzatacak şekilde ölçeklenir.
Ayrıca bir dikkat ölçekleme terimi eklenerek, genişletilmiş bağlamda baskın değerlerin büyüklüğü kontrol altına alınır. Bu, eğitilmiş davranışın daha iyi korunmasını sağlar.
Pratikte ne yapılıyor?
Uzun bağlam desteği genellikle ek eğitimle sağlanır: kısa bir devam eğitimi, konum ölçeklemesinin doğru kurulmasını ve modelin yeni bağlam aralığına uyum sağlamasını kolaylaştırıyor.
Bu yaklaşımın sınırı, eğitim maliyetinin artmasıdır. Ancak mimariyi değiştirmeden sağladığı kazanım, birçok modelde tercih edilmesinin temel nedenidir.
- Dikkat, konum bilgisi olmadan sırayı göremez
- RoPE, konumları açısal dönüşle göreli mesafeye bağlar
- Uzak konumlarda iç çarpım kalibrasyondan çıkıyor
- YaRN düşük frekansları ölçekler, yüksekleri korur
Sık sorulan sorular
RoPE neden standart hâle geldi?
Göreli konumları doğrudan ifade eder, ayrı parametre tablosu gerektirmez ve mevcut dikkat hesabına kolayca eklenir. Bu, uzun bağlam için pratik bir çözüm sağlar.
Uzun bağlamda neden performans düşüyor?
Eğitimde görülmemiş konumlarda iç çarpım değerleri kalibre olmaz ve dikkat dağılımı bozulur. Model, uzun bağlamda hangi kısma odaklanacağını kaybeder.
YaRN tam olarak neyi değiştiriyor?
Frekans spektrumunu farklı ölçeklerle çarparak yüksek frekanslarda yerel çözünürlüğü korurken düşük frekanslarda bağlamı uzatır. Ayrıca dikkat ölçekleme terimi ekler.
Bu teknikler ek eğitim gerektiriyor mu?
Genellikle kısa bir devam eğitimi gerekir. Bu eğitim, konum ölçeklemesinin doğru kurulmasını ve modelin genişletilmiş bağlam aralığına uyumunu sağlıyor.
Kaynakça
- RoFormer: Döndürmeli Konumsal KodlamaarXiv
- YaRN: Verimli Bağlam GenişletmearXiv
- Konumsal kodlamaWikipedia
- Transformer mimarisiWikipedia
- Büyük dil modeli bağlam penceresiWikipedia
Bu konuyla ilgili haberler
- Rotary Positional Embedding (RoPE) Nedir, Neden Standart Hale Geldi?
- Transformer'da Positional Encoding Olmasa Ne Olur?
- Airbnb’den Yazılım Dünyasını Sarsan İtiraf: Yeni Kodların Yüzde 60’ını Artık Yapay Zekâ Yazıyor!
- OpenAI’dan Fiyat-Performans Darbesi: Astra İptal Edildi, 5 Kat Ucuz Amiral Gemisi GPT-6.1 Sol Duyuruldu