Doğrudan Tercih Optimizasyonu: Ödül Ağı ve PPO Olmadan Hizalama

656 kelime3 dk okuma

DPO, insan tercihlerinden öğrenilen ayrı bir ödül modelini ve pahalı politika optimizasyonu adımını kaldırıp ödülü politikanın kendi olasılık oranına gömen tek bir sınıflandırma kaybıyla eğitim yapan yöntemdir; Rafailov ve arkadaşlarının Mayıs 2023 tarihli Stanford çalışması IMDB duygu kontrolü ve TL;DR özetlemede PPO tabanlı RLHF’yi yakaladığını ya da geçtiğini bildirdi.

RLHF hattının ağır tarafı

Klasik hizalama üç parçalı bir boru hattı kuruyordu: tercih verisiyle eğitilmiş bir ödül modeli, bu ödülü tahmin eden bir değer ağı ve ödülü maksimize eden bir politika güncellemesi. Her adımda referans modele benzeme cezası hesaplanıyor, üretim çevrimi içinde örnek toplanıyordu.

Bu hat pahalı ve kırılgan: dört modelin aynı anda bellekte durması, hiperparametre avı ve eğitimin orta yerinde çöken kararsızlıklar. Açık ağırlıklı küçük ekipler için asıl engel buydu; sorun teorik değil, işçilik maliyetiydi.

Tek kayba indirgenen formül

DPO’nun gözlemi, ödül maksimizasyonu ile KL cezalı hedefin kapalı biçimde çözülebilmesiydi: optimum politika, ödülün politikanın kendi log-olasılık oranına taşınmasıyla yazılabiliyor. Böylece tercih verisi doğrudan politika kaybına girdi; ayrı bir yargıç ağı ve çevrimi üretim adımı devreden çıktı.

Sonuç, eğitimi bir sınıflandırma problemine çeviren tek bir fonksiyon: seçilen yanıtın referans politikaya göre göreceli olasılığını yükselt, reddedilenin düşür. Kağıt, IMDB duygu kontrolü, soru-cevap ve TL;DR özetlemede PPO tabanlı RLHF ile eşit ya da daha iyi sonuç bildirdi; üstelik çok daha az hareketli parçayla.

Açık modellerde standartlaşması

Yöntemin asıl yayılma nedeni kısayoldan değil maliyetten geldi. Hugging Face’in Zephyr çizgisi, sentetik tercih verisi üzerinde damıtılmış DPO uygulayarak 7 milyar bandında dönemin en iyi sohbet modelini üretti ve küçük ekiplerin de hizalama yapabildiğini gösterdi. Meta ise Llama 3’ün eğitim hattında eleme temelli örnekleme, DPO ve PPO aşamalarından birlikte söz etti.

Açık kaynak kütüphanelerinde DPO tek bir eğitim komutu hâline geldi. Kapalı ağırlıklı devlerin hâlâ çevrimi pekiştirmeli öğrenme kullandığı bir ortamda, açık ekosistemin varsayılan tercih yöntemi bu oldu; 2024–2026 arası yayınların çoğunda hizalama kelimesi DPO ile eşanlamlı kullanılır hâle geldi.

Türevler ve nerede durdukları

Aile hızla dallandı. DeepMind’ın ΨPO çizgisi hem klasik RLHF’nin hem DPO’nun taşıdığı yaklaşımları aşmayı hedefleyen bir çerçeve önerdi. KTO, ikili beğeni/beğenmemezlik verisiyle çalışıp çift yanıt zorunluluğunu kaldırdı ve davranışsal ekonomi temelli bir ağırlıklandırma getirdi. SimPO ise referans modeli tamamen çıkarıp uzunlukla normalize edilmiş ortalama log-olasılığı ödül olarak kullandı.

Bu çeşitliliğin ortak paydası basitlik değil, varsayım avı: kimisi dağılım kaymasını, kimisi etiket formatını, kimisi referans ağı belleğini hedef alıyor. Hangi varyantın hangi görevde üstün olduğu, ölçüm protokolüne duyarlı olmaya devam ediyor.

Sınırları nereye kadar?

En sert eleştiri, DPO’nun tercih kümesinin dışına çıkamaması. Nisan 2024 tarihli kapsamlı karşılaştırma çalışması, özenle ayarlanmış PPO kurulumlarının test edilen tüm görevlerde DPO’yu geçebildiğini ve DPO’nun daha temel sınırları olabildiğini savundu; özellikle eğitim dağılımından uzak bölgelerde politika, veri kümesindeki sıralamayı dışa genellemekte zorlanıyor.

Bir başka gerilim, çevrimi örnekleme ihtiyacı. DPO sabit bir tercih kümesiyle yetindiği için modelin kendi hatalarını göremiyor; bu boşluğu kapatmak için çevrimi DPO, tekrarlı güncellemeler ve kendini üreten tercih verisi çizgileri denendi. Doğrulanabilir ödüllerin yükselişi de tartışmayı “hangi kayıp fonksiyonu” sorusundan “ödül nereden geliyor” sorusuna taşıdı.

  • Ayrı ödül ağı ve PPO adımı tek bir politika kaybına indirgendi
  • Kayıp, seçilen ve reddedilen yanıt arasındaki göreceli log-olasılık farkını büyütür
  • Zephyr ve açık ekosistem DPO’yu varsayılan hizalama yöntemi yaptı
  • ΨPO, KTO ve SimPO farklı varsayımları hedefleyen türevlerdir
  • Sabit tercih kümesi dağılım dışı genellemeyi ve çevrimi öğrenmeyi sınırlıyor

Sık sorulan sorular

DPO gerçekten RLHF’nin yerini mi aldı?

Kısmen. Tercih verisiyle hizalama fikri aynı kaldı, ama uygulama değişti: ayrı bir ödül modeli ve politika optimizasyonu adımı kalktı, yerine tek bir sınıflandırma kaybı geldi. Kapalı sınır modellerde çevrimi PPO hattı hâlâ kullanılıyor; açık ağırlıklı modellerde ise DPO fiilen standart oldu.

Neden bu kadar ucuz?

Çünkü eğitimin her adımında modelden yeni yanıt üretmesi gerekmiyor ve yargıç ile değer ağı bellekte tutulmuyor. Tercih çiftleri önceden hazır; kayıp, doğrudan politikaya uygulanıyor. Bu, dört model yerine iki model — politika ve dondurulmuş referans — demek; SimPO referansı da kaldırdı.

Hangi durumda geride kalıyor?

Tercih kümesinin kapsamadığı yanıtlarda. Sabit veriyle eğitim, modelin kendi ürettiği hataları görmesini engelliyor ve dağılım kayması oluşan bölgelerde sıralama dışa genellenemiyor. 2024’te yayımlanan karşılaştırmalı bir çalışma, iyi ayarlanmış PPO’nun test edilen görevlerin tamamında DPO’yu geçebildiğini bildirdi.

KTO ve SimPO’dan farkı ne?

KTO, tercih çifti yerine ikili beğeni sinyaliyle çalıştığı için daha ucuz veriyle eğitilebiliyor. SimPO ise referans modeli kaldırıp uzunlukla normalize edilmiş ortalama log-olasılığı ödül olarak kullanıyor; böylece bellek ve hesap yükünü daha da azaltıyor. Üçü de aynı tercih-hizalama ailesinin farklı varsayımları.

Kaynakça

  1. Direct Preference Optimization: Your Language Model is Secretly a Reward ModelarXiv
  2. Zephyr: Direct Distillation of LM AlignmentarXiv
  3. A General Theoretical Paradigm to Understand Learning from Human PreferencesarXiv
  4. KTO: Model Alignment as Prospect Theoretic OptimizationarXiv
  5. SimPO: Simple Preference Optimization with a Reference-Free RewardarXiv
  6. Is DPO Superior to PPO for LLM Alignment?arXiv
  7. Introducing Meta Llama 3Meta AI

Bu konuyla ilgili haberler