RLVR: Cevabı Otomatik Denetlenen Ödüllerle Eğitilen Akıl Yürütme
RLVR, ödülü insan tercih modellerinden değil otomatik doğrulayıcılardan — kesin cevap eşleşmesi, birim testler, biçim kuralları — alan pekiştirmeli öğrenme yaklaşımıdır; DeepSeek-R1 Ocak 2025’te bunu grup bazlı GRPO ve kural tabanlı ödüllerle üretim ölçeğine taşıdı, ancak Nisan 2025’te yayımlanan bir çalışma yöntemin temel modelin ötesinde yeni akıl yürütme kalıpları üretmediğini, var olan davranışları keskinleştirdiğini savundu.
Tercih modeli neden devreden çıktı?
İnsan gözetimli hizalamada ödül, iki yanıtı sıralayan öğrenilmiş bir tercih modelinden gelir. Bu model kusurludur: uzunluk ve dalkavukluğu aşırı ödüllendirebilir, dolayısıyla model onu sömürmeyi öğrenir.
RLVR bu halkayı ortadan kaldırıyor. Doğru cevap otomatik denetlenebiliyorsa — matematikte nihai sonuç, kodda birim testler, biçimde şablon kuralları — ödülü bir yargıç değil bir program veriyor. Ölçeklemesi ucuz ve tutarlı, ama yalnızca doğru cevabın tanımının mümkün olduğu alanlarda.
GRPO ve R1’in sıçraması
GRPO, Ocak 2025’te üretim ölçeğinde ses getiren eğitimin teknik dayanağıydı ve kökü Şubat 2024 tarihli DeepSeekMath çalışmasına uzanıyor. Yöntem, aynı soru için üretilen bir örnek grubundaki göreli skorları avantaj olarak kullanıyor; böylece klasik pekiştirmeli öğrenmenin pahalı değer ağı devre dışı kalıyor.
DeepSeek-R1 bu iskeleti kural tabanlı doğruluk ve biçim ödülleriyle birleştirdi. Yorumcu ağı ve insan tercih modeli olmadan, yalnızca doğrulanabilir sinyalle eğitilen varyantın uzun zincirler ve kendini düzeltme davranışı geliştirdiğini bildirdi; raporlanan AIME 2024 başarısı %79,8 oldu.
“Yeni yetenek üretmiyor” eleştirisi
Nisan 2025’te yayımlanan ve Kasım 2025’te güncellenen çalışma, pekiştirmeli eğitimin temel modelin ötesine geçip geçmediğini sorguladı. Bulgular arasında yüksek pass@k değerlerinde temel modellerin daha iyi olabilmesi ve kazanımların temel modelin kapsamıyla sınırlı görünmesi yer aldı.
Yazarlar ayrıca bir salıncak etkisinden söz ediyor: bir hata türü bastırılırken başka bir hata türü beliriyor. Bu okumaya göre RLVR yeni bir akıl yürütme kalıbı icat etmiyor, temel modelin zaten üretebildiği davranışların olasılık dağılımını keskinleştiriyor.
Karşı tezler ve kırılgan noktalar
Aynı yıl yayımlanan ProRL çizgisi, eğitimi uzatıp güçlük sırası kurarak sınırın yukarı çekilebildiğini savundu; tavan sabit olmayabilir. Başka bir çalışma ise doğrulanabilir ödülün sonuç doğruysa gerekçeyi de tutarlılaştırdığını ileri sürdü.
Kırılgan nokta doğrulayıcının kendisi. Ödülü veren program sistematik biçimde yanlışsa, pekiştirilen davranış da hatalı oluyor ve bu hata ölçekle birlikte gizli kalabiliyor. Bir başka risk, cevabı doğru olan ama gerekçesi boş uzun zincirler: doğrulanan yalnızca nihai çıktıysa, model gösteriyi öğreniyor.
Neden kritik bir eşik?
RLVR, çıkarım anı ölçeklemesinin ekonomik gerekçesini de üretiyor. Doğrulama ucuzsa eğitimde çok deneme, çalışma anında uzun zincir meşrulaşıyor; “daha fazla düşünce tokenı” ürün özelliğine dönüşüyor.
Ancak yöntemi taşıyabileceği alanlar sınırlı. Hukuki muhakeme, tıbbi karar, yaratıcı yazarlık ve çok adımlı ajan görevlerinde tek bir doğrulayıcıya sığmayan boyutlar var. Bu nedenle tartışma, RLVR’nin işe yarayıp yaramadığından çok nerede ve hangi iddiayla kullanıldığına taşınmış durumda.
- Ödül insan yargısından otomatik doğrulayıcıya devredildi
- GRPO değer ağını kaldırıp grup içi göreli skor kullandı
- R1 kural tabanlı ödüllerle AIME 2024’te %79,8 bildirdi
- Kazanım temel modelle sınırlı olabilir; doğrulayıcı hatası riski var
Sık sorulan sorular
RLVR ile RLHF arasındaki fark nedir?
RLHF ödülü insan tercihlerini öğrenmiş bir modelden alır ve bu model sömürülebilir. RLVR ise ödülü cevap eşleşmesi, birim test veya biçim kuralı gibi programatik bir doğrulayıcıdan alır. Ucuz ve tutarlıdır, ama doğrunun otomatik denetlenebildiği alanlarla sınırlıdır.
GRPO neden tercih ediliyor?
Klasik politika eğitimi, ödülü tahmin eden bir değer ağı gerektirir ve bu bellek ile kararlılık maliyeti demektir. GRPO aynı soru için üretilen örnek grubunun göreli skorlarını avantaj olarak kullanarak değer ağını kaldırıyor; bu, kaba ama ölçeklenebilir bir çözüm.
RLVR yeni akıl yürütme yeteneği kazandırıyor mu?
Tartışmalı. Nisan 2025 tarihli bir çalışma yüksek çoklu deneme skorlarında temel modellerin öne çıkabildiğini ve kazanımların temel modelle sınırlı göründüğünü bildirdi. ProRL gibi karşıt çalışmalar ise uzatılmış eğitim ve güçlük sırasıyla sınırın ileri çekilebildiğini savunuyor.
Hangi görevlerde kullanılamaz?
Doğru cevabın programatik denetlenemediği görevlerde: açık uçlu yazı, muhakeme ve danışmanlık gerektiren kararlar, uzun vadeli ajan hedefleri. Bu alanlarda ödül tasarımı ya yeniden insan yargısına ya da zayıf vekil metriklerle döner.
Kaynakça
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningarXiv
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsarXiv
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?arXiv
- ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language ModelsarXiv
- Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMsarXiv
- Awesome RLVR — Reinforcement Learning with Verifiable RewardsOpenDILab
Bu konuyla ilgili haberler
- Güneş'i Yeryüzünde Şişelemek: CFS ve DeepMind'dan SPARC Reaktöründe Yapay Zekâlı Füzyon Zaferi
- OpenAI'da Güvenlik Alarmı: Pekiştirmeli Öğrenme (RL) Eğitimleri Geçici Olarak Durduruldu
- Öğrenciler Yapay Zekâyı Nasıl Kullanmalı? Ödev Kopyalamaktan Zihinsel Partnere Geçiş Rehberi
- Transformer Makalesi Neyi Anlatıyor? 'Attention Is All You Need' Rehberi