Difüzyon LLM’ler: Üretim Sırasını Bırakan Paralel Yazı Üretimi

524 kelime3 dk okuma

Difüzyon dil modelleri yanıtı baştan sona maskelenmiş bir yüzey olarak alıp her adımda birden çok maskeyi eşzamanlı doldurarak üretimi paralelleştiriyor; Google DeepMind’ın deneysel Gemini Diffusion’ı ile Inception Labs’ın Mercury’si bu yolla saniyede binlerce token vaat ederken, kalite ve hizalama tarafında otoregresif modellerin önde olduğu değerlendiriliyor.

Soldan sağa zorunluluğun bedeli

Otoregresif bir model, yanıtı tek tokenlık adımlarla kurar. Adım başına gecikme sabit görünse de toplam süre üretilen token sayısıyla çarpılır; bu, arayüzde gecikmenin ve veri merkezinde maliyetin ana kaynağıdır.

Difüzyon tarafında bu sıralı bağımlılık kaldırılıyor. Model, maskelenmiş bir yanıt yüzeyi üzerinde çalışıyor ve her adımda birçok konuma aynı anda karar verebiliyor. Kazancın kaynağı tek adımda daha fazla token üretmek.

Metinde difüzyon nasıl çalışıyor?

Süreç, yanıtın tüm tokenlarını maske işaretiyle başlatıp adımlar halinde maskeyi “temiz” tokenlarla değiştirmektir. Eğitimde model, maskelenmiş girdiden orijinal tokenı tahmin etmeyi öğrenir; çıkarımda ise hangi konumların önce dolacağı çoğunlukla modelin kendi güvenliğine göre seçilir.

Bu yaklaşımın görüntü difüzyonundan farkı, uzayın ayrık ve sıralı bir sözlük olması. Görsel tarafın matematiğini anlatan komşu maddeyle ayrım burada netleşiyor: söz konusu olan pikseller değil, üretimin sırası.

Açık modeller ve hız iddiaları

2025 boyunca LLaDA ve Dream 7B gibi çalışmalar, 7-8 milyar ölçekte difüzyon dil modellerinin otoregresif akranlarına yaklaşabildiğini gösterdi; Dream’in 2025 yazında yayımlanan raporu bu ölçeğe çıkan ilk büyük difüzyon dil modellerinden biriydi.

Ticari tarafta Inception Labs, Haziran 2025’te Mercury’i duyurdu. Şirket, Nvidia veri merkezi donanımında saniyede binden fazla token ve otoregresif akranlara göre on kata varan üretim hızı bildirdi. Google DeepMind ise 2025 Mayıs’ındaki geliştirici etkinliğinde Gemini Diffusion adlı deneysel metin difüzyon modelini tanıttı ve kod tamamlama senaryolarını öne çıkardı.

Sıra takıntısı neden işe yarıyor?

Paralel üretim yalnızca hız demek değil, farklı kullanım biçimleri de açıyor. Model metnin ortasından yazabildiği için var olan bir dosyada boşluk doldurma, çok noktalı kod düzenleme ve eşzamanlı yeniden yazma görevleri daha doğal hale geliyor.

Ayrıca 2025’in ikinci yarısında yayımlanan analizler, difüzyon dil modellerinin üretime başlamadan önce cevabı “bildiğini” gösterdi. Kararın erken verilmesi, otoregresif modellerdeki düşünce zincirlerinden bağımsız bir akıl yürütme okuma biçimi olarak tartışılıyor.

Hâlâ kapatılmayan farklar

Kalite tarafında tablo eşit değil. Aynı parametre ölçeğinde difüzyon modelleri, otoregresif akranlarının belgeleme, talimat takibi ve uzun bağlam performansına her görevde ulaşamıyor; üretimde de çok adımlı denoising maliyeti ortaya çıkıyor.

Hizalama ve pekiştirmeli öğrenme bu mimari üzerinde daha az sınanmış durumda. Bir diğer pratik engel akışkanlık: kullanıcı yanıtı parça parça görmek istediğinde, paralel doldurmanın kendisi doğal bir sunum sırası taşımıyor.

  • Otoregresif üretimde toplam süre token sayısıyla çarpılır
  • Difüzyon LLM’ler birçok maskeyi aynı adımda doldurur
  • Mercury ve Gemini Diffusion hızı ürün gerekçesi yapıyor
  • LLaDA ve Dream 7B açık ölçek referansları oldu
  • Kalite, hizalama ve akışkanlıkta otoregresif modeller önde

Sık sorulan sorular

Difüzyon dil modeli ile görüntü difüzyonu aynı şey mi?

İkisi de gürültüden/maskeden temizleme fikrini kullanır ama ayrılmış uzay farklı. Görüntüde sürekli pikseller, metinde ayrık sözcük birimleri vardır. Bu madde yalnızca metin üretimini, yani token düzeyinde paralel doldurmayı konu alıyor.

Hız avantajı nereden geliyor?

Model bir adımda birden fazla token üretebildiği için toplam adım sayısı düşüyor. Mercury örneğinde şirket, veri merkezi donanımında saniyede binden fazla token ve otoregresif akranlara karşı on kata varan hız bildiriyor.

Ne için daha uygun?

Boşluk doldurma, var olan kodu çok noktadan yeniden yazma ve tamamlama gibi sırasız görevler. Kod editörleri bu modeli hızlı öneri üretimi için deniyor; tek yönlü uzun metin akışında avantaj daha az belirgin.

Otoregresif modellerin sonu geliyor mu?

Bunu söylemek için erken. 2025 boyunca difüzyon tarafı hızda büyük kazanç gösterdi, ancak kalite, hizalama ve uzun bağlam güvenilirliğinde otoregresif modeller referans olmaya devam ediyor.

Kaynakça

  1. Gemini DiffusionGoogle DeepMind
  2. Gemini Diffusion is our new experimental research modelGoogle
  3. Mercury: Ultra-Fast Language Models Based on DiffusionarXiv
  4. Introducing Mercury, the World’s First Commercial-Scale Diffusion LLMInception Labs
  5. Dream 7B: Diffusion Large Language ModelsarXiv
  6. Diffusion Language Models Know the Answer Before DecodingarXiv

Bu konuyla ilgili haberler