vLLM Nedir? Üretimde Çıkarım (Inference) Hızı Neden Standart API'lardan 10 Kat Hızlı?

PagedAttention algoritmasıyla KV önbellek israfını sıfırlayan vLLM kütüphanesi; kurumsal sunucularda yüksek eşzamanlı LLM çalıştırmanın teknik sırrı.

vLLM nedir PagedAttention ile üretimde 10 kat hızlı çıkarım mimarisi

Bir yapay zekâ modelini laboratuvar ortamında tek bir istemle çalıştırmak kolaydır. Ancak o modeli canlıya alıp aynı anda binlerce kullanıcının sorgu gönderdiği bir web veya mobil uygulamaya bağladığınızda felaket başlar: Sunucular kilitlenir, bellek yetersiz uyarısı verir ve yanıt süreleri dakikaları bulur.

İşte UC Berkeley araştırmacılarının 2023’te tanıttığı ve 2026’da tüm kurumsal yapay zekâ veri merkezlerinin fiili standardı haline gelen vLLM, bu üretim krizini çözen sihirli anahtardır.


Klasik Çıkarım Sistemlerinin Gizli Katili: Bellek Parçalanması

Büyük dil modelleri her yeni kelimeyi üretirken geçmiş kelimelerin dikkat anahtarlarını ve değerlerini (Key-Value Cache) bellekte saklamak zorundadır.

Geleneksel çıkarım kütüphanelerinde (Hugging Face Transformers vb.) iki büyük felaket yaşanırdı:

  1. İçsel Parçalanma (Internal Fragmentation): Sistem kullanıcının ne kadar uzun yazacağını bilemediği için peşinen örneğin 4096 tokenlik boş yer ayırırdı. Kullanıcı 100 token yazıp durduğunda, ayrılan belleğin %95’i tamamen çöpe giderdi.
  2. Bitişik Bellek Zorunluluğu: Hafızanın tek parça halinde rezerve edilmesi gerektiğinden, toplamda boş yer olsa bile yan yana yeterli blok bulunamadığı için yeni istekler sıraya alınıp bekletilirdi.

Sonuç: Çok pahalı H100 veya A100 GPU’larının belleğinin %60 ile %80’i hiçbir iş yapmadan boş yere bloke edilirdi.


Devrim: PagedAttention Mimarisi Nasıl Çalışır?

vLLM’in dahi mimarları bu sorunu çözmek için bilgisayar bilimlerinin 50 yıllık temel kavramına geri döndü: İşletim Sistemlerindeki Sanal Bellek Sayfalaması (Virtual Memory Paging).

PagedAttention sayesinde:

  • KV önbelleği bellekte bitişik tutulmak zorunda değildir.
  • Bellek, 16 veya 32 tokenlik küçük “Sayfalara (Pages)” bölünür.
  • Tıpkı işletim sisteminin RAM’i yönettiği gibi bir Sayfa Tablosu (Page Table) tutulur.
  • Yeni token üretildikçe boş olan herhangi bir küçük sayfa tahsis edilir.
  • Sonuç: Bellek israfı neredeyse %0’a iner!

Performans Karşılaştırması: Neden 10 Kat Daha Hızlı?

Aynı sunucuda (1x Nvidia H100 GPU) Llama 3 70B modeliyle yapılan stres testleri:

MetrikHugging Face TGIKlasik vLLM ÖncesiModern vLLM Motoru
Bellek İsrafı Oranı%60 - %75%70 - %85<%3 (Neredeyse Sıfır)
Saniyedeki Token Çıktısı~220 token/sn~180 token/sn2.400+ token/sn (10X+ Hızlı)
Aynı Anda Hizmet Verilen Kullanıcı12 Eşzamanlı İstek8 Eşzamanlı İstek95+ Eşzamanlı İstek
Gruplama YöntemiStatik BatchingStatik BatchingSürekli Gruplama (Continuous Batching)

Sürekli Gruplama (Continuous Batching) Nedir?

Klasik sistemlerde 10 kişilik bir grup oluşturulur ve en uzun yanıtı isteyen kullanıcı işini bitirene kadar diğer 9 kişi bekletilirdi.

vLLM’in Sürekli Gruplama mimarisinde ise işlem iterasyon seviyesindedir:

  • Kısa cevabı biten kullanıcının yeri anında boşaltılır ve bekleme kuyruğundaki yeni kullanıcının isteği o milisaniyede havuza dahil edilir.
  • GPU hiçbir zaman bir saniyenin binde biri kadar bile boş kalmaz.

Üretimde vLLM Kurulumu: Tek Komutla Canlı API

Docker ile vLLM ayağa kaldırmak inanılmaz derecede basittir:

python3 -m vllm.entrypoints.openai.api_server     --model meta-llama/Meta-Llama-3.1-8B-Instruct     --port 8000     --max-model-len 8192

Bu komut çalıştığı anda yerel sunucunuzda OpenAI SDK’sı ile doğrudan konuşabilen endüstri standardı bir API servisi başlar.


Sonuç

Yapay zekâ projelerini prototipten milyonlarca kullanıcılı gerçek bir ürüne dönüştürmenin yolu vLLM’den geçer. Bellek yönetimindeki bu devrim, şirketlerin GPU sunucu maliyetlerini onda birine düşürürken kullanıcı deneyimini ışık hızına taşımaktadır.

Sık sorulan sorular

vLLM nedir?

vLLM, üretim ortamında çıkarım hızını 10 kat artıran açık kaynak bir çıkarım motorudur.

vLLM nasıl hızlanıyor?

vLLM, PagedAttention tekniğini kullanarak bellek yönetimini optimize ediyor ve çıkarım hızını radikal biçimde artırıyor.

Altyapı & Veri Merkezleri kategorisinden