
Bir yapay zekâ modelini laboratuvar ortamında tek bir istemle çalıştırmak kolaydır. Ancak o modeli canlıya alıp aynı anda binlerce kullanıcının sorgu gönderdiği bir web veya mobil uygulamaya bağladığınızda felaket başlar: Sunucular kilitlenir, bellek yetersiz uyarısı verir ve yanıt süreleri dakikaları bulur.
İşte UC Berkeley araştırmacılarının 2023’te tanıttığı ve 2026’da tüm kurumsal yapay zekâ veri merkezlerinin fiili standardı haline gelen vLLM, bu üretim krizini çözen sihirli anahtardır.
Klasik Çıkarım Sistemlerinin Gizli Katili: Bellek Parçalanması
Büyük dil modelleri her yeni kelimeyi üretirken geçmiş kelimelerin dikkat anahtarlarını ve değerlerini (Key-Value Cache) bellekte saklamak zorundadır.
Geleneksel çıkarım kütüphanelerinde (Hugging Face Transformers vb.) iki büyük felaket yaşanırdı:
- İçsel Parçalanma (Internal Fragmentation): Sistem kullanıcının ne kadar uzun yazacağını bilemediği için peşinen örneğin 4096 tokenlik boş yer ayırırdı. Kullanıcı 100 token yazıp durduğunda, ayrılan belleğin %95’i tamamen çöpe giderdi.
- Bitişik Bellek Zorunluluğu: Hafızanın tek parça halinde rezerve edilmesi gerektiğinden, toplamda boş yer olsa bile yan yana yeterli blok bulunamadığı için yeni istekler sıraya alınıp bekletilirdi.
Sonuç: Çok pahalı H100 veya A100 GPU’larının belleğinin %60 ile %80’i hiçbir iş yapmadan boş yere bloke edilirdi.
Devrim: PagedAttention Mimarisi Nasıl Çalışır?
vLLM’in dahi mimarları bu sorunu çözmek için bilgisayar bilimlerinin 50 yıllık temel kavramına geri döndü: İşletim Sistemlerindeki Sanal Bellek Sayfalaması (Virtual Memory Paging).
PagedAttention sayesinde:
- KV önbelleği bellekte bitişik tutulmak zorunda değildir.
- Bellek, 16 veya 32 tokenlik küçük “Sayfalara (Pages)” bölünür.
- Tıpkı işletim sisteminin RAM’i yönettiği gibi bir Sayfa Tablosu (Page Table) tutulur.
- Yeni token üretildikçe boş olan herhangi bir küçük sayfa tahsis edilir.
- Sonuç: Bellek israfı neredeyse %0’a iner!
Performans Karşılaştırması: Neden 10 Kat Daha Hızlı?
Aynı sunucuda (1x Nvidia H100 GPU) Llama 3 70B modeliyle yapılan stres testleri:
| Metrik | Hugging Face TGI | Klasik vLLM Öncesi | Modern vLLM Motoru |
|---|---|---|---|
| Bellek İsrafı Oranı | %60 - %75 | %70 - %85 | <%3 (Neredeyse Sıfır) |
| Saniyedeki Token Çıktısı | ~220 token/sn | ~180 token/sn | 2.400+ token/sn (10X+ Hızlı) |
| Aynı Anda Hizmet Verilen Kullanıcı | 12 Eşzamanlı İstek | 8 Eşzamanlı İstek | 95+ Eşzamanlı İstek |
| Gruplama Yöntemi | Statik Batching | Statik Batching | Sürekli Gruplama (Continuous Batching) |
Sürekli Gruplama (Continuous Batching) Nedir?
Klasik sistemlerde 10 kişilik bir grup oluşturulur ve en uzun yanıtı isteyen kullanıcı işini bitirene kadar diğer 9 kişi bekletilirdi.
vLLM’in Sürekli Gruplama mimarisinde ise işlem iterasyon seviyesindedir:
- Kısa cevabı biten kullanıcının yeri anında boşaltılır ve bekleme kuyruğundaki yeni kullanıcının isteği o milisaniyede havuza dahil edilir.
- GPU hiçbir zaman bir saniyenin binde biri kadar bile boş kalmaz.
Üretimde vLLM Kurulumu: Tek Komutla Canlı API
Docker ile vLLM ayağa kaldırmak inanılmaz derecede basittir:
python3 -m vllm.entrypoints.openai.api_server --model meta-llama/Meta-Llama-3.1-8B-Instruct --port 8000 --max-model-len 8192
Bu komut çalıştığı anda yerel sunucunuzda OpenAI SDK’sı ile doğrudan konuşabilen endüstri standardı bir API servisi başlar.
Sonuç
Yapay zekâ projelerini prototipten milyonlarca kullanıcılı gerçek bir ürüne dönüştürmenin yolu vLLM’den geçer. Bellek yönetimindeki bu devrim, şirketlerin GPU sunucu maliyetlerini onda birine düşürürken kullanıcı deneyimini ışık hızına taşımaktadır.
Sık sorulan sorular
vLLM nedir?
vLLM, üretim ortamında çıkarım hızını 10 kat artıran açık kaynak bir çıkarım motorudur.
vLLM nasıl hızlanıyor?
vLLM, PagedAttention tekniğini kullanarak bellek yönetimini optimize ediyor ve çıkarım hızını radikal biçimde artırıyor.




