GGUF Nedir? Hangi Kuantizasyon Seviyesi (Q4, Q8) Hangi VRAM'e Sığar?

Llama.cpp'nin GGUF dosya formatı, kuantizasyon seviyeleri (Q4_K_M, Q5, Q8), doğruluk kaybı analizleri ve VRAM hesaplama formülü.

GGUF formatı kuantizasyon seviyeleri ve VRAM hesaplama rehberi

Hugging Face üzerinde herhangi bir açık kaynak model sayfasına girdiğinizde Files sekmesinde onlarca garip uzantılı dosya görürsünüz: llama-3-8b.Q4_K_M.gguf, Q5_K_S.gguf, Q8_0.gguf… Bu kısaltmalar ilk bakışta karmaşık bir şifre gibi gelebilir. Ancak açık kaynak yapay zekânın kalbi tam olarak bu dosyaların içinde atar.

Georgi Gerganov ve llama.cpp topluluğu tarafından geliştirilen GGUF formatı, 100 GB’lık kurumsal modelleri tek bir dosya halinde dizüstü bilgisayarlarımıza sığdıran mühendislik mucizesidir.


GGUF Nedir ve Eski Formatlardan Neden Üstündür?

GGUF (GPT-Generated Unified Format), dil modellerini depolamak ve hızlıca çalıştırmak için tasarlanmış ikili (binary) bir dosya formatıdır:

  1. Tek Dosya Rahatlığı: Modelin ağırlıkları, tokenleştiricisi (tokenizer), şablonları ve tüm meta verileri tek bir .gguf dosyasında paketlenir.
  2. Doğrudan Bellek Eşleme (mmap): Model çalıştırılırken RAM’e yavaşça kopyalanmaz; işletim sistemi dosyayı doğrudan hafıza gibi eşler, bu da yükleme süresini saniyelere indirir.
  3. Esnek Bölünme (CPU + GPU): Modelin örneğin 20 katmanını ekran kartına, kalan 12 katmanını bilgisayarın RAM’ine atayarak hibrit çalıştırabilirsiniz.

Kuantizasyon Seviyeleri ve Doğruluk (Perplexity) Tablosu

Orijinal modeller genellikle FP16 (16-bit kayan nokta) hassasiyetinde eğitilir. Kuantizasyon işlemi, bu devasa 16-bitlik sayıları 8-bit, 5-bit veya 4-bitlik tam sayılara sıkıştırır:

Kuantizasyon KoduBit DerinliğiDosya Boyutu OranıZekâ / Doğruluk KaybıKullanım Tavsiyesi
FP16 (Orijinal)16-bit%100 (Devasa)Sıfır (Referans)Sadece sunucu ve fine-tuning için
Q8_08-bit~%55Fark Edilemez (<%0.2)Yeterli VRAM’i olanlar için en iyi kalite
Q6_K6-bit~%42İhmal Edilebilir (<%0.5)Üst düzey muhakeme için mükemmel
Q5_K_M5-bit~%35Çok Düşük (<%1)Hassas kodlama ve matematik işleri
Q4_K_M (KRAL)4-bit~%28Minimal (%1 - %2)Tüm dünyada kabul edilen altın standart
Q3_K_M3-bit~%22Hissedilir (%4 - %7)Sadece VRAM yetmediğinde son çare
Q2_K2-bit~%16Yüksek (>%15)Model halüsinasyon görmeye başlar

K-Quants (K-Blok Kuantizasyonu) Neden Önemli?

Klasik kuantizasyonda tüm katmanlar düz mantıkla 4-bit’e çekilirdi. Ancak bir yapay zekâ modelindeki her katman eşit öneme sahip değildir; dikkat (attention) katmanları ve çıktı projeksiyonları modelin zekâsını doğrudan belirler.

İşte GGUF’taki “K-Quants” yeniliği burada devreye girer:

  • Q4_K_M modeli, kritik önemdeki dikkat katmanlarını 5 veya 6-bit olarak bırakır, daha az kritik olan ileri besleme katmanlarını 4-bit’e çeker.
  • Böylece dosya boyutu 4-bit seviyesinde kalırken, modelin zekâsı 5-bit seviyesinde korunur. İsimdeki “M” (Medium) ve “S” (Small) bu dengeyi ifade eder.

Hangi VRAM’e Hangi Model Sığar?

Popüler ekran kartı kapasitelerine göre güvenli seçim rehberi:

  • 6 GB - 8 GB VRAM:
    • 8B Modeller (Q4_K_M) -> Mükemmel çalışır (~5.5 GB tüketir).
  • 12 GB VRAM (RTX 3060 / 4070):
    • 8B Modeller (Q8_0) -> Sıfır kayıpla en tepe kalite.
    • 14B Modeller (Q4_K_M) -> Tam kapasite sığar.
  • 16 GB VRAM:
    • 14B Modeller (Q5_K_M) veya 8B modellerle 32K devasa bağlam penceresi.
  • 24 GB VRAM (RTX 3090 / 4090):
    • 32B Modeller (Q4_K_M) rahatlıkla sığar.

Sonuç

Model indirirken kararsız kalıyorsanız kural çok basittir: Her zaman ilk tercihiniz Q4_K_M olmalıdır. Eğer ekran kartınızda fazladan boş yer kalıyorsa Q5_K_M veya Q8_0 sürümüne geçebilirsiniz; ancak Q4_K_M sunduğu hız ve zekâ dengesiyle yerel yapay zekânın tartışmasız lideridir.

Sık sorulan sorular

GGUF nedir?

GGUF, yerel LLM çalıştırma için kullanılan model formatıdır ve farklı kuantizasyon seviyeleri sunar.

Q4 ve Q8 kuantizasyon arasındaki fark nedir?

Q4 kuantizasyonu daha düşük kalite ama daha az VRAM gerektirirken, Q8 daha yüksek kalite sunar ama daha fazla VRAM kullanır.

Dil Modelleri kategorisinden