
Hugging Face üzerinde herhangi bir açık kaynak model sayfasına girdiğinizde Files sekmesinde onlarca garip uzantılı dosya görürsünüz: llama-3-8b.Q4_K_M.gguf, Q5_K_S.gguf, Q8_0.gguf… Bu kısaltmalar ilk bakışta karmaşık bir şifre gibi gelebilir. Ancak açık kaynak yapay zekânın kalbi tam olarak bu dosyaların içinde atar.
Georgi Gerganov ve llama.cpp topluluğu tarafından geliştirilen GGUF formatı, 100 GB’lık kurumsal modelleri tek bir dosya halinde dizüstü bilgisayarlarımıza sığdıran mühendislik mucizesidir.
GGUF Nedir ve Eski Formatlardan Neden Üstündür?
GGUF (GPT-Generated Unified Format), dil modellerini depolamak ve hızlıca çalıştırmak için tasarlanmış ikili (binary) bir dosya formatıdır:
- Tek Dosya Rahatlığı: Modelin ağırlıkları, tokenleştiricisi (tokenizer), şablonları ve tüm meta verileri tek bir
.ggufdosyasında paketlenir. - Doğrudan Bellek Eşleme (mmap): Model çalıştırılırken RAM’e yavaşça kopyalanmaz; işletim sistemi dosyayı doğrudan hafıza gibi eşler, bu da yükleme süresini saniyelere indirir.
- Esnek Bölünme (CPU + GPU): Modelin örneğin 20 katmanını ekran kartına, kalan 12 katmanını bilgisayarın RAM’ine atayarak hibrit çalıştırabilirsiniz.
Kuantizasyon Seviyeleri ve Doğruluk (Perplexity) Tablosu
Orijinal modeller genellikle FP16 (16-bit kayan nokta) hassasiyetinde eğitilir. Kuantizasyon işlemi, bu devasa 16-bitlik sayıları 8-bit, 5-bit veya 4-bitlik tam sayılara sıkıştırır:
| Kuantizasyon Kodu | Bit Derinliği | Dosya Boyutu Oranı | Zekâ / Doğruluk Kaybı | Kullanım Tavsiyesi |
|---|---|---|---|---|
| FP16 (Orijinal) | 16-bit | %100 (Devasa) | Sıfır (Referans) | Sadece sunucu ve fine-tuning için |
| Q8_0 | 8-bit | ~%55 | Fark Edilemez (<%0.2) | Yeterli VRAM’i olanlar için en iyi kalite |
| Q6_K | 6-bit | ~%42 | İhmal Edilebilir (<%0.5) | Üst düzey muhakeme için mükemmel |
| Q5_K_M | 5-bit | ~%35 | Çok Düşük (<%1) | Hassas kodlama ve matematik işleri |
| Q4_K_M (KRAL) | 4-bit | ~%28 | Minimal (%1 - %2) | Tüm dünyada kabul edilen altın standart |
| Q3_K_M | 3-bit | ~%22 | Hissedilir (%4 - %7) | Sadece VRAM yetmediğinde son çare |
| Q2_K | 2-bit | ~%16 | Yüksek (>%15) | Model halüsinasyon görmeye başlar |
K-Quants (K-Blok Kuantizasyonu) Neden Önemli?
Klasik kuantizasyonda tüm katmanlar düz mantıkla 4-bit’e çekilirdi. Ancak bir yapay zekâ modelindeki her katman eşit öneme sahip değildir; dikkat (attention) katmanları ve çıktı projeksiyonları modelin zekâsını doğrudan belirler.
İşte GGUF’taki “K-Quants” yeniliği burada devreye girer:
Q4_K_Mmodeli, kritik önemdeki dikkat katmanlarını 5 veya 6-bit olarak bırakır, daha az kritik olan ileri besleme katmanlarını 4-bit’e çeker.- Böylece dosya boyutu 4-bit seviyesinde kalırken, modelin zekâsı 5-bit seviyesinde korunur. İsimdeki “M” (Medium) ve “S” (Small) bu dengeyi ifade eder.
Hangi VRAM’e Hangi Model Sığar?
Popüler ekran kartı kapasitelerine göre güvenli seçim rehberi:
- 6 GB - 8 GB VRAM:
- 8B Modeller (
Q4_K_M) -> Mükemmel çalışır (~5.5 GB tüketir).
- 8B Modeller (
- 12 GB VRAM (RTX 3060 / 4070):
- 8B Modeller (
Q8_0) -> Sıfır kayıpla en tepe kalite. - 14B Modeller (
Q4_K_M) -> Tam kapasite sığar.
- 8B Modeller (
- 16 GB VRAM:
- 14B Modeller (
Q5_K_M) veya 8B modellerle 32K devasa bağlam penceresi.
- 14B Modeller (
- 24 GB VRAM (RTX 3090 / 4090):
- 32B Modeller (
Q4_K_M) rahatlıkla sığar.
- 32B Modeller (
Sonuç
Model indirirken kararsız kalıyorsanız kural çok basittir: Her zaman ilk tercihiniz Q4_K_M olmalıdır. Eğer ekran kartınızda fazladan boş yer kalıyorsa Q5_K_M veya Q8_0 sürümüne geçebilirsiniz; ancak Q4_K_M sunduğu hız ve zekâ dengesiyle yerel yapay zekânın tartışmasız lideridir.
Sık sorulan sorular
GGUF nedir?
GGUF, yerel LLM çalıştırma için kullanılan model formatıdır ve farklı kuantizasyon seviyeleri sunar.
Q4 ve Q8 kuantizasyon arasındaki fark nedir?
Q4 kuantizasyonu daha düşük kalite ama daha az VRAM gerektirirken, Q8 daha yüksek kalite sunar ama daha fazla VRAM kullanır.
Dil Modelleri kategorisinden
- 1 Milyon Token Maliyeti Karşılaştırması: OpenAI, Anthropic, Gemini ve DeepSeek (2026 Fiyat Tablosu)
- Alan Turing ve Makine Düşünmesi: Yapay Zekânın Felsefi Doğuşu
- Alibaba'dan Batı'ya Ağır Darbe: 2.4 Trilyon Parametreli Qwen 3.8-Max ve 27B Açık Kaynak Devrimi
- Doğu'dan Gelen Açık Kaynak Fırtınası: Alibaba Qwen 3 Max ile 1 Trilyon Parametreli Frontier Model
- Tüm haberler →



