
Yapay zekâ algoritma mühendisliğinde açık kaynak dünyasının öncüsü DeepSeek, büyük dil modellerinin trilyonlarca parametreye ulaşırken karşılaştığı devasa bellek ve çıkarım (inference) maliyeti krizini kökten çözen yeni nesil “Seyrek Uzmanlar Karışımı” (Sparse MoE) ve “Engram Şartlı Bellek” mimarisini duyurdu. Batılı teknoloji devlerinin yüz binlerce Nvidia H100 GPU’suna bağımlı kaldığı bir dönemde; DeepSeek’in geliştirdiği matematiksel optimizasyonlar, açık kaynaklı modellerin süper bilgisayar maliyetlerini onda birine düşürüyor.
Yeni mimari; Multi-Head Latent Attention (MLA), mHC (Manifold-Kısıtlı Hiper-Bağlantılar) ve O(1) sabit süreli Engram bilgi arama katmanlarını bir araya getirerek 1 milyon tokenlik uzun bağlam pencerelerinde rekor çıkarım hızlarına ulaşıyor.
3 Büyük Matematiksel Atılım: Çıkarım Maliyetini Nasıl Düşürdü?
Geleneksel Transformer modellerinde her token üretildiğinde önceki tüm kelimelerin anahtar-değer (KV) matrisleri GPU belleğinde (VRAM) tutulmak zorundaydı. Bu durum uzun metinlerde belleğin tükenmesine ve faturanın katlanmasına yol açıyordu.
DeepSeek mimarisinin getirdiği 3 temel çözüm:
- Multi-Head Latent Attention (MLA): Standart MHA yerine KV önbelleğini düşük boyutlu gizli uzaya (latent space) sıkıştırır. Bellek ayak izini %93 azaltarak aynı GPU üzerinde 10 kat daha fazla eşzamanlı kullanıcıya hizmet verir.
- mHC (Manifold-Constrained Hyper-Connections): Yüz milyarlarca parametreli modellerin eğitimi sırasında ortaya çıkan katastrofik kayıp (loss spike) çökmelerini engelleyen matematiksel kararlılık katmanı.
- Engram Koşullu Bellek: Statik ansiklopedik bilgileri GPU VRAM’inde tutmak yerine ana sunucu belleğinde (RAM) $O(1)$ sürede sorgulanan bir sözlük gibi indeksler.
Trilyon Parametrede Yalnızca 37 Milyar Aktif Parametre
DeepSeek’in seyrek yönlendirme (sparse gating) mekanizması, gelen her sorgu için modelin tüm nöronlarını çalıştırmak yerine; sorunun konusuna göre yalnızca 37 milyar parametrelik uzman alt kümelerini (Expert Layers) uyandırıyor.
Bu sayede kullanıcı bir matematik veya kodlama sorusu sorduğunda model trilyonluk bir AGI derinliğinde muhakeme yaparken, enerji tüketimi ve donanım maliyeti küçük bir 30B model seviyesinde kalıyor.
| Kriter | Standart Yoğun Model (Dense GPT-4o) | DeepSeek Seyrek MoE + MLA Mimarisi |
|---|---|---|
| Aktif Parametre Oranı | %100 (Her Token İçin Tüm Model Çalışır) | ~%10 - %15 (Yalnızca İlgili Uzmanlar) |
| KV-Cache Bellek Yükü | 1 Milyon Token için ~120 GB VRAM | MLA ile 1 Milyon Token için ~8 GB VRAM |
| Eğitim Kararlılığı | Standart Residual Bağlantılar | mHC ile Sıfır Çökme Riski |
| Açık Kaynak Durumu | Tamamen Kapalı Ticari API | Açık Ağırlıklar ve Yayınlanmış Teknik Rapor |
Kısa Özet
- Çıkarım Devrimi: DeepSeek, MLA ve seyrek MoE ile yapay zekâ maliyetlerini 10 kat düşürdü.
- %93 Bellek Tasarrufu: Multi-Head Latent Attention KV önbelleğini sıkıştırarak GPU krizini aştı.
- Engram Bellek: Statik bilgileri GPU yerine ana bellekten O(1) sabit hızda çekiyor.
- Açık Kaynak Gücü: Geliştiriciler trilyonluk modeli uygun fiyatlı sunucularda çalıştırabilecek.
Sonuç
DeepSeek’in mimari yenilikleri, yapay zekâda üstünlüğün sadece devasa sunucu çiftliklerine sahip olmaktan değil, zekice tasarlanmış algoritmik verimlilikten geçtiğini kanıtlıyor. Bu optimizasyonlar, AGI seviyesindeki modellerin her işletme için erişilebilir olmasını sağlıyor.
Sık sorulan sorular
Multi-Head Latent Attention (MLA) ne işe yarar?
KV önbelleğini düşük boyutlu gizli uzaya sıkıştırarak bellek ayak izini %93 azaltır ve tek GPU'da 1 milyon tokenlik bağlam işlemeyi mümkün kılar.
Seyrek MoE yönlendirmesi nasıl çalışır?
Trilyon parametreli bir modelde her sorgu için yalnızca 37 milyar parametrelik uzman katmanları aktive edilerek işlem maliyeti minimumda tutulur.
Engram Şartlı Bellek nedir?
Statik bilgileri GPU VRAM'inde tutmak yerine ana sunucu belleğinden O(1) sabit sürede anlık sorgulayan bir bellek mimarisidir.
mHC katmanı neden önemlidir?
Büyük dil modellerinin eğitimi sırasında meydana gelen katastrofik kayıp (loss spike) çökmelerini engelleyerek eğitim kararlılığı sağlar.
Dil Modelleri kategorisinden
- 1 Milyon Token Maliyeti Karşılaştırması: OpenAI, Anthropic, Gemini ve DeepSeek (2026 Fiyat Tablosu)
- Alan Turing ve Makine Düşünmesi: Yapay Zekânın Felsefi Doğuşu
- Alibaba'dan Batı'ya Ağır Darbe: 2.4 Trilyon Parametreli Qwen 3.8-Max ve 27B Açık Kaynak Devrimi
- Doğu'dan Gelen Açık Kaynak Fırtınası: Alibaba Qwen 3 Max ile 1 Trilyon Parametreli Frontier Model
- Tüm haberler →


