DeepSeek Neden Bu Kadar Ucuz? Mimari, Donanım ve Çıkarım Maliyeti Analizi

DeepSeek’in rakip AGI laboratuvarlarına kıyasla 10 kat daha düşük maliyetle model eğitip sunabilmesinin arkasındaki teknik sır: MLA, DeepSeekMoE, FP8 ve radikal verimlilik mühendisliği.

DeepSeek sunucu altyapısı ve düşük maliyetli yapay zekâ mimarisi
DeepSeek sunucu altyapısı ve düşük maliyetli yapay zekâ mimarisi

Yapay zekâ dünyasında uzun süre hâkim olan ana varsayım şuydu: “En güçlü modeli geliştirmek için yüz milyonlarca dolarlık devasa GPU kümeleşmeleri ve devasa elektrik bütçeleri şarttır.” Ancak Çin merkezli yapay zekâ laboratuvarı DeepSeek, bu ezberi kökten sarstı. Rakip Silikon Vadisi devlerinin 100 milyon doları aşan ön eğitim (pre-training) bütçelerine kıyasla, DeepSeek kendi amiral gemisi modellerini 6 milyon doların altında bir maliyetle eğittiğini duyurdu ve çıkarım (inference) fiyatlarını pazardaki rakiplerin onda birine çekti.

Peki DeepSeek bu radikal maliyet avantajını gerçekten nasıl sağladı? Arkasında gizli bir devlet desteği mi var, yoksa saf matematiksel ve mimari verimlilik mühendisliği mi yatıyor? Bu teknik analizde, DeepSeek’in maliyet mucizesinin arkasındaki mimari sütunları inceliyoruz.

1. Multi-Head Latent Attention (MLA): KV Cache Darboğazını Yıkmak

Büyük dil modellerinde (LLM) uzun bağlam penceresi (context window) işletmenin en büyük maliyet kalemi, ekran kartlarının VRAM hafızasında tutulan Key-Value (KV) Cache miktarıdır. Klasik Transformer mimarilerinde (Multi-Head Attention - MHA) her yeni token üretildikçe KV bellek ihtiyacı doğrusal olarak büyür ve H100/A100 GPU’larının bellek bant genişliğini kilitler.

DeepSeek model maliyet verimliliği karşılaştırması
DeepSeek mimarisinin klasik Transformer modellerine kıyasla sunduğu VRAM ve KV Cache verimliliği.

DeepSeek, bu darboğazı aşmak için Multi-Head Latent Attention (MLA) mimarisini geliştirdi. MLA, Key ve Value matrislerini düşük boyutlu (low-rank) gizli bir uzaya (latent space) sıkıştırır. Böylece:

  • KV Cache boyutunu %90’a varan oranlarda küçültür.
  • Çıkarım anında aynı sunucuda 10 kata kadar daha fazla eşzamanlı kullanıcı isteği (throughput) işlenebilir.
  • Sunucu maliyetleri ve VRAM ihtiyacı radikal seviyede düşer.

2. DeepSeekMoE: İnce Taneli Uzmanlar Ağı (Mixture of Experts)

Standart MoE mimarilerinde (örneğin Mixtral veya GPT-4 benzeri yapılarda) az sayıda büyük “uzman” (expert) katmanı bulunur. DeepSeek ise DeepSeekMoE adı verilen ince taneli (fine-grained) bir uzman mimarisi kullanır.

Geleneksel MoE modellerinde 8 uzmandan 2’si aktif edilirken; DeepSeek modelinde parametreler çok daha küçük 64 veya 128 uzmana bölünür. Her token için bu uzmanlardan örneğin 8’i veya 16’sı seçilir. Ek olarak, her zaman aktif olan Paylaşılan Uzmanlar (Shared Experts) sayesinde genel bilgi birikimi korunur. Bu sayede model 671 milyar toplam parametreye sahip olsa bile, tek bir token yanıtlanırken sadece 37 milyar parametre aktif olur. Bu da işlemciye binen yükü inanılmaz derecede azaltır.

3. FP8 Karma Hassasiyetli Eğitim (FP8 Mixed Precision Training)

Model eğitiminde standart 16-bit (FP16/BF16) hassasiyet yerine 8-bit (FP8) veri formatına geçmek teoride kolay, pratikte ise derece derece taşma (overflow) ve gradyan kararsızlıkları nedeniyle son derece zordur. DeepSeek mühendisleri, donanım seviyesinde özel quantization (nicemleme) algoritmaları ve FP8 veri formatına uygun özel CUDA çekirdekleri geliştirerek ön eğitimin %90’ından fazlasını FP8 ile tamamlamayı başardı.

FP8 kullanımı sayesinde:

  • GPU bellek kullanımı yarı yarıya düştü.
  • GPU’lar arası veri transfer hat bant genişliği ihtiyacı azaldı.
  • Çip başına saniyede yapılan hesaplama sayısı (FLOPS) neredeyse iki katına çıktı.

4. Donanım ve Ağ Optimizasyonu: DualPipe ve PTX Çekirdekleri

ABD’nin Çin’e uyguladığı yüksek performanslı yapay zeka çipi ihracat kısıtlamaları (NVIDIA H100 ve H200 ambargoları), DeepSeek’i mevcut H800 ve yerli alternatif çipleri en yüksek verimle çalıştırmaya zorladı. DeepSeek mühendisleri yüksek seviyeli kütüphanelerle yetinmeyip doğrudan NVIDIA’nın alt seviye montaj dili olan PTX (Parallel Thread Execution) kodları yazdı.

Ayrıca geliştirdikleri DualPipe algoritması sayesinde, hesaplama (computation) ve GPU’lar arası iletişim (communication) adımlarını tam zamanlı olarak örttüler (pipeline parallelism). Bir GPU bir sonraki katmanın matris çarpımını yaparken, aynı anda bir önceki katmanın verilerini ağ üzerinden transfer eder. Sonuç olarak GPU’ların boşta bekleme süresi sıfıra yaklaştırıldı.

5. Çıkarım Ekonomisi ve Gelecek Projeksiyonu

DeepSeek’in sunduğu bu radikal maliyet düşüşü, yapay zekâ pazarında rekabetin yönünü tamamen değiştirdi. Artık sadece “en büyük modeli kim yapacak” sorusu değil, “en uygun maliyetle sürdürülebilir zekâyı kim sunacak” sorusu belirleyici hale geldi.

Maliyetlerin düşmesi, otonom ajanların (agentic AI) 7/24 kesintisiz çalışabilmesinin ve karmaşık kod yazım süreçlerinin çok ucuz fiyatlara çekilmesinin önünü açtı. DeepSeek’in açtığı bu çığır, Silikon Vadisi devlerini de çıkarım optimizasyonuna ve açık kaynak verimlilik tekniklerine yatırım yapmaya zorluyor.

Sık sorulan sorular

DeepSeek modelleri neden diğer AGI laboratuvarlarından çok daha ucuz?

DeepSeek; MLA (Multi-Head Latent Attention) ile VRAM kullanımını %90 düşürür, DeepSeekMoE ile işlemciye binen yükü azaltır, FP8 formatında ön eğitim yapar ve PTX seviyesinde özel GPU optimizasyonları kullanır.

DeepSeek ön eğitimi gerçekten 6 milyon dolara mı tamamlandı?

Evet, DeepSeek yayımladığı teknik raporda 2 bin 048 adet H800 GPU kümesi üzerinde yaklaşık 2 ay süren ön eğitimin toplam donanım maliyetini 5.58 milyon dolar olarak açıklamıştır.

DeepSeek çıkarım (inference) fiyatları ne kadar ucuz?

DeepSeek V3 ve R1 API fiyatları, rakip OpenAI GPT-4o veya Claude 3.5 Sonnet fiyatlarına kıyasla girdi token’larında 10 ila 15 kat, çıktı token’larında ise 20 kat daha düşük fiyatlandırılmıştır.

MLA (Multi-Head Latent Attention) ne işe yarar?

MLA, Key ve Value matrislerini düşük boyutlu gizli bir uzaya sıkıştırarak VRAM’deki KV Cache boyutunu devasa oranda küçültür ve tek bir sunucuda 10 kat daha fazla eşzamanlı istek işlenmesini sağlar.

Yapay Zeka kategorisinden