Cihaz Üzerinde Çok Modlu Devrim: Google DeepMind EmbeddingGemma 2’yi Açık Kaynak Yayınladı

Google DeepMind, uç cihazlarda 191 MB RAM ile çalışan çok modlu vektör gömme modeli EmbeddingGemma 2'yi duyurdu; metin, ses ve görüntü tek uzayda birleşiyor.

Ahşap çalışma masasında duran ve cihaz üzerinde çalışan vektör uzayı projeksiyonu yansıtan akıllı telefon

Bulut sunucularına bağımlı yapay zekâ mimarilerinden uç cihazlarda (edge computing) çalışan gizlilik odaklı sistemlere geçiş hızlanırken, Google DeepMind açık kaynak dünyasında büyük heyecan yaratan yeni modelini duyurdu. Şirket, metin, kod, görsel, video kareleri ve ses verilerini tek bir 768 boyutlu vektör uzayında birleştiren çok modlu gömme (embedding) modeli ‘EmbeddingGemma 2’yi Apache 2.0 lisansıyla genel kullanıma açtı.

Gelişmiş Gemma 4 mimarisinin temel prensipleri üzerine inşa edilen model, toplamda 740 milyon parametrelik kompakt yapısıyla dikkat çekiyor. Akıllı telefonlar, dizüstü bilgisayarlar ve mikro IoT cihazlarında sıfır bulut bağımlılığıyla çalışabilen EmbeddingGemma 2, yerel semantik arama ve Bilgiyle Zenginleştirilmiş Üretim (RAG) uygulamalarında yeni bir endüstri standardı belirliyor.


Modüler Tasarım: 191 MB RAM ile Çalışan Yerel Zekâ

EmbeddingGemma 2’nin geliştiricilere sunduğu en devrimsel yenilik, ‘ihtiyaç duyduğun kadar yükle’ prensibine dayanan modüler mimarisidir. 740 milyon parametrelik toplam gövde, bağımsız olarak belleğe alınabilen üç uzman katmandan oluşuyor:

  • Metin ve Kod Çekirdeği (~270 Milyon Parametre): Yalnızca metin ve kaynak kod indeksleme görevleri için bu modül yüklendiğinde, modelin bellek ayak izi inanılmaz biçimde yalnızca 191 MB RAM seviyesinde kalıyor.
  • Görsel Enkoder (~170 Milyon Parametre): Fotoğraflar, şemalar ve taranmış belgeler piksel seviyesinde vektörleştirilebiliyor.
  • Ses Enkoderi (~300 Milyon Parametre): Konuşma kayıtları, sesli notlar ve ortam sesleri aynı semantik uzaya haritalanıyor.
  • Tam Çok Modlu Çalışma: Üç modülün tamamı aynı anda devreye alındığında dahi sistemin toplam bellek tüketimi 567 MB RAM düzeyinde kalarak en mütevazı akıllı telefonlarda bile sorunsuz çalışıyor.

Matryoshka Temsili (MRL) ve 8.192 Token Bağlam

Vektör veritabanlarının depolama ve sorgulama maliyetlerini optimize etmek amacıyla EmbeddingGemma 2, Matryoshka Representation Learning (MRL) teknolojisiyle donatıldı. Bu özellik, 768 boyutlu tam vektörlerin doğruluktan minimum feragatle 512, 256 ve hatta 128 boyuta budanabilmesine (truncation) imkan tanıyor:

  1. Yüzde 75 Bellek Tasarrufu: Cihaz belleğinde saklanan milyonlarca vektör, 128 boyuta indirilerek disk ve RAM tüketimi dörtte bire düşürülebiliyor.
  2. 8.192 Tokenlik Uzun Bağlam: Model, tek bir sorguda binlerce sayfalık teknik el kitaplarını veya onlarca dakikalık ses kayıtlarını tek parça halinde indeksleyebiliyor.
  3. MTEB ve MAEB Liderliği: Model, Massive Text Embedding Benchmark (MTEB) ve Massive Audio Embedding Benchmark (MAEB) testlerinde kendi ağırlık sınıfındaki tüm rakiplerini geride bırakarak liderliğe yerleşti.
Laboratuvar test tezgahında yerel yapay zeka hızlandırıcısı mikroişlemci çipi

Veri Gizliliği: Şirket ve Kullanıcı Verileri Cihazdan Çıkmıyor

Kurumsal dünyada ve bireysel kullanımda bulut tabanlı API’lerin en büyük handikapı, hassas müşteri verilerinin ve kişisel notların üçüncü taraf sunuculara gitme zorunluluğuydu. EmbeddingGemma 2 ile bu mimari tamamen değişiyor:

  • Çevrimdışı Çalışma Kabiliyeti: İnternet bağlantısı tamamen kesilmiş bir ortamda dahi kullanıcı cihazındaki tüm PDF’ler, fotoğraflar ve ses kayıtları anında semantik olarak aranabiliyor.
  • Geniş Ekosistem Desteği: Model lansman anından itibaren Hugging Face, Kaggle, Ollama ve llama.cpp (GGUF formatı) depolarında yayımlandı; Google AI Edge kütüphaneleriyle Android ve iOS uygulamalarına tek satır kodla dahil edilebiliyor.

Sonuç: Cep Boyutunda Çok Modlu Gelecek

Google DeepMind’ın EmbeddingGemma 2 hamlesi, yapay zekânın yalnızca devasa veri merkezlerinin tekelinde kalmayacağını; optimize edilmiş matematiksel modeller sayesinde cebimizdeki cihazların da bağımsız birer zekâ merkezine dönüşebileceğini kanıtlıyor. Tamamen açık kaynaklı ve modüler bu altyapı, cihaz içi yapay zekâ devriminin en kritik yapı taşı olmaya aday.

Sık sorulan sorular

EmbeddingGemma 2'nin temel teknik özellikleri nelerdir?

Gemma 4 tabanlı model, 740 milyon parametrelidir ve metin, kod, görüntü, video karesi ve sesleri tek bir 768 boyutlu vektör uzayında haritalamaktadır.

Model cihaz üzerinde ne kadar bellek (RAM) tüketiyor?

Yalnızca metin modülü yüklendiğinde yaklaşık 191 MB RAM tüketirken, ses ve görsel enkoderlerin tamamı devredeyken toplam ayak izi 567 MB RAM düzeyinde kalmaktadır.

Matryoshka Temsili (MRL) geliştiricilere ne kazandırıyor?

MRL desteği sayesinde 768 boyutlu vektörler performans kaybı yaşamadan 128, 256 veya 512 boyuta budanabilmekte, bu da vektör veritabanı depolama maliyetlerini dörtte bire düşürmektedir.

Model hangi platformlarda ve lisansla dağıtılıyor?

Model Apache 2.0 ticari lisansıyla Hugging Face, Kaggle, Ollama ve llama.cpp üzerinde genel kullanıma sunulmuştur.

WebTuring AtlasBu haberin arka planı

Konunun teknik geçmişi ve bağlamı ansiklopedimizde:

Tüm WebTuring Atlas ansiklopedisi →

Dil Modelleri kategorisinden