Bulutsuz ve Sansürsüz Ses: Kyutai Moshi 2.0 ile Cihazda Çalışan 100ms Gecikmeli Konuşma Modeli

Fransız kâr amacı gütmeyen yapay zekâ laboratuvarı Kyutai, internete bağlanmadan doğrudan dizüstü bilgisayarda çalışan, 100 milisaniye gecikmeli çift yönlü sesli yapay zekâ modeli Moshi 2.0'ı açık kaynak yayınladı.

Kyutai Moshi 2.0 sesli yapay zekâ modeli canlı konuşma dalga boyu arayüzü ve yerel terminal çalıştırması

Sesli yapay zekâda bulut bağımlılığına, gizlilik ihlallerine ve yüksek sunucu faturalarına son veren Avrupa merkezli açık kaynak zaferi açıklandı: Xavier Niel ve Eric Schmidt tarafından finanse edilen kâr amacı gütmeyen Fransız yapay zekâ laboratuvarı Kyutai, yeni nesil tam çift yönlü (Full-Duplex) konuşma modeli “Moshi 2.0”ı ücretsiz ve açık kaynak olarak yayınladı.

OpenAI’ın gelişmiş ses moduna (Advanced Voice Mode) açık kaynaklı bir alternatif sunan Moshi 2.0; hiçbir internet veya bulut bağlantısı gerektirmeden doğrudan standart bir MacBook veya tüketici sınıfı Nvidia RTX ekran kartında çalışıyor ve insan konuşma refleksinden bile daha hızlı olan 100 milisaniyelik ultra düşük gecikmeyle akıcı sohbet ediyor.


Metinsiz Saf Sesten Sese (Audio-to-Audio) Mimari

Eski sesli asistanlar önce sesi metne çeviriyor (ASR), sonra dil modeline gönderiyor (LLM) ve son olarak cevabı seslendiriyordu (TTS). Bu 3 adımlı zincir saniyeler süren gecikmeye ve duygusal ton kaybına neden oluyordu.

Kyutai Moshi 2.0’ın 3 devrimsel teknik özelliği:

  1. Doğrudan Mimi Nöral Ses Kodeki (Audio-to-Audio): Model sesi metne çevirmez; ses dalgalarını doğrudan anlar ve anında ses olarak yanıt üretir. Bu sayede tonlama, nefes ve duygu kaybı sıfırdır.
  2. Tam Çift Yönlü Dinleme ve Söz Kesme (Full-Duplex): Kullanıcı model konuşurken araya girip lafını kestiğinde, model insan gibi anında susar ve yeni cümleye kulak verir.
  3. %100 Çevrimdışı Gizlilik: Ses kayıtlarınız hiçbir şirketin sunucusuna gitmez; tüm konuşmalar tamamen sizin yerel cihazınızın RAM belleğinde işlenir ve biter.
Mimi nöral ses kodeki ve çift kanallı tam çift yönlü (Full-Duplex) konuşma sinir ağı mimarisi
Moshi 2.0 ağırlıkları ve kaynak kodları, tüm araştırmacıların ve ticari şirketlerin kullanımına açık şekilde GitHub ve Hugging Face'te paylaşıldı.

Avrupa’nın Egemen Açık Kaynak Hamlesi

Kyutai Araştırma Lideri Hervé Jégou; “Kullanıcıların en mahrem sesli diyaloglarını silikon vadisi devlerinin bulutlarına emanet etmek zorunda olmadığı bir gelecek inşa ediyoruz. Moshi 2.0, açık kaynağın ve kullanıcı mahremiyetinin en büyük zaferidir” dedi.

KriterBulut Tabanlı Sesli Modeller (GPT-4o Voice)Kyutai Moshi 2.0 (Yerel Açık Kaynak)
Gecikme Süresi300 - 600 Milisaniye (İnternet Gecikmeli)< 100 Milisaniye (Yerel Donanım Hızı)
İnternet İhtiyacıSürekli ve Hızlı İnternet Zorunlu%100 Çevrimdışı (Uçakta/Ormanda Çalışır)
Veri MahremiyetiSesler Şirket Sunucularına GönderilirSıfır Veri Çıkışı (Tamamen Yerel Bellek)
Maliyet ve LisansDakika Başına Pahalı API ÜcretiTamamen Ücretsiz ve Açık Kaynak (Apache 2.0)

Kısa Özet

  • Moshi 2.0 Çıktı: Fransız Kyutai laboratuvarı açık kaynak ses modelini duyurdu.
  • İnternetsiz Çalışıyor: Model doğrudan yerel bilgisayarda bulutsuz çalışıyor.
  • 100ms Gecikme: İnsan gibi anında cevap veriyor ve söz kesmeyi anlıyor.
  • Tam Gizlilik: Ses verileri hiçbir sunucuya gitmeden cihazda kalıyor.

Sonuç

Kyutai Moshi 2.0, sesli yapay zekânın pahalı bulut servislerinin tekelinden çıkıp her kullanıcının kendi yerel bilgisayarında özgürce, anında ve tam mahremiyetle çalıştırdığı yeni bir açık kaynak standardı başlattığını tescilliyor.

Sık sorulan sorular

Bulutsuz ve Sansürsüz Ses: Kyutai Moshi 2.0 ile Cihazda Çalışan 100ms Gecikmeli Konuşma Modeli nedir?

Fransız kâr amacı gütmeyen yapay zekâ laboratuvarı Kyutai, internete bağlanmadan doğrudan dizüstü bilgisayarda çalışan, 100 milisaniye gecikmeli çift yönlü sesli yapay zekâ modeli Moshi 2.0'ı açık kaynak yayınladı. Bu konuyu WebTuring (webturing.com.tr) özgün ve ölçülebilir bir çerçeveyle ele alır; /haber/ arşivinde Dil Modelleri kategorisinde tam analiz yer alır.

Bulutsuz ve Sansürsüz Ses: Kyutai Moshi 2.0 ile Cihazda Çalışan 100ms Gecikmeli Konuşma Modeli neden önemlidir ve hangi gelişmeler öne çıkar?

WebTuring, Bulutsuz ve Sansürsüz Ses: Kyutai Moshi 2.0 ile Cihazda Çalışan 100ms Gecikmeli Konuşma Modeli konusunu güncel veriler, karşılaştırmalar ve Türkçe bağlamla ele alır. İlgili etiketler: Kyutai, Moshi 2.0, Sesli Yapay Zeka, Açık Kaynak AI, Cihaz İçi Çıkarım. Konu; Dil Modelleri alanının güncel gündemini şekillendirmektedir.

Bulutsuz ve Sansürsüz Ses: Kyutai Moshi 2.0 ile Cihazda Çalışan 100ms Gecikmeli Konuşma Modeli hakkında en güncel WebTuring analizi nerede?

Tam analiz ve özgün değerlendirme için WebTuring /haber/ arşivindeki Dil Modelleri kategorisini ve ilgili haber sayfasını inceleyebilirsiniz.

Dil Modelleri kategorisinden