Jailbreak Yer Altı Pazarı: Meraktan Hizmet Modeline Geçiş

706 kelime4 dk okuma

Jailbreak, sınır modellerinin güvenlik davranımını söz dizimi hileleriyle devre dışı bırakmanın adı; 2023’te otomatik ve taşınabilir saldırı suffix’leriyle akademik bir merak konusu olan alan, 2025–2026’da forumlarda ayda 60–100 avro bandında satılan “kontrolleri kaldırılmış” hizmetlere dönüştü, sağlayıcılar OpenAI’ın 2026 ortasında 50 bin dolara çıkardığı güvenlik ödülleriyle yanıt verirken, Nisan 2026 tarihli bir ölçüm ise 28 kamuya açık jailbreak’te yetenek kaybının sınırlı kaldığını raporladı.

Merak basamağı

Hikâye bir eğlenceyle başlamadı: 2022’nin rol yapma kalıpları, 2023’te akademik bir programa dönüştü. Temmuz 2023 tarihli çalışma, insan eliyle yazılmış bir zararlı davranım listesine karşı otomatik olarak saldıdı ve üretilen tek bir eklentinin ChatGPT, Bard ve Claude’un arayüzlerinde istenmeyen çıktıyı tetikleyebildiğini, yani saldırıların modeller arasında taşınabildiğini gösterdi.

Bu, savunmanın maliyet dengesini bozan asıl bulguydu: tek bir başarı, milyonlarca kullanıcı arayüzünde yeniden kullanılabilir. Akademik tarafın ürettiği bu tür liste ve sabit setler — bugün standarda yakın ölçüm protokolleri — aynı zamanda yer altı pazarının envanteri oldu; hazır kalıplar makalelerden forumlara kopyalandı.

Hizmet modeline geçiş

Hazır kalıbı satmak düşük marjlı bir iş; asıl para erişimde. Cato’nun Haziran 2025 tarihli analizinde, suç forumlarında yayılan “WormGPT” markalı hizmetler aylık 60–100 avro, yıllık 550 avro bandında fiyatlanıyor ve arkasında sıfırdan eğitilmiş bir model değil, mevcut modellerin ustaca yönlendirilmesi duruyor. Aynı dönemde araştırmacılar, Grok ve Mistral gibi modellerin jailbreak edilmiş hâllerinin suç kitleleri arasında dolaştığını raporladı.

2026’da bu yapı, organize suç kataloğuna benzedi: Rapid7’in Haziran 2026 değerlendirmesi FraudGPT, WormGPT ve Xanthorox gibi markaların abonelikle satıldığını, çalınmış yapay zekâ hesaplarının forumlarda listelendiğini aktarıyor. Yani zincirin ucunda bir prompt değil, hesaba erişim, yönlendirme katmanı ve ücretli bir arayüz var.

Sağlayıcıların yarışı

Tarafın yanıtı iki kanaldan geldi: filtre ve para. Şirketler girdi sınıflandırıcıları, çıktı denetimi, kızıl team programları ve kalıp bankaları kurarken, kamuya açık ödül programlarını jailbreak’e özel kategorilerle genişletti. OpenAI, biyogüvenlik sınıfındaki evrensel jailbreak’ler için verdiği azami ödülü 2026 ortasında 50 bin dolara çıkardı; mantık net: bir savunucunun maliyeti, bir suçlunun gelirinden yüksek olmalı.

Fiyatlandırmanın sembolik bir yanı da var: ödül tavanı, hangi davranımın şirket için kırmızı çizgi olduğunu da ilan ediyor. Biyogüvenlik, kamusal manipülasyon ve otonom saldırı sınıfları pahalı; “kaba dil ürettirmek” bedava. Yer altı pazarı da bu sıralamayı okuyor ve en az savunulmuş kategoriyi hedefliyor.

Ölçüm cephesi: savunma kazanıyor mu?

Kasım 2025’te Oxford, Anthropic, Stanford ve Martian imzalı çalışma, “düşünen” modellerin zincir içi manipülasyonlarla daha kolay ele geçirilebildiğini savundu; raporlanan saldırı başarı oranları Gemini 2.5 Pro, o4 mini, Grok 3 mini ve Claude 4 Sonnet üzerinde %94–100 bandına kadar çıktı. Akıl yürütme, savunmanın değil saldırının tarafına yazılıyor gibi göründü.

Nisan 2026’daki bir ölçüm ise tabloyu dengeledi: kamuya açık 28 jailbreak, Claude ailesinin Haiku 4.5’ten Opus 4.6’ya uzanan modellerinde test edildi ve en iyi savunulmuş modelde yetenek kaybı yalnızca %7,7 olarak ölçüldü. Yani jailbreak’ler büyük ölçüde modeli sakatlamadan değil, aynı yeteneği farklı kurallarla konuşturarak çalışıyor; bu da “kırık model” savunmasını zayıflatıyor.

Ekonomi neden kapanmıyor?

Çünkü iki asimetri kalıcı. Birincisi, saldırının maliyeti ile savunmanın maliyeti arasındaki fark: hazır bir kalıp bir kez bulunca tekrar tekrar kullanılabiliyor, oysa savunma her yeni varyantta yeniden çalışmak zorunda. İkincisi, dağıtım: suç pazarı, jailbreak’i ayrı bir ürün olarak değil mevcut yazılımların içine gömülü bir özellik olarak satıyor; bu da kaldırmayı imkânsız kılıyor.

Bir de açık ağırlık gerçeği var: indirilebilen modeller, filtresiz bir taban sunuyor ve yer altı hizmetlerinin çoğu bu tabanın üzerine ticari bir arayüz koyuyor. Sonuç, güvenlik tartışmasının “nasıl kırılır”dan “kimin kırmasına izin veriliyor”a kayması; bu da jailbreak’i teknik bir kusurdan çok bir dağıtım politikası meselesine çeviriyor.

  • 2023’te otomatik ve taşınabilir saldırılarla akademik ölçüm başladı
  • Hazır kalıplar yerini abonelikle satılan erişim hizmetlerine bıraktı
  • WormGPT türü hizmetler ayda 60–100 avro bandında fiyatlanıyor
  • OpenAI biyogüvenlik jailbreak ödülünü 50 bin dolara yükseltti
  • Ölçümler hem %94–100’lük başarıları hem de düşük yetenek kaybını raporluyor

Sık sorulan sorular

Jailbreak ile prompt injection aynı şey mi?

Hayır. Jailbreak, modelin kendi güvenlik davranımını aşacak bir söz dizimi veya rol kurmayı hedefler; kullanıcı bunu kendi sohbetinde yapar. Prompt injection ise aracı bir sisteme gizli talimat sokup ajanın hedefini kaçırır. İlki modelin savunmasını, ikincisi uygulama katmanını hedef alır.

Kaça satılıyor?

Hazır kalıplar düşük maliyetli bir giriş ürünü; asıl gelir abonelikte. Haziran 2025’te Cato araştırmacıları, suç forumlarındaki WormGPT markalı hizmetlerin aylık 60–100 avro, yıllık 550 avro bandında fiyatlandığını raporladı. 2026 değerlendirmelerinde bu model, çalınmış hesap satışı ve kiralık arayüzlerle genişledi.

Şirketler nasıl karşılık veriyor?

Girdi ve çıktı sınıflandırıcıları, kızıl team çalışmaları, kalıp bankaları ve nakit ödül programlarıyla. OpenAI, biyogüvenlik sınıfında evrensel jailbreak gösteren raporlar için azami ödülü 2026’da 50 bin dolara çıkardı; ama savunma, tek bir kalıbın tekrar kullanımını engellemede hâlâ sınırlı.

Jailbreak modeli bozuyor mu?

Araştırma, çoğu durumda bozmadığını gösteriyor. Nisan 2026’da kamuya açık 28 jailbreak Claude ailesinde ölçüldü ve en güçlü modelde genel yetenek kaybı %7,7 civarında kaldı. Yani savunmanın “kırınca işe yaramaz hâline gelir” varsayımı geçerliğini yitiriyor.

Kaynakça

  1. Researchers say cybercriminals are using jailbroken AI chatbotsThe Record
  2. Criminal AI-as-a-Service in 2026: How the Underground Market Is Operationalizing CybercrimeRapid7
  3. Universal and Transferable Adversarial Attacks on Aligned Language ModelsarXiv
  4. Jailbroken Frontier Models Retain Their CapabilitiesarXiv
  5. Advanced AI Reasoning Makes Models Easier to Jailbreak, Study FindsOxford Martin AIGI
  6. OpenAI Bio Bug BountyOpenAI

Bu konuyla ilgili haberler