Prompt Injection ve Dolaylı Saldırılar

331 kelime3 dk okuma

Prompt injection saldırısı, modelin kullanıcı talimatı ile veri içeriğindeki komutları birbirinden ayıramamasını istismar eder; ajanlarda bu ayrımın bulanıklaşması, veri sızdırma ve izinsiz eylem riskini doğrudan artırıyor.

Saldırının fikri

Dil modeli, tek bir metin akışını işliyor. Bu akışta kullanıcının talimatı, sistem istemi ve getirilen veri aynı biçimde görünüyor.

Saldırgan, getirilen bir belgeye veya web sayfasına modeli yönlendiren bir talimat yerleştiriyor. Model bunu meşru bir kullanıcı talimatından ayırt edemiyor.

Dolaylı saldırılar

Doğrudan saldırıda kullanıcı, modele kendisi talimat veriyor. Dolaylı saldırıda ise saldırgan, modelin okuduğu bir kaynağa içerik yerleştiriyor.

Bir ajan web sayfasını okuyorsa, o sayfadaki gizli metin modeli etkileyebilir. Bir e-posta özeti aracı kullanıyorsa, e-postadaki talimatlar modele sızabilir.

Ajanlarda neden daha tehlikeli?

Bir sohbet modelinde saldırı en kötü durumda istenmeyen bir yanıt üretir. Ajan ise eylem gerçekleştirebilir: dosya okuyabilir, e-posta gönderebilir, kod çalıştırabilir.

Bu nedenle ajanik sistemlerde enjeksiyon, doğrudan veri sızdırma ve yetkisiz eylem riskine dönüşüyor. Saldırı yüzeyi çok daha büyük.

Savunma yaklaşımları

Girdi ile talimatı ayırmaya çalışan yöntemler var. Ancak bu ayrım güvenilir biçimde yapılamıyor, çünkü model her şeyi aynı bağlamda işliyor.

Bu nedenle savunma katmanlı olmalı. Model seviyesinde yetkilendirme, araç seviyesinde izin sınırları ve sistem seviyesinde denetim birlikte uygulanıyor.

Sınırlar

Tam bir çözüm bulunmuyor. Araştırmacılar, modelin enjeksiyon tespitini zorunlu bir güvenlik katmanı olarak nasıl kuracağı üzerine çalışıyor.

Amaç, etkiyi azaltmak ve saldırı başarısını izlenebilir kılmak. Güvenliğin, modelin kendisine değil, modeli çevreleyen sisteme inşa edilmesi gerekiyor.

  • Model, talimat ile veri içeriğini güvenilir biçimde ayırt edemiyor
  • Dolaylı saldırılar web, e-posta ve belge üzerinden gerçekleşiyor
  • Ajanlarda sonuç, istenmeyen yanıt yerine yetkisiz eylem olabiliyor
  • Savunma katmanlı olmalı; tek önlem yeterli değil

Sık sorulan sorular

Prompt injection tam olarak nedir?

Modelin kullanıcı talimatı ile veri içeriğindeki komutları birbirinden ayıramamasını istismar eden saldırıdır. Saldırgan, modelin okuduğu içeriğe kendi talimatını yerleştiriyor.

Ajanlarda neden daha tehlikeli?

Sohbet modelinde en kötü durum istenmeyen bir yanıtken, ajan eylem gerçekleştirebilir. Dosya okuma, e-posta gönderme veya kod çalıştırma gibi işlemler yetkisiz gerçekleşebiliyor.

Tam bir çözüm var mı?

Hayır. Modelin enjeksiyon tespitini güvenilir biçimde yapması henüz mümkün değil. Bu nedenle savunma, model seviyesinde değil modeli çevreleyen sistem seviyesinde kuruluyor.

Hangi savunmalar işe yarıyor?

Katmanlı yaklaşım: araç seviyesinde izin sınırları, veri ile talimatın ayrılması, tehlikeli işlemlerde kullanıcı onayı ve kapsamlı denetim kaydı birlikte uygulanıyor.

Kaynakça

  1. Prompt Injection tehdidiOWASP
  2. Dil modeli istem enjeksiyonuWikipedia
  3. Ajan teknolojileriWikipedia
  4. Dolaylı istem enjeksiyonuOWASP
  5. Uygulama güvenliğiWikipedia

Bu konuyla ilgili haberler