Prompt Injection
Modelin güvenilmeyen içerikteki talimatları yetkili sistem veya kullanıcı talimatı gibi yorumlamasına neden olmayı hedefleyen saldırı sınıfı.
Yapay Zekâ Güvenliği Bağlamı
RAG belgeleri, web sayfaları, e-posta veya tool çıktıları dolaylı prompt injection taşıyabilir. Trust boundary, instruction/data ayrımı, least privilege ve tool policy mitigasyonun temelidir.
Model ve Saldırı Sınırı
Metni filtrelemek tek başına yeterli değildir; saldırı semantik olabilir ve izinleri modelden bağımsız enforcement katmanı korumalıdır.
İlişkili Yapay Zekâ Güvenliği Kavramları
İlgili teknik yazı: Yapay Zeka: Felsefe, Kuram ve Uygulama.