Prompt Injection
Modelin güvenilmeyen içerikteki talimatları yetkili sistem veya kullanıcı talimatı gibi yorumlamasına neden olmayı hedefleyen saldırı sınıfı.
Teknik Bağlam
RAG belgeleri, web sayfaları, e-posta veya tool çıktıları dolaylı prompt injection taşıyabilir. Trust boundary, instruction/data ayrımı, least privilege ve tool policy mitigasyonun temelidir.
Sınırlar
Metni filtrelemek tek başına yeterli değildir; saldırı semantik olabilir ve izinleri modelden bağımsız enforcement katmanı korumalıdır.
İlgili Kavramlar
- Tool Calling
- Model Context Protocol
- Grounding
- Least Privilege