Context Window
Bir modelin tek inference bağlamında işleyebildiği token dizisinin izin verilen veya etkin uzunluğu.
Teknik Bağlam
Prompt, önceki konuşma, tool çıktıları ve üretilen tokenlar aynı context bütçesini paylaşabilir. Uzun context attention/KV cache belleği, latency ve retrieval tasarımını doğrudan etkiler.
Sınırlar
Nominal maksimum context uzunluğu, modelin tüm mesafelerde aynı kaliteyle bilgiyi kullanacağı anlamına gelmez; positional ve retrieval davranışı ayrıca ölçülmelidir.
İlgili Kavramlar
- KV Cache
- Tokenization
- Retrieval-Augmented Generation
- Attention