Tokenization

Türkçe karşılığı: TokenleştirmeAlan: Büyük Dil Modelleri

Tokenleştirme (Tokenization) — Metin veya başka sembolik girdiyi modelin işlediği ayrık token kimliklerine dönüştürme işlemi.

Büyük Dil Modeli Bağlamı

Subword tokenizasyon bilinmeyen kelime sorununu azaltır ve vocabulary boyutunu kontrol eder. Token sayısı context window tüketimini, inference maliyetini ve bazı dillerde verimliliği etkiler.

Bağlam ve Çıkarım Sınırı

Token kelime ile aynı şey değildir; bir kelime birden fazla tokena, bir token birden fazla karaktere karşılık gelebilir.

İlişkili LLM Kavramları

İlgili teknik yazı: Yapay Zeka: Felsefe, Kuram ve Uygulama.

İlgili teknik yayınlar

Başlık veya özetinde bu kavrama doğrudan karşılık gelen yayınlar.

SentencePiece ile Metin Parçalama Sınırları

SentencePiece, metni sabit bir sözlük altında alt sözcük parçalara ayırırken normalizasyonu metin parçalama öncesinde uygular. Türkçe gibi eklemeli dillerde sözlük boyutu, normalizasyon ve bölümleme politikası doğrudan model davranışına dönüşür.