Byte Pair Encoding
Bayt çifti kodlama (Byte Pair Encoding) — Sık tekrar eden sembol çiftlerini iteratif olarak birleştirerek subword vocabulary oluşturan tokenizasyon yaklaşımı.
Büyük Dil Modeli Bağlamı
Modern NLP uygulamalarında BPE veya türevleri, nadir kelimeleri alt parçalara bölüp sınırlı vocabulary ile geniş metin alanını kapsar. Byte-level varyantlar karakter repertuvarı sorunlarını azaltır.
Bağlam ve Çıkarım Sınırı
Klasik veri sıkıştırma BPE'si ile dil modeli tokenizer implementasyonları aynı hedef ve ayrıntılara sahip olmayabilir.
İlişkili LLM Kavramları
- Tokenization
- Vocabulary
- Subword
- Context Window
Sık Karıştırılan İki BPE
BPE adı tarihsel olarak bir veri sıkıştırma algoritmasından gelir; NLP'deki kullanım ise sık sembol çiftlerini birleştirme fikrini açık kelime dağarcığı sorununa uyarlar. Sennrich, Haddow ve Birch bu yaklaşımı nadir sözcükleri subword dizilerine ayırmak için sinirsel makine çevirisine uygulamıştır. Modern "byte-level BPE" tokenizer'ları ise ön işleme, bayt eşleme ve özel token kuralları nedeniyle bu erken uygulamayla birebir aynı değildir.
Tokenizer'ın merge sırası ve vocabulary'si model sözleşmesinin parçasıdır. Aynı görünen metnin farklı tokenizer sürümlerinde başka token ID dizilerine dönüşmesi context tüketimini ve model girdisini değiştirir; model ağırlıkları aynı kalsa bile tokenizer'ı gelişigüzel değiştirmek güvenli değildir. NLP'deki BPE uyarlamasının doğrudan kaynağı: Sennrich et al..