Byte Pair Encoding
En sık birleşen karakter çiftlerini iteratif olarak birleştirerek sabit boyutlu alt kelime sözlüğü oluşturan tokenizasyon algoritması.
Byte Pair Encoding (BPE), doğal dil işleme ve büyük dil modellerinde kullanılan bir alt kelime tokenizasyon algoritmasıdır. Orijinal olarak 1994 yılında Philip Gage tarafından veri sıkıştırma amacıyla tasarlanan bu algoritma, Sennrich ve ekibinin 2016 tarihli çalışmasıyla sinir ağı tabanlı makine çevirisine uyarlanmış; ardından GPT, LLaMA ve benzeri büyük dil modellerinin standart tokenizasyon yöntemi hâline gelmiştir. BPE'nin temel amacı, tam kelime tokenizasyon ile karakter tokenizasyon arasındaki dengeyi kurmaktır. Tam kelime tokenizasyon büyük bir sözlük gerektirirken eğitim sırasında hiç görülmemiş kelimeleri (OOV — Out-of-Vocabulary) işleyemez. Karakter tokenizasyon ise aşırı uzun diziler üretir ve modelin anlam ilişkilerini öğrenmesini güçleştirir. BPE bu iki yaklaşımın güçlü yanlarını birleştirir: sözlük boyutunu yönetilebilir düzeyde tutarken OOV problemini de çözer. Algoritma şu adımları izler: Başlangıçta sözlük, eğitim metinlerindeki tüm bireysel karakterlerden oluşur. Ardından en sık yan yana gelen iki token çifti belirlenerek yeni bir birim olarak birleştirilip sözlüğe eklenir. Örneğin "l", "o", "w" karakterleri önce "lo" ardından "low" birimine dönüşebilir. Bu birleştirme adımı hedef sözlük boyutuna ulaşıncaya kadar tekrarlanır. Tipik sözlük boyutları 32.000 ile 100.000 token arasında değişmektedir. GPT-2'den itibaren OpenAI, BPE'yi standart tokenizasyon yöntemi olarak benimsemiştir. GPT-4'te kullanılan tiktoken kütüphanesinin cl100k_base kodlayıcısı yaklaşık 100.000 token içerir. BERT, BPE'ye alternatif olan WordPiece algoritmasını kullanırken LLaMA ve Mistral gibi açık kaynaklı modeller SentencePiece kütüphanesiyle BPE'yi uygular. Tokenizasyon kalitesi modelin performansını doğrudan etkiler. Verimliliği ölçmek için fertilite metriği kullanılır: kelime başına ortalama token sayısı. İngilizce için bu değer yaklaşık 1,2–1,5 iken Türkçe gibi eklemeli dillerde 2,5–4 aralığına çıkabilir; bu durum aynı bağlam penceresi içine sığan bilgi miktarını azaltır ve API maliyetlerini artırır. Çok dilli sözlük desteği ve OOV dayanıklılığı sayesinde BPE, günümüz LLM geliştirme pratiklerinde vazgeçilmez bir araç olmayı sürdürmektedir.