Tokenizör

Ham metni yapay zeka modellerinin anlayabileceği en küçük birimlere (token) bölen ön işleme aracı.

Tokenizör (tokenizer), ham metni bir yapay zeka modelinin işleyebileceği en küçük birimlere — token'lara — bölen bir ön işleme aracıdır. Modern büyük dil modellerinde metin önce token dizisine dönüştürülür, ardından bu token'lar sayısal kimlik (token ID) listesine çevrilir ve modele beslenir. Tokenizörün seçimi modelin hem performansını hem de Türkçe gibi eklemeli dillerdeki doğruluğunu doğrudan etkiler. Günümüzde en yaygın tokenizasyon yöntemi Byte Pair Encoding'dir (BPE). BPE, eğitim verisindeki en sık geçen karakter çiftlerini tekrarlı olarak birleştirerek bir alt kelime sözlüğü oluşturur. GPT ailesi bu yöntemi kullanır. WordPiece ise Google tarafından BERT için geliştirilmiştir; SentencePiece, dil bağımsız çalışarak boşluk içeren diller dahil her dili aynı pipeline ile işleyebilir ve LLaMA, Mistral gibi modellerde tercih edilir. Unigram dil modeli ise olasılıksal bir yaklaşım benimseyerek token seçimini entropi minimize ederek yapar. Tokenizörün kritik bir özelliği bağlam penceresidir: bir LLM'in tek seferde işleyebildiği maksimum token sayısı. GPT-4o 128K token penceresiyle 300 sayfalık bir belgeyi aynı anda değerlendirebilirken, bazı modeller 4K ile sınırlıdır. Türkçe açısından önemli bir nokta şudur: eklemeli yapı nedeniyle Türkçe bir metin İngilizceye kıyasla 2-3 kat daha fazla token tüketir. "Yapamayabileceğim" gibi tek bir Türkçe kelime, İngilizce karşılığının birkaç token'ına karşı 5-7 token olarak temsil edilebilir. Özel tokenlar (special tokens) modelin davranışını yönlendirmek için kullanılır. `<|endoftext|>`, `<|system|>`, `<|user|>`, `<|assistant|>` gibi kontrol token'ları chat şablonlarının temelini oluşturur. `[CLS]` ve `[SEP]` BERT ailesi modellerde cümle sınırlarını işaretler. Bu token'lar olmadan model giriş yapısını anlayamaz. Bir tokenizörü keşfetmek için Hugging Face'in `transformers` kütüphanesindeki `AutoTokenizer.from_pretrained()` kullanılabilir. Token sayısını önceden hesaplamak, API maliyetini kontrol etmek ve bağlam penceresi aşımını önlemek açısından üretim sistemlerinde zorunlu bir adımdır. OpenAI'nin tiktoken kütüphanesi, GPT modellerinin token kullanımını yerel olarak saymak için yaygın bir araçtır.