Text Classification Nedir? Metin Sınıflandırma (Metin Sınıflandırma)

Metinlere otomatik olarak önceden tanımlanmış kategoriler atayan NLP tekniği; spam filtreleme, duygu analizi ve içerik moderasyonunun temel taşı.

Text classification (metin sınıflandırma), bir metin parçasının önceden tanımlanmış kategorilerden birine veya birkaçına otomatik olarak atanması görevidir. Doğal Dil İşleme'nin (NLP) temel taşlarından biri olan bu teknik; e-posta spam filtrelerinden duygu analizine, haber kategorizasyonundan müşteri hizmetleri otomasyonuna kadar geniş bir uygulama yelpazesine sahiptir. Makine öğrenimi tabanlı yaklaşımlarda metin önce sayısal temsillere dönüştürülür: TF-IDF vektörleri, Word2Vec embeddingler veya BERT gibi transformer tabanlı temsiller. Bu vektörler ardından Naive Bayes, Destek Vektör Makineleri (SVM) veya derin sinir ağları gibi sınıflandırıcılara beslenir. Modern uygulamalarda BERT, RoBERTa ve GPT gibi büyük dil modelleri ince ayar yapılarak (fine-tuning) olağanüstü doğruluk oranları elde edilmektedir. Üç temel türü vardır: ikili sınıflandırma (binary: spam/değil), çok sınıflı sınıflandırma (multi-class: spor/siyaset/ekonomi haber kategorizasyonu) ve çok etiketli sınıflandırma (multi-label: tek metne birden fazla kategori atama). Değerlendirme için salt doğruluk (accuracy) yetersiz kalabilir; sınıf dengesizliği durumlarında precision, recall ve F1 skoru daha güvenilir metriklerdir. Eşik bağımsız ölçüm için ROC-AUC kullanılır; kalibrasyon testi ise model güvenirliğini doğrular. Gerçek dünya uygulamalarının en yaygın zorluğu veri dengesizliğidir: örneğin yüzde bir spam, yüzde doksan dokuz normal e-posta dağılımı. Bu sorun SMOTE örnekleme, class-weight ayarlaması veya threshold kalibrasyonu ile giderilir. Sağlık alanında klinik not kategorizasyonu, hukuk sektöründe belge sınıflandırması ve içerik moderasyonunda zararlı içerik tespiti kritik kullanım alanlarıdır. SetFit gibi few-shot öğrenme çerçeveleri, contrastive learning ile yalnızca 8–64 etiketli örnek kullanarak tam ince ayar düzeyinde performans elde eder. Zero-shot sınıflandırmada GPT-4o veya Claude gibi büyük dil modelleri ek eğitim verisi olmaksızın kategori açıklamalarıyla doğru etiket ataması yapabilir. Türkçe için BERTurk, bert-base-turkish-cased ve XLM-R modelleri güçlü kıyaslama noktaları oluşturmaktadır.

Transformer Öncesi ve Sonrası: Tarihsel Gelişim

Metin sınıflandırmanın kökleri 1960'lara dayanır; ilk sistemler kural tabanlı ve istatistiksel yaklaşımları kullanırdı. 1990'larda Naive Bayes ve Destek Vektör Makineleri (SVM) pratik uygulamaları mümkün kıldı. 2013'te Word2Vec ile anlam odaklı metin temsilleri devreye girdi. Asıl dönüşüm 2018'de Google'ın BERT modeliyle gerçekleşti: tek yönlü dil modelleri yerine çift yönlü bağlamı yakalayan transformer mimarisi, SST-2 duygu analizi ve MNLI niyet tanıma kıyaslamalarında insan performansına yaklaştı. Bugün RoBERTa, DeBERTa ve küçük cihazlar için DistilBERT standart başlangıç noktalarıdır.

Sınıflandırma Türleri

  • check_circle İkili Sınıflandırma (Binary): Metni yalnızca iki kategoriden birine atar. Spam/değil, olumlu/olumsuz gibi ikili kararlar için idealdir; sigmoid çıktısı ve binary cross-entropy kaybı kullanılır.
  • check_circle Çok Sınıflı (Multi-class): Birden fazla sınıf arasından tek bir etiketi seçer. Haber kategorilendirme (spor/siyaset/ekonomi/teknoloji) tipik örnektir; softmax çıktısı ve categorical cross-entropy kullanılır.
  • check_circle Çok Etiketli (Multi-label): Bir metne aynı anda birden fazla etiket atanabilir. Makale etiketleme veya çok konulu sosyal medya gönderileri için kullanılır; her sınıf için bağımsız sigmoid çıktıları üretilir.
  • check_circle Hiyerarşik Sınıflandırma: Etiketler ağaç yapısında iç içe geçmiştir. E-ticaret ürün kataloğunda 'Elektronik → Telefon → Akıllı Telefon' gibi kademeli sınıflandırma örnek verilebilir.

Yaygın Kullanım Alanları

  • check_circle Duygu Analizi: Ürün yorumlarını, müşteri şikayetlerini veya sosyal medya gönderilerini otomatik olarak olumlu/nötr/olumsuz kategorilerine ayırır. E-ticaret ve müşteri deneyimi ekiplerinin temel aracıdır.
  • check_circle Spam ve İçerik Moderasyonu: E-posta spam filtreleri ile sosyal medya platformlarındaki zararlı ve yanıltıcı içeriklerin otomatik tespiti. Kural tabanlı sistemlerin yerini artık BERT tabanlı sınıflandırıcılar almaktadır.
  • check_circle Konu Tespiti ve Yönlendirme: Müşteri destek talepleri, haber makaleleri veya akademik yayınlar otomatik olarak ilgili departmana ya da kategoriye yönlendirilir; bu sayede işlem hızı önemli ölçüde artar.
  • check_circle Klinik Not Sınıflandırması: ICD kodlama otomasyonu, hasta tahliye özeti kategorizasyonu ve acil servis triage sistemleri için sağlık sektöründe yaygın biçimde kullanılır.
  • check_circle Hukuki Belge İşleme: Sözleşme türleri, mahkeme kararları ve mevzuat metinleri otomatik olarak kategorilere ayrılır; hukuk teknolojisi (LegalTech) şirketlerinin temel iş akışlarını oluşturur.

Modern Araçlar ve Kütüphaneler

  • check_circle Hugging Face Transformers: BERT, RoBERTa, DistilBERT gibi ön eğitimli modelleri pipeline('text-classification') API'siyle birkaç satır kodla kullanmayı mümkün kılan standart kütüphanedir.
  • check_circle SetFit: Hugging Face'in few-shot çerçevesi; 8–64 etiketli örnekle contrastive öğrenme kullanarak tam ince ayar düzeyinde sonuç üretir. Etiketleme maliyetini önemli ölçüde azaltır.
  • check_circle scikit-learn: TF-IDF + Naive Bayes/SVM kombinasyonuyla hızlı prototipleme ve kıyaslama için standart başlangıç kütüphanesidir. Küçük boyutlu veri kümelerinde transformer modellerine rakip olabilir.
  • check_circle spaCy + textcat: Türkçe dahil çok dilli metin işleme desteği sunan spaCy'nin textcat bileşeni, hızlı inference için optimize edilmiş boru hattı modeli olarak üretim ortamlarında tercih edilir.
  • check_circle LLM API (Zero-shot): GPT-4o veya Claude gibi modeller, kategori açıklamaları yönergesiyle herhangi bir ek eğitim verisi olmaksızın sınıflandırma yapabilir. Kategoriler dinamik değiştiğinde en pratik seçenektir.

LLM Çağında Metin Sınıflandırma

Büyük dil modellerinin (LLM) yaygınlaşması metin sınıflandırma paradigmasını köklü biçimde değiştirdi. Geleneksel ince ayar yaklaşımı, yüksek hacimli ve sabit kategorili görevlerde maliyet etkinliği açısından hâlâ üstündür. Ancak kategorilerin dinamik değiştiği, etiketli verinin kıt olduğu ya da sınıflandırma kararının gerekçelendirilmesi gereken durumlarda LLM'ler yapılandırılmış çıktı (JSON mode, function calling) ile yüksek doğruluk elde eder. OpenAI'ın GPT-4o Structured Outputs ve Anthropic'in tool_use özelliği bu yaklaşımı üretime taşımayı kolaylaştırmaktadır. Ayrıca LLM sınıflandırıcılar gerekçe üretebilir; bu da denetim, hata analizi ve şeffaflık gereksinimleri açısından kritik değer taşır.