tag boyut-indirgeme
Boyut İndirgeme (Dimensionality Reduction) (Boyut İndirgeme)
Bu sayfada boyut-indirgeme (Boyut İndirgeme (Dimensionality Reduction) (Boyut İndirgeme)) etiketi ile işaretlenmiş 2 yapay zeka kavramını bulabilirsiniz.
Boyut indirgeme (dimensionality reduction), yüksek boyutlu veri kümelerindeki değişken sayısını azaltırken verinin özünü ve yapısını koruyan teknikler bütünüdür. Modern veri kümelerinde binlerce hatta milyonlarca özellik bulunabilir; bu durum "boyutun laneti" olarak adlandırılan ve modellerin genelleştirilmesini zorlaştıran bir soruna yol açar. Boyut indirgeme bu karmaşıklığı yönetilebilir hale getirir ve makine öğrenimi boru hatlarında standart bir ön işlem adımı olarak yer alır. Temel yaklaşımlar iki gruba ayrılır. Doğrusal yöntemler arasında en yaygın kullanılan Temel Bileşenler Analizi (PCA), veri setindeki en yüksek varyansı açıklayan ortogonal eksenleri hesaplar. Yüzlerce özelliği 10-20 bileşene indirgemek ve verinin yüzde 95'inden fazla bilgisini korumak mümkündür. Lineer Diskriminant Analizi (LDA) ise sınıflar arası ayrımı maksimize ederek indirgeme yapar; bu özelliği onu sınıflandırma öncesi ön işlemde değerli kılar. Doğrusal olmayan manifold yöntemleri, verinin karmaşık eğrisel yapılarını koruyabilir. t-SNE (t-dağılımlı Stokastik Komşu Gömme), yüksek boyutlu noktalar arasındaki yerel benzerlikleri 2 veya 3 boyutlu uzayda görselleştirmek için en sık tercih edilen yöntemdir; birbirine yakın kümeler arasındaki ayrımı belirginleştirir. UMAP (Uniform Manifold Approximation and Projection) ise hem yerel hem küresel yapıyı korurken t-SNE'den çok daha hızlı çalışır ve büyük veri kümelerinde üretim ortamlarında tercih edilir. Derin öğrenme dünyasında otoenkoderler sinir ağları aracılığıyla boyut indirger: kodlayıcı kısım veriyi düşük boyutlu bir latent uzaya sıkıştırır, kod çözücü kısım ise orijinal veriyi yeniden oluşturmaya çalışır. Bu yaklaşım anomali tespiti, görüntü sıkıştırma ve öneri sistemleri gibi alanlarda yaygın biçimde kullanılır. Dil modellerindeki embedding vektörler de özünde boyut indirgemenin bir biçimidir: geniş sözcük dağarcıklarını yoğun vektörlerle temsil eder. Uygulama alanları geniştir: biyoinformatik analizinde gürültü azaltma, öneri sistemlerinde matris çarpanlara ayırma, doğal dil işlemede konu modelleme ve görüntü işlemede özellik çıkarma bu alanların başında gelir.
Boyut İndirgeme (Dimensionality Reduction) (Boyut İndirgeme)
Boyut indirgeme (dimensionality reduction), yüksek boyutlu veri kümelerindeki değişken sayısını azaltırken verinin özünü ve yapısını koruyan teknikler bütünüdür. Modern veri kümelerinde binlerce hatta milyonlarca özellik bulunabilir; bu durum "boyutun laneti" olarak adlandırılan ve modellerin genelleştirilmesini zorlaştıran bir soruna yol açar. Boyut indirgeme bu karmaşıklığı yönetilebilir hale getirir ve makine öğrenimi boru hatlarında standart bir ön işlem adımı olarak yer alır. Temel yaklaşımlar iki gruba ayrılır. Doğrusal yöntemler arasında en yaygın kullanılan Temel Bileşenler Analizi (PCA), veri setindeki en yüksek varyansı açıklayan ortogonal eksenleri hesaplar. Yüzlerce özelliği 10-20 bileşene indirgemek ve verinin yüzde 95'inden fazla bilgisini korumak mümkündür. Lineer Diskriminant Analizi (LDA) ise sınıflar arası ayrımı maksimize ederek indirgeme yapar; bu özelliği onu sınıflandırma öncesi ön işlemde değerli kılar. Doğrusal olmayan manifold yöntemleri, verinin karmaşık eğrisel yapılarını koruyabilir. t-SNE (t-dağılımlı Stokastik Komşu Gömme), yüksek boyutlu noktalar arasındaki yerel benzerlikleri 2 veya 3 boyutlu uzayda görselleştirmek için en sık tercih edilen yöntemdir; birbirine yakın kümeler arasındaki ayrımı belirginleştirir. UMAP (Uniform Manifold Approximation and Projection) ise hem yerel hem küresel yapıyı korurken t-SNE'den çok daha hızlı çalışır ve büyük veri kümelerinde üretim ortamlarında tercih edilir. Derin öğrenme dünyasında otoenkoderler sinir ağları aracılığıyla boyut indirger: kodlayıcı kısım veriyi düşük boyutlu bir latent uzaya sıkıştırır, kod çözücü kısım ise orijinal veriyi yeniden oluşturmaya çalışır. Bu yaklaşım anomali tespiti, görüntü sıkıştırma ve öneri sistemleri gibi alanlarda yaygın biçimde kullanılır. Dil modellerindeki embedding vektörler de özünde boyut indirgemenin bir biçimidir: geniş sözcük dağarcıklarını yoğun vektörlerle temsil eder. Uygulama alanları geniştir: biyoinformatik analizinde gürültü azaltma, öneri sistemlerinde matris çarpanlara ayırma, doğal dil işlemede konu modelleme ve görüntü işlemede özellik çıkarma bu alanların başında gelir.
t-SNE (t-SNE (T-Dağılımlı Stokastik Komşu Gömme))
t-SNE (t-Distributed Stochastic Neighbor Embedding), yuksek boyutlu veriyi iki veya uc boyutlu bir uzaya gorselleştirme amaciyla indirgemek icin kullanilan dogrusal olmayan bir boyut indirgeme yontemidir. 2008 yilinda Laurens van der Maaten ve Geoffrey Hinton tarafindan tanitilan bu algoritma, ozellikle derin ogrenme modellerinin gizli katman temsillerini (embedding) insan gozuyle kavranabilir bicimde gorselleştirme konusunda standart arac haline gelmistir. Algoritmanin calisma prensibi iki temel asamaya dayanir. Birinci asamada yuksek boyutlu uzaydaki her nokta cifti arasindaki benzerlikler Gaussian dagilimi kullanilarak kosullu olasilik degerlerine donusturulur; yakin noktalar yuksek, uzak noktalar dusuk olasilik alir. Ikinci asamada bu dagilim dusuk boyutlu uzayda Student-t dagilimiyla yeniden modellenir. Algoritma, iki dagilim arasindaki Kullback-Leibler (KL) iraksamasini minimize ederek veriyi dusuk boyutlu uzaya gomer. Student-t dağiliminin kalin kuyrugu, uzak noktalarin dusuk boyutlu temsilde daha da ayrismasini saglar ve kalabalik problemi olarak bilinen yapisal bozulmayı buyuk olcude giderir. En kritik hiperparametre perplexity degeridir; bu parametre her nokta icin efektif komsu sayisini belirler ve tipik olarak 5 ile 50 arasinda ayarlanir. Dusuk degerler yerel yapiyi on plana cikarirken yuksek degerler kuresel yapiyi daha iyi yakalar. Cikti rastsal baslangica duyarli oldugundan tekrarlanabilirlik icin random_state parametresinin sabitlenmesi zorunludur. PCA ile karsilastirildiginda t-SNE dogrusal olmayan manifold yapilarini daha iyi ortaya cikarir; ancak eksen degerlerinin dogrudan yorumu yoktur ve yeni veri noktalari icin projeksiyon uretemez. Buyuk veri kumelerinde hesaplama maliyeti yuksek oldugunde Barnes-Hut t-SNE veya GPU hizlandirmali RAPIDS cuML gibi olceklenebilir alternatiflere basvurulur. MNIST rakam gorselleştirmesi, scRNA-seq hucre populasyonu analizi ve transformer gomu uzayi arastirmalari en yaygin uygulama alanlaridir. Scikit-learn uzerinden TSNE sinifi ile hizla uygulanabilir; buyuk ol cekler icin openTSNE veya UMAP alternatif olarak degerlendirilebilir.