Matematiksel Tanım ve Özellikleri
Sigmoid fonksiyonunun matematiksel ifadesi σ(x) = 1 / (1 + e⁻ˣ) şeklindedir. Fonksiyon, tüm gerçel sayılar üzerinde tanımlıdır ve çıktısı her zaman (0, 1) açık aralığında kalır. x = 0 noktasında simetri ekseni bulunur: σ(0) = 0.5. Bu özellik özellikle sınıflandırma problemlerinde kullanışlıdır; çıktı, "pozitif sınıfa ait olma olasılığı" olarak yorumlanabilir. Türevinin σ'(x) = σ(x) · (1 − σ(x)) şeklinde özyinelemeli olarak hesaplanabilmesi, geri yayılım algoritmasının verimli çalışmasına zemin hazırlar. Bu özellik, 1986'da Rumelhart, Hinton ve Williams tarafından geri yayılımın önerildiği dönemde sigmoid'i standart seçim haline getirdi.
Gradyan Kaybı Sorunu
Sigmoid'in en önemli dezavantajı, |x| büyüdükçe türevinin (0'a yakın bir değer olan) sıfıra yaklaşmasıdır. Derin sinir ağlarında geri yayılım sırasında gradyanlar her katmandan geçerken çarpılır; sigmoid türevleri 0-0.25 arasında kaldığından 10 katmanlı bir ağda başlangıç katmanına ulaşan gradyan 0.25¹⁰ ≈ 10⁻⁶ gibi ihmal edilebilir bir değere düşebilir. Bu durum ağırlıkların güncellenmemesine ve öğrenmenin durmasına yol açar. ReLU (Rectified Linear Unit) bu sorunu büyük ölçüde çözdü. x > 0 için türevi sabit 1 olan ReLU, gradyanları zayıflatmadan iletir. Bu nedenle 2010 sonrasında geliştirilen derin ağların ara katmanları büyük ölçüde ReLU ve türevlerine (Leaky ReLU, ELU, GELU) geçiş yaptı.
Sigmoid ve ReLU Karşılaştırması
İki fonksiyon farklı senaryolar için tercih edilir: **Sigmoid tercih edildiği durumlar:** Çıkış olasılık gerektiriyorsa (ikili sınıf., LSTM kapıları), 0-1 arasında normalize edilmiş değer isteniyorsa. **ReLU tercih edildiği durumlar:** Derin ağların gizli katmanlarında gradyan kaybından kaçınmak için, hesaplama verimliliği önemli olduğunda (max(0,x) çok hızlı hesaplanır). Pratik kural: ikili sınıflandırma çıkış katmanı → sigmoid; derin ağ gizli katmanları → ReLU/GELU.