A/B Testing (A/B Testi)

A/B Testi, iki sistem sürümünü rastgele atanmış kullanıcı gruplarında eş zamanlı çalıştırıp istatistiksel güvenle kazananı belirleyen kontrollü deney yöntemidir.

A/B testi (bölünmüş test veya ikili değerlendirme olarak da bilinir), iki farklı sürüm ya da yaklaşımın kontrollü bir deney ortamında karşılaştırıldığı istatistiksel bir yöntemdir. Makine öğrenimi ve yapay zeka sistemlerinde A/B testi; iki farklı modelin, algoritmanın, hiperparametre setinin veya ürün özelliğinin hangisinin belirli bir hedef metrikte daha iyi performans gösterdiğini nesnel biçimde kanıtlamak için kullanılır. Deney, kullanıcılar veya veri örneklemleri rastgele iki gruba ayrılarak yürütülür: kontrol grubu (A varyantı) mevcut veya temel çözümü kullanırken, tedavi grubu (B varyantı) yeni yaklaşımla test edilir. Her iki varyant eş zamanlı çalışır ve yeterli örnek büyüklüğüne ulaşıldığında istatistiksel anlamlılık testi (t-testi, chi-kare veya z-testi) uygulanır. Belirlenen güven eşiği (çoğunlukla yüzde doksan beş, p küçüktür 0.05) aşıldığında B varyantının gerçekten daha iyi olduğu kabul edilir ve üretim ortamına alınır. Makine öğrenimi ve MLOps bağlamında A/B testi; öneri motorlarının, sıralama algoritmalarının, doğal dil işleme modellerinin ve üretken yapay zeka çıktılarının nesnel olarak karşılaştırılmasında kritik rol oynar. Deney öncesinde gerçekleştirilen A/A testi, her iki grupta da aynı versiyon kullanılarak sistemin güvenilirliğinin doğrulanmasını sağlar. Endüstride Netflix, Spotify, Amazon ve Google gibi şirketler yılda binlerce eş zamanlı A/B deneyi yürütmektedir. Multi-armed bandit algoritmaları, keşfetme aşamasındaki kaybı azaltmak için en iyi varyanta trafik payını dinamik olarak yönlendirir. Modern Bayesian A/B testi, posterior dağılım güncellemesiyle önceki bilgiyi analize dahil ederek daha az örneklemle güvenilir sonuçlar üretir. Arama ve sıralama sistemlerinde kullanılan interleaving yöntemi ise iki sonuç listesini iç içe geçirerek son derece az trafikte hızlı karşılaştırma yapar. A/B testi, veri odaklı karar alma süreçlerinin temel taşı olup yazılım ve MLOps ekiplerinin her özellik veya model güncellemesini kanıta dayalı biçimde değerlendirmesini sağlar.

A/B Testi Nasıl Çalışır?

A/B testi beş temel aşamadan oluşur. İlk olarak hipotez kurulur: 'B varyantı, A varyantından X metriğinde en az Y kadar daha iyidir' biçiminde somut bir iddia formüle edilir. İkinci aşamada güç analizi yapılır; beklenen etki büyüklüğüne, alfa hatasına (0.05) ve istenen istatistiksel güce (0.80) göre her grupta gerekli minimum gözlem sayısı hesaplanır. Üçüncü aşamada kullanıcılar veya istekler rastgele ve deterministic biçimde (aynı kullanıcı her zaman aynı varyantı görür) gruplara atanır. Dördüncü aşamada her iki varyant eş zamanlı çalışır ve metrikler izlenir. Son olarak, minimum örneklem büyüklüğüne ulaşıldıktan sonra istatistiksel test uygulanır ve sonuç yorumlanır. Birincil metriğin yanı sıra ikincil metrikler de (guardrail metrics) izlenerek kazanan varyantın başka metriklere zarar vermediği doğrulanır.

Makine Öğrenimi ve MLOps'ta A/B Testi

Model Karşılaştırması

Yeni eğitilmiş modeli mevcut prodüksiyon modeliyle gerçek kullanıcı trafiğinde karşılaştırır. Metrikler dönüşüm oranı, NDCG veya yanıt gecikmesi olabilir.

Öneri Sistemleri

Farklı öneri algoritmalarının tıklama oranı ve satın alma üzerindeki etkisini kontrollü biçimde ölçer; hangi algoritmanın gerçek kullanıcı değeri yarattığını kanıtlar.

Hiperparametre Seçimi

Farklı hiperparametre setleriyle eğitilmiş modellerin prodüksiyon metriklerini çevrimdışı değerlendirme yerine gerçek kullanıcı davranışlarıyla doğrular.

Prompt ve İçerik Testi

Üretken yapay zeka sistemlerinde farklı sistem prompt'larını veya içerik stratejilerini karşılaştırır; kullanıcı memnuniyetini ve görev tamamlama oranını ölçer.

Modern A/B Test Varyantları

  • check_circle Multi-Armed Bandit: Keşfet-sömür dengesi kurarak en iyi varyanta trafik payını dinamik olarak artırır; uzun keşfetme aşamasını ve gelir kaybını ortadan kaldırır.
  • check_circle Bayesian A/B Testi: Posterior dağılım güncellemesiyle önceki bilgiyi analize dahil eder; klasik yönteme kıyasla daha az örneklemle erken güvenilir sonuçlar üretir.
  • check_circle Interleaving: Arama ve sıralama sistemlerinde iki sonuç listesini iç içe geçirerek son derece az trafikte hızlı ve hassas karşılaştırma yapar.
  • check_circle A/A Testi: Her iki grupta aynı sürüm çalıştırılır; sahte pozitif oranı ve sistemin güvenilirliği doğrulanır, deney altyapısı kalibrasyon yapılır.

Sıkça Sorulan Sorular

  • check_circle A/B testi ne zaman kullanılır?: Yeni bir model, özellik veya algoritmanın mevcut sistemden gerçekten daha iyi olduğunu nesnel biçimde kanıtlamak gerektiğinde kullanılır. Gözlemsel karşılaştırmalar korelasyon gösterir, A/B testi nedenselliği kanıtlar.
  • check_circle İstatistiksel anlamlılık neden önemlidir?: Gözlemlenen farkın rastlantı eseri mi yoksa gerçek bir etki mi olduğunu belirler. p < 0.05 eşiği, farkın rastlantıdan kaynaklanma olasılığının %5'ten az olduğunu gösterir.
  • check_circle Kaç kullanıcı gereklidir?: Güç analizi (power analysis) ile hesaplanır. Beklenen etki büyüklüğüne, güven eşiğine (%95) ve istenen istatistiksel güce (%80) göre değişir; çok küçük etkiler için binlerce gözlem gerekebilir.
  • check_circle Multi-armed bandit ne zaman tercih edilir?: Keşfetme aşamasındaki kaybı minimize etmek kritik olduğunda — örneğin e-ticaret promosyonları veya haber akışı sıralamasında — klasik A/B testine kıyasla daha az kayıpla sonuca ulaşılır.