A/B Testi Nedir? Makine Öğrenmesinde A/B Testing (A/B Testi)

Kontrol ve deney gruplarına rastgele kullanıcı atayarak model veya özellik değişikliklerini istatistiksel olarak doğrulayan standart üretim test yöntemi.

A/B testi, iki farklı sürümü (A kontrol, B deney) kullanıcılara rastgele göstererek hangisinin daha iyi performans gösterdiğini belirleyen istatistiksel bir deney yöntemidir. Makine öğrenmesinde model değerlendirmesinin temel taşı olan A/B testi; web uygulamalarından öneri sistemlerine, dil modellerinden görüntü sınıflandırıcılara kadar geniş bir alanda kullanılır. Testin çalışma mantığı şu adımlara dayanır: Kullanıcılar rastgele iki gruba ayrılır. A grubu mevcut sistemi (kontrol), B grubu yeni modeli veya özelliği (deney) deneyimler. Belirli bir süre sonra tıklama oranı, dönüşüm, RMSE veya doğruluk gibi metrikler karşılaştırılır; istatistiksel anlamlılık p-değeri ve güven aralığı ile ölçülür. Makine öğrenmesi ekipleri A/B testini şu senaryolarda kullanır: Yeni model sürümünü üretim ortamında doğrulama, hiperparametre değişikliklerinin gerçek etkisini ölçme, farklı öneri algoritmalarını kullanıcı katılımıyla karşılaştırma ve özellik mühendisliği değişikliklerinin işletme metriklerine katkısını ölçme. Sık karşılaşılan tuzaklar arasında erken sonuç okuma (peeping problem), çoklu karşılaştırma yanılgısı (Bonferroni düzeltmesi gerektirir), yeterli örneklem büyüklüğü hesaplamamak ve kullanıcı segmentasyonu farklarını göz ardı etmek sayılabilir. Sıralı A/B testi (sequential testing) ise bu sorunları azaltmak için erken durdurma kuralları kullanır. Kanary dağıtımı (canary deployment) ve gölge modu (shadow mode) A/B testinin üretim ortamında uygulandığı ileri düzey varyantlardır. Kanary dağıtımında yeni model yalnızca küçük bir trafik dilimine sunularak riskler sınırlandırılır; gölge modunda ise yeni model gerçek trafiği paralel olarak işler ancak kullanıcıya hiçbir zaman yanıt vermez. Türkiye'de büyük e-ticaret ve fintech platformları üretim ML sistemlerini bu yöntemlerle doğrulamaktadır. Yaygın araçlar: MLflow Experiments, Amazon SageMaker Experiments, Optimizely ve açık kaynak Wasabi. Interleaved (karışık) A/B testi ise öneri ve arama sistemleri için özel olarak geliştirilmiş bir varyantdır: A ve B sistemlerinin sonuçları tek bir listeye interleave edilerek kullanıcı tıklamaları üzerinden hangisinin daha iyi sıralama yaptığı çıkarılır. Bu yöntem, klasik A/B testi karşılaştırmasına göre çok daha hızlı istatistiksel güç elde etmeyi sağlar.

A/B Testinin Temel Mantığı

A/B testi, kontrollü deney tasarımının dijital ürün geliştirmeye uyarlanmış biçimidir. Kullanıcılar iki rastgele gruba ayrılır: kontrol grubu (A) mevcut sistemi, deney grubu (B) ise test edilen değişikliği deneyimler. Testin geçerliliği iki istatistiksel boyuta bağlıdır: p-değeri anlamlılık eşiğini (tipik olarak p < 0.05) ve güven aralığı ölçülen etkinin gerçekliğini belirler. Örneklem büyüklüğü hesabı (power analysis), testin başlamadan önce kaç kullanıcıya ulaşması gerektiğini ortaya koyar; bu adım atlandığında test küçük ama gerçek etkileri gözden kaçırır ve karar vericileri yanıltır. Örneklem belirlenirken beklenen etki büyüklüğü, anlamlılık düzeyi (α = 0.05) ve istenilen istatistiksel güç (genellikle %80) birlikte hesaba katılır.

ML Geliştirmede Kullanım Senaryoları

  • check_circle Üretim Modeli Doğrulama: Yeni eğitilmiş modeli gerçek trafik üzerinde test ederek çevrimdışı metriklerden kaynaklanan önyargıları ortadan kaldırır ve nesnel performans ölçümü sağlar.
  • check_circle Hiperparametre Etkisi Ölçümü: Öğrenme hızı veya mimari değişikliklerinin gelir ve kullanıcı katılımı gibi işletme metriklerine gerçek katkısını doğrudan üretim ortamında ortaya koyar.
  • check_circle Öneri Algoritması Karşılaştırması: Farklı sıralama modellerini tıklama oranı veya oturum süresi gibi kullanıcı davranışı metrikleriyle karşılaştırarak en iyi algoritmayı veriye dayalı seçmeyi mümkün kılar.
  • check_circle Özellik Mühendisliği Doğrulama: Yeni özelliğin çevrimdışı RMSE iyileşmesinin üretimde gerçek davranış değişikliğine dönüşüp dönüşmediğini ölçer; offline-online uçurum tespitinin temel aracıdır.

İstatistiksel Tuzaklar ve Çözüm Yolları

  • check_circle Peeping Problem (Erken Okuma): Test süresi dolmadan ara sonuçlara bakarak karar vermek tip I hatasını dramatik biçimde artırır. Sıralı test (sequential testing) bu sorunu erken durdurma kurallarıyla yönetir.
  • check_circle Çoklu Karşılaştırma Yanılgısı: Aynı anda birden fazla metrik test edildiğinde rastlantısal anlamlılık olasılığı yükselir. Bonferroni düzeltmesi veya FDR (False Discovery Rate) kontrolü uygulanması gerekir.
  • check_circle Örneklem Yetersizliği: Güç analizi yapılmadan başlatılan testler küçük ama anlamlı etkileri gözden kaçırır; bu durum hem gereksiz büyük değişiklikleri hem de gerçek iyileşmeleri maskeleyebilir.
  • check_circle Segmentasyon Farkları: Kullanıcı randomizasyonu homojen değilse (cihaz, coğrafya, geçmiş davranış gibi faktörler nedeniyle) gruplar arasında başlangıç farkları oluşur ve test sonuçlarını yanıltır.

Üretim Varyantları: Kanary, Shadow ve Interleaved

  • check_circle Kanary Dağıtımı: Yeni model yalnızca küçük bir trafik dilimine (%1–5) sunulur; olası hatalar ya da performans düşüşleri geniş kullanıcı kitlesini etkilemeden erken tespit edilir.
  • check_circle Shadow Mode (Gölge Mod): Yeni model gerçek trafik üzerinde paralel çalışır ancak kullanıcıya yanıt göndermez; tahminler kayıt altına alınarak gecikme, hata oranı ve çıktı kalitesi analiz edilir.
  • check_circle Interleaved A/B Testi: Öneri ve arama sistemleri için A ile B sonuçları tek listede birleştirilir. Kullanıcı tıklamaları üzerinden hangisinin daha iyi sıralama yaptığı klasik A/B testine göre çok daha hızlı belirlenir.

Araçlar ve Ekosistem

  • check_circle MLflow Experiments: Açık kaynak deney takip platformu; model parametrelerini, metrikleri ve artifaktları sürümlü biçimde kaydeder, A/B sonuç karşılaştırmasını merkezi bir panelde sunar.
  • check_circle Amazon SageMaker Experiments: AWS ekosisteminde yönetilen deney altyapısı; SageMaker Pipeline ve AutoPilot ile entegre çalışarak ML modellerinin tüm yaşam döngüsünde izlenebilirlik sağlar.
  • check_circle Optimizely & VWO: Ürün ve pazarlama ekiplerine yönelik görsel arayüzlü platformlar; istatistiksel motor, segment raporlaması ve hedef kitle segmentasyonu araçları içerir.
  • check_circle Wasabi (Açık Kaynak): Sıralı A/B testi için Python kütüphanesi; peeping problem olmadan erken sonuç çıkarımı sunar ve standart klasik testlere göre daha yüksek esneklik tanır.

Sık Sorulan Sorular

  • check_circle A/B testi ne kadar sürmeli?: Örneklem büyüklüğü hesabına (power analysis) göre belirlenen kullanıcı sayısına ulaşılana kadar devam edilmeli; iş döngüsünün en az tam bir haftasını kapsaması mevsimsel ve haftalık kullanıcı davranışı farklılıklarını dengeler.
  • check_circle Aynı anda kaç varyant test edilebilir?: A/B/n testi birden fazla varyantı destekler; ancak her ek varyant için örneklem boyutu büyür ve çoklu karşılaştırma düzeltmesi zorunlu hale gelir, bu da toplam test süresini uzatır.
  • check_circle İstatistiksel anlamlılık başarıyı kanıtlar mı?: Hayır. p < 0.05, etkinin küçük de olsa gerçek olduğunu gösterir; pratik önemi belirlemek için etki büyüklüğü (effect size) ayrıca değerlendirilmeli ve iş hedefleriyle karşılaştırılmalıdır.
  • check_circle Çevrimdışı metrikler A/B testini ne zaman yetersiz bırakır?: Oturum süresi, geri dönme oranı ve dönüşüm gibi gerçek kullanıcı etkileşimine bağlı metrikler çevrimdışı ortamda ölçülemez. Bu durumlarda üretim A/B testi veya interleaved test zorunludur.
  • check_circle Türkiye'de A/B testi kimler uygular?: Trendyol, Getir ve Hepsiburada gibi büyük e-ticaret platformları ile fintech şirketleri öneri algoritmalarını ve yeni model sürümlerini üretimde A/B testi ile doğrulamaktadır.