> tpl_aim_014
Deney Tasarımı ve A/B Test Planı
Hipotez formülasyonunu, istatistiksel güç analizini (power analysis), örneklem büyüklüğü hesaplamalarını, birincil ve güvenlik duvarı (guardrail) metriklerini, Örneklem Oranı Uyuşmazlığı (SRM) tespitini ve kademeli devreye alma yönetimini kapsayan deney tasarımı ve A/B test planı.
Gerekli örneklem büyüklüklerini hesaplayan, p-hacking uygulamalarını engelleyen, rastgeleleştirme bütünlüğünü doğrulayan ve özellik canlıya alma kararları öncesinde iş dengelerini değerlendiren uçtan uca bilimsel deney çerçevesi.
Önemli Teknik Doküman Şablonu ve Hukuki Uyarı
TinyCTO.tv Teknik Doküman Şablon Bildirimi: Bu şablon genel eğitim ve operasyon amaçlı bir başlangıç materyalidir. Hukuki, vergisel, muhasebesel, yatırım, satın alma, mevzuat, güvenlik veya sertifikasyon danışmanlığı değildir. Gereklilikler ülkeye, kuruma, sözleşmeye ve riske göre değişir. Kullanmadan önce yetkin uzmanlarla gözden geçirip uyarlayın.
Çözülen Üretim Problemi
Ürün ekipleri, yetersiz güçte, gürültülü örneklemlere veya erken durdurmaya (p-hacking) dayalı olarak kazanan özellikleri ilan eder; bu da geliri ve kullanıcı tutundurmayı zedeleyen gerilemelerin yayına alınmasına neden olur.
Ne Zaman Kullanılmalı?
- •Ürün kullanıcı arayüzü değişiklikleri, algoritmik sıralama güncellemeleri veya fiyatlandırma paketleri için rastgele kontrollü deneyler tasarlarken
- •Çevrim içi deneyleri başlatmadan önce gereken örneklem süresini ve istatistiksel gücü hesaplarken
- •Gecikme süresini (latency), hata oranlarını veya temel geliri düşüren deneyleri durdurmak için otomatik güvenlik bariyerleri kurarken
Ne Zaman Kullanılmamalı?
- •5-10 katılımcılı nitel kullanılabilirlik laboratuvarı çalışmalarında (TPL-PDS-003 kullanın)
- •Kontrol grubu olmaksızın anında %100 dağıtım gerektiren acil güvenlik düzeltmelerinde
5 Şablon Bölümü ve Yapısal İskelet
Sıfır (H0) ve alternatif (H1) hipotezler, test varyantı tanımları ve hedeflenen müşteri segmentleri.
Birincil karar metriği, destekleyici tanısal metrikler ve tavizsiz güvenlik duvarı (guardrail) eşiklerinin seçimi.
Alfa düzeyi, istatistiksel güç (1-beta), asgari tespit edilebilir etki (MDE), varyans azaltma (CUPED) ve minimum çalışma süresi.
Rastgeleleştirme birimi (user_id, session_id veya tenant_id), kümeleme tuzları (salts) ve Örneklem Oranı Uyuşmazlığı için ki-kare testleri.
Önceden tescil edilmiş yayım kriterleri, denge matrisi, kademeli yayım aşamaları ve merkezi öğrenim deposu.
Doldurma ve Uygulama Yönergeleri
Bağımsız İnceleme ve Onay Kontrol Listesi
- Tüm zorunlu bölümler dolduruldu
- Gizli anahtar veya parola içermiyor
- Yönetici sponsor onayı alındı
Deney Tasarımı ve A/B Test Planı - Örnek Vaka Analizi
Örnek Organizasyon: Kurumsal Ödeme Akışı Tek Tıkla Ödeme Deneyi
Kurumsal Ödeme Akışı Tek Tıkla Ödeme Deneyi için eksiksiz operasyonel uygulamayı gösteren gerçek dünya vaka analizi.
- •14 tam takvim günü boyunca varyant başına 420.000 tekil kullanıcı gerektiren %80 istatistiksel güç hesaplandı
- •Deney öncesi harcamayı kullanan CUPED varyans azaltımı uygulandı ve gereken çalışma süresi %28 oranında kısaltıldı
- •Sıfır Örneklem Oranı Uyuşmazlığı tespit edildi (SRM p=0.48) ve tamamlanan ödeme dönüşümünde +%4.2 artış doğrulandı
Sıkça Sorulan Sorular
Örneklem Oranı Uyuşmazlığı (SRM) nedir ve bir A/B testini neden geçersiz kılar?
Örneklem Oranı Uyuşmazlığı (SRM), varyantlar arasındaki gözlemlenen trafik dağılımının hedeflenen orandan istatistiksel olarak sapması durumunda (örn. 50/50 hedeflenirken 48/52 gerçekleşmesi) ortaya çıkar. Bu durum neredeyse her zaman bot filtreleme yanlılığı, yönlendirme gecikmesi veya belirli tarayıcılardaki çökme döngüleri gibi teknik bir kusura işaret eder; bu da örneklemin temsil edici olmadığını ve istatistiksel sonuçların geçersiz olduğunu gösterir.
CUPED varyans azaltma yöntemi deney hızını nasıl artırır?
CUPED (Controlled-experiment Using Pre-Experiment Data), ilgilenilen metrikteki temel varyansı açıklamak ve kaldırmak için deney öncesinde ölçülen kullanıcı davranışını kullanır. Bu önceden var olan gürültüyü temizleyerek CUPED, metrik varyansını %20 ila %50 oranında azaltır ve ürün ekiplerinin aynı Asgari Tespit Edilebilir Etkiyi (MDE) çok daha küçük örneklemlerle ve daha kısa sürede tespit etmesini sağlar.
Planlanan örneklem büyüklüğüne ulaşmadan p-değerine bakmak (peeking) neden tehlikelidir?
Veriler geldikçe istatistiksel anlamlılığı sürekli test etmek (sürekli izleme veya gözetleme), yalancı pozitif oranını (Tip I hata) katlar. Standart alfa=0.05 ile her gün değerlendirilen bir deneyde 14 gün içindeki gerçek yalancı pozitif olasılığı %30'u aşabilir. Ekipler ya sabit örneklem süresine kesinlikle uymalı ya da eşikleri matematiksel olarak ayarlayan sıralı test yöntemlerini (mSPRT veya Alpha Spending gibi) uygulamalıdır.
Teknik Doküman Şablon Paketi
Giriş GerekliTüm boş şablonları, işlenmiş senaryoları ve doğrulama manifestolarını tek bir arşivde indirin.
Yetkili Standartlar ve Kaynaklar
- Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing (Kohavi et al.)Cambridge University Press • OFFICIAL REQUIREMENT
- Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data (CUPED)WSDM Research • OFFICIAL REQUIREMENT
