A/B testi sonuçlarını analiz etmek, iki sürüm arasındaki farkın gerçek bir etkiden mi yoksa rastlantıdan mı kaynaklandığını ayırt etmek demektir. Bunun için sonucu yalnızca “hangisi daha yüksek” sorusuyla değil, istatistiksel anlamlılık, yeterli örneklem ve pratik önem birlikte değerlendirilerek okumak gerekir.
Test aracının panelinde bir sürümün önde göründüğünü görmek kolaydır; zor olan, bu farkın yarın da geçerli olup olmayacağını bilmektir. Yanlış okunan bir test, işe yaramayan bir değişikliğin kalıcı hale gelmesine ya da iyi bir fikrin erken terk edilmesine yol açar. Bu yazıda sonuçları değerlendirmeden önce hazırlanması gerekenleri, anlamlılık kavramını ve analiz adımlarını ele alıyoruz.
Analiz Test Başlamadan Önce Başlar
Bir testin sonucunu sağlıklı yorumlayabilmek için bazı kararların test başlamadan önce alınmış olması gerekir. Sonuçlar geldikten sonra alınan kararlar, farkında olmadan veriyi istediğiniz yanıta göre bükmenize yol açar.
- Hipotez: Neyi değiştirdiğinizi, hangi davranışı etkilemesini beklediğinizi ve nedenini tek cümleyle yazın.
- Birincil metrik: Kazananı belirleyecek tek bir metrik seçin; örneğin form gönderimi veya satın alma.
- İkincil ve koruyucu metrikler: Değişikliğin başka bir şeyi bozmadığını kontrol edeceğiniz göstergeler, örneğin iade oranı veya sayfa hızı.
- Gereken örneklem ve süre: Mevcut trafiğinize ve saptamak istediğiniz en küçük etkiye göre bir örneklem hesaplayıcısıyla belirlenir.
- Karar kuralı: Hangi koşulda yeni sürümü yayına alacağınızı, hangi koşulda eskide kalacağınızı önceden tanımlayın.
İstatistiksel Anlamlılık Ne Söyler, Ne Söylemez?
İstatistiksel anlamlılık, iki sürüm arasında gerçekte hiçbir fark olmasaydı gözlemlediğiniz kadar büyük bir farkı görmenin ne kadar olası olduğunu değerlendirir. Bu olasılık, önceden belirlediğiniz eşiğin altında kalıyorsa sonuç anlamlı kabul edilir ve farkın salt şansla açıklanmasının zor olduğu sonucuna varılır.
Anlamlılığın söylemediği şeyler de en az söyledikleri kadar önemlidir:
- Farkın büyük ya da işletme açısından değerli olduğunu söylemez. Çok yüksek trafikte önemsiz bir fark bile anlamlı çıkabilir.
- Yeni sürümün her kullanıcı grubu için daha iyi olduğunu söylemez.
- Sonucun gelecekte aynen tekrarlanacağını garanti etmez; yalnızca rastlantı riskini sınırlar.
Bu nedenle sonucu değerlendirirken güven aralığına da bakın. Güven aralığı, gerçek etkinin makul olarak hangi aralıkta olabileceğini gösterir. Aralık hem olumlu hem olumsuz değerleri kapsıyorsa, elinizdeki veri hangi yönde bir etki olduğunu söylemeye yetmiyor demektir.
Örneklem Büyüklüğü ve Test Süresi
Az veriyle alınan sonuç gürültüdür. Test, önceden hesaplanan örneklem büyüklüğüne ulaşmadan bitirilmemelidir. Süre belirlerken şu noktaları göz önünde bulundurun:
- Testi en az bir tam haftalık döngüyü kapsayacak şekilde çalıştırın; hafta içi ve hafta sonu davranışı genellikle farklıdır.
- Kampanya dönemleri, bayramlar veya büyük indirimler test sonucunu olağan dışı etkileyebilir.
- Yeni bir tasarım, alışkanlıklarından dolayı geri dönen kullanıcılarda başlangıçta farklı tepki doğurabilir; bu yenilik etkisi zamanla azalır.
- Trafiğiniz düşükse, küçük farkları saptamaya çalışmak yerine daha cesur değişiklikler test edin.
Satış döngüsü uzun olan işletmelerde bir ek zorluk daha vardır: Testin gördüğü dönüşüm, kullanıcının ilk ziyaretinden günler sonra gerçekleşebilir. Böyle durumlarda testi kapattıktan sonra da bir süre dönüşümlerin gelmesini beklemek ya da birincil metrik olarak satışa daha yakın ama daha erken ölçülebilen bir adımı seçmek gerekebilir. Hangi yolu seçtiğinizi test başlamadan önce kararlaştırın.
Erken Bakma Tuzağı
Test sürerken sonuçları her gün kontrol edip bir sürüm anlamlı göründüğü anda testi durdurmak, en yaygın ve en pahalı hatalardan biridir. Sonuçlar test boyunca dalgalanır; erken dönemde anlamlı görünen farklar sıkça kaybolur. Her bakışta durdurma fırsatı yarattığınızda, aslında olmayan bir etkiyi gerçek sanma olasılığınız artar.
Çözüm, testi önceden belirlenen örneklem ve süreye kadar sürdürmek ya da sıralı analiz yöntemlerini baştan destekleyen bir test aracı kullanmaktır. Ara sonuçlara bakmak yasak değildir; ama bu bakışlar teknik hataları yakalamak için yapılmalı, karar vermek için değil.
A/A Testiyle Altyapıyı Sınayın
Test aracınıza ve ölçümünüze güvenip güvenemeyeceğinizi anlamanın pratik bir yolu A/A testidir. Bu testte iki grup da aynı sayfayı görür. Altyapı doğru çalışıyorsa sonuçlar arasında anlamlı bir fark çıkmaması beklenir. Sürekli olarak bir tarafın öne geçtiğini görüyorsanız, trafiğin bölünmesinde, önbellek ayarlarında ya da etkinlik ölçümünde bir sorun olabilir. Yeni bir test aracına geçtiğinizde veya etiket yapınızı değiştirdiğinizde kısa bir A/A testi, sonraki bütün testlerin güvenilirliğini korur. Aynı kontrol, sayfanın yeni sürümünde ölçüm kodunun eksik yüklenmediğini doğrulamak için de iyi bir fırsattır; yalnızca bir sürümde çalışmayan bir etiket, gerçekte olmayan bir kazanan ya da kaybeden üretebilir.
Adım Adım Sonuç Analizi
- Veri kalitesini doğrulayın. Trafiğin sürümler arasında planlanan oranda bölünüp bölünmediğini kontrol edin. Belirgin bir sapma, yönlendirme veya izleme hatasına işaret eder ve sonucu geçersiz kılabilir.
- Birincil metriği değerlendirin. Farkın yönüne, anlamlılığına ve güven aralığına birlikte bakın.
- Koruyucu metrikleri kontrol edin. Dönüşüm artarken sipariş değeri düşmüş ya da iadeler artmış olabilir.
- Segmentlere bakın. Mobil ve masaüstü, yeni ve geri dönen kullanıcılar gibi ana gruplarda sonucun yönü tutarlı mı? Segment analizinin temellerini kullanıcı davranışı ve segmentasyon yazımızda anlattık.
- Pratik önemi tartın. Farkın büyüklüğü, değişikliği kalıcı hale getirmenin maliyetini karşılıyor mu?
- Kararı ve gerekçeyi belgeleyin. Hipotezi, sonucu, görselleri ve alınan kararı ortak bir test arşivine kaydedin.
Kaybeden ve Sonuçsuz Testlerden Öğrenmek
Her test bir kazanan üretmez ve bu bir başarısızlık değildir. Kaybeden bir sürüm, kullanıcıların neye değer vermediğini gösterir; sonuçsuz bir test ise değiştirdiğiniz öğenin davranış üzerinde sandığınız kadar etkili olmadığını söyler. İkisi de bir sonraki hipotezin kalitesini artırır. Bu yüzden test arşivinde kazananlar kadar kaybedenlere de yer açın; ekip yeni bir fikir önerdiğinde benzerinin daha önce denenip denenmediği hızla kontrol edilebilsin.
Sonuçsuz testlerde segment verisine bakıp “mobilde kazandı” gibi sonradan bulunan bir alt sonucu hemen uygulamaya koymak cazip gelir. Bu tür bulgular yeni bir hipotez olarak ele alınmalı ve ayrı bir testle doğrulanmalıdır. Test fikirlerini beslemek için ısı haritaları iyi bir kaynaktır; bu konuyu ısı haritaları yazımızda inceledik. Hipotezden karara uzanan sürecin tamamı, sistemli bir dönüşüm optimizasyonu programının parçasıdır.
Sık Yapılan Hatalar
- Sonradan metrik değiştirmek: Birincil metrik kazanan çıkmayınca başka bir metrikte kazanan aramak, yanlış pozitif üretmenin kestirme yoludur.
- Aynı anda çok sayıda sürüm ve metrik: Karşılaştırma sayısı arttıkça rastlantısal bir “kazanan” bulma olasılığı da artar.
- Çerez onayının etkisini unutmak: Onay vermeyen kullanıcılar ölçümün dışında kalıyorsa, test yalnızca onay veren kitle üzerinde sonuç üretir. Bu sınırı raporda belirtin.
- Kazananı doğrulamadan yaymak: Büyük değişikliklerde yayına alma sonrası performansı izlemeye devam edin.
- Test sırasında başka değişiklik yapmak: Test sürerken fiyatı, kampanya hedeflemesini veya sayfanın başka bir bölümünü değiştirmek, sonucun neye bağlı olduğunu belirsizleştirir.
- Arşiv tutmamak: Belgelenmeyen testler aylar sonra yeniden yapılır ve kurum aynı dersi iki kez öğrenir.
Sonuç
A/B testi analizi, bir rakamın diğerinden büyük olup olmadığına bakmaktan çok daha fazlasıdır. Hipotezi ve karar kuralını önceden belirleyin, yeterli veri toplayın, erken bakma tuzağından kaçının, anlamlılığı pratik önemle birlikte değerlendirin ve her sonucu belgeleyin. Test programınızı birlikte planlamak için bizimle iletişime geçin.