Ich beschäftige mich gerade damit, wie viel man auf A/B-Tests auf Affiliate-Sites eigentlich geben kann. Konkret: Ich lese immer wieder, dass X% mehr Conversions durch Button-Farbe Y oder Headline-Variante Z rauskommen – aber wenn ich genauer hinschaue, frage ich mich oft, ob die Stichproben überhaupt groß genug waren und ob saisonale Effekte rausgrechnet wurden.
Sommer zum Beispiel. Wir haben gerade Juli, Nutzerverhalten ist anders als im Oktober, Kaufabsichten verschieben sich. Wenn ich jetzt einen Test 3 Wochen laufen lasse und danach Entscheidungen treffe, wie valide ist das? Ich zweifle ehrlich gesagt stark daran, dass die meisten "Tests" in dieser Branche statistisch irgendwas taugen – zu wenig Traffic, zu kurze Laufzeit, keine Kontrolle von externen Einflussfaktoren.
Mich würde interessieren: Wie macht ihr das konkret? Ab welcher monatlichen Besucherzahl fängt A/B-Testing überhaupt an, sinnvolle Ergebnisse zu liefern? Nutzt ihr Tools die euch statistische Signifikanz anzeigen, oder verlasst ihr euch auf Bauchgefühl? Und wie geht ihr mit saisonalen Verzerrungen um?
Ich suche hier keine Erfolgsgeschichten, sondern ehrliche Einschätzungen – auch gerne kritische. Was habt ihr gelernt, dass A/B-Testing auf kleineren Affiliate-Sites eher Zeitverschwendung ist, oder wo hat es euch wirklich weitergebracht?
Ich seh das ähnlich skeptisch wie du. Das Grundproblem ist doch: statistische Signifikanz und praktische Relevanz werden ständig verwechselt. Selbst wenn ein Ergebnis mit 95% Konfidenz signifikant ist – was bedeutet das für eine Seite mit 800 Besuchern im Monat? Nichts. Die Konfidenzintervalle sind so breit, dass der "echte" Effekt zwischen -5% und +40% liegen könnte.
Sommer macht es noch schlimmer. Ich hatte das saisonale Thema schon mal in anderem Kontext – Nutzerintention ändert sich stark je nach Jahreszeit, das verfälscht jede Baseline.
Mein Fazit nach einigen Tests: Für kleine Sites lieber qualitative Methoden – Heatmaps, Session Recordings, 5-Minuten-Usertests mit echten Leuten. Kostet weniger Zeit und liefert oft mehr echte Insights als ein p-Wert den man sich schönredet.
Ich hab das Thema ehrlich gesagt von einer anderen Seite angegangen – Button-Farben getestet und die Ergebnisse haben mich selbst überrascht, hab da was dazu gepostet. Aber ich muss zugeben: nach Markus' Punkt hier zweifle ich jetzt selbst etwas an der Aussagekraft. Mein Traffic war in dem Testzeitraum bei ca. 3.200 Besuchern gesamt. Zu wenig?
Gute Frage, und ja – das Thema wird in der Community massiv romantisiert. Ich mach das seit über 12 Jahren und kann dir sagen: Unter 5.000 Besuchern pro Monat pro Variante ist A/B-Testing bei den meisten Affiliate-Seiten schlicht nicht aussagekräftig. Das ist die unbequeme Wahrheit.
Was viele machen: Sie lassen einen Test 2 Wochen laufen, sehen +18% und jubeln. Dabei hat Google in der zweiten Woche gerade irgendeinen kleinen Algorithmus-Crawl gemacht, oder die Nutzerdemografie hat sich durch einen viralen Post verschoben. Keiner kontrolliert das.
Ich nutze selbst Google Optimize – ah, der ist ja mittlerweile eingestellt – jetzt teste ich mit VWO auf größeren Projekten. Für kleinere Seiten ehrlich gesagt: sequentielle Tests über Zeiträume von 6-8 Wochen, mindestens, mit manueller Prüfung auf saisonale Ausreißer. Das ist mühsam aber realistischer.
Das Thema Schutz von Testergebnissen wenn man mit externen Partnern zusammenarbeitet hab ich übrigens hier schon mal angesprochen – wer Tests outsourct, hat noch ganz andere Probleme.
Ich bin noch relativ neu dabei, aber die Frage beschäftigt mich auch. Ich hatte eigentlich geplant jetzt im Sommer ein paar Tests zu starten, weil ich dachte mehr Zeit gleich mehr Erkenntnisse. Aber wenn ich das hier so lese – macht das bei mir mit aktuell um die 1.500 Besucher im Monat wohl noch keinen Sinn. Lieber erst Traffic aufbauen und dann testen, oder?