blog/ab-testing-smb-dfm
BLOG · ARTIKEL
Tutorial 02. Oktober 2026KI-generiert~4 Min Lesezeit

A/B-Tests für kleine Shops: Was bei wenig Traffic valide ist

A/B-Tests gelingen auch mit 1.000 Besuchern im Monat – wenn Hypothese, Laufzeit und Signifikanzschwelle vorher feststehen. Was kleine Shops messen können.

A/B-Tests sind auch bei niedrigem Traffic valide möglich, aber eng begrenzt: Bei 1.000 Besuchern im Monat und einer Conversion-Rate von 2 % lässt sich statistisch nur nachweisen, was die Rate mindestens verdoppelt – Verbesserungen von 10 bis 20 % sind mit dieser Stichprobe nicht sauber von Zufall zu trennen. Entscheidend sind drei Regeln, die vor dem Start feststehen: eine einzige Hypothese pro Test, eine Laufzeit in vollen Wochen und ein Primärziel, das nachträglich nicht wechselt. Alles andere ist Dashboard-Lektüre, nicht Auswertung.

Ab wie vielen Besuchern lohnt sich ein A/B-Test?

Der Stichprobenbedarf wächst quadratisch, je kleiner der gesuchte Effekt wird – das erklärt, warum klassische Test-Tools scheinbar unvernünftige Besucherzahlen verlangen. Beispielrechnung, ausdrücklich hypothetisch und kein Messergebnis: Bei 1.000 Besuchern im Monat und 2 % Conversion-Rate sind das 20 Bestellungen. Ein +10 %-Effekt (= 0,2 Prozentpunkte) ist mit dieser Stichprobe kaum signifikant nachweisbar – die Formel unten fordert dafür rund 77.000 Besucher je Variante. Ein Effekt dagegen, der die Rate von 2 % auf 4 % verdoppelt, zeigt sich schon mit etwa 770 Besuchern je Variante. Genau das ist die brutale Wahrheit des A/B-Testings im Mittelstand: Kleine Shops können nicht fein messen, nur grob.

── python ──
import math

def n_pro_variante(p, mde):
    """Stichprobe je Variante (Normal-Approximation, 95 %, 80 % Power).
    p = Basisrate, mde = absoluter Mindesteffekt (z. B. 0,002 = 0,2 pp)."""
    z_a, z_b = 1.96, 0.84
    return math.ceil(((z_a + z_b) ** 2 * 2 * p * (1 - p)) / mde ** 2)

# Basisrate 2 %: +0,2 Prozentpunkte benötigt rund 77.000 je Variante
print(n_pro_variante(0.02, 0.002))
# Basisrate 2 %: Verdopplung auf 4 % benötigt rund 770 je Variante
print(n_pro_variante(0.02, 0.02))

Die Formel ist eine Normal-Approximation und liefert eine Größenordnung, keine exakte Zahl; Evan Millers Sample-Size-Rechner rechnet dieselbe Aufgabe exakt aus. Praktisch heißt das für kleine Shops: entweder sehr große Effekte suchen oder auf Kennzahlen mit höherer Basisrate ausweichen. Klicks in den Warenkorb liegen häufig im zweistelligen Prozentbereich – dort sinkt der Stichprobenbedarf für denselben relativen Effekt von fünfstelligen auf vierstellige Besucherzahlen je Variante.

INFO· Die 95-%-Schwelle

Ein Test gilt erst als entschieden, wenn die Wahrscheinlichkeit, dass der beobachtete Unterschied zufällig ist, unter 5 % sinkt (Signifikanzniveau 95 %). Zwischenstände, die diese Schwelle vorzeitig überschreiten, fallen oft darunter zurück, sobald der Test weiterläuft – Evan Miller beschreibt den Mechanismus in „How Not To Run An A/B Test“.

Wie lange muss ein A/B-Test laufen?

Mindestens eine volle Woche, in kleinen Shops eher zwei bis vier. Der Grund ist der Wochentagseffekt: Montagskunden verhalten sich anders als Samstagskunden, und ein Test, der am Dienstag beginnt und am Freitag endet, misst vor allem den Kalender. Zusätzlich leitet sich die Laufzeit aus der berechneten Stichprobe ab, nicht aus dem Kalender: 1.000 Besucher im Monat bei 50/50-Split bedeuten rund 500 pro Variante, und wenn die Formel 770 verlangt, dauert der Test eben gut zwei Monate. Abbrechen, weil das Dashboard nach zehn Tagen schön aussieht, ist der häufigste und teuerste Fehler.

Was sollte ein kleiner Shop zuerst testen?

Nicht das Detail, das gerade auffällt, sondern die Stelle mit dem höchsten Traffic und der plausibelsten Hypothese. Jede Hypothese folgt dem Muster „Wenn wir X ändern, dann Y, weil Z“ – wer das „weil Z“ nicht formulieren kann, testet Geschmack, keine Vermutung.

  • ›Seiten mit dem meisten Traffic zuerst – der Checkout-Vorraum, nicht das Impressum. Der Test braucht die Besucher, die ohnehin da sind.
  • ›Kennzahlen mit hoher Basisrate als Primärziel: Klicks in den Warenkorb lassen sich früher nachweisen als Bestellungen.
  • ›Änderungen mit plausibel großem Hebel: Preisdarstellung, Sichtbarkeit der Versandkosten, Formularlänge – nicht die Schattenfarbe eines Buttons.
  • ›Eine Änderung pro Test. Zwei zugleich bedeuten, dass hinterher niemand weiß, welche gewirkt hat.
  • ›Tests nacheinander statt parallel: Der zweite startet, nachdem der erste ausgewertet und ausgerollt ist, sonst vermischen sich die Effekte.

Welche Fehler machen ein Ergebnis ungültig?

Vier Fehler kehren regelmäßig wieder. Erstens der vorzeitige Blick auf Zwischenstände, sobald eine Variante führt – die Schwelle gilt einmal am Testende, nicht an jedem Tag. Zweitens zwei Änderungen in einem Test, denn danach weiß niemand, welche gewirkt hat. Drittens ein Primärziel, das erst nach dem Ergebnis festgelegt wird: Wer am Ende die Kennzahl wählt, die gerade gut aussieht, hat nicht gemessen, sondern deklariert. Viertens das Ignorieren von Saisonalität – ein Test im November misst Weihnachtskaufverhalten, nicht die Seite.

Welches Werkzeug braucht ein kleiner Shop?

Weniger, als die Anbieter suggerieren. Entscheidend ist nicht das Dashboard, sondern die Zuweisung: zufällig, über die gesamte Laufzeit stabil und ohne Flackern beim ersten Rendern. Kostenlose Plug-ins erfüllen das, solange sie die Variante serverseitig oder per Cookie setzen, bevor die Seite gerendert wird. Teure Suites lohnen sich erst, wenn mehrere Tests parallel laufen und sich gegenseitig ausschließen müssen – ein Stadium, das kleine Shops nach den Zahlen oben ohnehin selten erreichen.

Was passiert nach einem gewonnenen Test?

Ausrollen, dokumentieren, aufräumen. Die Gewinner-Variante wird zur neuen Grundversion, die Verlierer-Variante fliegt samt Zuweisungscode aus dem Projekt – zurückbleibender Testcode ist eine häufige Ursache für langsame Seiten. Hypothese, Datum, Stichprobe und Ergebnis wandern in ein Protokoll; nach einer Handvoll dokumentierter Tests zeigen sich Muster, und meist gewinnt Klarheit gegen Gestaltung. Und wer bei der Auswertung merkt, dass kein Effekt nachweisbar war, verwirft die Hypothese und testet etwas Größeres – auch kein Ergebnis ist ein Ergebnis, solange der Test sauber war.

Wann lohnt sich A/B-Testing trotz wenig Traffic?

Ab dem ersten Tausend Besuchern – mit eingeordneten Erwartungen. Kleine Shops messen grob statt fein: große Effekte, lange Laufzeiten, ein Test nach dem anderen. Der Aufwand liegt bei wenigen Stunden pro Test; der Ertrag ist eine Entscheidung, die nicht auf Meinung beruht. Genau das ist in kleinen Teams der knappste Rohstoff.

/blog/ab-testing-smb-dfm
$ echo "Gefallen?" | share --to=you

Wir bauen das für Sie

Vom Artikel zur Implementierung — sprechen Sie mit uns.