Was ist A/B-Testing?
A/B-Testing ist ein kontrolliertes Experiment auf einer Website oder in einer App. Der Traffic wird zufällig auf eine Kontrollversion (A) und eine Variante (B) verteilt. Gemessen wird eine vorher festgelegte Zielgröße, zum Beispiel die Conversion Rate.
Der Zufall ist der entscheidende Teil. Weil beide Gruppen gleich zusammengesetzt sind, lässt sich ein Unterschied im Ergebnis auf die Änderung zurückführen. Saison, Wetter oder eine laufende Kampagne treffen beide Gruppen gleich. Genau das unterscheidet einen A/B-Test von einem Vorher-nachher-Vergleich.
Das Prinzip ist alt. Medizinische Studien arbeiten seit Jahrzehnten so. Online wurde es in den 2000er-Jahren zum Standard, als Amazon, Google und Booking.com begannen, Entscheidungen systematisch zu testen. Booking.com gilt heute als eines der Unternehmen mit den meisten parallel laufenden Experimenten.
A/B-Test, Split-URL-Test, multivariater Test: der Unterschied
Testart | Was getestet wird | Trafficbedarf | Typischer Einsatz |
|---|---|---|---|
A/B-Test | Eine Kontrolle gegen eine oder mehrere Varianten auf derselben URL | mittel | neue Argumentation, neues Layout eines Bereichs |
Split-URL-Test | Zwei komplett unterschiedliche Seiten unter eigenen URLs | mittel | neue Landingpage, neuer Checkout |
Multivariater Test | Mehrere Elemente gleichzeitig in allen Kombinationen | sehr hoch | Feinabstimmung bei sehr viel Traffic |
A/A-Test | Zweimal dieselbe Version | mittel | Prüfung, ob Tool und Tracking sauber messen |
Für die meisten Websites ist der klassische A/B-Test die richtige Wahl.
Ein multivariater Test mit drei Überschriften und drei Bildern hat neun Kombinationen. Jede braucht genug Besucher für ein belastbares Ergebnis. Für die meisten Websites ist das zu viel. Wann sich nacheinander, gleichzeitig oder multivariat testen lohnt, steht in einem eigenen Artikel.
Daneben gibt es Bandit-Verfahren. Sie verschieben den Traffic während des Tests zur besseren Variante. Das bringt kurzfristig mehr Umsatz, liefert aber weniger saubere Erkenntnisse. Für Aktionen mit kurzer Laufzeit kann das sinnvoll sein. Für Entscheidungen, die länger gelten sollen, ist der klassische A/B-Test besser.
Wann sich A/B-Testing lohnt
Viele prüfen zu spät, ob ihr Traffic überhaupt reicht. Wie viele Besucher ein Test braucht, hängt von drei Werten ab. Erstens die heutige Conversion Rate. Zweitens der Effekt, den du nachweisen willst. Drittens die gewünschte Sicherheit, üblich sind 95 % Konfidenz und 80 % Power.
Ausgangslage | Gesuchter Effekt | Besucher pro Variante | Besucher gesamt (A und B) | Laufzeit bei 5.000 Besuchern am Tag |
|---|---|---|---|---|
3 % Conversion Rate | +10 % (auf 3,3 %) | rund 53.000 | rund 106.000 | rund 3 Wochen |
3 % Conversion Rate | +20 % (auf 3,6 %) | rund 14.000 | rund 28.000 | rund 6 Tage, aufgerundet auf 2 Wochen |
Rechenbeispiel mit 95 % Konfidenz und 80 % Power, zweiseitiger Test.
Zwei Dinge fallen auf. Kleine Effekte brauchen sehr viel Traffic, bei halbem Effekt etwa viermal so viel. Und jeder Test sollte mindestens zwei volle Wochen laufen, auch wenn die Zahl früher erreicht ist. Sonst verzerren Wochentage und Zahltage das Ergebnis.
Für deine eigenen Zahlen gibt es den kostenlosen Testlaufzeitrechner.
Als grobe Faustregel wird klassisches A/B-Testing unter rund 1.000 Conversions im Monat auf der getesteten Strecke schwierig. Dann helfen größere Änderungen mit größerem Effekt, Tests auf Zwischenschritten wie „In den Warenkorb“ und qualitative Methoden wie Nutzerinterviews.
Ablauf eines A/B-Tests in sechs Schritten
1. Analyse. Finde heraus, wo und warum Besucher abspringen. Zahlen aus der Webanalyse zeigen das Wo. Nutzerinterviews, Umfragen und Session-Aufzeichnungen zeigen das Warum.
2. Hypothese. Formuliere, was du änderst, warum es wirken soll und woran du den Erfolg misst. Eine gute Hypothese stützt sich auf beobachtetes Verhalten und nicht auf Geschmack. Ein Muster dafür ist das Hypothesen-Template.
3. Priorisierung. Sortiere deine Ideen nach erwartetem Wertbeitrag, Aufwand und Trafficbedarf. So läuft zuerst, was am meisten bringt. Wie das geht, zeigt der Artikel zur Backlog-Priorisierung.
4. Umsetzung und Qualitätssicherung. Baue die Variante im Testing-Tool oder serverseitig. Prüfe sie auf allen wichtigen Browsern und Geräten. Ein Fehler in einer Variante kostet echten Umsatz. Mehr dazu im Artikel zur Qualitätssicherung beim A/B-Testing.
5. Laufzeit. Lass den Test über die vorher berechnete Dauer laufen und schau nicht täglich auf den Gewinner. Wer abbricht, sobald eine Variante vorne liegt, findet viele Scheingewinner.
6. Auswertung und Roll-out. Prüfe Signifikanz, Stichprobenverteilung und Segmente. Rolle Gewinner aus und dokumentiere, was du gelernt hast. Auch ein verlorener Test sagt dir etwas über deine Kunden, wie der Artikel über Testverlierer zeigt.
Eine ausführlichere Fassung findest du in den zehn Schritten zum Testingprozess.
Was du testen kannst
Bereich | Typische Hypothese | Zielgröße |
|---|---|---|
Produktseite | Wer Lieferzeit und Rückgabe direkt am Preis sieht, zögert weniger. | Add-to-Cart-Rate |
Checkout | Ein Gastkauf ohne Pflichtregistrierung senkt die Abbrüche. | abgeschlossene Bestellungen |
Formular | Weniger Pflichtfelder bringen mehr Anfragen, ohne die Qualität zu senken. | Anfragen und qualifizierte Leads |
Preisseite | Eine hervorgehobene mittlere Option lenkt die Wahl. | Umsatz pro Besucher |
Landingpage | Eine Überschrift, die das Problem des Besuchers benennt, hält ihn auf der Seite. | Klicks auf den nächsten Schritt |
Beispiele für Hypothesen nach Seitentyp.
Wichtiger als das Element ist die Begründung. Ein Test „roter gegen grünen Button“ ohne Hypothese bringt selten etwas. Warum das so ist, beschreibt der Artikel über Button-Tests. Wirksamer sind Änderungen, die eine Sorge des Kunden aufgreifen oder ein Verhaltensmuster wie Verlustaversion oder Social Proof nutzen. Eine Übersicht bieten unsere Behavior Patterns.
Statistik ohne Fachchinesisch
Konfidenz. Sie gibt an, wie sicher du sein kannst, dass der Unterschied nicht zufällig ist. Üblich sind 95 %. Das heißt auch: Bei 20 Tests ohne echten Effekt zeigt im Schnitt einer trotzdem einen Gewinner. Die Grundlagen zur Konfidenz erklären das ausführlich.
Power. Sie gibt an, mit welcher Wahrscheinlichkeit dein Test einen echten Effekt findet. Üblich sind 80 %. Ein Test mit zu wenig Besuchern hat eine niedrige Power und übersieht Gewinner. In einer Auswertung von 115 A/B-Tests durch den Statistiker Georgi Georgiev waren fast 70 % zu schwach angelegt.
Stichprobe und Laufzeit. Beide legst du vor dem Start fest, nicht währenddessen. Der Testplaner rechnet auch mehrere Varianten und ungleiche Trafficverteilung.
Frequentistisch oder bayesianisch. Die frequentistische Auswertung beantwortet, ob ein Unterschied signifikant ist. Die bayesianische Auswertung beantwortet, wie wahrscheinlich welcher Uplift ist und was er in Euro bedeutet. Für Entscheidungen im Management ist die zweite oft verständlicher. Dafür gibt es den Bayesianischen Business-Case-Rechner.
Ob ein abgeschlossener Test signifikant ist, prüfst du mit dem Konfidenzrechner. Die häufigsten Denkfehler bei der Auswertung stehen in den zehn Statistik-Fallen.
Wie oft Tests gewinnen
Viele Tests bringen kein signifikantes Ergebnis. Das ist normal und kein Zeichen schlechter Arbeit. Wie hoch die Trefferquote ist, hängt vor allem davon ab, woher die Hypothesen kommen.
Wer Best Practices aus Blogs testet, trifft selten. Wer vorher versteht, warum Kunden zögern, trifft häufiger. Bei freenet waren zwei Drittel aller Tests erfolgreich, der kumulierte Uplift lag bei 30 %. Der Grund war nicht ein besseres Tool, sondern Hypothesen aus Kundenverständnis.
Auch ein Test ohne Gewinner hat einen Wert. Er verhindert, dass eine teure Änderung ohne Wirkung live geht. Und er zeigt, welche Annahme über deine Kunden nicht stimmt.
Beispiele aus der Praxis
Schuh-Onlineshop: Der Gewinner war teurer als gedacht
Ein Fashion-Händler testete für ein Schuhmodell drei Varianten der Produktseite gegen die Kontrolle. Eine Variante betonte Rabatte, eine die Qualität, eine verbesserte die Darstellung. Die Gewinner-Variante steigerte die Add-to-Cart-Rate um 244 % und die Bestellungen um 43 %. Gleichzeitig kamen fast dreimal so viele Retouren zurück. Nach Abzug der Retouren blieben 22 % mehr Deckungsbeitrag.
Der Test war also ein Erfolg, aber nur halb so groß wie die erste Zahl. Wer nur auf die Conversion Rate schaut, rechnet sich solche Tests schön. Die ganze Geschichte steht in der Case Study zu Conversion, Retouren und Deckungsbeitrag.
Fashion-D2C-Marke: Testen als Wachstumshebel
Der Markt für das Kerngeschäft einer mittelständischen D2C-Marke war gesättigt. Mehr Werbebudget brachte kaum noch neue Kunden. Gemeinsam mit dem internen Team wurde Experimentation zum festen Teil jeder wichtigen Entscheidung. Ergebnis: +20,69 % Umsatzwachstum und 22,8 Mio. € Wertbeitrag pro Jahr. Die Werte sind konservativ gerechnet, mit Konfidenzintervall und Abschreibung. Weitere Ergebnisse stehen auf unserer Seite zur Conversion-Optimierung.
Typische Fehler beim A/B-Testing
Zu früh abbrechen. Wer den Test stoppt, sobald eine Variante vorne liegt, erhöht das Risiko eines Scheingewinners deutlich.
Zu kleine Stichprobe. Ohne vorherige Berechnung bleibt offen, ob der Test einen Effekt überhaupt finden kann.
Ungleiche Verteilung. Bekommt eine Variante deutlich mehr oder weniger Besucher als geplant, stimmt etwas mit der Aufteilung nicht. Fachleute sprechen von Sample Ratio Mismatch. Das Ergebnis ist dann nicht verwertbar.
Flackern. Lädt die Variante sichtbar nach der Originalseite, verfälscht das Verhalten. Tipps dazu stehen im Artikel zur Front-End-Performance.
Zu viele Zielgrößen. Wer zehn Kennzahlen misst, findet fast immer eine, die zufällig gewinnt. Lege eine Hauptzielgröße vorher fest.
Neuheitseffekt. Wiederkehrende Besucher klicken anfangs auf alles Neue. Der Effekt kann nach zwei, drei Wochen verschwinden.
Falsche Zielgröße. Mehr Bestellungen sind nicht automatisch mehr Gewinn, wie der Schuh-Test zeigt.
Fünf weitere unscheinbare Testing-Fehler beschreibt ein eigener Artikel.
A/B-Testing, SEO und Datenschutz
Google erlaubt A/B-Tests ausdrücklich. Drei Regeln solltest du einhalten. Zeige Suchmaschinen keine andere Version als Besuchern, das wäre Cloaking. Setze bei Split-URL-Tests einen Canonical-Tag auf die Originalseite. Und beende Tests nach der geplanten Laufzeit, statt sie monatelang laufen zu lassen. Mehr dazu im Artikel A/B-Testing als SEO-Gefahr?
Beim Datenschutz gilt: Die meisten Testing-Tools setzen Cookies oder speichern eine Kennung im Browser. Dafür brauchst du in der Regel eine Einwilligung über dein Consent-Banner. Serverseitige Tests ohne personenbezogene Daten sind einfacher abzusichern. Kläre die Einbindung mit deinem Datenschutzbeauftragten. Wie viel Tracking mit Einwilligung möglich ist, zeigt unser Test zum Cookie-Banner.
Tools für A/B-Testing
Seit Google Optimize im September 2023 eingestellt wurde, nutzen die meisten Unternehmen spezialisierte Anbieter. Grob unterscheiden sich zwei Gruppen. Clientseitige Tools verändern die Seite im Browser. Sie sind schnell eingerichtet und gut für Marketing-Teams geeignet. Serverseitige Tools liefern die Variante direkt vom Server aus. Sie sind aufwendiger, aber schneller, stabiler und besser für Tests an Preisen, Suche oder Logik.
Welches Tool passt, hängt von Traffic, Tech-Stack und Datenschutzanforderungen ab. Einen Vergleich von 29 Tools findest du in unserem Blog.
Selbst machen oder mit Agentur?
Für die ersten Tests reichen ein Tool, eine saubere Hypothese und der Testlaufzeitrechner. Schwieriger wird es, wenn A/B-Testing dauerhaft Umsatz bringen soll. Dann braucht es Research, Statistik, Entwicklung und eine Organisation, die Ergebnisse auch umsetzt. Wenn dir dafür Kapazität oder Erfahrung fehlt, bekommst du bei uns A/B-Testing als Dienstleistung. Wie A/B-Testing in die gesamte Conversion-Optimierung passt, erklärt unser Ratgeber Conversion-Optimierung.






