Seit über zwanzig Jahren schaue ich mir A/B-Tests an. Viele davon waren unsere eigenen, Hunderte kamen von anderen Agenturen und Dienstleistern. Die Geschichten, die Kunden mir danach erzählen, ähneln sich auffällig. Eine Agentur meldet Monat für Monat Gewinner, im Umsatz kommt davon nichts an. Oder das Testing-Tool zählt munter Conversions, die es im Shop nie gab.
Irgendwann glaubt die Geschäftsleitung der ganzen Methode nicht mehr. Wer danach kommt, arbeitet auf verbrannter Erde.
Ich zeige dabei nicht mit dem Finger auf andere. Wir haben jeden Fehler in diesem Ratgeber selbst schon gemacht und mussten lernen, woran es liegt. Heute arbeiten wir auch für große Konzerne, und dort können wir uns solche Startup-Fehler nicht mehr leisten.
Dieser Ratgeber sammelt, woran du eine gute Agentur erkennst. Ja, wir bieten Conversion-Optimierung selbst an. Die Kriterien kannst du trotzdem jedem Anbieter vorlegen, uns eingeschlossen.
Brauchst du überhaupt eine CRO-Agentur?
Ehrliche Antwort: nicht unbedingt. Es hängt an deinem Traffic, deinem Budget und daran, was dein Team schon kann.
Option | Passt, wenn | Grenze |
|---|---|---|
In-house | Ihr habt Entwickler, Analytics-Wissen und Zeit | Oft fehlen Skills wie Statistik, Research und Testentwicklung. Noch häufiger fehlen eine Kultur, die Experimente aushält, und echte Kundenzentrierung |
Freelancer | Ihr braucht eine einzelne Fähigkeit, zum Beispiel Testentwicklung | Eine Person deckt selten Research, Statistik und Umsetzung ab |
Agentur | Ihr wollt ein laufendes Testprogramm ohne eigenes CRO-Team | Qualität schwankt stark zwischen Anbietern |
Tool-Anbieter mit Service | Ihr nutzt das Tool schon und braucht günstig Hände für die Testentwicklung | Der Service ist an ein Tool gebunden. Research, Strategie und ein kritischer Blick auf die eigenen Daten gehören selten dazu |
Beratung | Ihr wollt wissen, wo im Vergleich zu Markt und Customer Experience der größte Hebel liegt | Reine Beratung liefert Empfehlungen, aber keine Tests |
Vier Wege zur Conversion-Optimierung im Vergleich.
Eine Frage wird in Pitches gern übersprungen. Reicht dein Traffic überhaupt für Tests? Für einen aussagekräftigen A/B-Test brauchst du je nach Conversion Rate mehrere zehntausend Besucher pro Variante. Ob das bei dir reicht, rechnest du mit dem Testlaufzeitrechner in zwei Minuten aus. Reicht er nicht, ist Research ohne Tests oft die bessere Investition. Das hört keine Agentur gern, wir auch nicht :-)
Agentur oder Beratung: was der Unterschied bedeutet
Irgendwann fällt in jedem Erstgespräch der Satz: „Wir sind keine klassische Agentur, wir beraten auch.“ Den Satz sagen fast alle. Hinter den beiden Begriffen stecken in Wahrheit drei Leistungen, und gute Anbieter decken alle drei ab.
Leistung | Was passiert | Ergebnis |
|---|---|---|
Strategische Beratung | Strategie und Ziele des Unternehmens werden analysiert und mit dem Potenzial am Markt und in der Customer Experience verglichen | Klare Prioritäten: wo der größte Hebel liegt |
Umsetzung | Research, Hypothesen, Testentwicklung, Auswertung | Validierte Ergebnisse und mehr Umsatz |
Training und Enabling | Das eigene Team lernt Methoden, Statistik und kundenzentriertes Arbeiten | Erfolge lassen sich wiederholen, auch ohne Dienstleister |
Drei Leistungen, die hinter „Agentur“ und „Beratung“ stecken.
Wer nur eine der drei Leistungen einkauft, merkt die Lücke oft erst nach Monaten. Ohne Strategie testet das Team an der falschen Stelle. Fehlt die Umsetzung, landen gute Empfehlungen in der Schublade, gleich neben dem letzten Strategiepapier. Am teuersten ist fehlendes Enabling, denn dann endet der Fortschritt an dem Tag, an dem der Vertrag ausläuft.
Frag deshalb weniger nach dem Etikett. Frag lieber, welche der drei Leistungen ein Anbieter wirklich selbst erbringt.
8 Kriterien für die Auswahl
Woran erkennst du eine gute Agentur, bevor du unterschreibst? Die Referenzlogos helfen wenig, die hat jeder. Die folgenden acht Fragen helfen mehr.
1. Wer setzt um?
Im Pitch sitzt ein vollständiges Team auf der Folie. In der Praxis konzipieren viele Agenturen selbst und geben die Entwicklung an Subunternehmer weiter. Manchmal sind das Freelancer, die den Kunden nie kennengelernt haben. Das wirkt effizient. Jede Übergabe kostet aber Zeit, und mit jeder Übergabe geht ein Stück Verständnis für das eigentliche Problem verloren. Das ist Stille Post mit Stundensatz.
Prüffrage: Wer schreibt den Testcode? Sitzen die Entwickler im eigenen Team?
2. Worauf stützen sich die Hypothesen?
In vielen Projekten entstehen Hypothesen im Workshop, mit vielen Post-its und noch mehr Überzeugung. Gute Hypothesen entstehen aus Daten über deine Kunden und aus Erfahrung mit früheren Tests. Eine Agentur mit einer großen, dokumentierten Testdatenbank weiß, welche Muster in deiner Branche tragen und welche nur im Workshop gut aussahen.
Prüffrage: Wie viele Tests habt ihr dokumentiert? Könnt ihr anonymisierte Beispiele aus meiner Branche zeigen?
3. Wie wird KI eingesetzt?
Kaum ein Pitch kommt heute ohne KI-Folie aus. Zu Recht, denn KI beschleunigt fast jeden Schritt: Datenanalyse, Auswertung von Kundenfeedback, Hypothesen, Testentwicklung und Reporting. Sie ersetzt aber weder Tests noch Urteilsvermögen. Eine KI formuliert in Sekunden zwanzig plausible Hypothesen. Welche davon bei deinen Kunden stimmt, weiß sie trotzdem nicht. Das zeigt nur der Test.
Manche Tool-Hersteller gehen inzwischen einen Schritt weiter. Du beschreibst eine Idee in einem Satz, die KI baut die Variante und startet den Test. Die Botschaft dahinter ist klar: Agenturen braucht es bald nicht mehr.
Für die Testentwicklung stimmt das teilweise. Einfache Varianten baut eine KI heute schneller als jeder Entwickler, und wir nutzen das selbst. Blöd nur, dass die Entwicklung selten der Engpass war. Der Engpass ist die Frage, was man überhaupt testen sollte. Eine KI im Testing-Tool kennt deine Seite und deine Klicks. Deine Kunden kennt sie nicht. Sie weiß nicht, warum jemand im Checkout zögert, was dein Wettbewerber besser macht oder welches Ziel deine Geschäftsleitung gerade verfolgt.
Wenn ein Test nur noch einen Prompt kostet, entsteht außerdem ein Mengenproblem. Statt fünf Tests laufen bald fünfzig. Jeder davon braucht aber weiterhin genug Besucher. Mehr Tests auf denselben Traffic bedeuten kürzere oder kleinere Tests und damit mehr Zufallsgewinner, siehe Kriterium 5.
Bleibt die Frage, wer die KI prüft. Wenn die KI im Tool die Hypothese schreibt, den Test baut und das Ergebnis bewertet, kontrolliert sich das System selbst. Der Hersteller hat wenig Grund, daran etwas zu ändern. Er verkauft ja das Tool.
Prüffrage: Wofür setzt ihr KI ein? Wer prüft das Ergebnis, bevor es bei mir landet? Woher kommen die Ideen, die die KI umsetzt?
4. Wie schnell geht der erste Test live?
Jede Woche ohne Test ist eine Woche ohne Erkenntnis, und sie kostet Umsatz. Trotzdem beginnen viele Projekte mit einem Audit über mehrere Monate. Das wirkt gründlich. Am Ende steht ein dickes PDF, und die besten Hypothesen entstehen trotzdem erst, wenn die ersten Tests laufen.
Prüffrage: Wie viele Tage vergehen vom Kickoff bis zum ersten Test? Wie viele Tests pro Monat sind realistisch?
5. Wie werden Tests geplant und ausgewertet?
Jetzt wird es kurz technisch, aber es lohnt sich. Bei der Statistik trennen sich gute von schwachen Anbietern deutlicher als irgendwo sonst. Fehler bleiben hier nämlich lange unsichtbar. Sie fallen erst auf, wenn der versprochene Uplift im Shop nie ankommt. Drei Fehler sehen wir besonders oft.
Tests zu früh abbrechen. Wer Tests stoppt, sobald das Tool „signifikant“ meldet, produziert Scheingewinner. Laut einer Auswertung von 115 A/B-Tests waren fast 70 % zu kurz angelegt, um einen echten Effekt sicher nachzuweisen. Mehr dazu in 70 % deiner A/B-Tests sind „underpowered“.
Gewinner in Segmenten suchen. Ein Test bringt insgesamt keinen Uplift. Danach wird das Ergebnis so lange nach Segmenten zerlegt, bis eines gewinnt: Mobile, Neukunden, Besucher aus dem Newsletter. Vielleicht denkst du jetzt: „Aber genau solche Segmente brauchen wir doch für Personalisierung.“ Die Idee ist richtig, die Methode nicht. Jeder zusätzliche Vergleich erhöht die Wahrscheinlichkeit, rein zufällig einen Gewinner zu finden. Statistiker nennen das Alpha-Fehler-Kumulierung. Bei zehn Segmenten und 95 % Konfidenz liegt die Chance auf mindestens einen falschen Gewinner schon bei rund 40 %. Dazu kommt, dass die Stichprobe für den Vergleich einzelner Segmente fast nie reicht. So entstehen Uplifts, die es nicht gibt. Wer Segmente vergleichen will, muss das vor dem Test planen und die Stichprobe dafür auslegen, zum Beispiel mit dem Testplaner.
Die falsche Metrik wählen. In Case Studies anderer Anbieter finden sich oft Uplifts auf Revenue per Visitor, obwohl der Traffic des Kunden dafür nicht gereicht hat. Die Kennzahl klingt nach der wichtigsten. Blöd nur, dass Umsatzwerte viel stärker schwanken als Conversions. Ein Test auf Umsatz braucht deshalb ein Vielfaches an Besuchern. Reicht der Traffic nicht, ist das Ergebnis Zufall. Verfahren wie CUPED verringern die Streuung, sie ersetzen aber keine ausreichende Stichprobe. Wie groß der Unterschied ist, zeigt der Testlaufzeitrechner mit einem eigenen Rechner für Umsatzziele.
Prüffragen: Berechnet ihr Stichprobe und Laufzeit vor dem Start? Plant ihr Segmentvergleiche vorab oder sucht ihr sie hinterher? Auf welche Metrik testet ihr, und reicht mein Traffic dafür?
Du kannst die Antworten selbst prüfen: mit dem Testlaufzeitrechner vor dem Test und dem Konfidenzrechner danach.
6. Stimmen die Daten überhaupt?
Jede Auswertung ist nur so gut wie die Daten darunter. Und die sind öfter falsch, als man denkt. Das Testing-Tool zählt Conversions anders als der Shop. Consent-Banner schlucken einen Teil der Besucher, und zwar nicht in beiden Varianten gleich viel. Eine Variante lädt sichtbar später und flackert. Oder die Besucher verteilen sich nicht so auf die Varianten, wie sie sollten.
Solche Fehler stehen in keinem Dashboard. Man findet sie nur, wenn jemand die Zahlen aus Tool, Analytics und Shop-Backend gegeneinander prüft. Dafür braucht eine Agentur technische Kompetenz und eine gewisse Unabhängigkeit. Wer an der Lizenz eines Tools mitverdient, schaut dem Tool selten kritisch auf die Finger.
Das betrifft auch die Tool-Anbieter selbst. Viele bieten die Umsetzung von Tests inzwischen mit an, oft zu einem Preis, bei dem keine Agentur mithalten kann. Das ist für viele Unternehmen verständlich attraktiv. Man sollte nur wissen, was man dafür bekommt. Der Anbieter verdient an der Lizenz, also soll das Tool möglichst unersetzlich wirken. Gebaut wird, was im Tool gut geht. Ob dein Problem überhaupt mit einem Test zu lösen ist, fragt dabei selten jemand. Und ob das eigene Tool falsch misst, prüft der Hersteller ungefähr so gründlich wie ein Bäcker, der sein eigenes Brot bewertet.
Prüffrage: Wie prüft ihr, ob die Daten aus Testing-Tool und Analytics stimmen? Verdient ihr an Tool-Lizenzen mit, und mit welchen Tools arbeitet ihr?
7. Fängt die Arbeit beim Kunden an?
Viele Testprogramme starten mit Taktiken wie Button-Farben, Vertrauenssiegeln oder Countdown-Timern. Verkauft werden sie als Best Practices, tatsächlich ist es Trial and Error. Einige Taktiken funktionieren. Welche, weiß vorher niemand, auch nicht die Agentur mit der längsten Liste.
Das größere Problem liegt woanders. Jedes Unternehmen hat am Markt eine eigene Herausforderung: andere Kunden, andere Wettbewerber, andere Gründe, warum jemand nicht kauft. Eine Liste von Taktiken verfehlt diesen Kern. Sie beantwortet Fragen, die niemand gestellt hat, und überspringt die eine, auf die es ankommt. Warum kaufen deine Kunden nicht?
Prüffrage: Wie findet ihr heraus, was meine Kunden vom Kauf abhält?
8. Welche Research-Methoden kommen zum Einsatz?
Keine Methode allein liefert ein vollständiges Bild. Analytics zeigt, wo Nutzer abspringen, aber nicht warum. Interviews zeigen das Warum, aber nicht, wie viele Kunden es betrifft. Wer nur eins von beidem macht, sieht die Hälfte und hält sie für das Ganze. Gute Agenturen kombinieren deshalb Methoden, zum Beispiel Interviews, Usability-Tests, Onsite-Umfragen und Analytics. Wie das geht, zeigt unser Artikel zu Mixed-Methods.
Prüffrage: Welche Methoden nutzt ihr? Darf ich einen anonymisierten Research-Bericht sehen?
Was kostet Conversion-Optimierung?
Das ist die Frage, der fast jede Agenturseite ausweicht. Ich versuche es trotzdem. Feste Marktpreise gibt es nicht. Die Kosten hängen vor allem an drei Dingen: wie viele Tests pro Monat laufen, wie viel Research dazugehört und ob die Agentur selbst entwickelt.
Preismodell | So funktioniert es | Gut für |
|---|---|---|
Projekt | Festpreis für Analyse oder eine begrenzte Testreihe | Einstieg, Redesign-Absicherung |
Retainer | Monatliches Budget für ein laufendes Testprogramm | Kontinuierliche Optimierung |
Proof of Concept | Festes Programm über 3 bis 6 Monate mit klarem Ziel | Prüfen, ob sich Optimierung für dich rechnet |
Erfolgsabhängig | Honorar hängt am gemessenen Uplift | Selten fair, siehe Warnsignale |
Übliche Preismodelle für Conversion-Optimierung.
Vor jedem Vertrag sollte eine gründliche Analyse stehen, die dein Problem klärt. Seriöse Anbieter machen sie, bevor sie ein Angebot schreiben. Sie zeigt auch, ob sich Optimierung bei dir überhaupt lohnt. Manchmal lautet die ehrliche Antwort Nein.
Rechne die Kosten immer gegen den möglichen Effekt. Ein Beispiel: Ein Shop mit 10 Mio. € Jahresumsatz, der durch Optimierung 2 % mehr Umsatz macht, gewinnt 200.000 € im Jahr. Ein Proof of Concept über 6 Monate zu 5.000 € im Monat kostet 30.000 €. Bei 1 Mio. € Umsatz sieht dieselbe Rechnung ganz anders aus. Dann sollte dir das auch jemand sagen.
11 Fragen für das Erstgespräch
Wer aus eurem Team arbeitet konkret an meinem Projekt?
Wer entwickelt die Tests?
Wie viele Tests habt ihr in meiner Branche durchgeführt?
Wie entsteht bei euch eine Hypothese?
Welche Research-Methoden setzt ihr ein?
Wie berechnet ihr die Laufzeit eines Tests, und auf welche Metrik testet ihr?
Wie lange dauert es bis zum ersten Test?
Wie setzt ihr KI ein, und wer prüft das Ergebnis?
Wie prüft ihr, ob die Daten aus den Tools stimmen?
Wie sieht ein Testreport bei euch aus?
Was lernt mein Team in der Zusammenarbeit?
Warnsignale
Garantierte Uplifts. Niemand kann vorher wissen, wie ein Test ausgeht. Wer es trotzdem verspricht, verkauft Hoffnung.
Tests ohne Laufzeitplanung. Abbrechen nach Gefühl führt zu Scheingewinnern.
Gewinner aus Segmenten im Nachhinein. Wer nach dem Test so lange filtert, bis ein Segment gewinnt, verkauft Zufall als Ergebnis.
Umsatz als Testmetrik bei zu wenig Traffic. Revenue per Visitor braucht ein Vielfaches an Besuchern. Ohne die nötige Stichprobe ist jedes Ergebnis unseriös.
Blindes Vertrauen in das Tool. Wer Zahlen aus dem Testing-Tool nie mit Analytics und Shop abgleicht, wertet im Zweifel Messfehler aus.
Umsetzung als Beigabe zur Lizenz. Günstige Testentwicklung vom Tool-Hersteller ersetzt weder Research noch Strategie noch eine unabhängige Prüfung der Daten.
Hypothesen aus Taktik-Listen. Was bei anderen funktioniert hat, muss bei dir nicht wirken.
„KI ersetzt Tests“ oder „KI ersetzt Research“. KI baut Tests schneller. Was getestet werden sollte und ob das Ergebnis stimmt, entscheidet sie nicht zuverlässig.
Erfolgsprovision auf jeden Uplift. Sie belohnt kurze Tests und schöne Zahlen statt belastbarer Ergebnisse.
Keine Einblicke in frühere Arbeit. Wer keinen anonymisierten Report zeigen kann, hat meistens keinen.
Die ersten 90 Tage
Zeitraum | Was passieren sollte |
|---|---|
Vor dem Start | Discovery: Analyse des Problems, Zugänge zu Analytics und Testing-Tool, Klärung, ob sich Optimierung lohnt |
Woche 1 | Setup und Kickoff: Tools und Tracking einrichten, Team abstimmen, erster Test live |
Ab Woche 2 | Tests laufen, parallel dazu Research mit Kunden und Daten. Neue Erkenntnisse fließen laufend ins Testprogramm |
Woche 6 bis 12 | Erste belastbare Ergebnisse, Learnings fürs Team |
So sollten die ersten 90 Tage aussehen.
Wichtig ist die Reihenfolge. Research und Tests laufen parallel. Wer erst drei Monate analysiert und dann testet, verliert Zeit, ohne bessere Hypothesen zu bekommen.
Checkliste
Traffic reicht für Tests (mit dem Testlaufzeitrechner geprüft)
Umsetzung liegt im Team der Agentur
Hypothesen kommen aus Research und dokumentierter Erfahrung
Laufzeit wird vor jedem Test berechnet
Daten aus Tool, Analytics und Shop werden abgeglichen
Segmentvergleiche werden vorab geplant, nicht hinterher gesucht
Die Testmetrik passt zum Traffic
Erster Test ist innerhalb weniger Tage live, Research läuft parallel
KI wird eingesetzt und geprüft
Ein anonymisierter Report liegt dir vor
Kosten stehen in einem realistischen Verhältnis zum möglichen Effekt





