Abstrakter Hintergrund mit roten Dreiecken

Ratgeber

CRO-Agentur finden: Kriterien, Kosten und die richtigen Fragen

Woran du eine gute Agentur für Conversion-Optimierung erkennst, bevor du unterschreibst. Mit 8 Kriterien und Prüffragen, ehrlichen Zahlen zu Kosten und Preismodellen, Warnsignalen und einer Checkliste für das Erstgespräch.

Von André Morys · Aktualisiert am 3. Oktober 2026

Seit über zwanzig Jahren schaue ich mir A/B-Tests an. Viele davon waren unsere eigenen, Hunderte kamen von anderen Agenturen und Dienstleistern. Die Geschichten, die Kunden mir danach erzählen, ähneln sich auffällig. Eine Agentur meldet Monat für Monat Gewinner, im Umsatz kommt davon nichts an. Oder das Testing-Tool zählt munter Conversions, die es im Shop nie gab.

Irgendwann glaubt die Geschäftsleitung der ganzen Methode nicht mehr. Wer danach kommt, arbeitet auf verbrannter Erde.

Ich zeige dabei nicht mit dem Finger auf andere. Wir haben jeden Fehler in diesem Ratgeber selbst schon gemacht und mussten lernen, woran es liegt. Heute arbeiten wir auch für große Konzerne, und dort können wir uns solche Startup-Fehler nicht mehr leisten.

Dieser Ratgeber sammelt, woran du eine gute Agentur erkennst. Ja, wir bieten Conversion-Optimierung selbst an. Die Kriterien kannst du trotzdem jedem Anbieter vorlegen, uns eingeschlossen.

Brauchst du überhaupt eine CRO-Agentur?

Ehrliche Antwort: nicht unbedingt. Es hängt an deinem Traffic, deinem Budget und daran, was dein Team schon kann.

Option

Passt, wenn

Grenze

In-house

Ihr habt Entwickler, Analytics-Wissen und Zeit

Oft fehlen Skills wie Statistik, Research und Testentwicklung. Noch häufiger fehlen eine Kultur, die Experimente aushält, und echte Kundenzentrierung

Freelancer

Ihr braucht eine einzelne Fähigkeit, zum Beispiel Testentwicklung

Eine Person deckt selten Research, Statistik und Umsetzung ab

Agentur

Ihr wollt ein laufendes Testprogramm ohne eigenes CRO-Team

Qualität schwankt stark zwischen Anbietern

Tool-Anbieter mit Service

Ihr nutzt das Tool schon und braucht günstig Hände für die Testentwicklung

Der Service ist an ein Tool gebunden. Research, Strategie und ein kritischer Blick auf die eigenen Daten gehören selten dazu

Beratung

Ihr wollt wissen, wo im Vergleich zu Markt und Customer Experience der größte Hebel liegt

Reine Beratung liefert Empfehlungen, aber keine Tests

Vier Wege zur Conversion-Optimierung im Vergleich.

Eine Frage wird in Pitches gern übersprungen. Reicht dein Traffic überhaupt für Tests? Für einen aussagekräftigen A/B-Test brauchst du je nach Conversion Rate mehrere zehntausend Besucher pro Variante. Ob das bei dir reicht, rechnest du mit dem Testlaufzeitrechner in zwei Minuten aus. Reicht er nicht, ist Research ohne Tests oft die bessere Investition. Das hört keine Agentur gern, wir auch nicht :-)

Agentur oder Beratung: was der Unterschied bedeutet

Irgendwann fällt in jedem Erstgespräch der Satz: „Wir sind keine klassische Agentur, wir beraten auch.“ Den Satz sagen fast alle. Hinter den beiden Begriffen stecken in Wahrheit drei Leistungen, und gute Anbieter decken alle drei ab.

Leistung

Was passiert

Ergebnis

Strategische Beratung

Strategie und Ziele des Unternehmens werden analysiert und mit dem Potenzial am Markt und in der Customer Experience verglichen

Klare Prioritäten: wo der größte Hebel liegt

Umsetzung

Research, Hypothesen, Testentwicklung, Auswertung

Validierte Ergebnisse und mehr Umsatz

Training und Enabling

Das eigene Team lernt Methoden, Statistik und kundenzentriertes Arbeiten

Erfolge lassen sich wiederholen, auch ohne Dienstleister

Drei Leistungen, die hinter „Agentur“ und „Beratung“ stecken.

Wer nur eine der drei Leistungen einkauft, merkt die Lücke oft erst nach Monaten. Ohne Strategie testet das Team an der falschen Stelle. Fehlt die Umsetzung, landen gute Empfehlungen in der Schublade, gleich neben dem letzten Strategiepapier. Am teuersten ist fehlendes Enabling, denn dann endet der Fortschritt an dem Tag, an dem der Vertrag ausläuft.

Frag deshalb weniger nach dem Etikett. Frag lieber, welche der drei Leistungen ein Anbieter wirklich selbst erbringt.

8 Kriterien für die Auswahl

Woran erkennst du eine gute Agentur, bevor du unterschreibst? Die Referenzlogos helfen wenig, die hat jeder. Die folgenden acht Fragen helfen mehr.

1. Wer setzt um?

Im Pitch sitzt ein vollständiges Team auf der Folie. In der Praxis konzipieren viele Agenturen selbst und geben die Entwicklung an Subunternehmer weiter. Manchmal sind das Freelancer, die den Kunden nie kennengelernt haben. Das wirkt effizient. Jede Übergabe kostet aber Zeit, und mit jeder Übergabe geht ein Stück Verständnis für das eigentliche Problem verloren. Das ist Stille Post mit Stundensatz.

Prüffrage: Wer schreibt den Testcode? Sitzen die Entwickler im eigenen Team?

2. Worauf stützen sich die Hypothesen?

In vielen Projekten entstehen Hypothesen im Workshop, mit vielen Post-its und noch mehr Überzeugung. Gute Hypothesen entstehen aus Daten über deine Kunden und aus Erfahrung mit früheren Tests. Eine Agentur mit einer großen, dokumentierten Testdatenbank weiß, welche Muster in deiner Branche tragen und welche nur im Workshop gut aussahen.

Prüffrage: Wie viele Tests habt ihr dokumentiert? Könnt ihr anonymisierte Beispiele aus meiner Branche zeigen?

3. Wie wird KI eingesetzt?

Kaum ein Pitch kommt heute ohne KI-Folie aus. Zu Recht, denn KI beschleunigt fast jeden Schritt: Datenanalyse, Auswertung von Kundenfeedback, Hypothesen, Testentwicklung und Reporting. Sie ersetzt aber weder Tests noch Urteilsvermögen. Eine KI formuliert in Sekunden zwanzig plausible Hypothesen. Welche davon bei deinen Kunden stimmt, weiß sie trotzdem nicht. Das zeigt nur der Test.

Manche Tool-Hersteller gehen inzwischen einen Schritt weiter. Du beschreibst eine Idee in einem Satz, die KI baut die Variante und startet den Test. Die Botschaft dahinter ist klar: Agenturen braucht es bald nicht mehr.

Für die Testentwicklung stimmt das teilweise. Einfache Varianten baut eine KI heute schneller als jeder Entwickler, und wir nutzen das selbst. Blöd nur, dass die Entwicklung selten der Engpass war. Der Engpass ist die Frage, was man überhaupt testen sollte. Eine KI im Testing-Tool kennt deine Seite und deine Klicks. Deine Kunden kennt sie nicht. Sie weiß nicht, warum jemand im Checkout zögert, was dein Wettbewerber besser macht oder welches Ziel deine Geschäftsleitung gerade verfolgt.

Wenn ein Test nur noch einen Prompt kostet, entsteht außerdem ein Mengenproblem. Statt fünf Tests laufen bald fünfzig. Jeder davon braucht aber weiterhin genug Besucher. Mehr Tests auf denselben Traffic bedeuten kürzere oder kleinere Tests und damit mehr Zufallsgewinner, siehe Kriterium 5.

Bleibt die Frage, wer die KI prüft. Wenn die KI im Tool die Hypothese schreibt, den Test baut und das Ergebnis bewertet, kontrolliert sich das System selbst. Der Hersteller hat wenig Grund, daran etwas zu ändern. Er verkauft ja das Tool.

Prüffrage: Wofür setzt ihr KI ein? Wer prüft das Ergebnis, bevor es bei mir landet? Woher kommen die Ideen, die die KI umsetzt?

4. Wie schnell geht der erste Test live?

Jede Woche ohne Test ist eine Woche ohne Erkenntnis, und sie kostet Umsatz. Trotzdem beginnen viele Projekte mit einem Audit über mehrere Monate. Das wirkt gründlich. Am Ende steht ein dickes PDF, und die besten Hypothesen entstehen trotzdem erst, wenn die ersten Tests laufen.

Prüffrage: Wie viele Tage vergehen vom Kickoff bis zum ersten Test? Wie viele Tests pro Monat sind realistisch?

5. Wie werden Tests geplant und ausgewertet?

Jetzt wird es kurz technisch, aber es lohnt sich. Bei der Statistik trennen sich gute von schwachen Anbietern deutlicher als irgendwo sonst. Fehler bleiben hier nämlich lange unsichtbar. Sie fallen erst auf, wenn der versprochene Uplift im Shop nie ankommt. Drei Fehler sehen wir besonders oft.

Tests zu früh abbrechen. Wer Tests stoppt, sobald das Tool „signifikant“ meldet, produziert Scheingewinner. Laut einer Auswertung von 115 A/B-Tests waren fast 70 % zu kurz angelegt, um einen echten Effekt sicher nachzuweisen. Mehr dazu in 70 % deiner A/B-Tests sind „underpowered“.

Gewinner in Segmenten suchen. Ein Test bringt insgesamt keinen Uplift. Danach wird das Ergebnis so lange nach Segmenten zerlegt, bis eines gewinnt: Mobile, Neukunden, Besucher aus dem Newsletter. Vielleicht denkst du jetzt: „Aber genau solche Segmente brauchen wir doch für Personalisierung.“ Die Idee ist richtig, die Methode nicht. Jeder zusätzliche Vergleich erhöht die Wahrscheinlichkeit, rein zufällig einen Gewinner zu finden. Statistiker nennen das Alpha-Fehler-Kumulierung. Bei zehn Segmenten und 95 % Konfidenz liegt die Chance auf mindestens einen falschen Gewinner schon bei rund 40 %. Dazu kommt, dass die Stichprobe für den Vergleich einzelner Segmente fast nie reicht. So entstehen Uplifts, die es nicht gibt. Wer Segmente vergleichen will, muss das vor dem Test planen und die Stichprobe dafür auslegen, zum Beispiel mit dem Testplaner.

Die falsche Metrik wählen. In Case Studies anderer Anbieter finden sich oft Uplifts auf Revenue per Visitor, obwohl der Traffic des Kunden dafür nicht gereicht hat. Die Kennzahl klingt nach der wichtigsten. Blöd nur, dass Umsatzwerte viel stärker schwanken als Conversions. Ein Test auf Umsatz braucht deshalb ein Vielfaches an Besuchern. Reicht der Traffic nicht, ist das Ergebnis Zufall. Verfahren wie CUPED verringern die Streuung, sie ersetzen aber keine ausreichende Stichprobe. Wie groß der Unterschied ist, zeigt der Testlaufzeitrechner mit einem eigenen Rechner für Umsatzziele.

Prüffragen: Berechnet ihr Stichprobe und Laufzeit vor dem Start? Plant ihr Segmentvergleiche vorab oder sucht ihr sie hinterher? Auf welche Metrik testet ihr, und reicht mein Traffic dafür?

Du kannst die Antworten selbst prüfen: mit dem Testlaufzeitrechner vor dem Test und dem Konfidenzrechner danach.

6. Stimmen die Daten überhaupt?

Jede Auswertung ist nur so gut wie die Daten darunter. Und die sind öfter falsch, als man denkt. Das Testing-Tool zählt Conversions anders als der Shop. Consent-Banner schlucken einen Teil der Besucher, und zwar nicht in beiden Varianten gleich viel. Eine Variante lädt sichtbar später und flackert. Oder die Besucher verteilen sich nicht so auf die Varianten, wie sie sollten.

Solche Fehler stehen in keinem Dashboard. Man findet sie nur, wenn jemand die Zahlen aus Tool, Analytics und Shop-Backend gegeneinander prüft. Dafür braucht eine Agentur technische Kompetenz und eine gewisse Unabhängigkeit. Wer an der Lizenz eines Tools mitverdient, schaut dem Tool selten kritisch auf die Finger.

Das betrifft auch die Tool-Anbieter selbst. Viele bieten die Umsetzung von Tests inzwischen mit an, oft zu einem Preis, bei dem keine Agentur mithalten kann. Das ist für viele Unternehmen verständlich attraktiv. Man sollte nur wissen, was man dafür bekommt. Der Anbieter verdient an der Lizenz, also soll das Tool möglichst unersetzlich wirken. Gebaut wird, was im Tool gut geht. Ob dein Problem überhaupt mit einem Test zu lösen ist, fragt dabei selten jemand. Und ob das eigene Tool falsch misst, prüft der Hersteller ungefähr so gründlich wie ein Bäcker, der sein eigenes Brot bewertet.

Prüffrage: Wie prüft ihr, ob die Daten aus Testing-Tool und Analytics stimmen? Verdient ihr an Tool-Lizenzen mit, und mit welchen Tools arbeitet ihr?

7. Fängt die Arbeit beim Kunden an?

Viele Testprogramme starten mit Taktiken wie Button-Farben, Vertrauenssiegeln oder Countdown-Timern. Verkauft werden sie als Best Practices, tatsächlich ist es Trial and Error. Einige Taktiken funktionieren. Welche, weiß vorher niemand, auch nicht die Agentur mit der längsten Liste.

Das größere Problem liegt woanders. Jedes Unternehmen hat am Markt eine eigene Herausforderung: andere Kunden, andere Wettbewerber, andere Gründe, warum jemand nicht kauft. Eine Liste von Taktiken verfehlt diesen Kern. Sie beantwortet Fragen, die niemand gestellt hat, und überspringt die eine, auf die es ankommt. Warum kaufen deine Kunden nicht?

Prüffrage: Wie findet ihr heraus, was meine Kunden vom Kauf abhält?

8. Welche Research-Methoden kommen zum Einsatz?

Keine Methode allein liefert ein vollständiges Bild. Analytics zeigt, wo Nutzer abspringen, aber nicht warum. Interviews zeigen das Warum, aber nicht, wie viele Kunden es betrifft. Wer nur eins von beidem macht, sieht die Hälfte und hält sie für das Ganze. Gute Agenturen kombinieren deshalb Methoden, zum Beispiel Interviews, Usability-Tests, Onsite-Umfragen und Analytics. Wie das geht, zeigt unser Artikel zu Mixed-Methods.

Prüffrage: Welche Methoden nutzt ihr? Darf ich einen anonymisierten Research-Bericht sehen?

Was kostet Conversion-Optimierung?

Das ist die Frage, der fast jede Agenturseite ausweicht. Ich versuche es trotzdem. Feste Marktpreise gibt es nicht. Die Kosten hängen vor allem an drei Dingen: wie viele Tests pro Monat laufen, wie viel Research dazugehört und ob die Agentur selbst entwickelt.

Preismodell

So funktioniert es

Gut für

Projekt

Festpreis für Analyse oder eine begrenzte Testreihe

Einstieg, Redesign-Absicherung

Retainer

Monatliches Budget für ein laufendes Testprogramm

Kontinuierliche Optimierung

Proof of Concept

Festes Programm über 3 bis 6 Monate mit klarem Ziel

Prüfen, ob sich Optimierung für dich rechnet

Erfolgsabhängig

Honorar hängt am gemessenen Uplift

Selten fair, siehe Warnsignale

Übliche Preismodelle für Conversion-Optimierung.

Vor jedem Vertrag sollte eine gründliche Analyse stehen, die dein Problem klärt. Seriöse Anbieter machen sie, bevor sie ein Angebot schreiben. Sie zeigt auch, ob sich Optimierung bei dir überhaupt lohnt. Manchmal lautet die ehrliche Antwort Nein.

Rechne die Kosten immer gegen den möglichen Effekt. Ein Beispiel: Ein Shop mit 10 Mio. € Jahresumsatz, der durch Optimierung 2 % mehr Umsatz macht, gewinnt 200.000 € im Jahr. Ein Proof of Concept über 6 Monate zu 5.000 € im Monat kostet 30.000 €. Bei 1 Mio. € Umsatz sieht dieselbe Rechnung ganz anders aus. Dann sollte dir das auch jemand sagen.

11 Fragen für das Erstgespräch

  1. Wer aus eurem Team arbeitet konkret an meinem Projekt?

  2. Wer entwickelt die Tests?

  3. Wie viele Tests habt ihr in meiner Branche durchgeführt?

  4. Wie entsteht bei euch eine Hypothese?

  5. Welche Research-Methoden setzt ihr ein?

  6. Wie berechnet ihr die Laufzeit eines Tests, und auf welche Metrik testet ihr?

  7. Wie lange dauert es bis zum ersten Test?

  8. Wie setzt ihr KI ein, und wer prüft das Ergebnis?

  9. Wie prüft ihr, ob die Daten aus den Tools stimmen?

  10. Wie sieht ein Testreport bei euch aus?

  11. Was lernt mein Team in der Zusammenarbeit?

Warnsignale

  • Garantierte Uplifts. Niemand kann vorher wissen, wie ein Test ausgeht. Wer es trotzdem verspricht, verkauft Hoffnung.

  • Tests ohne Laufzeitplanung. Abbrechen nach Gefühl führt zu Scheingewinnern.

  • Gewinner aus Segmenten im Nachhinein. Wer nach dem Test so lange filtert, bis ein Segment gewinnt, verkauft Zufall als Ergebnis.

  • Umsatz als Testmetrik bei zu wenig Traffic. Revenue per Visitor braucht ein Vielfaches an Besuchern. Ohne die nötige Stichprobe ist jedes Ergebnis unseriös.

  • Blindes Vertrauen in das Tool. Wer Zahlen aus dem Testing-Tool nie mit Analytics und Shop abgleicht, wertet im Zweifel Messfehler aus.

  • Umsetzung als Beigabe zur Lizenz. Günstige Testentwicklung vom Tool-Hersteller ersetzt weder Research noch Strategie noch eine unabhängige Prüfung der Daten.

  • Hypothesen aus Taktik-Listen. Was bei anderen funktioniert hat, muss bei dir nicht wirken.

  • „KI ersetzt Tests“ oder „KI ersetzt Research“. KI baut Tests schneller. Was getestet werden sollte und ob das Ergebnis stimmt, entscheidet sie nicht zuverlässig.

  • Erfolgsprovision auf jeden Uplift. Sie belohnt kurze Tests und schöne Zahlen statt belastbarer Ergebnisse.

  • Keine Einblicke in frühere Arbeit. Wer keinen anonymisierten Report zeigen kann, hat meistens keinen.

Die ersten 90 Tage

Zeitraum

Was passieren sollte

Vor dem Start

Discovery: Analyse des Problems, Zugänge zu Analytics und Testing-Tool, Klärung, ob sich Optimierung lohnt

Woche 1

Setup und Kickoff: Tools und Tracking einrichten, Team abstimmen, erster Test live

Ab Woche 2

Tests laufen, parallel dazu Research mit Kunden und Daten. Neue Erkenntnisse fließen laufend ins Testprogramm

Woche 6 bis 12

Erste belastbare Ergebnisse, Learnings fürs Team

So sollten die ersten 90 Tage aussehen.

Wichtig ist die Reihenfolge. Research und Tests laufen parallel. Wer erst drei Monate analysiert und dann testet, verliert Zeit, ohne bessere Hypothesen zu bekommen.

Checkliste

  • Traffic reicht für Tests (mit dem Testlaufzeitrechner geprüft)

  • Umsetzung liegt im Team der Agentur

  • Hypothesen kommen aus Research und dokumentierter Erfahrung

  • Laufzeit wird vor jedem Test berechnet

  • Daten aus Tool, Analytics und Shop werden abgeglichen

  • Segmentvergleiche werden vorab geplant, nicht hinterher gesucht

  • Die Testmetrik passt zum Traffic

  • Erster Test ist innerhalb weniger Tage live, Research läuft parallel

  • KI wird eingesetzt und geprüft

  • Ein anonymisierter Report liegt dir vor

  • Kosten stehen in einem realistischen Verhältnis zum möglichen Effekt

In eigener Sache

So arbeiten wir bei konversionsKRAFT

Wir fangen bei deinen Kunden an. Wir gleichen deine Strategie und Ziele mit dem Potenzial am Markt und in der Customer Experience ab, setzen selbst um und befähigen dein Team. Am Anfang steht eine intensive Discovery. Sie ist kostenlos und zeigt dir, wo dein Problem wirklich liegt. Danach folgt ein Proof of Concept über 3 oder 6 Monate, je nach nötiger Testlaufzeit, ab 5.000 € im Monat.

Unsere Hypothesen stützen sich auf rund 4.500 dokumentierte Experimente und auf Research mit echten Kunden. Nach einer Woche Setup geht der erste Test live. Research und Tests laufen danach parallel, so arbeitet unsere Rapid Growth Engine. KI nutzen wir in jedem Projektschritt, und kein Ergebnis verlässt uns ungeprüft. Wir sind unabhängig von Tool-Anbietern, verdienen an keiner Lizenz mit und arbeiten mit dem Testing-Tool, das zu dir passt.

Was unsere Kunden dazu sagen:

„konversionsKRAFT liefert uns messbare, ROI-positive Ergebnisse durch klare Prozesse und Verantwortlichkeiten, zusätzlich bekommen wir ehrliches Feedback, auch wenn ein Test mal nicht funktioniert.“ Markus Merz, Arnulf Betzold GmbH

„konversionsKRAFT liefert fundierte, psychologisch-wissenschaftlich abgesicherte Aussagen ohne Bullshit Bingo. Diese Seriosität schätze ich sehr.“ Nora Metzler

Mehr zu unserem Vorgehen auf der Seite Conversion-Optimierung als Dienstleistung.

FAQ

Häufige Fragen zur Wahl einer CRO-Agentur

Das hängt an Testumfang, Research und Umsetzung. Laufende Programme werden meist monatlich abgerechnet. Bei konversionsKRAFT ist die Discovery kostenlos, der Proof of Concept über 3 oder 6 Monate kostet ab 5.000 € im Monat.

Eine Agentur für Conversion-Rate-Optimierung lohnt sich, wenn genug Traffic für Tests da ist und schon kleine Uplifts spürbar Umsatz bringen. Rechne die Kosten gegen 1 bis 2 % mehr Umsatz.

Die Agentur setzt um. Die Beratung gleicht Strategie und Ziele mit dem Potenzial am Markt ab. Gute Anbieter machen beides und befähigen zusätzlich das Team des Kunden.

Der erste Test sollte nach wenigen Tagen laufen. Belastbare Ergebnisse gibt es nach zwei bis vier Wochen Testlaufzeit.

Ja, mit Entwicklern, Analytics-Wissen und Statistik-Grundlagen. Mindestens so wichtig sind eine Kultur, in der verlorene Tests als Lernen zählen, und ein Team, das bei den Kunden anfängt. Einen Einstieg gibt der Ratgeber Conversion-Optimierung und der Ratgeber A/B-Testing.

Für einfache Testentwicklung zum Teil ja. KI beschleunigt Analyse, Hypothesen und Entwicklung. Sie kennt aber deine Kunden nicht, und sie prüft sich nicht selbst. Ob eine Idee wirkt, zeigt weiterhin nur ein sauber geplanter Test mit echten Nutzern.

Conversion-Optimierung mit konversionsKRAFT

Du willst wissen, wo dein Shop Umsatz liegen lässt?

Die Discovery ist kostenlos. Danach weißt du, wo dein Problem liegt und ob sich Optimierung für dich rechnet.