Die meisten Ideen, die bei Google, Bing und Microsoft getestet werden, verbessern nichts. Das ist keine Schwarzmalerei, sondern das Ergebnis grosser Testprogramme.
Bei Google und Bing führen nur etwa 10 bis 20 Prozent der Experimente zu einem positiven Ergebnis. Bei Microsoft insgesamt wirkt ein Drittel der getesteten Ideen, ein Drittel bleibt ohne Wirkung, ein Drittel schadet (Kohavi und Thomke, Harvard Business Review, 2017).
Genau deshalb wird getestet. Niemand weiss vorher sicher, in welchem Drittel die eigene Idee landet – auch Fachleute nicht.
Hier liest du, wie ein A/B-Test funktioniert, was du testen kannst und warum er auf vielen KMU-Websites an einer einfachen Rechnung scheitert. Und was du tust, wenn die Rechnung nicht aufgeht.
Was ein A/B-Test ist – und was nicht
Ein A/B-Test vergleicht zwei Varianten einer Seite oder eines Elements. Variante A ist der heutige Stand, die Kontrollgruppe. Variante B ändert genau das, was du prüfen willst.
Die Besucher werden zufällig auf beide Varianten verteilt, und zwar gleichzeitig. Am Ende vergleichst du eine Zielgrösse, die du vorher festgelegt hast: Anfragen, Käufe oder Anmeldungen.
Ebenso wichtig ist, was kein A/B-Test ist. Ein Vorher-nachher-Vergleich ist kein Test.
Änderst du im März die Headline und hast im April mehr Anfragen, kann das an der Headline liegen. Oder an der Saison, an einer Kampagne, an einem Mitbewerber, der gerade Ferien macht. Erst die gleichzeitige, zufällige Aufteilung trennt die Wirkung der Änderung von allem anderen.
Drei verwandte Begriffe begegnen dir dabei:
- Split-Test: ein anderes Wort für den A/B-Test.
- Multivariater Test: mehrere Elemente gleichzeitig, in allen Kombinationen. Weil sich die Besucher auf viele Varianten verteilen, braucht er ein Vielfaches an Traffic.
- A/A-Test: zwei identische Varianten. Er prüft das Werkzeug: Bei 95 Prozent Konfidenz meldet er in rund 5 Prozent der Fälle einen Unterschied, den es nicht gibt (Kohavi, Henne und Sommerfield, KDD 2007).
Warum Bauchgefühl so oft danebenliegt
2012 hatte ein Mitarbeiter von Microsoft, der an Bing arbeitete, eine Idee, wie Anzeigentitel in der Suche dargestellt werden könnten. Sie hatte niedrige Priorität und blieb über sechs Monate liegen.
Als ein Ingenieur sie schliesslich testete, stieg der Umsatz um 12 Prozent. Hochgerechnet waren das über 100 Millionen Dollar im Jahr, allein in den USA (Kohavi und Thomke, 2017). Die Autoren ziehen daraus eine unbequeme Lehre: Selbst Fachleute schätzen oft falsch ein, welche Ideen sich auszahlen.
Ob sich solche Effekte auf ein Schweizer KMU übertragen lassen, ist nicht gemessen. Der Mechanismus dürfte derselbe sein.
In jeder Sitzung, in der über eine Headline entschieden wird, gewinnt eine Meinung, nicht ein Messwert. Kohavi nennt das die HiPPO: die Meinung der bestbezahlten Person im Raum.
Was du auf einer Website testen kannst
Testen lässt sich alles, was ein Besucher sieht oder tut. Am meisten lernst du dort, wo die Entscheidung fällt:
- Headline und Nutzenversprechen: Spricht der erste Bildschirm das Problem des Besuchers an? Wie du solche Texte schreibst, zeigt der Beitrag zu Website-Texten.
- Call-to-Action: Text, Position und Umfeld der Schaltfläche, die zur Anfrage führt.
- Formulare: Anzahl und Reihenfolge der Felder, Pflichtfelder, die Frage nach dem Budget.
- Landingpages: Aufbau, Reihenfolge der Argumente, Vertrauenselemente wie Referenzen.
- Angebot und Preisdarstellung: Pakete, Einstiegsangebot, die Begründung des Preises.
Welche Elemente eine Website braucht, damit Anfragen überhaupt entstehen, steht im Beitrag zur conversionstarken Website. Typische Ursachen, wenn trotzdem keine kommen, zeigt der Beitrag Warum deine Website keine Kunden bringt.
Ein Test beantwortet die Frage danach: welche Fassung bei deinen Besuchern besser wirkt.
Kleine Änderungen können dabei durchaus wirken. Bei Bing brachten kaum sichtbar veränderte Farbtöne in den Suchergebnissen hochgerechnet über 10 Millionen Dollar Mehrumsatz im Jahr. Bestätigt wurde das in einer Wiederholung mit 32 Millionen Nutzern (Kohavi und Thomke, 2017).
Genau darin liegt der Haken für kleine Websites: Ein so kleiner Unterschied lässt sich nur mit sehr vielen Nutzern verlässlich nachweisen. Wer wenige Besucher hat, testet deshalb die Botschaft, nicht die Buttonfarbe.
Die Rechnung, an der viele KMU-Tests scheitern
Laut Kohavi und Thomke kann jedes Unternehmen mit mindestens einigen tausend täglich aktiven Nutzern solche Tests durchführen. Bevor du testest, lohnt deshalb ein Blick in dein Analytics: Wie viele Besucher hat deine Website am Tag?
Wie viele Besucher ein Test braucht, lässt sich vorab abschätzen. Kohavi, Henne und Sommerfield geben dafür eine Faustformel an, für 95 Prozent Konfidenz und 90 Prozent Teststärke:
n = (4 · r · s / d)²
Dabei ist r die Zahl der Varianten, s die Standardabweichung der Zielgrösse und d der kleinste Unterschied, den du erkennen willst. Für den Vergleich von A und B ist r = 2. Bei einer Anfragequote p ist s die Quadratwurzel aus p · (1 - p).
Ein Beispiel mit runden Annahmen: Deine Website hat 3'000 Besucher im Monat, 2 Prozent davon fragen an. Das sind 60 Anfragen. Mit p = 0,02 ist s = 0,14.
- Willst du eine Steigerung um ein Fünftel erkennen, von 2,0 auf 2,4 Prozent, ist d = 0,004. Nach der Formel braucht es (4 · 2 · 0,14 / 0,004)² = 78'400 Besucher. Bei 3'000 im Monat läuft der Test rund zwei Jahre.
- Für eine Steigerung um die Hälfte, von 2 auf 3 Prozent, ist d = 0,01. Dann reichen (4 · 2 · 0,14 / 0,01)² = 12'544 Besucher, also rund vier Monate.
Die Formel ist eine Näherung: Der Faktor 4 kann bei grossen Stichproben um rund ein Viertel zu hoch liegen (Kohavi u. a., 2007). Weil er im Quadrat eingeht, kann die nötige Besucherzahl deutlich tiefer liegen. Am Befund ändert das nichts: Für ein Fünftel mehr Anfragen läuft der Test auch dann länger als ein Jahr.
Daraus folgt die wichtigste Regel für kleine Websites: Teste grosse Unterschiede. Je grösser der Unterschied, desto weniger Besucher braucht der Nachweis. Für eine Verdopplung der Quote, von 2 auf 4 Prozent, sind es nach der Formel (4 · 2 · 0,14 / 0,02)² = 3'136 Besucher, bei 3'000 im Monat rund ein Monat.
Teste deshalb Änderungen, die Besucher bemerken: eine neue Botschaft, ein anderes Angebot, ein halb so langes Formular. Was den Besuchern kaum auffällt, fällt auch in deinen Zahlen kaum auf.
Zwei Wege, schneller zu einem Ergebnis zu kommen
Zähle nur die Besucher, die die Änderung überhaupt sehen konnten. Änderst du das Formular, gehören nur jene in die Auswertung, die das Formular erreicht haben. Alle anderen erzeugen bloss Rauschen (Kohavi u. a., 2007).
Oder wähle eine häufigere Zielgrösse, etwa Klicks auf den Call-to-Action oder begonnene Formulare. Der Test wird schneller entscheidbar. Der Preis: Mehr Klicks sind nicht automatisch mehr Anfragen. Prüfe deshalb immer beides.
Wo KMU stattdessen testen: in den Anzeigen
Reicht der Traffic der Website nicht, gibt es einen Ort, an dem schneller Daten anfallen: die Anzeigen, die Besucher bringen. Impressionen und Klicks sind dort häufiger als Anfragen auf der Website.
Google Ads bietet dafür benutzerdefinierte Tests. Ein Teil der Zugriffe und des Budgets der ursprünglichen Kampagne geht an die Testfassung, zugeteilt zufällig nach Nutzer oder nach Suchanfrage.
Benutzerdefinierte Tests gibt es nur für Such-, Display-, Video- und Hotelkampagnen, nicht für App- und Shopping-Kampagnen (Google Ads-Hilfe, abgerufen 2026). Auch Meta bietet einen eigenen A/B-Test an (Meta Business Help Center, abgerufen 2026).
Ein Anzeigentest beantwortet allerdings zuerst eine andere Frage als ein Seitentest: welche Botschaft Menschen zum Klicken bringt.
Die Botschaft, die in der Anzeige gewinnt, ist trotzdem ein guter Kandidat für die nächste Hypothese auf der Landingpage. Was eine Kampagne kosten darf, zeigt der Beitrag zu den Kosten von Google Ads in der Schweiz.
Verstehen, bevor du testest
Ein Test prüft eine Vermutung. Die Vermutung kommt aus Beobachtung, nicht aus der Sitzung. Drei Quellen liefern sie, und keine braucht viel Traffic:
- Analytics: Wo brechen Besucher ab? Welche Seiten werden oft gelesen, führen aber zu keiner Anfrage? Wie du diese Zahlen findest und das Conversion-Tracking einrichtest, zeigt der Beitrag zu Google Analytics 4 für KMU.
- Heatmaps und Sitzungsaufzeichnungen: Sie zeigen, wohin Besucher klicken und wie weit sie scrollen. Microsoft Clarity bietet beides kostenlos und ohne Traffic-Grenze (Microsoft Learn, 2026). Vollständige Aufzeichnungen gibt es für Besucher aus der Schweiz allerdings nur mit Einwilligung.
- Nutzertests: Fünf Testpersonen, die du beim Bedienen deiner Website beobachtest, finden im Schnitt rund 85 Prozent der Bedienprobleme (Nielsen, Nielsen Norman Group, 2000). Für Kennzahlen statt Probleme empfiehlt die Nielsen Norman Group 20 Personen.
Für kleine Websites ist das oft der grössere Hebel als der Test selbst. Ein Formularfeld, an dem drei von fünf Testpersonen hängen bleiben, musst du nicht testen. Du behebst es.
Nutzertests gehören zum UX-Design. Wie du die Etappen bis zur Anfrage sichtbar machst, zeigt der Beitrag zum Customer Journey Mapping.
So läuft ein sauberer A/B-Test ab
- Problem aus den Daten ableiten. Nicht «Wir sollten mal etwas testen», sondern eine Stelle, an der Besucher nachweislich abspringen.
- Hypothese aufschreiben. «Wenn wir das Formular von acht auf vier Felder kürzen, steigt die Anfragequote, weil weniger Besucher abbrechen.» Die Begründung entscheidet, was du aus dem Ergebnis lernst.
- Zielgrösse vorab festlegen. Wer erst nach dem Test aussucht, worauf er schaut, findet leicht Unterschiede, die nur Zufall sind (Kohavi u. a., 2007).
- Stichprobe und Laufzeit vorab rechnen. Mit der Formel oben oder einem Rechner. Plane in ganzen Wochen, damit jeder Wochentag gleich oft vorkommt.
- Zufällig und gleichzeitig verteilen. Das Werkzeug teilt die Besucher zu, nicht du. Wer wiederkommt, sieht dieselbe Variante.
- Laufen lassen, ohne vorzeitig zu entscheiden. Warum, steht im nächsten Abschnitt.
- Auswerten und festhalten. Nicht nur die Quote, auch die Qualität der Anfragen. Dokumentiere das Ergebnis, auch wenn es keinen Unterschied gab.
Vier Fehler, die einen Test unbrauchbar machen können
Zu früh abbrechen
Nach drei Tagen liegt Variante B vorne, also wird sie übernommen. Wer laufend nachschaut und stoppt, sobald ein Unterschied signifikant aussieht, macht die übliche Auswertung unzuverlässig (Johari, Pekelis und Walsh, 2015).
Schwankungen am Anfang sind normal. Entschieden wird, wenn die geplante Stichprobe erreicht ist.
Zu viel auf einmal ändern
Wer Headline, Bild, Formular und Aufbau gleichzeitig ändert, weiss am Ende nicht, was gewirkt hat. Auf einer kleinen Website kann genau das trotzdem richtig sein: Erst ein grosser, gebündelter Unterschied wird überhaupt messbar.
Du kaufst dir die Messbarkeit mit dem Verzicht auf die Erklärung. Entscheide das bewusst, bevor der Test startet, nicht danach.
Einem überraschenden Ergebnis glauben
Zeigt eine Variante nach einer Woche ein sensationelles Plus, ist Misstrauen angebracht. Kohavi und Thomke verweisen auf Twymans Gesetz: Jede Zahl, die interessant oder auffällig aussieht, ist meist falsch. Überraschende Ergebnisse werden wiederholt, bevor sie gelten.
Die Qualität der Anfragen vergessen
Eine Variante, die mehr Formulare erzeugt, aber vor allem unpassende Anfragen bringt, hat nicht gewonnen. Werte deshalb aus, was aus den Anfragen wird. Wie du ihre Qualität bewertest, zeigt der Beitrag zum Lead Scoring.
A/B-Tests und SEO: was Google erlaubt
Ein Test verändert, was Besucher sehen. Google beschreibt, wie das ohne Schaden für die Suche geht (Google Search Central, aktualisiert 2025):
- Kein Cloaking: Googlebot darf keine anderen Inhalte sehen als Menschen. Das verstösst gegen die Spamrichtlinien.
- Canonical auf Varianten: Läuft eine Variante unter eigener URL, verweist ein rel="canonical" auf das Original.
- 302 statt 301: Leitet der Test auf eine Varianten-URL um, nutze eine vorübergehende Weiterleitung (302), keine dauerhafte (301).
- Test beenden: Ist der Test entschieden, wird die Gewinnerfassung übernommen und alles Testbezogene entfernt. Läuft ein Test unnötig lange, kann Google das als Täuschungsversuch werten.
Für die typischen Testobjekte gibt Google Entwarnung. Kleine Änderungen wie Grösse, Farbe oder Position eines Buttons oder der Text eines Call-to-Action haben oft wenig oder keinen Einfluss auf Snippet und Ranking der Seite.
Werkzeuge und Datenschutz
Lange bot Google mit Optimize ein eigenes Werkzeug für Website-Tests an. Seit dem 30. September 2023 gibt es das nicht mehr.
Google verweist seither auf Testwerkzeuge anderer Anbieter und arbeitet für die Anbindung an Google Analytics mit AB Tasty, Optimizely und VWO zusammen (Google Optimize-Hilfe, abgerufen 2026). Für Anzeigen brauchst du kein zusätzliches Werkzeug: Google Ads und Meta haben ihre Tests eingebaut.
Damit ein Besucher bei jedem Besuch dieselbe Variante sieht, merken sich Testwerkzeuge die Zuteilung meist in einem Cookie (Kohavi u. a., 2007). Für Cookies gilt in der Schweiz Art. 45c FMG: Das Bearbeiten von Daten auf fremden Geräten ist erlaubt, wenn die Besucher über die Bearbeitung und ihren Zweck informiert und auf ihr Ablehnungsrecht hingewiesen werden (FMG, SR 784.10). Das ist Information mit Ablehnungsrecht, kein Opt-in.
Das Testwerkzeug gehört deshalb in die Datenschutzerklärung, ebenso Heatmaps und Sitzungsaufzeichnungen. Clarity geht dabei über das Gesetz hinaus: Für Besucher aus der Schweiz verlangt es eine ausdrückliche Einwilligung, bevor es Cookies setzt. Was für Besucher aus der EU zusätzlich gilt, steht im Beitrag zum Remarketing. Dieser Abschnitt ersetzt keine Rechtsberatung.
Was ALPENIQ hier tut
Wir fangen bei der Messung an. Conversion-Tracking gehört zum Aufbau jeder Kampagne, die wir aufsetzen, bei Google Ads zusammen mit der Anbindung an Google Analytics. Ohne Messung gibt es nichts, was ein Test vergleichen könnte.
In Google Ads testen wir Anzeigenvarianten gegeneinander, auf Meta Anzeigen und Zielgruppen, laufend und dort, wo genug Daten für eine Entscheidung zusammenkommen. Auf der Website optimieren wir Landingpages und Conversion an den Stellen, an denen Daten und Nutzerverhalten den Hebel zeigen.
Reicht die Besucherzahl für einen belastbaren Test nicht, ist die bessere Investition meist eine andere: mehr passende Besucher, eine klarere Botschaft, ein kürzeres Formular.
Diese Verbindung aus Sichtbarkeit, Website und Kampagnen, die messbar Anfragen bringen, ist die Arbeit von ALPENIQ Growth.
Häufige Fragen
Was ist ein A/B-Test?
Ein A/B-Test vergleicht zwei Varianten einer Seite oder eines Elements. Die Besucher werden zufällig und gleichzeitig auf beide verteilt. Gemessen wird eine vorher festgelegte Zielgrösse wie Anfragen oder Käufe. So zeigt sich, welche Variante besser wirkt, unabhängig von Saison, Kampagnen oder Meinungen im Team.
Wie lange sollte ein A/B-Test laufen?
So lange, bis die vorab berechnete Stichprobe erreicht ist, geplant in ganzen Wochen. Nicht so lange, bis ein Unterschied zufällig signifikant aussieht: Wer laufend nachschaut und dann stoppt, macht die übliche Auswertung unzuverlässig. Ist der Test entschieden, beendest du ihn rasch.
Wann ist ein A/B-Test signifikant?
Wenn der gemessene Unterschied so gross ist, dass er bei der gewählten Sicherheit kaum zufällig entstanden sein kann. Üblich sind 95 Prozent Konfidenz. Gibt es in Wahrheit keinen Unterschied, meldet ein Test dann trotzdem in etwa einem von zwanzig Fällen einen. Das gilt nur, wenn Stichprobe und Zielgrösse vorher feststanden.
Wie viele Besucher braucht ein A/B-Test?
Das hängt von der heutigen Quote ab und vom Unterschied, den du erkennen willst. Bei 2 Prozent Anfragequote braucht der Nachweis einer Steigerung um ein Fünftel nach der Faustformel von Kohavi und Kollegen rund 78'400 Besucher. Für eine Steigerung um die Hälfte reichen rund 12'500.
Kann man mit Google Analytics A/B-Tests machen?
Google Analytics wertet aus, die Varianten ausspielen muss ein Testwerkzeug. Das frühere Google Optimize wurde am 30. September 2023 eingestellt. Seither arbeitet Google für die Anbindung an Google Analytics mit den Anbietern AB Tasty, Optimizely und VWO zusammen.
Welche Tools gibt es für A/B-Tests?
Für Websites Testwerkzeuge wie AB Tasty, Optimizely oder VWO, mit deren Anbietern Google bei der Anbindung an Google Analytics zusammenarbeitet. Für Anzeigen die eingebauten Tests in Google Ads und bei Meta. Für die Vorarbeit kostenlose Werkzeuge wie Microsoft Clarity.
Lohnt sich A/B-Testing für KMU?
Ja, wenn genug Besucher da sind und die getesteten Unterschiede gross genug sind. Laut Kohavi und Thomke gehen solche Tests ab einigen tausend täglich aktiven Nutzern. Darunter lohnt es sich meist mehr, das Nutzerverhalten mit Analytics, Heatmaps und Nutzertests zu verstehen und in den Anzeigen zu testen.
Fazit: messen statt meinen, aber ehrlich rechnen
A/B-Testing ersetzt die lauteste Meinung im Raum durch eine Messung. Das ist sein Wert, und der ist gross: Selbst bei Google und Bing scheitert die Mehrheit der getesteten Ideen.
Ein Test braucht aber Besucher. Wer ihn auf einer kleinen Website startet, ohne vorher zu rechnen, wartet Monate auf ein Ergebnis, das am Ende keines ist.
Rechne zuerst, teste dann, und wenn die Rechnung nicht aufgeht, beobachte zuerst deine Besucher. Für die meisten KMU heisst die Reihenfolge: Messung einrichten, Nutzerverhalten verstehen, grosse Unterschiede testen und in den Anzeigen testen, wo die Daten schneller anfallen. Jede dieser Stufen ersetzt eine Vermutung durch eine Beobachtung.
