AI Max testen, ohne sich selbst zu täuschen
Die meisten AI-Max-Tests messen die Lernphase, eine Budgetänderung oder eine Kampagne, die sich selbst kannibalisiert — nicht AI Max. So geht ein sauberer Test.
Google berichtet, dass Werbetreibende, die AI Max für Suchkampagnen aktivieren, typischerweise 14 % mehr Conversions oder Conversion-Wert bei ähnlichem CPA sehen. Das ist ein Durchschnitt über Konten, die sich für die Aktivierung entschieden haben. Es ist keine Prognose für Ihr Konto — und der einzige Weg herauszufinden, was es dort bewirkt, ist ein Test.
Das Problem: Die meisten AI-Max-Tests beantworten eine andere Frage als die gestellte. Sie messen die Lernphase, eine Budgetänderung oder eine Kampagne, die gegen sich selbst antritt. Dieser Artikel ist eine Methode, kein Urteil: wie Sie einen Test so aufsetzen, dass das Ergebnis etwas bedeutet — und wie Sie es anschließend lesen.
Drei Arten, wie ein AI-Max-Test lügt
Drei Fehler erklären fast jeden ergebnislosen AI-Max-Test, den wir gesehen haben:
- Die Lernphase liegt im Messfenster. Das Einschalten des Suchbegriffsabgleichs startet die Lernphase neu. Beginnt Ihr Nachher-Zeitraum am Tag des Umschaltens, beschreibt die erste Woche oder zwei vor allem einen Algorithmus, der sich sortiert. Kampagnen sehen in dieser Zeit meist schlechter aus — daher die vielen AI-Max-Horrorgeschichten, die in Wahrheit Screenshots aus der Lernphase sind.
- Gleichzeitig hat sich etwas anderes geändert. Mehr Budget, ein neuer Ziel-CPA, eine Saisonspitze, ein Landingpage-Release. Jedes Einzelne macht die Zuordnung unmöglich — und die Versuchung nachzujustieren ist genau dann am größten, wenn der Test einbricht.
- Der A/B-Test sind zwei Kampagnen, die sich bekämpfen. Eine Kampagne zu duplizieren klingt sauber und ist die schlechteste der drei Varianten: Beide Kampagnen treten in denselben Auktionen für dieselben Anfragen an, gemessen wird die Kollision. Googles eigene AI-Max-Experimente umgehen das, indem sie den Traffic innerhalb einer einzigen Kampagne aufteilen.
Zuerst: Gibt es überhaupt etwas zu finden?
Diese Frage gehört vor jede Testplanung — und wird fast immer übersprungen.
AI Max verdient sein Geld damit, auf Anfragen auszuspielen, die Sie nie gebucht haben. Die Größe des Potenzials hängt also an einer einzigen Größe: wie viel relevante Nachfrage außerhalb Ihrer Keyword-Liste existiert. Das ist keine Meinungsfrage — Ihr Konto beantwortet sie in etwa zwanzig Minuten.
- Wie viel Ihres Conversion-Volumens kommt über Markenbegriffe? Wenn es der Großteil ist, erntet die Kampagne bereits Nachfrage von Menschen, die Sie kennen. Da bleibt wenig zu entdecken und viel zu stören.
- Wie eng ist Ihr Match-Type-Mix? Eine Kampagne auf exakt passenden Keywords in einer gut kartierten Kategorie hat einen kleineren unbekannten Raum als eine breit laufende in einem explorativen Markt.
- Sehen Sie sich 90 Tage Suchbegriffe an. Wie viele wirklich neue, konvertierende Anfragen tauchten auf, die Sie nicht gebucht hatten? Lautet die Antwort „eine Handvoll pro Quartal", ist das Ihre realistische Obergrenze.
- Kann Ihre Website die angrenzenden Intentionen beantworten? Dieser Punkt entscheidet mehr, als die meisten erwarten. Die Erweiterung erreicht Serviceanfragen, Händler- und Standortsuchen, Supportfragen und benachbarte Produktkategorien — und schickt alles auf die Landingpage, die Sie ohnehin nutzen. Beantwortet diese Seite genau eine Intention, kann der neue Traffic nicht konvertieren, egal wie gut geboten wird.
Daraus folgen zwei Muster. In Kampagnen mit geschlossenem Suchvolumen — Brand-Kampagnen, eng kartierte Exact-Match-Sets — ist das Entdeckungspotenzial klein und das Risiko real. In generischen Kampagnen mit offener Suchintention gibt es tatsächlich etwas zu finden, und dort lohnt der Test.
Lautet die ehrliche Antwort „hier gibt es nichts zu entdecken", haben Sie sich sechs Wochen gespart. Auch das ist ein gültiges Ergebnis dieses Schritts.
Fünf Regeln für einen sauberen Test
Wenn es etwas zu finden gibt, tragen fünf Regeln die ganze Methode:
- Lernphase ausschließen. Planen Sie zwei Wochen Lernphase ein, die nicht Teil der Auswertung sind. Schreiben Sie die Daten vorher auf, damit sich das Fenster nicht stillschweigend verschiebt, sobald die ersten Zahlen schlecht aussehen.
- Stellschrauben einfrieren. Budget, Ziel-CPA oder Ziel-ROAS, Gebotsstrategie, Keyword-Struktur und Landingpages bleiben über den gesamten Test unberührt. Muss doch etwas geändert werden, endet der Test und ein neuer beginnt.
- Mindestens vier Wochen messen — nach der Lernphase. Bei einer Kampagne mit wenigen Conversions pro Woche entsprechend länger: Ein Ergebnis auf Basis von fünfzehn Conversions ist ein Münzwurf mit Zwischenschritten.
- Eine Sache testen. Automatische Textanpassung und Erweiterung der finalen URL bleiben beim ersten Test aus. Mit allen dreien messen Sie ein Paket — und wissen bei einem negativen Ergebnis nicht, welcher Teil es verursacht hat.
- Erfolgskriterien vorher aufschreiben. Primäre Kennzahl, Schwelle für einen Erfolg, und was Sie bei welchem Ausgang tun. Kriterien, die nach dem Ergebnis entstehen, sind keine Kriterien, sondern eine Erzählung.
Zum Testaufbau selbst: Googles AI-Max-Experiment teilt den Traffic innerhalb einer Kampagne in einen Kontroll- und einen Testarm — sauberer als jede Dublettenkonstruktion. Verfügbar ist es nicht überall: Kampagnen mit Portfolio-Gebotsstrategien, gemeinsamen Budgets, aktivierter Textanpassung oder einem laufenden Experiment sind ausgeschlossen. Dann bleibt der eingefrorene Vorher-Nachher-Vergleich als ehrliche Alternative. Er ist schwächere Evidenz, und das gehört so in den Report.
Was Sie messen — und die Kennzahl, die niemand ansieht
Auf Kampagnenebene verschwindet genau diese Art von Veränderung. Conversions, Kosten pro Conversion und CTR der Gesamtkampagne sind Durchschnitte — und ein Durchschnitt schluckt eine Umverteilung, ohne sie zu zeigen.
Der Mechanismus lässt sich in einem Satz sagen: Bekommt eine Smart-Bidding-Strategie zusätzlichen Traffic mit anderer Conversion-Rate, verteilt sie die Gebote neu, um ihr Ziel zu halten — und bietet dabei womöglich weniger auf die eine Anfrage, die die Kampagne getragen hat.
Berichten Sie deshalb neben den Kampagnenkennzahlen Ihre wertvollste einzelne Suchanfrage gesondert:
- Klicks und CTR
- Anteil an oberster Impressionen-Position (absolut)
- Durch Rang verlorener Impressionsanteil
- Conversions und Kosten pro Conversion
Wir haben das auf die unangenehme Art gelernt. In einem Brand-Kampagnen-Test im Frühjahr bewegten sich die Kampagnenzahlen im einstelligen Bereich, während die eine entscheidende Anfrage 29 % ihrer Conversions verlor — der gesamte Verlust der Kampagne steckte in einer Zeile, die niemand berichtet hat. Den vollständigen Test samt Zahlen haben wir veröffentlicht, auf unserer Schwesterseite.
Eine Berichtsgrenze sollten Sie einplanen: Ein großer Teil des AI-Max-Traffics — in unserem Test rund 60 % — erscheint im Suchbegriffsbericht nur als „andere Suchbegriffe". Ihre Analyse auf Anfrageebene ist also eine Stichprobe, keine Vollerhebung. Behandeln Sie sie als Richtungsangabe und bauen Sie keinen Beweis auf der sichtbaren Hälfte auf.
Wie Sie das Ergebnis lesen
Drei Fragen, in dieser Reihenfolge:
- Ist der Unterschied größer als Ihr normales Rauschen? Sehen Sie sich die Wochenschwankung der sechs Wochen vor dem Test an. Schwanken Conversions regelmäßig um 15 % von Woche zu Woche, ist ein Unterschied von 7 % kein Befund.
- Hat Ihre wertvollste Anfrage überlebt? Eine Kampagne, die insgesamt 5 % gewinnt, während ihre beste Anfrage 20 % verliert, hat sich nicht verbessert. Sie hat umverteilt — und die Umverteilung geht in der Regel weiter.
- Lässt es sich umkehren? Die günstigste Bestätigung, die es gibt: AI Max abschalten, die neue Lernphase abwarten, drei unveränderte Wochen messen. Kehren die Kennzahlen zurück, haben Sie einen Mechanismus statt eines Zufalls.
Eines lohnt sich unabhängig vom Urteil: die Anfragen behalten, die AI Max gefunden hat und die konvertiert haben. Buchen Sie sie als eigene Keywords. Selbst ein gescheiterter Test zahlt sich hier meist aus — und die Keywords bleiben Ihnen, auch nach dem Abschalten.
Seien Sie außerdem ehrlich zur Beweiskraft. Ein Vorher-Nachher-Vergleich mit eingefrorenen Stellschrauben ist gute Praxisevidenz, kein Beweis — die Kampagne lief weiterhin in einer Welt, in der sich Wettbewerber, Nachfrage und Googles Systeme bewegt haben. Schreiben Sie „plausibelste Erklärung", wenn es das ist. Jeder, der Ihren Report liest, kennt den Unterschied ohnehin.
Wann ein Rollout sinnvoll ist
Vier Bedingungen, die alle erfüllt sein sollten, bevor Sie AI Max über die Testkampagne hinaus ausweiten:
- Die Testkampagne hatte echte unentdeckte Nachfrage, und der Suchbegriffsbericht belegt es — neue konvertierende Anfragen, nicht nur mehr Volumen auf den alten.
- Ihre wertvollsten Anfragen haben ihre Position über den Test gehalten.
- Ihre Ausschlussliste deckt die Intentionen ab, die Sie nicht bedienen können: Service, Support, Karriere, Händler- und Standortsuchen, angrenzende Produktkategorien.
- Für die Intentionen, die die Erweiterung tatsächlich erreicht, existieren Landingpages. Wenn nicht: zuerst bauen. Das ist billiger, als Traffic zu bezahlen, der auf der falschen Seite landet.
Rollen Sie Kampagne für Kampagne aus, nicht kontoweit an einem Abend. Jede Kampagne hat ihren eigenen Mix aus Marken- und generischer Nachfrage — und derselbe Mechanismus, der AI Max in der einen nützlich macht, macht ihn in der anderen teuer.
Weiterlesen: die Gebotsänderung bei Performance Max funktioniert nach demselben Prinzip — ein Ziel, das auf einen veränderten Traffic-Mix angewendet wird. Und CRM-Conversion-Importe verhindern, dass eine Gebotsstrategie auf Leads optimiert, die nie abschließen. Wenn jemand den Aufbau prüfen soll, der solche Tests wöchentlich fährt: Das ist unsere Google-Ads-Arbeit.