Incrementality Testing
Welche Incrementality-testing-tools Brauchen Sie Intern?
Ein praxisnaher Vergleich der Tools, mit denen Sie einen Incrementality-Test intern durchführen können: native Lift-Studien der Werbeplattformen (Google Ads Conversion Lift, Meta Conversion Lift, TikTok Conversion Lift Study) versus die Open-Source-Pakete für R und Python, die Data-Teams tatsächlich nutzen (GeoLift, CausalImpact, CausalPy, GeoexperimentsResearch) – inklusive eines kurzen Codebeispiels und eines Frameworks, um die passende Option auszuwählen.

Du brauchst zwei Kategorien von Inkrementalitäts-Test-Tools, um einen Test intern durchzuführen: plattformnative Tools innerhalb von Plattformen wie Google Ads und Open-Source-Pakete für kausale Inferenz wie GeoLift und CausalImpact, die ein Datenteam unabhängig ausführt.
Die meisten Marketingteams haben kein Datenproblem. Sie haben ein Nachweisproblem. Dashboards zeigen, welcher Kanal einen Verkauf zuletzt berührt hat, nicht welcher Kanal ihn tatsächlich verursacht hat. In ELIYA’s Analyse werden im Durchschnitt 20% der Werbeausgaben bei vielen E-Commerce-Marken verschwendet, und Marken erschließen typischerweise weitere 5 bis 15% inkrementelles Wachstum, sobald diese verschwendeten Ausgaben mit eliya umverteilt werden.
Dieser Leitfaden schlüsselt die plattformgeführten Optionen, die Open-Source-Pakete und die Entscheidung zwischen ihnen auf – einschließlich eines kurzen durchgerechneten Beispiels, wie die Durchführung eines solchen Tests in Code tatsächlich aussieht.
💡 Wichtigste Erkenntnisse
Plattformnative Tools wie Google Ads Conversion Lift und Meta Conversion Lift sind der schnellste Weg, einen einzelnen Kanal zu testen, aber jede Plattform konzipiert, führt und berichtet ihren eigenen Test, sodass die Ergebnisse nicht unabhängig verifiziert werden.
Open-Source-Pakete wie GeoLift und CausalImpact wenden eine einheitliche statistische Methodik über jeden Kanal hinweg an und erfordern interne statistische Fähigkeiten, um die Ergebnisse korrekt auszuführen und zu interpretieren.
GeoLift nutzt Synthetic-Control-Methoden, die für Geo-Tests entwickelt wurden, während CausalImpact bayessche strukturelle Zeitreihen verwendet, um den kausalen Einfluss einer Kampagne zu messen.
Das richtige Tool hängt von den statistischen Fähigkeiten deines Teams ab, davon, wie viele Kanäle du testen musst, und davon, ob die Ergebnisse ein breiteres Marketing Mix Model kalibrieren müssen.
Was gilt als ein Inkrementalitäts-Test-Tool?
Inkrementalitäts-Testing misst den kausalen Lift eines Kanals mithilfe eines randomisierten kontrollierten Experiments, das einem Teil der Zielgruppen einen Kanal oder eine Anzeige vorenthält und die Ergebnisse mit einer Gruppe vergleicht, die exponiert war.
Die meisten Reviews zu „Incrementality-Testing-Tools“ empfehlen kommerzielle Plattformen, die den Test durchführen und anschließend ein Dashboard bereitstellen.

In diesem Leitfaden behandeln wir die zwei Kategorien, zu denen ein technisches Team greift, wenn es den Test selbst entwerfen und durchführen möchte: die Lift-Study-Funktionen innerhalb der Werbeplattformen, auf denen ihr ausgebt, und die Open-Source-Statistikpakete, die Data Scientists unabhängig ausführen können.
Geo-Holdout-Test: ein Incrementality-Test, der auf separater geografischer bzw. Marktebene durchgeführt wird und Verkäufe in Regionen vergleicht, in denen ein Kanal weiterläuft, mit Verkäufen in Regionen, in denen er pausiert wird.
Geo-Holdout-Tests sind nützlich, wenn eine Aufteilung auf Individualebene unpraktisch oder unmöglich ist. Zum Beispiel lassen sich Tests für TV, Radio, Out-of-Home und Retail Media nicht sauber auf Individualebene aufteilen.
Wie funktionieren plattformnative Lift Studies?
Plattformnative Tools sind in die großen Werbeplattformen integriert. Sie sind kostenlos, schnell zu starten und einfach, da ihr keine tiefen statistischen Kenntnisse benötigt, um die Ergebnisse auf eurer Seite zu analysieren. Der Trade-off ist die Unabhängigkeit: Plattformen korrigieren ihre eigenen Hausaufgaben.
Google Ads Conversion Lift
Google Ads Conversion Lift läuft als Experiment auf Nutzerebene oder Geo-Basis innerhalb von Google Ads und teilt berechtigte Nutzer oder Regionen in Test- und Kontrollgruppen auf, um die inkrementellen Conversions für Kampagnen wie Search, Shopping, Display oder YouTube zu messen. Es ist typischerweise der Einstiegspunkt für Marken, die stark im Google-Ökosystem ausgeben und einen Incrementality-Test durchführen möchten, ohne selbst etwas zu bauen.
Meta Conversion Lift und Brand Lift Study
Meta Conversion Lift funktioniert ähnlich im Ads Manager, indem Personen zufällig einer Testgruppe, die Anzeigen sieht, und einer Holdout-Gruppe zugewiesen werden; anschließend werden die Conversion-Ergebnisse verglichen. Meta bietet außerdem eine separate Brand Lift Study an, die statt Conversions die Anzeigen-Erinnerung und Bekanntheit misst. Dieser Test ist nützlich, wenn die Aufgabe einer Kampagne im Upper-Funnel liegt.
TikTok Conversion Lift Study
TikToks Conversion Lift Study wendet dieselbe Holdout-Logik auf TikTok-Kampagnen an. Snapchat und andere Plattformen bieten vergleichbare native Lift-Tools an und folgen demselben grundlegenden Design.
Die Einschränkung bei all diesen ist, dass jede Plattform den Test für ihre eigenen Kampagnen konzipiert, durchführt und das Ergebnis berichtet. Da jede Plattform ihren eigenen statistischen Ansatz verwendet, sind Lift-Ergebnisse von einer Plattform nicht mit denen einer anderen vergleichbar.
Wie funktionieren Open-Source-Pakete für kausale Inferenz?
Open-Source-Tools tauschen Bequemlichkeit gegen Unabhängigkeit. Eine Data Scientist entwirft das Experiment, führt die Analyse durch und kann Ergebnisse unabhängig mit einer konsistenten Methodik auswerten. Das setzt voraus, dass jemand im Team R oder Python beherrscht und die zugrunde liegende Sprache der kausalen Inferenz versteht.
GeoLift
GeoLift ist ein Open-Source-R-Paket. Von Meta entwickelt, ermöglicht es das Design und die Analyse geo-basierter Inkrementalitätstests.
Synthetische Kontrollmethode: Wird verwendet, wenn kein echtes randomisiertes Holdout verfügbar ist: Die synthetische Kontrollmethode ist eine statistische Technik, die ein kontrafaktisches Szenario aus einer Menge unbehandelter Märkte simuliert.
GeoLift nutzt synthetische Kontrollmethoden (SCM), um Situationen zu bewältigen, in denen ein sauberer Holdout oder ein Matched Market schwierig ist. Es enthält außerdem Tools zur Power-Analyse, die Teams helfen zu verstehen, wie lange ein Test laufen muss.
Für weitere Details zu SCM haben wir SCM und seine Varianten in der Messung von Offline-Kanälen besprochen.
CausalImpact
CausalImpact ist Googles Open-Source-R-Paket zur Schätzung des kausalen Effekts einer Intervention auf eine Zeitreihe. Die Intervention könnte eine Promotion, eine neue Richtlinie oder die Einführung eines Kanals sein.
Bayessche strukturelle Zeitreihen: ein statistisches Modell, das prognostiziert, wie sich eine Kennzahl ohne Intervention entwickelt hätte, und dann die Lücke zwischen dieser Prognose und dem tatsächlich Eingetretenen misst.
CausalImpact ist eines der am weitesten verbreiteten Tools zur Analyse eines Geo-Tests. Es erstellt eine bayessche Prognose dafür, wie eine Kennzahl wie Umsatz oder Website-Traffic ohne eine bestimmte Marketingintervention ausgesehen hätte, und vergleicht dann dieses kontrafaktische Szenario mit dem, was tatsächlich passiert ist.
CausalPy und GeoexperimentsResearch
CausalPy ist ein Python-Paket von PyMC Labs für kausale Inferenz in quasi-experimentellen Settings und unterstützt Difference-in-Differences, Synthetic Control, Interrupted Time Series und Regression Discontinuity in einer konsistenten Oberfläche.
Für Teams, die bereits in Python und bayesscher Modellierung arbeiten – einschließlich aller, die ein Bayesian Marketing Mix Model (MMM) betreiben –, fügt es sich in denselben Workflow ein, statt eine separate R-Umgebung zu erfordern.
GeoexperimentsResearch ist Googles Open-Source-R-Implementierung seiner internen Geo-Experiment-Methodik: Matched-Market-Pairing, Pre-Test-Balance-Checks und Lift-Schätzung.
Siehe ELIYA’s Leitfaden zu Geo-Experiment-Design und iROAS-Methoden wie DiD, SCM und BSTS dazu, wie diese Methoden speziell auf Offline- und schwer zu trennende Kanäle angewendet werden.
GeoLift vs. CausalImpact vs. CausalPy: Wie wählen Sie zwischen den Open-Source-Optionen?
Tool | Typ | Zentrale Stärke | Am besten geeignet für | Unterscheidungsmerkmal |
|---|---|---|---|---|
Google Ads Conversion Lift | Plattform-nativ | Nativ, keine Einrichtung erforderlich | Marken, die speziell Search-, Shopping- oder YouTube-Kampagnen testen | Unterstützt sowohl nutzerbasierte als auch geobasierte Designs innerhalb von Google Ads |
Meta Conversion Lift | Plattform-nativ | Schnelles Holdout-Setup im Ads Manager | Marken, die speziell Facebook- und Instagram-Kampagnen testen | Randomisierter Test- und Holdout-Split, vollständig von Meta verwaltet |
TikTok Conversion Lift Study | Plattform-nativ | Nativer Lift-Read für TikTok-Spend | Marken, die prüfen, ob TikTok-Conversions inkrementell sind | Gleiche Holdout-Logik wie bei Google und Meta, auf TikTok begrenzt |
GeoLift | Open-source ® | Synthetic Control für Märkte ohne sauberes Holdout | Teams, die Kanäle über viele Geografien gleichzeitig testen | Integrierte Power-Analyse für Testdauer und Anzahl der Märkte |
CausalImpact | Open-source ® | Bayessche kontrafaktische Prognose | Analyse des Lifts, nachdem ein Test bereits läuft | Entstand aus Googles interner Analyse von Werbekampagnen |
GeoexperimentsResearch | Open-source ® | Zweckgebundene Methodik für Geo-Experimente | Teams, die Googles eigenes Matched-Market-Design als Code nutzen möchten | Enthält Pre-Test-Balance-Checks, nicht nur Post-Test-Analyse |
CausalPy | Open-source (Python) | Eine Oberfläche für mehrere kausale Designs | Teams, die bereits Bayes-Modelle in Python einsetzen | Unterstützt DiD, Synthetic Control und Regression Discontinuity gemeinsam |
So sieht es ungefähr aus, eines davon in R-Code auszuführen. Ein CausalImpact-Test auf einer einzelnen Geo, sobald Sie eine Vorperiode und eine Nachperiode rund um die Intervention definiert haben, sind nur ein paar Zeilen:
data ist eine Zeitreihe mit der Kennzahl Ihres behandelten Marktes zusammen mit einem oder mehreren unbehandelten Kontrollmärkten. pre.period und post.period markieren die Datumsbereiche vor und nach der Kanaländerung.
Der Aufruf summary() liefert den geschätzten Lift, ein Konfidenzintervall und einen p-Wert – alles, was Sie brauchen, um zu entscheiden, ob der Effekt real ist oder nur Rauschen.
Schritt für Schritt: Wie wählen Sie das richtige Inkrementalitäts-Tool für Ihr Team?
- Beginnen Sie mit der Business-Frage. Entscheiden Sie, ob Sie einen oder mehrere Kanäle validieren müssen und ob Sie ein breiteres Messmodell kalibrieren müssen.
- Passen Sie das Testdesign an den Kanal an. Ein Kanal, der nach einzelnen Nutzer:innen aufgeteilt werden kann, wie Paid Search, funktioniert gut mit der nativen Lift-Studie einer Plattform. Ein Kanal, der nur geografisch aufgeteilt werden kann, wie TV oder Out-of-Home, braucht ein Geo-Holdout.
- Prüfen Sie, ob Sie Inhouse-Skills für kausale Inferenz haben. GeoLift, CausalImpact und CausalPy setzen alle voraus, dass jemand in Ihrem Team ein statistisches Modell in R oder Python aufsetzen, ausführen und korrekt interpretieren kann. Wenn das noch nicht verfügbar ist, ist ELIYA’s guide to running a lift analysis step by step oder ein von Expert:innen durchgeführter Test der realistischere Einstiegspunkt.
- Entscheiden Sie, ob Sie kanalübergreifende Vergleichbarkeit benötigen.Plattform-Tools lassen sich nicht eins-zu-eins miteinander vergleichen, da jedes seine eigene Methodik verwendet. Wenn Sie Kanäle gegeneinander ranken müssen, ist ein Open-Source-Tool, das über alle Kanäle hinweg konsistent eingesetzt wird, die einzige Möglichkeit, einen fairen Vergleich zu erhalten.
- Planen Sie, wie die Ergebnisse genutzt werden sollen.Medienkosten, Saisonalität und Promotions verändern sich monatlich, daher veraltet ein einmaliger Testlauf zum Launch schnell. Entscheiden Sie im Voraus, ob die Lift-Zahl ein Marketing Mix Model kalibrieren, eine Budgetumschichtung unterstützen oder eine konkrete interne Debatte über den tatsächlichen Return eines Kanals klären soll.

Wie geht ELIYA bei der Auswahl von Tools für Incrementality Testing vor?
ELIYA bietet zwei Lösungen für Incrementality Testing: 1) Self-Service eliya studio, in dem Nutzer experimentelle Ergebnisse entwerfen, implementieren, analysieren und interpretieren können. 2) Full Service, unterstützt von unseren Data-Science- und Marketing-Measurement-Expert:innen, die dabei helfen, das richtige Tool auszuwählen – abhängig vom Kanal und der Fragestellung. Das ELIYA-Team entwickelt ein Matched-Market- oder Geo-Holdout-Design und berechnet die statistische Power, die für ein belastbares Ergebnis nötig ist.
In unserem Full Service führt das ELIYA-Team incrementality testing and geo experiments als eigenständige Disziplin durch, live im Markt überwacht auf Anomalien, die das Ergebnis verzerren könnten, wobei jedes Design und jedes Ergebnis von einem Data Scientist geprüft wird, bevor es ausgeliefert wird.
Was das von der isolierten Nutzung von GeoLift oder CausalImpact unterscheidet, ist, wohin das Ergebnis als Nächstes fließt: direkt in die Kalibrierung eines Marketing Mix Model, sodass getestete Evidenz aus der realen Welt die Genauigkeit des Modells kontinuierlich verbessert, statt in einem einmaligen Report zu verschwinden.
Das ist derselbe Ansatz, der hinter einem der eigenen Kundenergebnisse von ELIYA steht. Für Beliani, einen europäischen E-Commerce-Möbelhändler, ergab ELIYA’s erstes vollständiges Incrementality-Audit, dass fast 24 % des Media-Budgets der Marke in gesättigte Kanäle ohne zusätzlichen Return flossen.
Diese Ergebnisse in ein Always-on, monatlich aktualisiertes Marketing Mix Model einzuspeisen und das Budget anhand seiner Empfehlungen umzuverteilen, führte über sechs Monate zu 2,95 Mio. an inkrementellem Umsatz – ohne die gesamten Media-Ausgaben zu erhöhen.
Wenn Ihr Team bereits Tests durchführt, die Ergebnisse aber bei einem Slide Deck enden, statt ein Budget zu verändern, book a meeting with ELIYA um zu sehen, wie diese Kalibrierungsschleife in der Praxis funktioniert.
Wer sollte Inkrementalitätstests intern durchführen, und wer braucht einen Experten?
Am besten geeignet für einen internen Open-Source-Ansatz: ein Team mit einem Analysten oder Data Scientist, der sich in R oder Python wohlfühlt, eine überschaubare Anzahl an Kanälen testet und Zeit hat, die Testinfrastruktur selbst aufzubauen und zu warten.
Am besten geeignet für ausschließlich plattformnative Tools: ein kleineres Team, das eine grobe Orientierung für ein oder zwei Kanäle braucht und keine kanalübergreifende Vergleichbarkeit oder eine Pipeline zur Modellkalibrierung benötigt.
Für beides nicht geeignet und ein besserer Kandidat für von Experten durchgeführte Tests: eine E-Commerce-Marke in der Wachstumsphase oder eine Multi-Market-Brand mit 2 Mio. $ oder mehr jährlichen Media-Ausgaben, die mehrere Kanäle testet, die mit einer konsistenten Methodik miteinander verglichen werden müssen – insbesondere, wenn die Ergebnisse dazu dienen sollen, ein laufendes Marketing Mix Model zu kalibrieren, statt eine einzelne einmalige Frage zu beantworten.
Häufig gestellte Fragen
Kann ich einen Inkrementalitätstest durchführen, ohne einen Data Scientist im Team zu haben?
Ja, wenn Sie bei plattformnativen Tools wie Google Ads Conversion Lift oder Meta Conversion Lift bleiben, die das statistische Design und die Analyse für Sie übernehmen. Open-Source-Tools wie GeoLift, CausalImpact und CausalPy erfordern jemanden, der ein statistisches Modell aufsetzen und korrekt interpretieren kann.
Was ist der tatsächliche Unterschied zwischen GeoLift und CausalImpact?
GeoLift wurde speziell für die Konzeption und Analyse von Marketing-Geo-Experimenten entwickelt und nutzt Synthetic-Control-Methoden, um ein kontrafaktisches Szenario zu erstellen. CausalImpact ist ein allgemeineres Zeitreihen-Tool, das eine Bayes’sche Prognose dessen erstellt, was ohne Intervention passiert wäre, und wird typischerweise genutzt, um einen Test zu analysieren, nachdem er bereits läuft.
Ist Google Ads Conversion Lift genau genug, um ihm allein zu vertrauen?
Es ist ein legitimer, statistisch konzipierter Test, aber er misst und berichtet nur über Googles eigene Kampagnen und nutzt dabei Googles eigene Methodik. Das macht ihn zu einem nützlichen Richtungssignal für diesen spezifischen Kanal, auch wenn er nicht unabhängig verifiziert ist.
Wie viel Werbebudget brauche ich, bevor Geo-Lift-Tests sinnvoll sind?
Es gibt keinen festen Schwellenwert, aber ein Geo-Holdout-Test braucht genügend Märkte und genügend Budget pro Markt, um ein statistisch aussagekräftiges Ergebnis zu liefern. Marken, die pro Jahr im niedrigen sechsstelligen Bereich in einem einzelnen Kanal ausgeben, haben oft nicht genug Volumen für eine saubere Geo-Aufteilung.
Ersetzt ein Inkrementalitäts-Testing-Tool ein Marketing Mix Model?
Nein. Ein Inkrementalitätstest liefert dir periodisch einen Ground-Truth-Input für einen spezifischen Kanal. Ein Marketing Mix Model gibt dir eine laufende, kanalbezogene Sicht auf den Return über deinen gesamten Marketing-Mix hinweg. Beides arbeitet zusammen: Inkrementalitäts-Ergebnisse sind es, die das Modell kalibrieren.
Das Fazit zu Inkrementalitäts-Testing-Tools
Plattform-native Tools wie Google Ads Conversion Lift und Meta Conversion Lift sind der schnellste Weg, um einen Lift für einen einzelnen Kanal zu ermitteln. Open-Source-Tools wie GeoLift und CausalImpact geben dir eine unabhängige, konsistente Methodik über jeden Kanal hinweg. Die richtige Wahl hängt davon ab, wie viele Kanäle du testen willst, wie die Ergebnisse genutzt werden sollen und ob du die entsprechende Inhouse-Expertise hast.
Wenn du eine E-Commerce-Marke in der Wachstumsphase oder eine Multi-Market-Brand bist, die 2 Mio. $ oder mehr pro Jahr kanalübergreifend ausgibt und Inkrementalitäts-Ergebnisse brauchst, die nicht nur in einem Report liegen bleiben, sondern aktiv ein Marketing Mix Model kalibrieren, auf das dein Team handeln kann, eliya studio ist genau für diese Art der Zusammenarbeit gebaut.


