Incrementality testing: cómo medir el efecto causal de una campaña.
Una guía para definir el efecto que querés estimar, elegir entre holdouts y geo experiments, planificar precisión, calcular lift e iROAS e interpretar el resultado sin confundir atribución con causalidad.
- Incrementalidad: qué se intenta estimar
- Incrementalidad, atribución y MMM
- Tratamiento, control y contrafactual
- Holdouts a nivel de usuario
- Geo experiments
- Duración, potencia y efecto detectable
- Lift, iROAS e incertidumbre
- Cómo interpretar el resultado
- Cuándo conviene usarlo
- Errores frecuentes
- Preguntas frecuentes
- Referencias
Incrementalidad: qué se intenta estimar.
La incrementalidad es el resultado adicional producido por una intervención respecto de lo que habría ocurrido sin ella. En marketing puede expresarse como conversiones, revenue, búsquedas, leads u otro KPI incremental.
Un test de incrementalidad es un diseño experimental para estimar ese efecto. La distinción importa: incrementalidad es el estimando causal; holdouts, conversion lift y geo experiments son formas de construir una comparación que permita estimarlo.
La pregunta deja de ser “¿qué canal recibe crédito por esta conversión?” y pasa a ser “¿cuánto habría cambiado el resultado si esta intervención no hubiese ocurrido?”. Ese segundo escenario no puede observarse para la misma unidad al mismo tiempo: es el contrafactual. El diseño experimental intenta aproximarlo con un grupo de control comparable.
Incrementalidad no pregunta quién estuvo presente antes de la conversión. Pregunta cuánto resultado adicional produjo realmente la intervención.
Síntesis editorialSi buscás la definición canónica del concepto, podés ver qué es incrementalidad en el Glosario. Para el marco general de diseño causal, consultá también Experimentación en marketing.
02 — DiferenciasIncrementalidad, atribución y Marketing Mix Modeling.
| Enfoque | Pregunta | Unidad habitual | Resultado |
|---|---|---|---|
| Atribución | ¿Cómo distribuir crédito entre touchpoints observados? | Interacciones y journeys registrados. | Crédito atribuido. |
| Test de incrementalidad | ¿Qué cambió por la intervención frente al control? | Usuarios, cuentas, regiones u otras unidades experimentales. | Efecto incremental estimado. |
| Marketing Mix Modeling | ¿Cómo responde el KPI agregado al mix de marketing y otros factores? | Tiempo y, cuando existe, geografía. | Efectos, ROI, ROI marginal y curvas de respuesta bajo supuestos del modelo. |
La atribución no es necesariamente “mala” por no ser un experimento: responde otra pregunta y puede ser útil para operación táctica. Pero no conviene interpretar crédito atribuido como equivalente automático a efecto causal.
Tampoco es correcto afirmar que los experimentos sean la única forma de inferencia causal. Los ensayos aleatorizados ofrecen una identificación especialmente fuerte cuando están bien ejecutados, pero existen diseños cuasi-experimentales y modelos causales observacionales que pueden estimar efectos bajo supuestos adicionales. El Marketing Mix Modeling, por ejemplo, puede formularse como metodología de inferencia causal a escala agregada.
03 — Diseño causalTratamiento, control y contrafactual.
Un test de incrementalidad necesita definir con precisión qué intervención se evalúa, quién puede recibirla, cuál es la unidad de asignación, qué condición funciona como control, qué KPI representa el efecto y durante qué horizonte se mide.
La randomización ayuda a crear grupos comparables en expectativa y rompe la asociación sistemática entre propensión previa y asignación al tratamiento. No garantiza que cada covariable quede exactamente balanceada en una muestra finita, por lo que el diseño, la ejecución y los diagnósticos siguen siendo importantes.
| Elemento | Decisión | Pregunta de control |
|---|---|---|
| Estimando | Definir qué efecto incremental se quiere medir. | ¿Conversiones, valor, búsquedas, leads, margen? |
| Tratamiento | Especificar la intervención real. | ¿Campaña activa, mayor spend, nueva estrategia? |
| Control | Definir qué ocurre sin la intervención. | ¿Holdout, campaña base, reducción de spend? |
| Unidad | Elegir dónde se asigna el tratamiento. | ¿Usuario, cuenta, tienda, ciudad, región? |
| Horizonte | Capturar el efecto y su lag relevante. | ¿Cuánto tarda normalmente en aparecer el resultado? |
Holdouts a nivel de usuario.
Cuando la plataforma o la infraestructura permiten controlar exposición individual, un diseño común separa una población elegible en tratamiento y control. El tratamiento puede recibir la campaña y el control queda retenido de esa exposición. La diferencia posterior en el KPI permite estimar lift.
Google Ads describe actualmente sus estudios de Conversion Lift con dos grupos: usuarios que ven los anuncios y usuarios que no los ven. También ofrece variantes basadas en geografía. La disponibilidad, elegibilidad y metodología concreta dependen de la plataforma y pueden cambiar, por lo que conviene distinguir el principio experimental de la implementación comercial específica.
En un holdout hay que vigilar contaminación entre condiciones, pérdidas de identificación, cambios de elegibilidad, cross-device, exposición externa y cualquier mecanismo que haga que “tratamiento” y “control” dejen de representar condiciones realmente diferentes.
05 — GeografíaGeo experiments: cuando la región es la unidad experimental.
Los geo experiments utilizan regiones geográficas no superpuestas como unidades de asignación. Algunas geografías reciben la intervención y otras funcionan como control. Google Research formalizó este enfoque para medir efectividad publicitaria mediante asignación aleatoria de regiones a condiciones de test y control.
Son especialmente útiles cuando la exposición no puede controlarse de manera fiable a nivel individual, cuando interesa medir canales offline o cuando la organización necesita una medición agregada cross-channel.
| Etapa | Qué resolver | Riesgo principal |
|---|---|---|
| Pool de regiones | Definir unidades con datos estables, cobertura suficiente y baja interferencia. | Pocas unidades o spillovers entre geos. |
| Asignación | Construir tratamiento y control de acuerdo con el diseño estadístico. | Desbalance y baja potencia. |
| Preperíodo | Usar historia previa para diseño, diagnóstico o mejora de precisión. | Confundir similitud histórica con prueba causal. |
| Intervención | Aplicar una diferencia suficientemente clara entre condiciones. | Tratamiento demasiado débil para generar señal detectable. |
| Análisis | Estimar efecto e incertidumbre con un método compatible con el diseño. | Ignorar dependencia temporal o heterogeneidad geográfica. |
No existe una proporción universal 70/30 o 50/50 que sea siempre correcta. La asignación entre tratamiento y control debe optimizarse según número y tamaño de regiones, variabilidad, presupuesto, efecto esperado y método de estimación.
06 — PrecisiónDuración, potencia y efecto detectable.
Un test no debería durar “hasta que dé significativo”. En un diseño frecuentista de horizonte fijo, la duración se planifica antes de leer el resultado principal y se relaciona con el efecto mínimo detectable, el volumen del KPI, la variabilidad, el nivel de error aceptado, el poder y la asignación entre grupos.
Los diseños secuenciales y bayesianos pueden permitir monitoreo y reglas de decisión diferentes. Por eso el problema del peeking no se resuelve con una prohibición universal de mirar datos, sino usando un procedimiento estadístico coherente con la forma en que se tomarán decisiones.
También importa el conversion lag. La ventana de medición debe capturar el tiempo razonable entre exposición y resultado. Como ejemplo de implementación de plataforma, Google Ads permite estudios de Conversion Lift basados en usuarios desde siete días, pero suele recomendar más de catorce días y ajustar la duración al ciclo de conversión. Eso no convierte “14 días” en una regla general para todos los tests.
Para profundizar en planificación, ver tamaño de muestra y precisión experimental.
07 — MétricasLift, conversiones incrementales e iROAS.
La salida del experimento debe corresponder al efecto definido. En un estudio de conversion lift pueden aparecer métricas como conversiones incrementales, lift relativo, valor incremental, costo incremental por adquisición e iROAS.
| Métrica | Lectura | Qué evita confundir |
|---|---|---|
| Lift absoluto | Resultado incremental estimado en unidades del KPI. | Crédito atribuido vs efecto adicional. |
| Lift relativo | Cambio proporcional respecto de la condición de referencia. | Comparar magnitudes sin considerar baseline. |
| Valor incremental | Valor económico adicional estimado. | Tratar todas las conversiones como equivalentes. |
| iROAS | Valor incremental estimado dividido por inversión. | Confundir ROAS atribuido con retorno incremental. |
Google Ads define hoy el iROAS de Conversion Lift como el valor de conversión incremental generado por dólar de inversión. Esa definición es útil porque mantiene separados dos conceptos que suelen mezclarse: atribución e incrementalidad.
La estimación puntual debe acompañarse de su incertidumbre. Dependiendo de la metodología pueden utilizarse intervalos de confianza o intervalos creíbles, que no tienen la misma interpretación estadística. Google Ads, por ejemplo, ha incorporado metodología bayesiana en Conversion Lift y reporta intervalos creíbles en los casos correspondientes.
08 — LecturaCómo interpretar el resultado sin sobrerreaccionar.
Un resultado de lift pequeño, incierto o compatible con cero no significa automáticamente “la campaña no funciona”. Puede significar que el efecto verdadero es pequeño, que el test tuvo baja potencia, que la intervención fue débil, que hubo contaminación o que el período no capturó todo el efecto.
Del mismo modo, encontrar lift positivo en una campaña no demuestra que cada audiencia, creatividad o impresión dentro de ella sea incremental. La granularidad de la decisión debe respetar la granularidad del experimento.
La decisión final debería considerar al menos cuatro dimensiones: tamaño del efecto, incertidumbre, costo de la intervención y relevancia económica. Un efecto estadísticamente detectable puede ser demasiado pequeño para justificar la inversión; un efecto económicamente valioso pero estimado con gran incertidumbre puede justificar un nuevo experimento.
La pregunta no es solamente si existe lift. Es cuánto lift estimamos, con qué incertidumbre y si ese efecto cambia una decisión real de inversión.
Síntesis editorialCuándo conviene usar incrementality testing.
Conviene cuando una decisión de presupuesto depende de saber si una intervención genera resultado adicional y es posible crear una comparación defendible entre tratamiento y control.
Es especialmente útil en retargeting, campañas de awareness, promociones, cambios grandes de inversión, canales con tracking incompleto y cualquier situación donde el crédito atribuido pueda confundirse con demanda preexistente.
No siempre es la mejor herramienta. Puede ser inviable cuando el volumen es demasiado bajo, la intervención no puede aislarse, existen fuertes spillovers entre unidades, el costo de mantener un control es desproporcionado o la pregunta es puramente descriptiva. En esos casos puede convenir otra estrategia de inferencia causal o una combinación de evidencias.
10 — ErroresErrores frecuentes en incrementality testing.
Error 1: confundir incrementalidad con el método
Incrementalidad es el efecto adicional respecto del contrafactual. Un holdout, un geo experiment o un conversion lift son diseños para estimarlo.
Error 2: afirmar que solo los experimentos pueden medir causalidad
Los experimentos aleatorizados son una referencia fuerte de identificación causal, pero no agotan la inferencia causal. Los diseños cuasi-experimentales y algunos modelos observacionales también pueden estimar efectos bajo supuestos explícitos.
Error 3: detener un fixed-horizon test cuando aparece significancia
Si el diseño fue planificado con horizonte fijo, detenerlo según resultados intermedios altera las propiedades del procedimiento. Si se necesita monitoreo continuo, conviene diseñar desde el inicio un método secuencial o bayesiano compatible.
Error 4: imponer reglas universales de duración o split
“Cuatro semanas”, “95%”, “70/30” o “50/50” pueden ser decisiones razonables en casos concretos, pero no son leyes generales. La configuración correcta depende del diseño y del costo de precisión.
Error 5: tratar ausencia de evidencia como evidencia de ausencia
Un intervalo amplio compatible con cero puede revelar falta de precisión, no necesariamente efecto nulo. La lectura debe considerar qué tamaños de efecto siguen siendo plausibles.
Error 6: extrapolar más allá de lo probado
Un experimento estima el efecto de una intervención concreta, en una población y período concretos. Generalizar a otras geografías, presupuestos, frecuencias o creatividades requiere evidencia adicional.
11 — Preguntas frecuentesPreguntas frecuentes.
¿Qué es un test de incrementalidad?
Un test de incrementalidad es un experimento diseñado para estimar el efecto adicional de una intervención de marketing respecto de un contrafactual. Compara una condición de tratamiento con una condición de control y estima cuánto cambió un resultado por la intervención, junto con su incertidumbre.
¿Incrementalidad y causalidad son lo mismo?
No. La incrementalidad es un tipo de efecto causal: el resultado adicional producido por una intervención frente a lo que habría ocurrido sin ella. Los experimentos aleatorizados son una forma especialmente fuerte de estimarlo, pero no son la única familia de métodos de inferencia causal.
¿Qué es un geo experiment o geo-lift test?
Es un experimento en el que las unidades de asignación son regiones geográficas no superpuestas. Algunas reciben la intervención y otras funcionan como control. El análisis compara su evolución para estimar el efecto incremental, teniendo en cuenta el diseño, la variación previa, el ruido y la incertidumbre.
¿Cuánto debe durar un test de incrementalidad?
No existe una duración universal. Debe planificarse según el volumen de resultados, el efecto mínimo relevante o detectable, la variabilidad, la asignación entre grupos, el lag de conversión y el método de análisis. En un diseño de horizonte fijo, la duración y la regla de análisis se definen antes de interpretar el resultado; diseños secuenciales o bayesianos pueden usar reglas diferentes.
¿Qué es el iROAS?
El iROAS o incremental return on ad spend relaciona el valor de conversiones incrementales estimado con la inversión utilizada para producir ese efecto. Sirve para evaluar retorno incremental, no crédito atribuido por reglas de tracking.
¿Un resultado no significativo significa que la campaña no tuvo efecto?
No necesariamente. Puede indicar que el experimento no tuvo suficiente precisión para distinguir entre efectos pequeños, nulos o incluso de distinto signo. Conviene interpretar la estimación, su intervalo de incertidumbre, el diseño y la relevancia económica, no sólo un umbral estadístico.
Referencias y bibliografía.
Google Research. Vaver, J. & Koehler, J. (2011). Measuring Ad Effectiveness Using Geo Experiments. Diseño de experimentos geográficos aleatorizados para medir efectividad publicitaria.
Google Ads Help. About Conversion Lift. Tratamiento, control, conversiones incrementales, iCPA e iROAS.
Google Ads Help. Set up Conversion Lift based on users. Diseño basado en usuarios, holdout, duración y conversion lag.
Google Ads Help. Set up Conversion Lift based on geography. Incremental ROI y medición geográfica cross-channel.
Google Ads Help. About Bayesian methodology in Conversion Lift. Metodología bayesiana e intervalos creíbles.
Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press.
Términos relacionados