Experimentación en marketing: cómo diseñar y ejecutar un sistema de pruebas.
Una guía para pasar de una decisión incierta a una pregunta causal, elegir un diseño coherente, ejecutar la prueba, estimar el efecto y convertir el resultado en aprendizaje reutilizable.
Empezar por la decisión, no por la herramienta.
Un sistema experimental empieza cuando una decisión importante necesita evidencia y existe una intervención que puede compararse contra una alternativa. Antes de elegir A/B testing, holdouts, geo experiments o cualquier otro diseño, conviene precisar qué decisión está en juego y qué efecto necesitás estimar.
La experimentación aporta el marco general; esta guía se concentra en el método para convertir una pregunta en una prueba ejecutable y una conclusión defendible.
La calidad de un experimento se decide antes de mirar los resultados: en la pregunta, la unidad, la asignación, la medición y la regla de análisis.
Síntesis editorial1. Formular la pregunta causal y el efecto de interés.
Una pregunta útil especifica qué intervención se evalúa, frente a qué comparación, sobre qué población o unidades, qué respuesta importa y durante qué horizonte. Eso define el efecto que se quiere estimar y evita decidir después de ver los datos qué resultado era “el importante”.
“¿Funciona este cambio?” es demasiado ambiguo. “¿Qué efecto tiene mostrar el costo total antes del checkout sobre la tasa de compra de usuarios elegibles durante siete días, frente a la experiencia actual?” ya permite diseñar una comparación.
03 — Unidad2. Definir intervención, unidad experimental y asignación.
La unidad experimental es la entidad a la que se asigna el tratamiento: usuario, cuenta, tienda, equipo, región u otra unidad. No siempre coincide con la unidad de observación. Si se randomiza por tienda y luego se analizan miles de compras como si fueran observaciones independientes, la incertidumbre puede quedar artificialmente reducida.
También hay que especificar qué cambia exactamente entre condiciones, qué permanece constante, quién es elegible y cómo se registra la exposición. Si unas unidades pueden afectar a otras —por ejemplo, por efectos de red, comunicación entre usuarios o solapamiento geográfico— la independencia no puede darse por supuesta.
04 — Diseño3. Elegir el diseño que responde la pregunta.
La randomización individual es una opción potente cuando puede aplicarse sin contaminación entre condiciones, pero no es la única estructura posible. Restricciones operativas, clusters naturales, múltiples factores, efectos geográficos o análisis intermedios pueden requerir otros diseños.
Bloqueo, randomización por clusters, factoriales, split-plots y diseños secuenciales resuelven problemas distintos y pueden combinarse. NIST y Penn State tratan estas decisiones como parte de la arquitectura del experimento, no como variantes intercambiables de un mismo test.
Si querés profundizar específicamente en esta decisión, podés ver cómo elegir entre A/B tests, holdouts, geo experiments y otros diseños experimentales.
Cuando la randomización no es viable, un diseño cuasi-experimental puede seguir aportando evidencia causal, pero la identificación depende de supuestos adicionales que deben hacerse explícitos.
05 — Medición4. Definir métrica principal, guardrails y precisión.
La respuesta principal debe representar la decisión que se quiere informar. Los guardrails son métricas secundarias que ayudan a detectar daños o trade-offs: por ejemplo, aumentar conversión a costa de devoluciones, margen o retención.
En un experimento frecuentista de horizonte fijo, el tamaño de muestra puede planificarse a partir del efecto mínimo relevante, la variabilidad esperada, el nivel de significancia y el poder. En diseños secuenciales, adaptativos o bayesianos las reglas pueden ser distintas. Lo importante es que la precisión esperada y la regla de decisión estén definidas antes de usar los resultados para decidir.
Elegir muchas métricas o segmentos y conservar sólo los hallazgos favorables aumenta el riesgo de conclusiones engañosas. El análisis principal y los análisis exploratorios conviene distinguirlos desde el diseño.
06 — Ejecución5. Preparar y ejecutar sin romper el diseño.
Antes de interpretar un efecto hay que comprobar que el experimento ocurrió como estaba previsto: elegibilidad correcta, asignación estable, exposición registrada, métricas funcionando y ausencia de cambios simultáneos que afecten diferencialmente a las condiciones.
Durante la ejecución conviene vigilar pérdidas de datos, contaminación, desbalances inesperados entre grupos y problemas de instrumentación. En experimentos aleatorizados online, un sample ratio mismatch puede ser una señal de que la asignación o el registro no están funcionando como se esperaba.
Revisar calidad técnica no significa mirar repetidamente la métrica principal y detener la prueba cuando aparece un resultado conveniente. Si el diseño admite análisis intermedios, las reglas deben contemplarlo explícitamente.
07 — Análisis6. Estimar el efecto y expresar la incertidumbre.
El análisis debería responder cuánto cambió la respuesta y con qué incertidumbre, no limitarse a “significativo / no significativo”. Un p-value no mide el tamaño del efecto ni su importancia económica.
En experimentos aleatorizados, analizar según la asignación original suele preservar la comparación creada por la randomización. Si existen incumplimientos de tratamiento, exposición parcial o attrition, cualquier estimación alternativa necesita explicitar qué efecto intenta medir y bajo qué supuestos.
La interpretación también debe considerar multiplicidad, intervalos de incertidumbre y relevancia práctica. La American Statistical Association subraya que la significancia estadística no equivale necesariamente a importancia práctica.
08 — Aprendizaje7. Convertir el resultado en una decisión y un aprendizaje reutilizable.
Documentar un experimento significa registrar pregunta, población, intervención, comparación, unidad de asignación, métricas, diseño, reglas de análisis, estimación, incertidumbre, desviaciones y decisión resultante.
También conviene separar tres cosas: qué mostró el experimento, qué explicación proponemos para ese resultado y qué decisión tomamos. Una diferencia causal puede estar bien estimada sin demostrar automáticamente el mecanismo que la produjo.
Un resultado negativo o inconcluso también puede ser útil si reduce incertidumbre, descarta una hipótesis plausible o muestra que el diseño necesita más precisión. El objetivo del sistema no es acumular “ganadores”, sino mejorar decisiones.
09 — DiseñosA/B test y otros diseños frecuentes.
| Diseño | Cuándo puede servir | Qué exige cuidar |
|---|---|---|
| A/B o holdout aleatorizado | Comparar una intervención con un control a nivel individual. | Elegibilidad, asignación, exposición y contaminación entre condiciones. |
| Factorial | Estudiar dos o más factores y sus interacciones. | Interpretación de efectos e interacciones, potencia y complejidad del diseño. |
| Cluster randomized | Asignar por tiendas, cuentas, equipos, regiones u otros grupos. | Dependencia dentro de clusters y menor cantidad efectiva de unidades independientes. |
| Geo experiment | Evaluar intervenciones de marketing que se aplican por regiones o mercados. | Selección y comparabilidad geográfica, spillovers, estacionalidad y pocas unidades. |
| Secuencial | Permitir decisiones intermedias mientras llegan datos. | Reglas de parada y análisis compatibles con revisiones repetidas. |
| Adaptativo / bandit | Cambiar la asignación mientras se aprende para equilibrar exploración y rendimiento. | El objetivo de optimizar asignación no es idéntico al de una comparación fija; inferencia y operación deben diseñarse en conjunto. |
Cuándo no experimentar.
No toda decisión merece un experimento. Puede no ser apropiado cuando el daño potencial es inaceptable, la intervención está limitada por razones legales o éticas, la exposición disponible es demasiado baja, el costo del test supera el valor de la decisión o la asignación no puede sostenerse de forma útil.
Tampoco hace falta experimentar para responder una pregunta puramente descriptiva. Y cuando el tratamiento ya ocurrió o no puede asignarse, puede ser más razonable recurrir a evidencia observacional o a diseños cuasi-experimentales.
11 — Preguntas frecuentesPreguntas frecuentes.
¿Cuál es el primer paso para diseñar un experimento?
Definir la decisión y el efecto que necesitás estimar: qué intervención se evaluará, sobre qué población y unidad, frente a qué condición de comparación, qué respuesta importa y durante qué horizonte. El diseño viene después de esa pregunta.
¿Necesito calcular siempre un tamaño de muestra fijo antes de empezar?
No en todos los diseños. En un experimento frecuentista de horizonte fijo suele planificarse a priori a partir del efecto mínimo relevante, la variabilidad, el nivel de significancia y el poder. Diseños secuenciales, adaptativos o bayesianos pueden usar reglas diferentes. En todos los casos, la precisión y la regla de decisión deben ser compatibles con el diseño.
¿Un resultado estadísticamente no significativo significa que no existe efecto?
No. Puede significar que los datos son compatibles con varios tamaños de efecto y que el experimento no tuvo precisión suficiente para distinguirlos. Conviene interpretar la estimación, su intervalo de incertidumbre y la relevancia práctica, no sólo un umbral.
¿Cuándo conviene no hacer un experimento?
Cuando el daño potencial es inaceptable, la exposición es insuficiente, la intervención no puede asignarse o mantenerse de forma útil, el costo supera el valor de la decisión o la pregunta es principalmente descriptiva. En algunos casos conviene usar evidencia observacional o un diseño cuasi-experimental.
Referencias y bibliografía.
NIST/SEMATECH. What is experimental design?. Diseño planificado, factores, respuestas y conclusiones válidas.
NIST/SEMATECH. Glossary of DOE terminology.. Randomización, bloqueo y replicación.
Penn State, Department of Statistics. STAT 503 — Design of Experiments.. Diseños comparativos, bloques, factoriales, split-plots y otras estructuras experimentales.
American Statistical Association. President’s Task Force Statement on Statistical Significance and Replicability.. Interpretación de p-values, incertidumbre y relevancia práctica.
Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press.
Montgomery, D. C. (2019). Design and Analysis of Experiments, 10th ed. Wiley.
Términos relacionados