Experimentación: convertir hipótesis en evidencia.
La experimentación permite aprender qué efectos producen intervenciones deliberadas bajo un diseño definido. En marketing y producto puede aplicarse a mensajes, interfaces, precios, ofertas, procesos, canales y otras decisiones, siempre que la pregunta, la unidad experimental, la asignación y la medición sean coherentes con el efecto que se busca estimar.

La definición de experimentación vive en el Glosario. Este subhub desarrolla cómo diseñar, ejecutar, analizar y convertir experimentos en aprendizaje acumulativo. El A/B test es uno de sus diseños posibles, no un sinónimo del concepto completo.
Qué problema resuelve la experimentación
Los datos históricos permiten describir qué ocurrió y estudiar asociaciones. Un experimento agrega una intervención deliberada: el investigador modifica una condición y observa cómo cambia una respuesta. Esa estructura permite formular preguntas causales más directas, siempre que el diseño controle adecuadamente las fuentes de variación.
Esto no significa que todo resultado experimental sea automáticamente causal ni que la experimentación sea el único enfoque posible para inferencia causal. La calidad de la conclusión depende de la asignación, la unidad experimental, el control de interferencias, la medición, el análisis y los supuestos del diseño.
Experimentar no es “probar algo y mirar qué pasó”. Es diseñar una comparación capaz de responder una pregunta definida con una incertidumbre que pueda evaluarse.
Síntesis editorialPrincipios de diseño experimental
NIST define un experimento como la modificación deliberada de uno o más factores para observar sus efectos sobre una o más respuestas. La tradición de diseño de experimentos agrega principios como randomización, replicación y control o bloqueo de fuentes de variación.
Intervención deliberada
El experimento modifica una condición, tratamiento o factor. Esa intervención lo diferencia de un estudio puramente observacional.
Unidad experimental clara
Hay que identificar qué entidad recibe la intervención: persona, sesión, cuenta, tienda, ciudad u otra unidad.
Asignación coherente
Cuando es posible, la asignación aleatoria ayuda a equilibrar factores de confusión entre condiciones. Otros diseños requieren controles y supuestos diferentes.
Respuesta medible
La variable de resultado y el horizonte de observación deben corresponder a la hipótesis y al mecanismo que se quiere estudiar.
El ciclo experimental
Una secuencia útil —sin convertirla en una taxonomía universal— es pasar de pregunta a diseño, ejecución, análisis y aprendizaje. La forma exacta cambia según el tipo de experimento.
1. Pregunta e hipótesis
Definir qué intervención se estudia, qué resultado se espera modificar y qué mecanismo motiva esa expectativa.
2. Diseño
Elegir unidad experimental, condiciones, esquema de asignación, métricas, precisión necesaria y regla de análisis.
3. Ejecución
Aplicar tratamientos de forma consistente y controlar contaminación, fallos de instrumentación y desviaciones del diseño.
4. Análisis
Estimar el efecto y su incertidumbre con métodos compatibles con el diseño; no limitar la lectura a “significativo/no significativo”.
5. Aprendizaje
Documentar qué pudo concluirse, qué no, qué supuestos quedan abiertos y cómo cambia la siguiente decisión o hipótesis.
Experimentación y causalidad
En un experimento aleatorizado, la asignación al azar permite que, en expectativa, los grupos sean comparables respecto de factores observados y no observados antes de la intervención. Esa propiedad es una de las razones por las que los experimentos aleatorizados son una herramienta central para estimar efectos causales.
Pero no toda pregunta admite randomización. Existen diseños con randomización restringida, experimentos por clusters, factoriales, secuenciales y adaptativos, además de diseños cuasi-experimentales y métodos observacionales de inferencia causal. La elección depende de la pregunta, la ética, la operación y los datos disponibles.
A/B testing y otros diseños
Un A/B test compara dos condiciones —por ejemplo control y variante— y es muy útil en entornos digitales. No agota la experimentación. Un experimento puede estudiar múltiples factores, interacciones, distintos niveles de tratamiento, clusters o secuencias temporales.
Tampoco todo experimento requiere el mismo criterio estadístico. Las pruebas frecuentistas de horizonte fijo, los diseños secuenciales, los enfoques bayesianos y los bandits responden a reglas de decisión diferentes. Por eso no existe una duración, tamaño de muestra o umbral universal válido para todo programa.
Errores frecuentes
Decir que experimentar es el único modo de establecer causalidad
Los experimentos aleatorizados ofrecen una identificación causal especialmente fuerte, pero existen diseños cuasi-experimentales y métodos observacionales que estudian efectos causales bajo supuestos adicionales.
Convertir p < 0,05 en sinónimo de éxito
La significancia estadística no mide importancia práctica, tamaño de efecto ni probabilidad de que una hipótesis sea verdadera.
Usar números universales de tráfico o duración
El tamaño muestral depende de variabilidad, baseline, efecto mínimo relevante, poder, diseño y criterio inferencial. La duración depende del fenómeno y de los ciclos que se necesite observar.
Confundir A/B testing con toda la experimentación
Es un diseño específico dentro de una familia mucho más amplia.
Creer que un resultado nulo “no enseña nada”
Un resultado puede acotar efectos plausibles, descartar hipótesis o revelar limitaciones de sensibilidad.
9 guías de experimentación
Empezá por el sistema de experimentación si necesitás ordenar el proceso completo. Después elegí la guía según tu decisión: diseñar un A/B test, interpretar sus resultados, planificar la muestra o trabajar con diseños más complejos.
01Cómo construir un sistema de experimentación
De una pregunta causal a hipótesis, diseño, ejecución, análisis y aprendizaje.
A/B testing básico
Cómo diseñar una comparación A/B y evitar errores frecuentes.
Significancia estadística
Qué dice un resultado estadísticamente significativo y qué no dice.
Diseño de experimentos
Cómo elegir un diseño según la pregunta, los factores y las restricciones.
Multivariate testing
Cuándo conviene estudiar múltiples factores e interacciones.
Tamaño de muestra
Poder, MDE, precisión y planificación del tamaño muestral.
Experimentación a escala
Interferencia, coordinación y calidad cuando se ejecutan muchos experimentos.
Bandit algorithms
Diseños adaptativos que equilibran exploración y explotación.
Cultura de experimentación
Procesos y hábitos para convertir pruebas aisladas en aprendizaje organizacional.
Preguntas frecuentes
¿Experimentación y A/B testing son lo mismo?
No. El A/B test compara dos variantes. La experimentación incluye muchos otros diseños y preguntas.
¿Todo experimento necesita p < 0,05?
No. Depende del diseño y del marco inferencial. Incluso dentro del enfoque frecuentista, el análisis debe considerar tamaño del efecto e incertidumbre, no solo un umbral.
¿La experimentación es el único modo de estudiar causalidad?
No. Los experimentos aleatorizados son una herramienta especialmente fuerte, pero no la única.
Referencias y bibliografía
NIST/SEMATECH. What is experimental design?
NIST/SEMATECH. Glossary of DOE terminology.
Penn State STAT 503. Introduction to Design of Experiments.
Penn State STAT 200. Collecting Data / Causal Conclusions.
Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press.
Thomke, S. (2020). Experimentation Works. Harvard Business Review Press.
Términos relacionados