¿Qué es la experimentación?

Autor: Lisandro IserteÚltima actualización: 2 de septiembre de 2026
Experimentación en pocas palabras

La experimentación es un método de investigación y aprendizaje en el que se manipulan deliberadamente uno o más factores o intervenciones y se observan sus efectos sobre respuestas definidas bajo un diseño planificado. Puede utilizarse para estimar efectos causales, comparar alternativas, identificar interacciones u optimizar un sistema. En experimentos comparativos, principios como la asignación aleatoria —cuando es viable—, la replicación y el bloqueo ayudan a controlar fuentes de variación y a sustentar la inferencia. Un A/B test es un caso particular de experimento comparativo con dos condiciones; no equivale a toda la experimentación.

¿Qué es la experimentación?

La característica que distingue a un experimento es la manipulación deliberada de uno o más factores. NIST define el diseño experimental como la planificación de cambios intencionales en variables o factores para observar cómo afectan una o más respuestas y obtener conclusiones válidas y objetivas.

Experimentar no sirve únicamente para decidir si una variante “gana”. Puede utilizarse para estimar efectos causales, comparar alternativas, estudiar interacciones, identificar factores relevantes, optimizar configuraciones y reducir incertidumbre.

En marketing y producto, los factores pueden ser mensajes, precios, flujos, interfaces, ofertas, políticas, canales o niveles de inversión. Las respuestas pueden ser conversiones, ingresos, retención, uso, margen, calidad, costo u otras variables definidas antes del análisis.

Elementos de un experimento

El detalle cambia según el diseño, pero un experimento defendible necesita dejar claras varias decisiones antes de interpretar resultados.

1

Pregunta y efecto de interés

Qué se quiere aprender y qué contraste o efecto respondería esa pregunta. Definirlo evita decidir retrospectivamente qué resultado “importaba”.

2

Factor, tratamiento y condiciones

Qué variable se manipula, cuáles son sus niveles y qué recibe exactamente cada condición experimental.

3

Unidad experimental y asignación

Qué entidad recibe el tratamiento —usuario, cuenta, tienda, región u otra unidad— y mediante qué mecanismo se asigna a cada condición.

4

Respuesta y medición

Qué variable se observará, cómo se calcula, durante qué ventana y con qué calidad de datos. Una métrica ambigua puede invalidar una comparación bien randomizada.

5

Control de variación y análisis

Replicación, bloqueo, controles, tamaño de muestra, reglas de parada y método de análisis ayudan a separar señal, ruido y fuentes conocidas de variación.

Experimentación y causalidad

La experimentación es especialmente valiosa para estudiar causa y efecto porque el investigador controla la intervención. En un experimento comparativo aleatorizado, la asignación al azar reduce el riesgo de que las condiciones difieran sistemáticamente por factores previos al tratamiento y proporciona una base conocida para cuantificar incertidumbre.

La randomización no vuelve infalible al experimento. Interferencia entre unidades, contaminación entre condiciones, attrition, fallas de instrumentación, incumplimiento del tratamiento, selección de métricas y errores de análisis pueden sesgar o volver ambigua la estimación.

Además, el efecto estimado siempre corresponde a una población, una intervención y unas condiciones concretas. La validez interna de un experimento no garantiza por sí sola que el resultado se generalice a otros mercados, períodos o contextos.

Experimento vs. estudio observacional

En un experimento, el investigador manipula deliberadamente al menos un factor o intervención. En un estudio observacional, registra exposiciones y resultados sin asignar deliberadamente el tratamiento.

Los experimentos aleatorizados ofrecen una base especialmente fuerte para la inferencia causal porque el mecanismo de asignación forma parte del diseño. Eso no significa que todo estudio observacional sea “solo correlación”: métodos observacionales y cuasi-experimentales pueden sostener inferencias causales cuando su diseño y sus supuestos permiten construir comparaciones defendibles.

La diferencia, por lo tanto, no es “causal vs. no causal” como regla absoluta, sino cómo se genera la comparación y qué supuestos hacen falta para interpretar el efecto.

Experimentación vs. A/B test

Un A/B test compara dos condiciones —habitualmente un control A y una variante B— y suele utilizar asignación aleatoria en entornos digitales.

Es una forma de experimento comparativo, no un sinónimo de experimentación. Un experimento puede incluir más de dos tratamientos, varios factores simultáneos, unidades agrupadas, restricciones de randomización o reglas de análisis secuencial.

La calidad tampoco depende del nombre de la técnica. Un “A/B test” con mala asignación, contaminación entre variantes o una regla de parada oportunista puede producir evidencia menos confiable que un diseño experimental más complejo pero correctamente especificado.

Decisiones de diseño experimental que pueden combinarse

No conviene tratar “bloques”, “clusters”, “factoriales” y “secuenciales” como familias excluyentes del mismo nivel. Describen decisiones distintas y pueden combinarse dentro de un mismo experimento.

1

Asignación completamente aleatoria

Las unidades elegibles se asignan directamente a las condiciones mediante randomización. Es una base frecuente para comparaciones simples.

2

Bloqueo o estratificación

Las unidades se agrupan previamente según una fuente conocida de variación y la randomización se realiza dentro de esos bloques para mejorar comparabilidad y precisión.

3

Randomización por clusters

El tratamiento se asigna a grupos —por ejemplo tiendas, regiones o cuentas— cuando las unidades individuales no pueden randomizarse de manera independiente o existe riesgo de contaminación.

4

Diseños factoriales

Manipulan dos o más factores para estimar efectos principales e interacciones, en lugar de cambiar un único elemento por vez.

5

Diseños secuenciales o adaptativos

Permiten revisar o modificar determinadas decisiones a medida que se acumula evidencia, siempre bajo reglas estadísticas previstas por el diseño. No equivalen a mirar el resultado repetidamente y detenerse cuando aparece un p-value conveniente.

Experimentación vs. significancia estadística

La significancia estadística pertenece a determinados marcos de inferencia; no define qué es un experimento ni determina por sí sola si una decisión es correcta.

Un p-value no mide el tamaño del efecto, la probabilidad de que la hipótesis sea verdadera ni la importancia económica del resultado. La interpretación necesita considerar incertidumbre, tamaño de efecto, multiplicidad, poder, relevancia práctica y consecuencias de decisión.

Por eso “un buen experimento tiene p < 0,05” es una regla incorrecta. La ASA recuerda que ningún umbral aislado reemplaza el razonamiento sobre el diseño, la variabilidad y el contexto de la decisión.

Ejemplo de experimentación en marketing

Una empresa quiere saber si mostrar el costo total antes del checkout reduce abandonos. Define como unidad experimental al usuario elegible, asigna aleatoriamente cada usuario a la experiencia actual o a la nueva, establece la finalización de compra como respuesta principal y fija antes del análisis la ventana de medición y la regla de decisión.

Si la asignación, la exposición y la medición funcionan como fueron diseñadas, la diferencia entre condiciones puede estimar el efecto causal de mostrar el costo total para esa población y ese contexto. El mismo problema podría requerir otro diseño si existiera contaminación entre usuarios, efectos de red o una unidad de intervención diferente.

Para pasar de esta definición a la práctica, podés profundizar en cómo diseñar experimentos de marketing: hipótesis, unidad de randomización, métricas, tamaño de muestra, guardrails y criterios de parada.

Errores frecuentes al experimentar

Confundir muestreo aleatorio con asignación aleatoria

El muestreo define cómo entran unidades al estudio; la randomización define a qué tratamiento se asignan. Resuelven problemas distintos: generalización y comparabilidad causal, respectivamente.

Randomizar una unidad y analizar otra sin justificarlo

Si el tratamiento se asigna por tienda, región o cuenta, el análisis debe respetar esa estructura. Tratar observaciones dependientes como si fueran unidades independientes puede subestimar la incertidumbre.

Mirar resultados continuamente y detenerse al aparecer significancia

El optional stopping modifica las propiedades inferenciales de pruebas clásicas. Si se necesitan decisiones intermedias, deben usarse métodos secuenciales diseñados para ello.

Probar muchas métricas o segmentos y reportar solo el resultado favorable

La multiplicidad aumenta la probabilidad de falsos positivos. Métrica principal, análisis exploratorios y ajustes necesarios deben distinguirse con claridad.

Confundir significancia con relevancia de negocio

Un efecto estadísticamente detectable puede ser demasiado pequeño para justificar costo, complejidad o riesgo. La decisión necesita tamaño de efecto y contexto económico.

Preguntas frecuentes

¿Qué es la experimentación?

La experimentación es un método de investigación y aprendizaje en el que se manipulan deliberadamente uno o más factores o intervenciones y se observan sus efectos sobre respuestas definidas bajo un diseño planificado. Puede utilizarse para estimar efectos causales, comparar alternativas, identificar interacciones u optimizar un sistema. En experimentos comparativos, principios como la asignación aleatoria —cuando es viable—, la replicación y el bloqueo ayudan a controlar fuentes de variación y a sustentar la inferencia. Un A/B test es un caso particular de experimento comparativo con dos condiciones; no equivale a toda la experimentación.

¿Experimentación y A/B test son lo mismo?

No. Un A/B test compara dos condiciones, normalmente un control y una variante, y es una forma particular de experimento comparativo. La experimentación abarca diseños con más tratamientos, múltiples factores, bloques, clusters y reglas secuenciales o adaptativas, entre otras posibilidades.

¿Qué diferencia hay entre un experimento y un estudio observacional?

En un experimento se manipula deliberadamente al menos un factor o intervención. En un estudio observacional se registran exposiciones y resultados sin asignar deliberadamente el tratamiento. Los experimentos aleatorizados ofrecen una base especialmente fuerte para la inferencia causal; los estudios observacionales pueden sostener inferencias causales bajo diseños y supuestos adicionales.

¿La randomización es obligatoria en todo experimento?

No. Lo que define al experimento es la manipulación deliberada de uno o más factores. La randomización es un principio central de muchos experimentos comparativos porque reduce el riesgo de diferencias sistemáticas entre condiciones y sustenta la inferencia estadística. Cuando no es viable, el diseño necesita otras estrategias y supuestos más fuertes.

¿Todo experimento necesita significancia estadística?

No. La experimentación no se define por alcanzar un p-value o un umbral de significancia. El análisis debe ser coherente con el diseño y considerar tamaño del efecto, incertidumbre, multiplicidad, relevancia práctica y reglas de decisión. Los p-values y los niveles de significancia pertenecen a determinados marcos inferenciales.

Referencias clave

NIST/SEMATECH. What is experimental design?. Define DOE como la planificación de cambios deliberados en factores para observar sus efectos sobre respuestas y obtener conclusiones válidas.

Penn State, Department of Statistics. STAT 503 — Design of Experiments. Desarrolla randomización, bloqueo, diseños factoriales, confounding, split-plots y otras estructuras experimentales.

Penn State, Department of Statistics. STAT 200 — Collecting Data. Distingue estudios experimentales y observacionales, randomización, confounding y conclusiones causales.

American Statistical Association. President’s Task Force Statement on Statistical Significance and Replicability. Sitúa p-values y significancia dentro de un marco más amplio de incertidumbre, variabilidad, multiplicidad y relevancia práctica.

Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press.

Montgomery, D. C. (2019). Design and Analysis of Experiments, 10th ed. Wiley.

Términos relacionados