Guía práctica · Nivel inicial

Cómo interpretar la significancia estadística y los p-values en experimentos.

Un método para leer resultados de A/B tests y otros experimentos sin confundir un umbral estadístico con magnitud, certeza, causalidad o valor de negocio.

Nivel: Inicial Lectura: 16 min. Autor: Lisandro Iserte Última actualización: 3 de septiembre de 2026
Cómo interpretar significancia estadística y p-values en experimentos
01 — Rol en el experimento

La significancia estadística es una parte del análisis, no el veredicto del experimento.

En experimentación, una prueba de significancia ayuda a evaluar cuánto se apartan los datos de lo esperado bajo una hipótesis nula y una regla inferencial definida. Si necesitás la definición formal del término, podés revisar qué es la significancia estadística.

Para interpretar un experimento, sin embargo, hace falta más: diseño válido, asignación adecuada, métricas bien definidas, calidad de datos, estimación del efecto, incertidumbre y una regla de decisión compatible con el método utilizado.

Un p-value pequeño no rescata un experimento mal diseñado, y un resultado estadísticamente significativo no responde por sí solo si conviene implementar.

02 — Antes de observar

Preparar la inferencia antes de conocer el resultado.

La interpretación mejora cuando las decisiones principales se toman antes de mirar qué variante parece ganar. Entre ellas:

Hipótesis y contraste: qué comparación responde la pregunta y cuál es la hipótesis nula relevante.

Métrica principal: qué resultado decidirá la lectura principal y qué métricas funcionarán como guardrails o diagnóstico.

Regla de análisis: qué método inferencial se utilizará y bajo qué condiciones se evaluará el resultado.

Precisión necesaria: qué magnitud mínima sería relevante para la decisión y cuánta incertidumbre puede tolerarse. Esto conecta directamente con tamaño de muestra.

Multiplicidad: cuántas variantes, métricas, segmentos o hipótesis formarán parte del análisis confirmatorio.

03 — Interpretación

Leer p y α sin transformar el umbral en una frontera de verdad.

En un contraste clásico basado en p-values, α forma parte de la regla de decisión y controla el riesgo de error tipo I del procedimiento bajo sus supuestos. El p-value se calcula a partir de los datos bajo el modelo nulo.

Cuando p ≤ α, el resultado cruza la regla establecida y se clasifica como estadísticamente significativo. Eso no significa que la hipótesis alternativa tenga una probabilidad determinada de ser verdadera ni que el resultado sea importante.

La American Statistical Association recomienda no basar conclusiones o decisiones únicamente en si un p-value cruza un umbral específico. Dos resultados muy próximos a cada lado de α no deberían recibir interpretaciones radicalmente opuestas sólo por esa etiqueta.

04 — Errores y poder

Tipo I, tipo II y poder describen propiedades del procedimiento.

Decisión del testH₀ verdaderaH₀ falsa para una alternativa relevante
Rechazar H₀Error tipo IDecisión correcta respecto del contraste
No rechazar H₀Decisión correcta respecto del contrasteError tipo II para esa alternativa

El poder estadístico es la probabilidad de rechazar H₀ cuando una alternativa específica es verdadera. Por eso hablar de “poder” sin especificar qué magnitud de efecto, variabilidad, tamaño de muestra, α y diseño se están considerando deja incompleta la afirmación.

El poder tampoco se interpreta retrospectivamente como una probabilidad de que el resultado obtenido sea correcto. Es una propiedad del procedimiento para escenarios definidos.

05 — Magnitud

La decisión necesita tamaño del efecto, incertidumbre y relevancia práctica.

Una diferencia puede cruzar el criterio estadístico y ser irrelevante para el negocio. También puede existir una magnitud potencialmente interesante y no cruzarlo porque la estimación todavía es demasiado imprecisa.

Por eso conviene leer conjuntamente estimación del efecto, intervalo o medida de incertidumbre, volumen de datos y umbral de relevancia práctica. El objetivo no es reemplazar p-values por otra cifra mágica, sino entender qué efectos siguen siendo compatibles con la evidencia.

En un A/B test aplicado, la pregunta final suele ser más parecida a “¿qué magnitudes son plausibles y qué decisión tiene mejor relación riesgo-beneficio?” que a “¿p quedó por debajo de cierto número?”.

06 — Monitoreo

Horizonte fijo, peeking y análisis secuencial: la regla depende del diseño.

En un procedimiento frecuentista de horizonte fijo, el tamaño de muestra y la regla de análisis se definen de antemano. Tomar decisiones de parada porque una mirada intermedia produjo un resultado favorable puede elevar la tasa de falsos positivos por encima de la prevista.

El problema no es observar un dashboard como acto físico. El problema es usar observaciones repetidas para decidir cuándo detener o declarar un ganador sin que el procedimiento estadístico contemple ese comportamiento.

Los métodos secuenciales permiten monitoreo y posibles decisiones intermedias cuando ajustan explícitamente la inferencia a esa secuencia. Por eso no existe una regla universal de “nunca mirar”: existe la obligación de que el modo de monitoreo sea compatible con el método elegido.

07 — Multiplicidad

Más comparaciones crean más oportunidades de encontrar resultados extremos.

Si un experimento prueba muchas variantes, métricas, segmentos o hipótesis y luego se muestran sólo los resultados que cruzaron un umbral, aumenta el riesgo de falsos descubrimientos.

La solución depende del objetivo inferencial. Algunos procedimientos controlan la probabilidad de uno o más errores dentro de una familia de comparaciones; otros controlan la proporción esperada de falsos descubrimientos. También importa distinguir análisis confirmatorios de exploratorios.

La práctica más importante es que el análisis refleje cuántas oportunidades reales hubo de encontrar un resultado llamativo, no sólo la comparación que terminó siendo publicada.

08 — No significancia

Un resultado no significativo todavía puede ser informativo.

No rechazar H₀ no demuestra que el efecto sea cero. La lectura depende de la precisión. Un intervalo amplio puede dejar compatibles desde efectos perjudiciales hasta efectos beneficiosos; en ese caso, la evidencia puede ser simplemente insuficiente para una decisión fuerte.

Si la pregunta es si las alternativas son suficientemente parecidas, si un efecto es trivial o si una variante no empeora más allá de un margen aceptable, conviene plantear explícitamente pruebas o diseños de equivalencia o no inferioridad.

La ausencia de significancia en una prueba diseñada para detectar diferencia no es un sustituto de esos objetivos.

09 — Decisión

Cómo decidir después del test.

Una lectura práctica puede seguir este orden:

1. Revisar validez: ¿el experimento respondió la pregunta correcta con asignación, medición y datos confiables?

2. Leer la estimación: ¿cuál es el efecto observado y qué rango de magnitudes sigue siendo compatible con los datos?

3. Revisar el procedimiento: ¿el monitoreo, la multiplicidad y la regla de inferencia fueron los planificados?

4. Evaluar relevancia: ¿las magnitudes plausibles justifican costo, riesgo y complejidad de implementación?

5. Mirar guardrails: ¿la mejora en la métrica principal deteriora resultados que no conviene sacrificar?

6. Decidir con incertidumbre: implementar, iterar, recolectar más evidencia o descartar son decisiones distintas; ninguna se desprende automáticamente de la palabra “significativo”.

10 — Errores frecuentes

Interpretaciones que conviene eliminar del análisis experimental.

“p = 0,03 significa 3% de probabilidad de que el resultado sea azar”

Incorrecto. El p-value es una probabilidad calculada bajo un modelo nulo sobre resultados iguales o más extremos, no una probabilidad de que “el azar” haya causado el resultado.

“p < 0,05 significa que hay 95% de probabilidad de que la variante funcione”

Incorrecto. Un test frecuentista clásico no produce esa probabilidad posterior.

“p > α demuestra que no hay efecto”

Incorrecto. No rechazar H₀ no prueba H₀. La precisión y las magnitudes compatibles con los datos siguen siendo centrales.

“Si es significativo, el experimento fue válido”

Incorrecto. Sesgos de asignación, instrumentación, contaminación, attrition o decisiones analíticas pueden invalidar la inferencia aunque el p-value sea pequeño.

“Mirar antes invalida cualquier experimento”

Demasiado general. La inferencia depende del método: el monitoreo no planificado es problemático en fixed horizon, mientras los diseños secuenciales incorporan reglas para observaciones intermedias.

“Una métrica significativa alcanza para declarar ganador”

No necesariamente. Hay que considerar multiplicidad, guardrails, magnitud, incertidumbre y la decisión de negocio que el experimento pretende informar.

11 — Preguntas frecuentes

Preguntas frecuentes.

¿Qué significa que un resultado sea estadísticamente significativo en un experimento?

Significa que, bajo el modelo, los supuestos y la regla de decisión del test, el resultado cruzó el criterio definido para rechazar la hipótesis nula. En un contraste basado en p-values, esto ocurre cuando p es menor o igual que α. No implica por sí solo que el efecto sea grande, importante o causalmente válido.

¿Un p-value de 0,05 significa que hay 95% de probabilidad de que el efecto sea real?

No. El p-value se calcula bajo un modelo que incluye la hipótesis nula y no expresa la probabilidad de que esa hipótesis sea verdadera ni la probabilidad posterior de que el efecto sea real.

¿Un resultado no significativo demuestra que no hay efecto?

No. Significa que el procedimiento no rechazó la hipótesis nula al nivel elegido. La estimación puede ser compatible con efectos relevantes, pequeños o nulos según su incertidumbre. Si la pregunta es equivalencia o no inferioridad, se necesitan criterios y diseños específicos.

¿La significancia estadística dice si conviene implementar una variante?

No. La decisión debería considerar la magnitud estimada, su incertidumbre, el costo y el beneficio esperados, métricas guardrail, riesgos, calidad del experimento y evidencia adicional. El p-value es sólo una parte del análisis.

¿Se puede mirar un test antes de alcanzar el horizonte planificado?

Depende del método. En un diseño frecuentista de horizonte fijo, tomar decisiones de parada a partir de miradas repetidas no contempladas puede inflar el error tipo I. Los procedimientos secuenciales permiten análisis intermedios cuando sus reglas inferenciales están diseñadas para ello.

¿Qué conviene reportar además del p-value?

Como mínimo, la estimación del efecto, una medida de incertidumbre compatible con el método, el tamaño de muestra, la métrica analizada, el diseño del experimento y cualquier decisión relevante sobre multiplicidad o monitoreo. Para una decisión de negocio también conviene incorporar relevancia práctica y costos de error.

12 — Referencias

Referencias y bibliografía.

American Statistical Association (2016). Statement on Statistical Significance and P-Values.

Wasserstein, R. L. & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose.

Wasserstein, R. L., Schirm, A. L. & Lazar, N. A. (2019). Moving to a World Beyond “p < 0.05”.

NIST/SEMATECH. Critical values and p values.

Optimizely (2026). Frequentist (Fixed Horizon) statistics.

Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press.

Términos relacionados
Siguiente guía

Con la inferencia mejor encuadrada, el siguiente paso es diseñar experimentos capaces de responder preguntas más complejas que una comparación simple entre dos variantes.

Diseño de experimentos →