¿Qué es el p-value?
El p-value o valor p es, bajo una hipótesis nula y un modelo estadístico especificados, la probabilidad de obtener un estadístico de prueba tan extremo o más extremo que el observado. Cuantifica cuán incompatibles son los datos con ese modelo nulo; no indica la probabilidad de que la hipótesis nula sea verdadera ni mide por sí solo el tamaño o la importancia del efecto.
Qué significa p-value
El p-value —también llamado valor p o p-valor— aparece dentro de un contraste de hipótesis. Primero se especifica una hipótesis nula (H₀), un modelo y un estadístico de prueba. Después se pregunta cuán extremo resulta el estadístico observado si ese modelo nulo fuera el mecanismo que genera los datos.
NIST lo define como la probabilidad de obtener un estadístico de prueba al menos tan extremo como el observado, dado que la hipótesis nula es verdadera. La American Statistical Association (ASA) reformula la idea de manera especialmente útil: los p-values indican cuán incompatibles son los datos con un modelo estadístico especificado.
La palabra clave es condicionado. El cálculo parte de H₀ y del modelo; no calcula la probabilidad de H₀ a partir de los datos. Invertir esa condición es uno de los errores estadísticos más extendidos.
Un p-value sí ayuda a expresar
- Cuán extremos son los datos respecto de un modelo nulo especificado.
- La evidencia estadística contra H₀ dentro de un procedimiento concreto.
- Si el resultado cruza o no un umbral α predefinido.
- Una parte de la incertidumbre inferencial del análisis.
Un p-value no es
- La probabilidad de que H₀ sea verdadera.
- La probabilidad de que el resultado haya ocurrido “por azar”.
- El tamaño del efecto.
- La probabilidad de que el resultado se replique.
- Una medida suficiente para decidir si algo importa.
Cómo interpretar un p-value con un ejemplo
Supongamos un A/B test donde H₀ afirma que la tasa de conversión de la variante B no difiere de la del control A. El análisis produce p = 0,03.
Interpretación aproximada correcta: si H₀ y los demás supuestos del modelo fueran adecuados, la probabilidad de obtener un estadístico de prueba tan extremo o más extremo que el observado sería de alrededor del 3%.
Esto no significa que haya 3% de probabilidad de que H₀ sea verdadera. Tampoco significa que exista 97% de probabilidad de que B sea mejor, ni que sólo haya 3% de probabilidad de que el resultado sea azar. Esas afirmaciones requieren otras cantidades y, en algunos casos, otro marco estadístico.
Un p-value pequeño muestra tensión entre datos y modelo nulo. Para decidir qué significa esa tensión, todavía hay que mirar el diseño, el tamaño del efecto, el intervalo de confianza, la calidad de la medición y la plausibilidad de los supuestos.
p-value y nivel de significancia α no son lo mismo
α es un umbral definido antes del análisis; el p-value se calcula después de observar los datos. En un procedimiento clásico bien preespecificado, se compara p con α para aplicar una regla de decisión.
| Concepto | Cuándo se define | Qué representa |
|---|---|---|
| α | Antes de analizar los datos. | Tasa de error tipo I que el procedimiento busca controlar bajo H₀, sujeto a sus supuestos. |
| p-value | Después de observar los datos. | Extremidad del estadístico observado bajo H₀ y el modelo especificado. |
Si α = 0,05 y p = 0,03, el procedimiento convencional rechaza H₀. Si p = 0,07, no la rechaza. Pero la ASA advierte que una conclusión científica o de negocio no debería reducirse a qué lado de 0,05 cayó el número.
La diferencia entre p = 0,049 y p = 0,051 no representa un salto brusco en la evidencia. El umbral es una regla de decisión, no una frontera natural entre “verdad” y “falsedad”.
Un p-value no mide el tamaño del efecto
La ASA señala explícitamente que significancia estadística y p-value no miden la magnitud ni la importancia de un resultado. Un efecto muy pequeño puede producir un p-value diminuto con suficiente muestra; un efecto grande puede tener un p-value alto si la muestra es pequeña o los datos son muy variables.
| Pregunta | Herramienta principal |
|---|---|
| ¿Qué tan incompatible es el resultado con H₀? | p-value dentro del test especificado. |
| ¿Cuánto cambió realmente la métrica? | Estimación del tamaño de efecto. |
| ¿Con qué precisión conocemos ese efecto? | Intervalo de confianza u otra medida de incertidumbre. |
| ¿Vale la pena actuar? | Contexto, efecto, costos, riesgo y criterio de negocio. |
En experimentación, reportar “p = 0,01” sin indicar el lift, la diferencia absoluta y su incertidumbre deja sin responder la pregunta que normalmente más importa: cuánto cambió el resultado y si ese cambio es relevante.
p-value e intervalo de confianza
Los dos provienen de la misma lógica inferencial en muchos procedimientos clásicos, pero comunican información diferente. El p-value resume una comparación con una hipótesis nula puntual; el intervalo presenta un rango de valores del efecto compatibles con el procedimiento y ayuda a evaluar magnitud y precisión.
Bajo el mismo modelo y para un test bilateral, existe una correspondencia habitual: si un intervalo de confianza del 95% excluye el valor nulo, el contraste equivalente suele producir p < 0,05.
Ejemplo: una variante mejora conversión en +1,2 puntos porcentuales, IC95% [+0,2; +2,2], p = 0,02. El p-value indica incompatibilidad con una diferencia nula bajo el test; el intervalo permite ver que los datos siguen siendo compatibles tanto con una mejora pequeña como con una bastante mayor.
Por eso autores metodológicos como Greenland, Senn, Rothman y Altman recomiendan no interpretar tests estadísticos de forma aislada y dar protagonismo a la estimación del efecto y su incertidumbre.
p-value en tests de una cola y dos colas
“Tan extremo o más extremo” depende de la hipótesis alternativa y del estadístico elegido. NIST distingue tests de una y dos colas.
| Test | Alternativa | Qué extremidad considera |
|---|---|---|
| Bilateral | El parámetro es distinto del valor nulo. | Desviaciones suficientemente grandes en ambas direcciones. |
| Unilateral superior | El parámetro es mayor. | La cola superior relevante. |
| Unilateral inferior | El parámetro es menor. | La cola inferior relevante. |
La dirección no debería elegirse después de observar qué lado favorecen los datos. Un test unilateral exige una justificación previa: la hipótesis y la regla de decisión deben estar definidas antes de mirar el resultado.
Por qué el tamaño de muestra afecta al p-value
El p-value depende no sólo de la magnitud del efecto observado, sino también de su error estándar. Con más datos, el error estándar suele reducirse y diferencias pequeñas pueden resultar más incompatibles con H₀.
Esto explica por qué “estadísticamente significativo” no equivale a “importante”. Con millones de observaciones, una diferencia trivial puede generar un p-value extremadamente pequeño. Con pocas observaciones, un efecto potencialmente importante puede quedar acompañado por mucha incertidumbre y un p-value elevado.
El diseño previo debería coordinar MDE, potencia, α y tamaño de muestra. El p-value observado llega después; no reemplaza esa planificación.
Cómo usar el p-value en experimentación sin romper el test
En un test frecuentista de horizonte fijo, el tamaño de muestra y el plan de análisis deberían definirse antes de iniciar el experimento. Optimizely exige justamente una muestra predeterminada en su modo Frequentist Fixed Horizon y advierte contra revisar resultados completos antes de alcanzar las condiciones definidas.
El problema es el optional stopping: si se mira el p-value repetidamente y se detiene el experimento apenas cruza 0,05, la probabilidad acumulada de un falso positivo puede superar la tasa nominal del test.
Predefiní la hipótesis
Incluí H₀, alternativa, dirección del test y métrica primaria.
Fijá α y muestra
Definí el umbral y el tamaño necesario según MDE, potencia, baseline y varianza.
Respetá el método de monitoreo
Fixed-horizon no equivale a sequential. Si necesitás mirar resultados continuamente, usá un método diseñado para hacerlo.
Controlá multiplicidad
Comparar muchos tratamientos, métricas o segmentos aumenta oportunidades de obtener p-values pequeños por azar y puede requerir ajustes específicos.
Interpretá efecto e incertidumbre
No cierres la decisión con “p < 0,05”. Revisá magnitud, intervalo, guardrails y relevancia práctica.
Errores frecuentes al interpretar p-values
“p = 0,03 significa que H₀ tiene 3% de probabilidad”
Falso. El cálculo supone H₀/modelo para evaluar los datos; no calcula P(H₀ | datos).
“1 − p es la probabilidad de que la alternativa sea verdadera”
Tampoco. Un p-value de 0,03 no implica 97% de probabilidad de Hₐ.
“p > 0,05 demuestra que no existe efecto”
No rechazar H₀ no equivale a demostrar ausencia. El estudio puede ser impreciso o tener poca potencia para el efecto relevante.
“p < 0,05 demuestra que el efecto es grande”
El p-value combina efecto, ruido y muestra; no mide magnitud ni importancia.
“0,049 y 0,051 son resultados cualitativamente opuestos”
El corte es una regla convencional. La evidencia no cambia bruscamente al cruzar una centésima alrededor del umbral.
“Puedo mirar hasta que sea significativo”
No con un fixed-horizon convencional. El monitoreo repetido altera la tasa de error si el método no está diseñado para análisis secuencial.
“Si pruebo muchas métricas, alguna significativa confirma la hipótesis”
La multiplicidad aumenta oportunidades de falsos positivos. Las métricas y reglas de éxito deberían preespecificarse y ajustarse cuando corresponda.
Preguntas frecuentes sobre p-value
¿Qué es el p-value?
Es la probabilidad, suponiendo una hipótesis nula y un modelo estadístico determinados, de obtener un estadístico de prueba tan extremo o más extremo que el observado. Valores pequeños indican mayor incompatibilidad entre los datos y ese modelo nulo.
¿Un p-value de 0,03 significa que hay 3% de probabilidad de que la hipótesis nula sea verdadera?
No. El p-value se calcula condicionando a que la hipótesis nula y el modelo sean los especificados. No entrega la probabilidad posterior de que H₀ sea verdadera.
¿p < 0,05 significa que el efecto es importante?
No. El umbral 0,05 es una convención y el p-value no mide el tamaño del efecto ni su relevancia práctica. Conviene examinar también la estimación del efecto, su intervalo de confianza y el contexto de decisión.
¿Cuál es la diferencia entre p-value y nivel de significancia α?
El p-value es calculado a partir de los datos. α es un umbral de decisión definido de antemano que controla, bajo el modelo del test, la tasa de error tipo I del procedimiento. Si el análisis fue preespecificado, suele compararse p con α.
¿Qué relación existe entre p-value e intervalo de confianza?
Bajo el mismo modelo y un test bilateral, existe una relación entre ambos: si un intervalo de confianza del 95% excluye el valor nulo correspondiente, el test equivalente suele tener p < 0,05. El intervalo agrega además información sobre tamaño y precisión del efecto.
¿Puedo mirar el p-value durante un A/B test y detenerlo cuando baje de 0,05?
No en un test frecuentista fixed-horizon convencional sin correcciones. Mirar repetidamente y detener al cruzar el umbral aumenta la tasa de falsos positivos. Los diseños secuenciales usan métodos específicos para permitir monitoreo continuo.
Referencias clave
American Statistical Association. Statement on Statistical Significance and P-Values. Sus seis principios delimitan qué puede y qué no puede inferirse de un p-value.
Wasserstein, R. L. & Lazar, N. A. The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 2016.
NIST/SEMATECH. Critical values and p values. Define el p-value respecto del estadístico de prueba y H₀ y explica su relación con α.
Greenland, S. et al. Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. Revisa 25 interpretaciones erróneas frecuentes de tests, p-values, intervalos y potencia.
ASA President's Task Force. Statement on Statistical Significance and Replicability. Reafirma que los p-values son herramientas válidas cuando se usan e interpretan correctamente, pero no son una medida única suficiente de evidencia o decisión.
Optimizely. Frequentist (Fixed Horizon) statistics. Documenta cálculo de p-values, muestra predeterminada y condiciones del test fixed-horizon en experimentación digital.