¿Qué es un intervalo de confianza?
Un intervalo de confianza es un rango calculado a partir de una muestra mediante un procedimiento estadístico que cuantifica la incertidumbre alrededor de una estimación de un parámetro o efecto. En un intervalo de confianza frecuentista del 95%, si el mismo procedimiento se repitiera muchas veces bajo sus supuestos, aproximadamente el 95% de los intervalos construidos contendrían el valor verdadero.
Qué significa intervalo de confianza
Una estimación puntual —por ejemplo, una media, una proporción o una diferencia entre grupos— resume un resultado con un solo número. Pero ese número cambia de una muestra a otra. El intervalo de confianza agrega información sobre esa incertidumbre mostrando un rango de valores compatible con el procedimiento de estimación.
NIST explica que un intervalo de confianza aborda precisamente el problema de cuánto puede variar una estimación muestral respecto del parámetro poblacional. El intervalo no elimina la incertidumbre: la cuantifica bajo un conjunto de supuestos y un método de construcción.
Puede construirse alrededor de medias, proporciones, diferencias, razones, coeficientes y muchos otros parámetros. La fórmula exacta depende del estimador, el diseño, la distribución muestral y los supuestos utilizados.
Un intervalo de confianza sí comunica
- Una estimación acompañada de incertidumbre.
- Un nivel de cobertura asociado al procedimiento.
- Qué valores del parámetro resultan compatibles con el método y los datos.
- La precisión relativa de una estimación: intervalos más estrechos suelen indicar mayor precisión.
Un intervalo de confianza no comunica por sí solo
- La probabilidad frecuentista de que un parámetro fijo esté dentro del intervalo observado.
- La relevancia práctica o de negocio del efecto.
- La ausencia de sesgo o errores de diseño.
- Una garantía de que el modelo y sus supuestos sean correctos.
Qué significa un intervalo de confianza del 95%
La frase “95% de confianza” suele interpretarse mal. En el enfoque frecuentista clásico, el 95% no es una probabilidad posterior sobre el parámetro después de observar los datos. Describe una propiedad de cobertura a largo plazo del procedimiento.
NIST lo formula de manera directa: si se toman muchas muestras del mismo proceso y se calcula un intervalo con el mismo método en cada una, aproximadamente el 95% de esos intervalos contendrán el parámetro verdadero. Una vez que un intervalo concreto fue calculado, el parámetro fijo está dentro o fuera de él; el método no asigna 95% de probabilidad a ese evento específico.
Visualización mental: imaginá 100 muestras independientes del mismo proceso. Construís 100 intervalos del 95% usando el mismo procedimiento. En condiciones ideales y si los supuestos se cumplen, alrededor de 95 cubrirían el valor verdadero y alrededor de 5 no.
Por eso es más riguroso decir “un intervalo de confianza del 95% construido con este procedimiento” que afirmar literalmente “hay 95% de probabilidad de que el valor real esté entre A y B”.
Qué determina la precisión de un intervalo de confianza
La amplitud depende de varios factores. NIST muestra que, para intervalos clásicos de una media, el tamaño de muestra aparece en el denominador del error estándar: al crecer n, la incertidumbre de la estimación suele disminuir y el intervalo tiende a estrecharse.
Tamaño de muestra
En igualdad de condiciones, muestras mayores suelen reducir el error estándar y producir intervalos más estrechos.
Variabilidad
Datos más variables generan mayor incertidumbre y, normalmente, intervalos más amplios.
Nivel de confianza
Un 99% exige mayor cobertura que un 95%, por lo que suele requerir un intervalo más ancho; uno del 90% suele ser más estrecho.
Método y diseño
El tipo de estimador, distribución, muestreo, dependencia entre observaciones y correcciones del modelo también afectan el intervalo.
Un intervalo estrecho no vuelve automáticamente correcto al resultado. Puede ser muy preciso alrededor de una estimación sesgada si el muestreo, la medición o el diseño son deficientes. Precisión y validez no son sinónimos.
Cómo se construye un intervalo de confianza
Muchos intervalos frecuentes pueden entenderse con una estructura general:
estimación puntual ± valor crítico × error estándar
Para una media bajo determinados supuestos, por ejemplo, el intervalo puede usar una distribución normal o t. Pero no existe una sola fórmula universal: proporciones, odds ratios, regresiones, muestras pequeñas, diseños agrupados o métodos bootstrap pueden requerir procedimientos diferentes.
El error estándar cuantifica cuánto variaría el estimador entre muestras hipotéticas del mismo proceso. El valor crítico depende del nivel de confianza y de la distribución de referencia. El margen de error combina ambos.
| Componente | Qué representa |
|---|---|
| Estimación puntual | El valor calculado con la muestra: media, proporción, diferencia u otro estimador. |
| Error estándar | La variabilidad esperada del estimador entre muestras bajo el modelo. |
| Valor crítico | El multiplicador correspondiente al nivel de confianza y la distribución usada. |
| Margen de error | La distancia entre la estimación puntual y cada límite cuando el intervalo es simétrico. |
Intervalo de confianza vs. p-value
Un p-value y un intervalo de confianza pueden estar matemáticamente relacionados bajo un mismo modelo, pero responden de forma distinta. El p-value ayuda a evaluar la incompatibilidad entre los datos y una hipótesis nula concreta. El intervalo muestra un rango de efectos o parámetros y, por lo tanto, comunica también magnitud y precisión.
BMJ ha defendido históricamente el uso de intervalos porque permiten interpretar el tamaño del efecto y la incertidumbre en lugar de reducir una conclusión a “significativo/no significativo”. Un resultado puede no cruzar un umbral convencional de significancia y aun ser compatible con efectos importantes si el intervalo es amplio.
| Herramienta | Aporta principalmente | Limitación frecuente |
|---|---|---|
| p-value | Compatibilidad de los datos con una hipótesis nula bajo un modelo. | No comunica directamente tamaño del efecto ni precisión. |
| Intervalo de confianza | Rango de valores del efecto o parámetro acompañado por incertidumbre. | Puede malinterpretarse como una probabilidad posterior del parámetro. |
La significancia estadística no debería evaluarse aislada de la magnitud del efecto, la precisión y la relevancia práctica.
Intervalo de confianza, intervalo de predicción e intervalo creíble
Los tres son intervalos de incertidumbre, pero no responden la misma pregunta.
| Intervalo | Qué intenta cubrir | Interpretación central |
|---|---|---|
| Confianza | Un parámetro o efecto desconocido. | El procedimiento tiene una tasa de cobertura definida en repeticiones. |
| Predicción | Una futura observación individual. | Incluye incertidumbre sobre el promedio estimado y además variabilidad individual, por eso suele ser más ancho. |
| Creíble bayesiano | El parámetro bajo una distribución posterior. | Un 95% creíble contiene 95% de la probabilidad posterior, condicionada al modelo, datos y prior. |
Penn State muestra que los intervalos de predicción suelen ser más amplios que los de confianza porque deben cubrir la variación de una nueva observación además de la incertidumbre de la respuesta media. En Bayes, el intervalo creíble admite una interpretación probabilística directa sobre el parámetro dentro del modelo posterior; eso es justamente lo que no permite afirmar un intervalo frecuentista clásico.
Ejemplo de intervalo de confianza en un A/B test
Supongamos un A/B Test donde una nueva variante de checkout muestra una mejora estimada de +1,2 puntos porcentuales en conversión frente al grupo de control, con un intervalo de confianza del 95% de +0,3 a +2,1 puntos.
La estimación puntual es +1,2, pero el intervalo recuerda que existe incertidumbre. Bajo el procedimiento usado, los datos son compatibles con mejoras bastante más pequeñas o más grandes dentro de ese rango. Si todo el intervalo está por encima de cero, el test bilateral equivalente al 5% suele rechazar una hipótesis nula de diferencia cero, siempre que se trate del mismo modelo y supuestos.
Pero eso no resuelve la decisión de negocio: una mejora mínima compatible de +0,3 puntos puede ser demasiado pequeña para justificar costos de implementación, o puede ser muy valiosa a gran escala. El intervalo ayuda a separar significancia estadística de importancia práctica.
En experimentación, conviene reportar conjuntamente la estimación del efecto y su intervalo, no sólo si el resultado cruzó o no un umbral de significancia.
Errores frecuentes al interpretar intervalos de confianza
Decir “hay 95% de probabilidad de que el parámetro esté acá”
Esa no es la interpretación frecuentista clásica. El 95% pertenece a la cobertura del procedimiento a largo plazo.
Creer que 95% de los datos están dentro del intervalo
El intervalo se refiere a un parámetro o efecto estimado, no al rango que contiene 95% de las observaciones individuales.
Confundir precisión con ausencia de sesgo
Un intervalo estrecho puede acompañar una estimación sistemáticamente equivocada si el diseño o la medición están sesgados.
Tratar valores dentro del intervalo como igualmente plausibles
Un intervalo frecuentista estándar no es una distribución de probabilidad sobre el parámetro y no asigna la misma plausibilidad a todos los puntos.
Usar el intervalo sólo para decidir “significativo/no significativo”
La información más valiosa suele estar en la magnitud y precisión del efecto, no sólo en si el intervalo cruza un valor nulo.
Preguntas frecuentes sobre intervalos de confianza
¿Qué es un intervalo de confianza?
Es un rango calculado a partir de una muestra que expresa la incertidumbre alrededor de una estimación. Su interpretación depende del procedimiento estadístico usado y del nivel de confianza elegido.
¿Qué significa un intervalo de confianza del 95%?
En el enfoque frecuentista, significa que si el mismo procedimiento de muestreo y cálculo se repitiera muchas veces bajo sus supuestos, aproximadamente el 95% de los intervalos obtenidos contendrían el valor verdadero del parámetro.
¿Un intervalo de confianza del 95% significa que hay 95% de probabilidad de que el parámetro esté dentro?
No en la interpretación frecuentista clásica. Una vez calculado el intervalo, el parámetro se considera fijo y el intervalo concreto lo contiene o no. El 95% describe la cobertura a largo plazo del procedimiento.
¿Qué hace que un intervalo de confianza sea más estrecho?
En igualdad de condiciones, una muestra mayor y una menor variabilidad suelen producir intervalos más estrechos. Un nivel de confianza más alto, como 99% en lugar de 95%, suele ensanchar el intervalo.
¿Cuál es la diferencia entre intervalo de confianza y p-value?
El p-value resume cuán incompatibles son los datos con una hipótesis nula bajo un modelo determinado. El intervalo de confianza muestra un rango de valores del parámetro o efecto compatibles con el procedimiento y comunica magnitud e incertidumbre, por lo que suele aportar más información.
¿Intervalo de confianza e intervalo creíble son lo mismo?
No. El intervalo de confianza pertenece al enfoque frecuentista y su nivel describe la cobertura del procedimiento en repeticiones. Un intervalo creíble bayesiano resume probabilidad posterior sobre el parámetro, condicionada al modelo, los datos y el prior.
Referencias clave
NIST/SEMATECH. What are confidence intervals?. Define el intervalo de confianza y su interpretación en términos de cobertura repetida.
NIST/SEMATECH. Confidence Limits for the Mean. Muestra cómo tamaño de muestra y variabilidad afectan la amplitud del intervalo.
Gardner, M. J. & Altman, D. G. Confidence intervals rather than P values: estimation rather than hypothesis testing. BMJ, 1986. Argumenta a favor de reportar tamaño del efecto e incertidumbre, no sólo tests dicotómicos.
Altman, D. G. & Bland, J. M. How to obtain the confidence interval from a P value. BMJ, 2011. Explica la relación entre estimación de efectos, p-values e intervalos.
Penn State University. STAT 501 — Estimation & Prediction. Distingue intervalos de confianza para respuesta media e intervalos de predicción para observaciones individuales.
Duke University. Bayesian statistical methods. Distingue la interpretación frecuentista de un intervalo de confianza de la probabilidad posterior de un intervalo creíble.