¿Qué es la potencia estadística?
La potencia estadística es la probabilidad de que un procedimiento de prueba rechace correctamente la hipótesis nula cuando existe un efecto de un tamaño especificado bajo los supuestos del diseño. En un test frecuentista suele expresarse como 1 − β, donde β es la probabilidad de error tipo II. La potencia no es una propiedad fija del estudio: depende del tamaño de efecto, la muestra, la variabilidad, α y el método estadístico.
Qué significa potencia estadística
La potencia estadística describe la capacidad de un diseño para detectar un efecto cuando ese efecto realmente existe. Más precisamente, se refiere a un efecto de una magnitud determinada: no existe una única “potencia del estudio” independiente del tamaño del efecto que se quiera detectar.
En un contraste frecuentista, la potencia suele escribirse como 1 − β. Si β representa la probabilidad de cometer un error tipo II —no rechazar H₀ cuando existe el efecto especificado—, la potencia representa la probabilidad complementaria de detectarlo.
Por eso decir “este experimento tiene 80% de potencia” está incompleto si no se aclara para qué efecto, con qué α, muestra, varianza y test. La potencia es una propiedad condicional del diseño.
La potencia sí expresa
- Sensibilidad del procedimiento frente a un efecto especificado.
- La relación complementaria con el error tipo II.
- Una entrada central para calcular tamaño de muestra.
- La probabilidad de detectar un efecto bajo los supuestos del diseño.
La potencia no expresa
- La probabilidad de que H₁ sea verdadera.
- La probabilidad de que el resultado observado sea correcto.
- La importancia práctica del efecto.
- Una garantía de replicación.
Potencia y error tipo II
Cuando un test no detecta un efecto que realmente existe, comete un error tipo II. Su probabilidad se simboliza β. La potencia es 1 − β.
| Realidad | No se rechaza H₀ | Se rechaza H₀ |
|---|---|---|
| H₀ es adecuada | Decisión compatible con H₀. | Error tipo I, controlado por α. |
| Existe el efecto especificado | Error tipo II, β. | Detección correcta, potencia = 1 − β. |
Un diseño con 80% de potencia frente a un efecto concreto implica β = 20% para ese escenario. Si el efecto verdadero fuera menor, la potencia sería menor; si fuera mayor, normalmente sería mayor.
Qué factores determinan la potencia estadística
Tamaño del efecto
Efectos grandes son más fáciles de distinguir del ruido que efectos pequeños. Manteniendo todo lo demás, mayor efecto implica mayor potencia.
Tamaño de muestra
Más observaciones reducen normalmente el error estándar y aumentan la sensibilidad del test.
Variabilidad
Más ruido hace más difícil identificar una señal y reduce potencia para una misma muestra.
Nivel α
Un α más estricto reduce falsos positivos, pero suele exigir más evidencia y reduce potencia si la muestra no aumenta.
Diseño y test
Asignación, dependencia entre observaciones, covariables, número de variantes, direccionalidad y método estadístico modifican la eficiencia.
Potencia y tamaño de muestra
La potencia es una de las entradas principales del cálculo de muestra. En muchos estudios se elige una potencia objetivo —80% y 90% son valores frecuentes— y se calcula cuántas observaciones hacen falta para detectar un efecto relevante bajo α y varianza definidos.
Una potencia más alta reduce la probabilidad de perder un efecto real, pero no es gratis: requiere normalmente más tráfico, más sujetos o más tiempo. El diseño debe equilibrar sensibilidad, costo y relevancia práctica.
Idea clave: no se elige la muestra “para obtener significancia”. Se dimensiona para que el estudio tenga una probabilidad adecuada de detectar un efecto que valga la pena encontrar.
Cómo se relacionan potencia y MDE
El MDE especifica el efecto mínimo que el diseño pretende detectar con una potencia objetivo. Ambos conceptos están directamente conectados.
| Cambio | Consecuencia habitual |
|---|---|
| MDE más pequeño | Hace falta más muestra para mantener la misma potencia. |
| Potencia más alta | Hace falta más muestra para el mismo MDE. |
| Mayor varianza | Hace falta más muestra para conservar MDE y potencia. |
| α más estricto | Hace falta más muestra para mantener potencia. |
Por eso un experimento “rápido” puede ser simplemente un experimento diseñado para detectar sólo efectos grandes. Eso no es necesariamente malo, pero debe ser coherente con el efecto mínimo que realmente importa.
Potencia estadística y significancia estadística no son lo mismo
La significancia estadística es una propiedad del resultado observado dentro de un test. La potencia pertenece principalmente al diseño y responde otra pregunta: ¿qué probabilidad tendría este procedimiento de detectar un efecto de cierta magnitud si existiera?
Un estudio puede tener alta potencia planificada y obtener un resultado no significativo. Eso puede ocurrir porque el efecto real sea menor que el MDE, porque sea cercano a cero, porque los supuestos no se cumplan o simplemente por variabilidad muestral.
También puede obtener significancia con un efecto muy pequeño si la muestra es enorme. Ni significancia ni potencia reemplazan la estimación del efecto y su intervalo de confianza.
Potencia a priori vs. potencia post hoc
La aplicación más útil de la potencia ocurre antes del experimento: se define el efecto relevante, α y potencia deseada, y se calcula la muestra necesaria.
Después de obtener los datos, calcular “potencia observada” usando el efecto observado suele aportar poco. Esa cantidad queda estrechamente ligada al propio p-value y puede producir interpretaciones engañosas, especialmente cuando se usa para explicar un resultado no significativo.
Mejor pregunta después del estudio: en lugar de “¿qué potencia tuvo?”, mirá el efecto estimado y su intervalo. Eso muestra qué magnitudes siguen siendo compatibles con los datos y con qué precisión.
Ejemplo de potencia estadística en un A/B test
Supongamos una conversión baseline del 10%. El equipo quiere detectar una mejora relativa mínima del 5%, usa α = 0,05 y decide trabajar con 80% de potencia.
El cálculo de muestra debe responder: ¿cuántos usuarios por variante necesitamos para que, si el verdadero lift fuera justamente ese 5%, el test tenga aproximadamente 80% de probabilidad de detectarlo bajo el modelo?
Si el efecto real fuera mayor que 5%, la potencia efectiva normalmente sería superior. Si fuera 2%, sería inferior. Por eso MDE y potencia describen juntos la sensibilidad del diseño.
En un fixed-horizon como el documentado por Optimizely, la muestra debe fijarse antes de iniciar el test y respetarse; mirar resultados repetidamente y detener al cruzar un umbral rompe las propiedades nominales del procedimiento.
Errores frecuentes al interpretar potencia estadística
“80% de potencia significa 80% de probabilidad de que el resultado sea verdadero”
No. La potencia se define condicionalmente a un efecto y diseño especificados.
“El estudio tiene una potencia única”
La potencia cambia con el tamaño de efecto considerado. Debe decirse para qué efecto fue calculada.
“No significativo = estudio sin potencia”
No necesariamente. Un resultado no significativo puede ser compatible con un efecto pequeño, con cero o con incertidumbre amplia.
“Más muestra siempre resuelve el problema”
Más muestra mejora precisión, pero no corrige sesgos, mala medición, confusión o un diseño causal deficiente.
“Hay que maximizar la potencia a cualquier costo”
El nivel adecuado depende de consecuencias del error, costo de muestra y efecto mínimo relevante.
“La potencia post hoc demuestra que un resultado nulo es confiable”
La potencia observada basada en el efecto muestral suele ser redundante; el intervalo de confianza es más informativo.
Preguntas frecuentes sobre potencia estadística
¿Qué es la potencia estadística?
Es la probabilidad de detectar un efecto de un tamaño especificado cuando ese efecto existe, bajo el diseño y los supuestos del test. En pruebas frecuentistas suele expresarse como 1 − β.
¿Qué significa una potencia del 80%?
Significa que, si el efecto real tuviera exactamente la magnitud especificada en el cálculo y se repitiera el mismo diseño muchas veces, alrededor del 80% de los estudios rechazarían H₀ correctamente. No significa que haya 80% de probabilidad de que el resultado actual sea correcto.
¿Más potencia siempre es mejor?
Más potencia reduce la probabilidad de pasar por alto un efecto relevante, pero normalmente exige más muestra, tiempo o recursos. El nivel adecuado depende de la decisión, el costo del error y la magnitud del efecto que importa detectar.
¿Qué aumenta la potencia estadística?
En general, una muestra mayor, un efecto verdadero más grande, menor variabilidad, un α menos estricto y un diseño más eficiente aumentan la potencia. Las relaciones exactas dependen del test.
¿Potencia estadística y significancia son lo mismo?
No. La potencia es una propiedad de planificación del procedimiento frente a un efecto especificado. La significancia estadística describe el resultado del test observado respecto de H₀ y α.
¿Conviene calcular potencia después del experimento?
La potencia más útil se calcula antes del estudio para dimensionar la muestra. La llamada potencia observada o post hoc basada en el efecto observado aporta poca información adicional porque queda estrechamente determinada por el propio resultado y el p-value.
Referencias clave
National Library of Medicine / PMC. Sample size, power and effect size revisited. Revisa la relación entre muestra, potencia, tamaño de efecto y significancia.
National Library of Medicine / PMC. Statistical primer: sample size and power calculations. Explica los componentes necesarios para planificar potencia y tamaño muestral.
National Library of Medicine / PMC. Biostatistics Series Module 5: Determining Sample Size. Resume cómo α, potencia, varianza y efecto modifican la muestra requerida.
Optimizely. Frequentist (Fixed Horizon) statistics. Documenta planificación de muestra, MDE, significancia y fixed-horizon en experimentación digital.