Tamaño de muestra: el cálculo que decide si tu test vale algo
Un test con menos muestra de la planificada puede quedar sin potencia para detectar el efecto que importa. El tamaño de muestra no es un detalle técnico: junto con el efecto objetivo, la variabilidad, alpha y la potencia define qué tan informativo puede ser el experimento.
- Por qué el tamaño de muestra es el parámetro más ignorado
- Los cuatro parámetros del cálculo
- La fórmula y cómo usarla
- El efecto mínimo detectable: cómo definirlo correctamente
- El problema del peeking y las reglas de parada
- Cuándo el tráfico no alcanza y qué hacer
- Implicaciones estratégicas del cálculo de muestra
- Errores frecuentes
- Preguntas frecuentes
Por qué el tamaño de muestra es el parámetro más ignorado
La mayoría de los equipos que hacen A/B testing por primera vez lanzan el test, revisan los resultados durante la ejecución y deciden cuándo detenerlo. En un diseño frecuentista de horizonte fijo, usar esas miradas intermedias para parar cuando aparece significancia altera la regla de decisión y puede inflar la tasa de falsos positivos por encima del nivel nominal. El problema no es observar datos en sí, sino tomar decisiones adaptativas con un método que no fue diseñado para hacerlo.
El tamaño de muestra no es burocracia estadística. En un diseño dado, influye directamente en la precisión de las estimaciones y en la potencia para detectar un efecto específico. Tamaño de muestra, tamaño de efecto, variabilidad, nivel de significancia y potencia están relacionados: cambiar uno modifica lo que puede esperarse de los demás. En un test de horizonte fijo, planificar la muestra antes de lanzar permite saber para qué efecto y con qué potencia fue diseñado el experimento.
Si buscás la definición estadística general —más allá del A/B testing— podés ver qué es el tamaño de muestra en el Glosario.
Los cuatro parámetros del cálculo
La fórmula y cómo usarla
La aproximación supone dos grupos independientes, una respuesta binaria por unidad, asignación 50/50 y un análisis bilateral de horizonte fijo, sin corrección por comparaciones múltiples. Los valores z indicados son críticos positivos de cola superior. Para efectos pequeños, usar esta aproximación de varianza no agrupada o separar la varianza bajo la hipótesis nula y la alternativa da resultados cercanos; para otros diseños, usá el cálculo correspondiente.
Ejemplo práctico: tasa base del 3% (p₀ = 0.03), MDE del 15% relativo (p₁ = 0.0345), α = 0.05 y poder = 0.80. Con la aproximación mostrada arriba, el resultado es de alrededor de n = 24.200 usuarios independientes por variante — unas 48.400 unidades en total. Si la página incorpora 3.000 nuevos usuarios elegibles por semana al experimento, el test necesita alrededor de 16-17 semanas solo para alcanzar esa muestra. Las visitas repetidas no agregan nuevos usuarios independientes; también hay que contemplar la maduración de la respuesta y los ciclos relevantes. Si ese plazo no es viable, las alternativas son redefinir el MDE, aumentar el tráfico elegible, aceptar menor potencia o revisar el diseño; hacer α más estricto no reduce la muestra.
En diseños simples de comparación entre grupos, el tamaño de muestra crece aproximadamente con el inverso del cuadrado del efecto: si se quiere detectar un efecto de la mitad de magnitud, puede hacer falta alrededor de cuatro veces más muestra, manteniendo constantes los demás supuestos. Esa relación obliga a definir antes del test cuál es la mejora mínima que sería material para el negocio y si el tráfico disponible permite detectarla con una potencia razonable.
El tamaño de muestra es la pregunta que obliga a explicitar el valor de lo que se está testeando. Si no podés responder qué mejora mínima justifica cambiar la implementación, no estás listo para lanzar el test — todavía no sabés qué estás buscando.
Lisandro IserteEl efecto mínimo detectable: cómo definirlo correctamente
El MDE es el parámetro más mal definido en la práctica de experimentación de marketing. La mayoría de los equipos lo fijan de forma arbitraria ("un 10% suena razonable") o al revés — calculan cuánto tráfico tienen disponible y deducen cuál MDE pueden detectar, sin preguntarse si ese MDE tiene sentido económico.
El MDE conviene definirse a partir de un efecto que sea material para la decisión y estadísticamente viable de detectar. Si implementar una variante ganadora tiene un costo relevante, el equipo puede usar el impacto económico esperado para establecer qué mejora mínima justificaría ese cambio. El criterio de negocio no reemplaza el cálculo estadístico: ambos se combinan para elegir un efecto objetivo defendible.
En el contexto de la relación CAC/LTV, el MDE correcto es aquel que produce un cambio material en la ecuación de unit economics: si un aumento del 5% en la tasa de conversión de una landing page reduce el CAC en un 4%, eso puede ser suficiente para justificar el test aunque el cambio parezca pequeño. Si el mismo 5% de mejora en una página de contenido de bajo tráfico produce un impacto económico despreciable, ese MDE no justifica el tiempo del equipo.
El problema del peeking
En un test de horizonte fijo, el peeking problemático aparece cuando se inspeccionan resultados intermedios y se decide detener, continuar o declarar un ganador en función de esas miradas sin ajustar el método estadístico. Esa regla de parada dependiente de los datos puede inflar el error tipo I.
El mecanismo es este: con muestras pequeñas, las tasas de conversión observadas fluctúan considerablemente alrededor del verdadero valor. En las primeras horas o días del test, es completamente normal que una variante que genuinamente no mejora la conversión aparezca con una ventaja del 20-30% — simplemente por varianza muestral. Si el equipo detiene el test en ese momento, declara un falso positivo. Si lo deja correr hasta que la señal "se estabilice", introduce sesgos de selección: está eligiendo cuándo parar en función de los datos, lo que invalida las garantías estadísticas del diseño original.
La solución depende del método elegido. En un diseño de horizonte fijo se define de antemano la muestra y la regla de análisis, y no se cambia la decisión por resultados intermedios. Si el negocio necesita monitoreo continuo o parada temprana, debe usar un diseño secuencial u otro método que incorpore explícitamente esas decisiones. Los p-values y los intervalos siempre válidos son una familia de herramientas creadas precisamente para ese contexto.
Cuándo el tráfico no alcanza y qué hacer
Muchas páginas no tienen el tráfico necesario para alcanzar la potencia prevista para efectos relevantes en plazos razonables. Frente a ese escenario, hay cuatro alternativas legítimas — y una que no lo es.
Aumentar el MDE
Si solo se puede detectar mejoras del 20% o más, testear solo cambios que tienen potencial de producir ese nivel de impacto. Eso implica priorizar hipótesis de alto impacto — cambios radicales en el mensaje, la oferta o el diseño — en lugar de optimizaciones marginales.
Agregar más variantes en el mismo test
Un experimento multiarm puede comparar varias variantes contra un mismo control en paralelo y ahorrar tiempo calendario frente a una secuencia de tests separados. No genera muestra gratis: cada brazo necesita información suficiente y las comparaciones múltiples deben tratarse con el método estadístico correspondiente.
Usar pruebas de una cola
Una prueba unilateral concentra α en una sola dirección y puede requerir menos muestra para detectar un efecto en esa dirección. La decisión debe justificarse por la pregunta y tomarse antes de observar los datos: no es un atajo para obtener significancia. Un resultado adverso puede observarse, pero el contraste unilateral no está diseñado para probar significancia en la dirección opuesta.
Medir métricas proxy con mayor sensibilidad
Si la conversión final tiene baja frecuencia, una métrica intermedia del funnel puede ofrecer más sensibilidad estadística. Pero sólo sirve como métrica primaria si existe una justificación sólida de que el proxy está alineado con la decisión final; elegirlo únicamente porque ocurre más seguido puede optimizar una señal que no representa el resultado de negocio.
La alternativa que no lo es: ignorar la baja potencia al interpretar el test
Lanzar un test con baja potencia y presentarlo como si pudiera descartar efectos relevantes produce conclusiones débiles. La baja potencia aumenta sobre todo el riesgo de falsos negativos para el efecto objetivo y deja estimaciones más inciertas. Por sí sola no convierte un α nominal de 5% en una tasa de error tipo I de 25-30%; ese error sí puede inflarse con prácticas como optional stopping o comparaciones múltiples sin control. Antes de tomar decisiones de asignación de presupuesto o de diferenciación de oferta, hay que interpretar el tamaño del efecto y su incertidumbre, no sólo si el resultado cruzó un umbral.
Implicaciones estratégicas
El cálculo de tamaño de muestra no es una tarea técnica aislada: determina qué efectos pueden detectarse con el tráfico disponible y cuánto tiempo puede requerir el experimento.
En el cluster de Crecimiento, el tráfico disponible en distintas etapas del funnel de conversión condiciona qué MDE puede detectar el equipo de CRO en un plazo razonable. Con los demás supuestos constantes, más muestra permite diseñar tests sensibles a efectos menores; con poco tráfico, el equipo debe aceptar efectos detectables mayores, más duración o una potencia menor. Esa restricción debe entrar en la priorización de iniciativas, no descubrirse después de lanzar.
La misma lógica vale para pricing, estudios de marca, segmentación y lifecycle: el tamaño debe calcularse para la métrica y el contraste que realmente sostienen la decisión. Una métrica proxy más frecuente puede reducir requisitos de muestra, pero sólo si representa de manera defendible el resultado que importa. En segmentaciones muy granulares, repartir la muestra entre subgrupos reduce la información disponible por comparación.
El reporting de un experimento debería conservar los supuestos previos —MDE, α, potencia, tamaño planificado y regla de análisis— y reportar el efecto observado con su incertidumbre. La calidad del experimento no se demuestra calculando “potencia observada” después de ver el resultado. En un programa maduro, el diseño del experimento y la cultura de experimentación hacen explícitas estas decisiones antes de interpretar el test.
Errores frecuentes
Error 1: usar horizonte fijo sin planificar la muestra
Si el análisis será frecuentista de horizonte fijo, la muestra y la regla de decisión deben definirse antes de interpretar los resultados. Un diseño secuencial puede permitir monitoreo y parada temprana, pero necesita una metodología que contemple esas decisiones.
Error 2: fijar el MDE con un solo criterio
Un MDE puede ser irrelevante para una decisión o inviable con el tráfico disponible. El efecto objetivo debe combinar materialidad de negocio con viabilidad estadística; elegirlo sólo por conveniencia de la calculadora o sólo por impacto económico deja incompleto el diseño.
Error 3: aplicar una duración mínima universal
No existe una regla estadística universal de “1-2 semanas” válida para todo A/B test. La duración debe ser suficiente para alcanzar la muestra o la regla de parada prevista y, cuando el negocio tiene ciclos de comportamiento relevantes —por ejemplo, diferencias por día de la semana—, cubrirlos de forma coherente con la población sobre la que se quiere decidir.
Error 4: ignorar interferencia entre experimentos
Que un usuario participe en más de un experimento no invalida automáticamente el segundo. El riesgo aparece cuando existe carryover, aprendizaje, fatiga o interacción entre tratamientos. Esas dependencias deben evaluarse en el diseño y, cuando son plausibles, resolverse con exclusiones, capas de experimentación, períodos de washout u otras reglas apropiadas.
Preguntas frecuentes sobre tamaño de muestra
¿Cómo se calcula el tamaño de muestra para un A/B test?
En un A/B test frecuentista de horizonte fijo, el tamaño de muestra depende de la tasa base y la variabilidad, el efecto mínimo detectable (MDE), el nivel de significancia (alpha), la potencia objetivo y la asignación entre variantes. Un alpha de 0.05 representa una tasa de error tipo I del 5% bajo la hipótesis nula y los supuestos del diseño; no significa que exista un 5% de probabilidad de que este ganador particular sea falso. Bajo condiciones simples, detectar un efecto de la mitad de magnitud puede requerir aproximadamente cuatro veces más muestra.
¿Qué es el efecto mínimo detectable (MDE)?
El efecto mínimo detectable (MDE) es el efecto para el que el diseño se dimensiona con una potencia objetivo y un alpha determinados. Si la tasa base es 3% y el MDE es 10% relativo, el efecto objetivo corresponde a pasar de 3% a 3.3%. Efectos menores pueden existir, pero el estudio tendrá menos capacidad para detectarlos. El MDE conviene definirlo combinando relevancia de negocio y viabilidad estadística.
¿Qué pasa si el test tiene menos muestra de la planificada?
Si un test de horizonte fijo queda por debajo de la muestra planificada, normalmente pierde potencia para detectar el efecto objetivo y sus estimaciones quedan más inciertas. La baja potencia, por sí sola, no eleva automáticamente el alpha nominal. El error tipo I sí puede inflarse si se inspeccionan resultados intermedios y se decide detener o continuar en función de ellos sin un método secuencial que contemple esa regla.
Referencias y bibliografía
- Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press. Caps. 17: "The Statistics behind Online Controlled Experiments" y 18: "Variance Estimation and Improved Sensitivity: Pitfalls and Solutions".
- statsmodels. samplesize_proportions_2indep_onetail y power_proportions_2indep. Supuestos y aproximaciones para dos proporciones independientes.
- Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences. 2nd ed. Lawrence Erlbaum. Cap. 6: "Differences Between Proportions".
- Croll, A. & Yoskovitz, B. (2013). Lean Analytics. O'Reilly. Cap. 2: "How to Keep Score", sección "What Makes a Good Metric?".
- Johari, R., Pekelis, L. & Walsh, D. J. Always Valid Inference: Bringing Sequential Analysis to A/B Testing. Trabajo sobre inferencia secuencial y monitoreo continuo.
- Flight, L. & Julious, S. A. Statistical primer: sample size and power calculations—why, when and how?. Relación entre tamaño de muestra, efecto, alpha, potencia y variabilidad.
- Optimizely. Frequentist (Fixed Horizon) statistics. Documentación práctica sobre muestra predeterminada y peeking en tests de horizonte fijo.