Home › Biblioteca › Rendimiento › Experimentación › Tamaño de Muestra
Spoke · Nivel intermedio - Rendimiento

Tamaño de muestra: el cálculo que decide si tu test vale algo

Un test con menos muestra de la planificada puede quedar sin potencia para detectar el efecto que importa. El tamaño de muestra no es un detalle técnico: junto con el efecto objetivo, la variabilidad, alpha y la potencia define qué tan informativo puede ser el experimento.

Nivel intermedioLectura: 14 min lecturaAutor Lisandro IserteÚltima actualización: 5 de octubre de 2026
Tamaño de Muestra en A/B Testing: cuánto tráfico necesitás

Por qué el tamaño de muestra es el parámetro más ignorado

La mayoría de los equipos que hacen A/B testing por primera vez lanzan el test, revisan los resultados durante la ejecución y deciden cuándo detenerlo. En un diseño frecuentista de horizonte fijo, usar esas miradas intermedias para parar cuando aparece significancia altera la regla de decisión y puede inflar la tasa de falsos positivos por encima del nivel nominal. El problema no es observar datos en sí, sino tomar decisiones adaptativas con un método que no fue diseñado para hacerlo.

El tamaño de muestra no es burocracia estadística. En un diseño dado, influye directamente en la precisión de las estimaciones y en la potencia para detectar un efecto específico. Tamaño de muestra, tamaño de efecto, variabilidad, nivel de significancia y potencia están relacionados: cambiar uno modifica lo que puede esperarse de los demás. En un test de horizonte fijo, planificar la muestra antes de lanzar permite saber para qué efecto y con qué potencia fue diseñado el experimento.

Si buscás la definición estadística general —más allá del A/B testing— podés ver qué es el tamaño de muestra en el Glosario.

Los cuatro parámetros del cálculo

Tasa base p₀ La tasa de conversión actual antes del test. Es la referencia para expresar el efecto relativo. Con el mismo MDE relativo, alpha, potencia y asignación, una tasa base más baja requiere más muestra en este diseño de dos proporciones. Si fijás la mejora absoluta en puntos porcentuales, la relación cambia: en tasas bajas, una base menor puede requerir menos muestra.
MDE δ Efecto mínimo detectable. La magnitud de efecto para la que dimensionás el test con una potencia y un alpha determinados. Un MDE del 10% relativo sobre una tasa base del 3% corresponde a pasar de 3% a 3.3%; conviene elegirlo según la mejora relevante para el negocio.
Significancia α α = 0.05 La tasa de error tipo I que acepta la regla de decisión cuando la hipótesis nula es verdadera, bajo los supuestos del test. Con todo lo demás fijo, bajar α de 0.05 a 0.01 exige más evidencia y suele requerir más muestra.
Poder 1−β 1-β = 0.80 La probabilidad de rechazar la hipótesis nula cuando existe el efecto específico usado para dimensionar el test, bajo sus supuestos. Una potencia de 80% implica β = 20% para ese efecto objetivo, no para cualquier mejora posible.

La fórmula y cómo usarla

Aproximación de tamaño de muestra por variante (dos proporciones, test bilateral, asignación 50/50)
n ≈ (z_α/2 + z_β)² × [p₀(1−p₀) + p₁(1−p₁)] / (p₁ − p₀)²
z_α/2Valor crítico para α. Con α = 0.05 → z = 1.96
z_βValor crítico para el poder. Con poder = 0.80 → z = 0.84
p₀Tasa de conversión base (control)
p₁Tasa de conversión esperada en la variante: p₀ × (1 + MDE relativo), con MDE expresado como fracción
nNúmero de unidades independientes por variante (multiplicar por 2 para el total con asignación 50/50)

La aproximación supone dos grupos independientes, una respuesta binaria por unidad, asignación 50/50 y un análisis bilateral de horizonte fijo, sin corrección por comparaciones múltiples. Los valores z indicados son críticos positivos de cola superior. Para efectos pequeños, usar esta aproximación de varianza no agrupada o separar la varianza bajo la hipótesis nula y la alternativa da resultados cercanos; para otros diseños, usá el cálculo correspondiente.

Ejemplo práctico: tasa base del 3% (p₀ = 0.03), MDE del 15% relativo (p₁ = 0.0345), α = 0.05 y poder = 0.80. Con la aproximación mostrada arriba, el resultado es de alrededor de n = 24.200 usuarios independientes por variante — unas 48.400 unidades en total. Si la página incorpora 3.000 nuevos usuarios elegibles por semana al experimento, el test necesita alrededor de 16-17 semanas solo para alcanzar esa muestra. Las visitas repetidas no agregan nuevos usuarios independientes; también hay que contemplar la maduración de la respuesta y los ciclos relevantes. Si ese plazo no es viable, las alternativas son redefinir el MDE, aumentar el tráfico elegible, aceptar menor potencia o revisar el diseño; hacer α más estricto no reduce la muestra.

En diseños simples de comparación entre grupos, el tamaño de muestra crece aproximadamente con el inverso del cuadrado del efecto: si se quiere detectar un efecto de la mitad de magnitud, puede hacer falta alrededor de cuatro veces más muestra, manteniendo constantes los demás supuestos. Esa relación obliga a definir antes del test cuál es la mejora mínima que sería material para el negocio y si el tráfico disponible permite detectarla con una potencia razonable.

El tamaño de muestra es la pregunta que obliga a explicitar el valor de lo que se está testeando. Si no podés responder qué mejora mínima justifica cambiar la implementación, no estás listo para lanzar el test — todavía no sabés qué estás buscando.

Lisandro Iserte

El efecto mínimo detectable: cómo definirlo correctamente

El MDE es el parámetro más mal definido en la práctica de experimentación de marketing. La mayoría de los equipos lo fijan de forma arbitraria ("un 10% suena razonable") o al revés — calculan cuánto tráfico tienen disponible y deducen cuál MDE pueden detectar, sin preguntarse si ese MDE tiene sentido económico.

El MDE conviene definirse a partir de un efecto que sea material para la decisión y estadísticamente viable de detectar. Si implementar una variante ganadora tiene un costo relevante, el equipo puede usar el impacto económico esperado para establecer qué mejora mínima justificaría ese cambio. El criterio de negocio no reemplaza el cálculo estadístico: ambos se combinan para elegir un efecto objetivo defendible.

En el contexto de la relación CAC/LTV, el MDE correcto es aquel que produce un cambio material en la ecuación de unit economics: si un aumento del 5% en la tasa de conversión de una landing page reduce el CAC en un 4%, eso puede ser suficiente para justificar el test aunque el cambio parezca pequeño. Si el mismo 5% de mejora en una página de contenido de bajo tráfico produce un impacto económico despreciable, ese MDE no justifica el tiempo del equipo.

El problema del peeking

En un test de horizonte fijo, el peeking problemático aparece cuando se inspeccionan resultados intermedios y se decide detener, continuar o declarar un ganador en función de esas miradas sin ajustar el método estadístico. Esa regla de parada dependiente de los datos puede inflar el error tipo I.

El mecanismo es este: con muestras pequeñas, las tasas de conversión observadas fluctúan considerablemente alrededor del verdadero valor. En las primeras horas o días del test, es completamente normal que una variante que genuinamente no mejora la conversión aparezca con una ventaja del 20-30% — simplemente por varianza muestral. Si el equipo detiene el test en ese momento, declara un falso positivo. Si lo deja correr hasta que la señal "se estabilice", introduce sesgos de selección: está eligiendo cuándo parar en función de los datos, lo que invalida las garantías estadísticas del diseño original.

La solución depende del método elegido. En un diseño de horizonte fijo se define de antemano la muestra y la regla de análisis, y no se cambia la decisión por resultados intermedios. Si el negocio necesita monitoreo continuo o parada temprana, debe usar un diseño secuencial u otro método que incorpore explícitamente esas decisiones. Los p-values y los intervalos siempre válidos son una familia de herramientas creadas precisamente para ese contexto.

Cuándo el tráfico no alcanza y qué hacer

Muchas páginas no tienen el tráfico necesario para alcanzar la potencia prevista para efectos relevantes en plazos razonables. Frente a ese escenario, hay cuatro alternativas legítimas — y una que no lo es.

Aumentar el MDE

Si solo se puede detectar mejoras del 20% o más, testear solo cambios que tienen potencial de producir ese nivel de impacto. Eso implica priorizar hipótesis de alto impacto — cambios radicales en el mensaje, la oferta o el diseño — en lugar de optimizaciones marginales.

Agregar más variantes en el mismo test

Un experimento multiarm puede comparar varias variantes contra un mismo control en paralelo y ahorrar tiempo calendario frente a una secuencia de tests separados. No genera muestra gratis: cada brazo necesita información suficiente y las comparaciones múltiples deben tratarse con el método estadístico correspondiente.

Usar pruebas de una cola

Una prueba unilateral concentra α en una sola dirección y puede requerir menos muestra para detectar un efecto en esa dirección. La decisión debe justificarse por la pregunta y tomarse antes de observar los datos: no es un atajo para obtener significancia. Un resultado adverso puede observarse, pero el contraste unilateral no está diseñado para probar significancia en la dirección opuesta.

Medir métricas proxy con mayor sensibilidad

Si la conversión final tiene baja frecuencia, una métrica intermedia del funnel puede ofrecer más sensibilidad estadística. Pero sólo sirve como métrica primaria si existe una justificación sólida de que el proxy está alineado con la decisión final; elegirlo únicamente porque ocurre más seguido puede optimizar una señal que no representa el resultado de negocio.

La alternativa que no lo es: ignorar la baja potencia al interpretar el test

Lanzar un test con baja potencia y presentarlo como si pudiera descartar efectos relevantes produce conclusiones débiles. La baja potencia aumenta sobre todo el riesgo de falsos negativos para el efecto objetivo y deja estimaciones más inciertas. Por sí sola no convierte un α nominal de 5% en una tasa de error tipo I de 25-30%; ese error sí puede inflarse con prácticas como optional stopping o comparaciones múltiples sin control. Antes de tomar decisiones de asignación de presupuesto o de diferenciación de oferta, hay que interpretar el tamaño del efecto y su incertidumbre, no sólo si el resultado cruzó un umbral.

Implicaciones estratégicas

El cálculo de tamaño de muestra no es una tarea técnica aislada: determina qué efectos pueden detectarse con el tráfico disponible y cuánto tiempo puede requerir el experimento.

En el cluster de Crecimiento, el tráfico disponible en distintas etapas del funnel de conversión condiciona qué MDE puede detectar el equipo de CRO en un plazo razonable. Con los demás supuestos constantes, más muestra permite diseñar tests sensibles a efectos menores; con poco tráfico, el equipo debe aceptar efectos detectables mayores, más duración o una potencia menor. Esa restricción debe entrar en la priorización de iniciativas, no descubrirse después de lanzar.

La misma lógica vale para pricing, estudios de marca, segmentación y lifecycle: el tamaño debe calcularse para la métrica y el contraste que realmente sostienen la decisión. Una métrica proxy más frecuente puede reducir requisitos de muestra, pero sólo si representa de manera defendible el resultado que importa. En segmentaciones muy granulares, repartir la muestra entre subgrupos reduce la información disponible por comparación.

El reporting de un experimento debería conservar los supuestos previos —MDE, α, potencia, tamaño planificado y regla de análisis— y reportar el efecto observado con su incertidumbre. La calidad del experimento no se demuestra calculando “potencia observada” después de ver el resultado. En un programa maduro, el diseño del experimento y la cultura de experimentación hacen explícitas estas decisiones antes de interpretar el test.

Errores frecuentes

Error 1: usar horizonte fijo sin planificar la muestra

Si el análisis será frecuentista de horizonte fijo, la muestra y la regla de decisión deben definirse antes de interpretar los resultados. Un diseño secuencial puede permitir monitoreo y parada temprana, pero necesita una metodología que contemple esas decisiones.

Error 2: fijar el MDE con un solo criterio

Un MDE puede ser irrelevante para una decisión o inviable con el tráfico disponible. El efecto objetivo debe combinar materialidad de negocio con viabilidad estadística; elegirlo sólo por conveniencia de la calculadora o sólo por impacto económico deja incompleto el diseño.

Error 3: aplicar una duración mínima universal

No existe una regla estadística universal de “1-2 semanas” válida para todo A/B test. La duración debe ser suficiente para alcanzar la muestra o la regla de parada prevista y, cuando el negocio tiene ciclos de comportamiento relevantes —por ejemplo, diferencias por día de la semana—, cubrirlos de forma coherente con la población sobre la que se quiere decidir.

Error 4: ignorar interferencia entre experimentos

Que un usuario participe en más de un experimento no invalida automáticamente el segundo. El riesgo aparece cuando existe carryover, aprendizaje, fatiga o interacción entre tratamientos. Esas dependencias deben evaluarse en el diseño y, cuando son plausibles, resolverse con exclusiones, capas de experimentación, períodos de washout u otras reglas apropiadas.

Preguntas frecuentes sobre tamaño de muestra

¿Cómo se calcula el tamaño de muestra para un A/B test?

En un A/B test frecuentista de horizonte fijo, el tamaño de muestra depende de la tasa base y la variabilidad, el efecto mínimo detectable (MDE), el nivel de significancia (alpha), la potencia objetivo y la asignación entre variantes. Un alpha de 0.05 representa una tasa de error tipo I del 5% bajo la hipótesis nula y los supuestos del diseño; no significa que exista un 5% de probabilidad de que este ganador particular sea falso. Bajo condiciones simples, detectar un efecto de la mitad de magnitud puede requerir aproximadamente cuatro veces más muestra.

¿Qué es el efecto mínimo detectable (MDE)?

El efecto mínimo detectable (MDE) es el efecto para el que el diseño se dimensiona con una potencia objetivo y un alpha determinados. Si la tasa base es 3% y el MDE es 10% relativo, el efecto objetivo corresponde a pasar de 3% a 3.3%. Efectos menores pueden existir, pero el estudio tendrá menos capacidad para detectarlos. El MDE conviene definirlo combinando relevancia de negocio y viabilidad estadística.

¿Qué pasa si el test tiene menos muestra de la planificada?

Si un test de horizonte fijo queda por debajo de la muestra planificada, normalmente pierde potencia para detectar el efecto objetivo y sus estimaciones quedan más inciertas. La baja potencia, por sí sola, no eleva automáticamente el alpha nominal. El error tipo I sí puede inflarse si se inspeccionan resultados intermedios y se decide detener o continuar en función de ellos sin un método secuencial que contemple esa regla.

Referencias y bibliografía

Términos del glosario