A/B Testing básico: cómo diseñar tu primer experimento
Un A/B test mal diseñado produce resultados incorrectos con apariencia de rigor — lo que es peor que no testear. El diseño correcto no es complejo, pero requiere decisiones explícitas antes de comenzar que la mayoría del equipo saltea.

Qué es un A/B test.
Un A/B test compara dos condiciones: el control (por ejemplo, la experiencia actual) y el tratamiento (la alternativa). En el diseño aleatorizado por usuario que desarrolla esta guía, cada usuario elegible se asigna a una condición de forma estable. La aleatorización hace comparables a los grupos en expectativa; no garantiza que todas sus características queden idénticas en una muestra concreta. La diferencia en la métrica principal puede estimar el efecto causal del cambio si la asignación, la medición y el análisis son válidos y no hay interferencias o pérdidas de datos que sesguen la comparación.
Los experimentos aleatorizados ofrecen una base especialmente fuerte para evaluar cambios en productos digitales. La comparación observacional entre usuarios expuestos y no expuestos puede confundir el efecto del cambio con diferencias previas entre ellos. Sin embargo, la aleatorización no es la única vía para estudiar causalidad: otros diseños pueden construir comparaciones defendibles bajo supuestos adicionales. La guía del sistema de experimentación explica cómo elegir el diseño según la pregunta.
02 — Anatomía de un testAnatomía de un test bien diseñado.
En este ejemplo sólo cambió el titular, lo que permite estudiar ese cambio dentro de la configuración probada. El paso de 2,4% a 3,1% equivale a +0,7 puntos porcentuales y a +29,2% relativo: (3,1 − 2,4) / 2,4 × 100. Con 12.000 usuarios independientes por grupo y una respuesta binaria por usuario, un test z bilateral de dos proporciones da p ≈ 0,0009; el intervalo de confianza del 95% para la diferencia, mediante aproximación normal no agrupada, es aproximadamente de +0,29 a +1,11 puntos porcentuales. Estos cálculos no sustituyen la revisión de validez ni la decisión económica. Si B cambiara también el formulario, un A/B bien diseñado podría estimar el efecto del paquete completo, pero no separar cuánto aportó cada componente.
03 — Los 6 pasos previosLos 6 pasos antes de correr el test.
Un A/B test mal diseñado produce resultados que no pueden interpretarse correctamente — y los errores de diseño no se corrigen después de que el test comenzó. Estos seis pasos deben completarse antes de que cualquier usuario vea la variante.
Paso 1: definir la métrica primaria
Para un primer test, conviene elegir una métrica primaria conectada con la decisión de negocio y definir de antemano cómo se calculará y cuándo habrá madurado. No necesita estar disponible en tiempo real: ventas, retención o devoluciones pueden requerir seguimiento. Si se usan varias métricas primarias, hay que prever la regla de decisión y el tratamiento de comparaciones múltiples. Para una landing page B2B, la tasa de conversión a lead puede ser una métrica primaria útil, siempre que la calidad del lead y sus consecuencias comerciales también se evalúen.
Paso 2: definir las métricas de guardrail
Las métricas que no deben deteriorarse aunque la métrica primaria mejore. Si el test busca aumentar la tasa de conversión de trials pero el equipo de ventas reporta que la calidad de los leads cae (más conversiones, menos revenue), el experimento necesita una métrica de guardrail de calidad de lead. Los guardrails protegen contra optimizaciones locales que deterioran el sistema global.
Paso 3: calcular el tamaño de muestra
En un diseño de horizonte fijo, calculá cuántas unidades necesitás por variante y en total. El cálculo depende de la métrica y su variabilidad (para una tasa, de su baseline), el efecto que querés detectar, el nivel de significancia α, el poder, la proporción de asignación y el método de análisis. El MDE describe la sensibilidad planificada; conviene elegirla en relación con el efecto mínimo que sería relevante para la decisión. La guía de tamaño de muestra desarrolla este cálculo.
Paso 4: definir la duración
Para estimar el tiempo de reclutamiento, dividí la muestra requerida por variante por los nuevos usuarios elegibles diarios que recibe esa variante. Si necesitás 10.000 usuarios en A y 10.000 en B, recibís 1.000 nuevos usuarios únicos por día, el 50% es elegible y asignás 50/50, entran 500 usuarios diarios al experimento y 250 a cada variante. Necesitás aproximadamente 40 días de reclutamiento: 10.000 / 250 = 40, o 20.000 / 500 = 40. La planificación debe contemplar además el seguimiento de conversiones, los ciclos relevantes y las posibles pérdidas; las visitas repetidas no cuentan como nuevos usuarios independientes.
Paso 5: verificar la implementación antes de lanzar
Antes de abrir el test, verificá elegibilidad, asignación estable y el tracking de ambas condiciones. Durante el piloto y la ejecución, comprobá la proporción observada frente a la asignación planificada, que puede ser 50/50 u otra. Un Sample Ratio Mismatch (SRM) es una discrepancia estadísticamente incompatible con esa proporción, no cualquier diferencia entre conteos. Es una señal de un posible problema de asignación, ejecución, procesamiento o análisis: hay que diagnosticarlo y resolverlo antes de confiar en los resultados.
Paso 6: documentar la hipótesis antes de ver resultados
Escribí la pregunta, la observación que la motiva, el mecanismo propuesto, la predicción y los criterios de análisis y decisión antes de observar los resultados. Si una incidencia obliga a cambiar el plan, documentá qué cambió, cuándo y cómo afecta la inferencia; no presentes decisiones tomadas después de ver los datos como si hubieran sido preespecificadas.
04 — La hipótesis correctaCómo formular la hipótesis correcta.
Una hipótesis explícita ayuda a convertir el test en aprendizaje. Puede conectar la observación que lo motiva, un mecanismo propuesto y una predicción sobre una métrica. El mecanismo orienta el diseño, pero el test del resultado no lo demuestra automáticamente. También son válidas preguntas comparativas o exploratorias, siempre que se distingan de una prueba confirmatoria.
El formato estándar
"Observamos que [dato de comportamiento]. Creemos que esto ocurre porque [mecanismo causal]. Si [cambio específico], esperamos que [métrica] cambie en [dirección] por al menos [magnitud]."
Pregunta todavía incompleta: "¿Un titular diferente mejora la conversión?". Para diseñar el test faltan la población, la comparación, la definición de conversión, el horizonte y la magnitud relevante. Puede responderse qué alternativa rindió mejor sin conocer todavía el mecanismo que explica la diferencia.
Ejemplo ilustrativo de hipótesis: "Observamos que el 68% de quienes llegan desde LinkedIn ocupan cargos de gerencia o dirección. Creemos que un mensaje orientado a velocidad puede resultarles más relevante. Si reemplazamos el titular actual por uno centrado en cerrar proyectos, esperamos aumentar al menos un 15% relativo la tasa de conversión a trial de usuarios elegibles de ese segmento durante la ventana definida". Un resultado favorable apoyaría el efecto del mensaje en ese contexto; no demostraría por sí solo el mecanismo ni su generalización. Un resultado no significativo tampoco demostraría que la velocidad no importa: habría que leer el tamaño del efecto y su incertidumbre.
Una pregunta explícita, un diseño válido y una regla de análisis definida ayudan a producir evidencia útil. Documentar qué se sabía antes de observar los datos permite distinguir lo confirmado de lo exploratorio.
Síntesis editorialDuración y tamaño de muestra: las dos variables más ignoradas.
En pruebas frecuentistas de horizonte fijo, detenerse porque una mirada intermedia produjo significancia puede elevar el error tipo I por encima del α previsto. La magnitud depende de la regla de parada, la frecuencia de análisis y el método; no existe una tasa universal de falsos positivos del peeking. Esto es distinto de terminar anticipadamente por una incidencia operativa independiente del resultado. Si necesitás decisiones intermedias, elegí desde el diseño un procedimiento secuencial que contemple ese monitoreo.
Efecto mínimo detectable (MDE) y relevancia práctica
El MDE es la magnitud de efecto para la que el diseño alcanza un poder especificado, dados el tamaño de muestra, la variabilidad, α y el método. Puede expresarse en unidades absolutas o relativas. El efecto mínimo relevante es un criterio de decisión que considera beneficios, costos y riesgos. Conviene planificar sensibilidad suficiente para esa magnitud; si el tráfico no alcanza, explicitá la limitación. Con 80% de poder para un efecto determinado, todavía habría alrededor de 20% de resultados no significativos si ese efecto fuera el verdadero y se cumplieran los supuestos.
Detectar efectos más pequeños suele requerir muestras mayores. Bajo una aproximación de varianza constante, con el mismo baseline, α, poder, asignación y método, la muestra crece aproximadamente con el inverso del efecto al cuadrado: pasar de detectar 20% relativo a 5% relativo puede requerir cerca de 16 veces más usuarios. Es una aproximación de planificación, no una regla exacta para toda métrica o diseño. El cálculo del tamaño de muestra debe usar los supuestos del test concreto.
Duración: muestra, ciclos y maduración de la respuesta
Si el comportamiento cambia entre días laborables y fines de semana, cubrir ciclos semanales completos puede mejorar la representatividad temporal. Otros casos requieren observar ciclos de compra, retención o estacionalidad más largos. La duración debe planificarse junto con la muestra, la ventana de respuesta y la regla de análisis; alcanzar tráfico suficiente en dos días no garantiza que ya se haya observado el efecto relevante. Tampoco hay un mínimo de siete días aplicable a cualquier experimento.
06 — ConexionesCómo conecta el A/B testing con el sistema de marketing.
Crecimiento y CRO
El A/B testing es una herramienta del CRO para evaluar cambios cuando la decisión, el tráfico, el costo y el riesgo justifican un experimento. La adquisición paga puede estudiar mensajes y ofertas con asignación controlada. En SEO y contenido, evaluar títulos o estructuras requiere un diseño apropiado para páginas, indexación y resultados de búsqueda; un A/B por usuario en el sitio no estima por sí solo el efecto sobre el CTR orgánico.
Oferta y producto
El pricing es uno de los territorios donde el A/B testing produce mayor impacto económico — y donde mayor resistencia cultural existe para testear. Mostrar distintos precios a distintos segmentos, testear la estructura de planes, evaluar el impacto de períodos de trial más largos — son todas hipótesis que el A/B test puede responder antes de comprometer el modelo de negocio. La propuesta de valor se itera con tests de mensaje — qué ángulo conecta mejor con qué segmento en qué canal. El onboarding se optimiza con tests de secuencia y contenido que identifican el camino de activación con menor abandono y mayor retención a 30 días.
Rendimiento
El A/B testing puede informar decisiones de unit economics, pero mejorar conversión no garantiza reducir CAC ni mejorar retención garantiza aumentar LTV: también importan costos, margen y valor de los clientes. Los reportes deberían registrar resultados y aprendizajes. Un holdout bien diseñado puede estimar incrementalidad de una intervención y ayudar a contrastar decisiones apoyadas en atribución; no convierte automáticamente todo crédito atribuido en efecto causal.
Estrategia, marca, mercado y fidelización
El diagnóstico estratégico mejora cuando el equipo tiene evidencia experimental sobre qué funciona — no solo datos correlacionales. La identidad verbal de la marca — tono, terminología, argumentos — puede informarse con tests de copy que revelan qué lenguaje resuena con distintos segmentos. La investigación de mercado genera hipótesis que los tests cuantitativos validan a escala. El lifecycle marketing itera con tests de cadencia, contenido y canal de las comunicaciones post-conversión.
07 — Errores frecuentesErrores frecuentes en A/B testing.
Atribuir a una pieza el efecto de un paquete
Si B cambia titular, CTA e imagen a la vez, el A/B puede estimar el efecto conjunto de esa alternativa frente a A. Lo que no permite es separar la contribución individual de cada cambio ni sus interacciones. Si esa descomposición es necesaria para decidir, usá comparaciones adicionales o un diseño factorial que permita identificarlas.
Detenerse por un resultado favorable sin una regla compatible
Observar la salud técnica del test no invalida la inferencia. El problema aparece cuando se aplican p-values de horizonte fijo a decisiones repetidas de parada no contempladas. Los métodos secuenciales permiten análisis intermedios bajo sus propias reglas. Confirmá qué procedimiento usa la herramienta y documentá el monitoreo; la guía de significancia estadística desarrolla esta diferencia.
No verificar el SRM antes de analizar
Con una asignación planificada 50/50, observar 12.800 usuarios en A y 11.200 en B sobre 24.000 exige investigar: la discrepancia es muy difícil de explicar por el azar bajo ese reparto. Compará siempre los conteos con la proporción configurada mediante una prueba de SRM. Investigá asignación, exposición, filtros y pérdidas de datos antes de interpretar la métrica principal; el test de SRM señala el síntoma, no identifica por sí solo su causa.
No documentar los resultados negativos
Documentá también resultados desfavorables y no significativos para evitar un repositorio que sólo conserve ganadores. Su utilidad depende de la validez y la precisión: un intervalo estrecho puede descartar efectos relevantes, mientras uno amplio puede dejar la decisión abierta. Separá el resultado observado de las explicaciones propuestas y de las hipótesis que aún necesitan otra prueba.
Cuándo el A/B test es suficiente — y cuándo no.
El A/B test es suficiente cuando…
La decisión compara dos alternativas bien definidas. Pueden diferir en un titular, una oferta o un paquete completo. Un A/B responde cuál de esas alternativas produce mejores resultados para la población y el horizonte estudiados, siempre que la unidad, la asignación y el análisis sean adecuados.
No necesitás descomponer el efecto de los componentes. Una comparación A/B puede evaluar un paquete incluso si sus piezas interactúan. El resultado corresponde a la configuración probada; la ausencia supuesta de interacciones no garantiza generalización a otras páginas, audiencias o períodos.
El A/B test es insuficiente cuando…
La pregunta exige separar componentes o interacciones. Comparar sólo dos paquetes no identifica cuánto aporta cada pieza. Un diseño factorial u otras comparaciones planificadas pueden responder esa pregunta; la muestra dependerá de los efectos e interacciones que se busque estimar.
La precisión necesaria no es viable con el tráfico disponible. Un segmento pequeño puede requerir demasiado tiempo. Antes de lanzar, evaluá si se puede mejorar la medición, elegir otra unidad o ampliar legítimamente la población. Trasladar resultados de páginas de mayor tráfico exige justificar la comparabilidad; no resuelve automáticamente la falta de evidencia para el segmento original.
09 — Preguntas frecuentesPreguntas frecuentes sobre A/B testing básico.
¿Cuánto tiempo debe durar un A/B test?
Depende de la muestra, el ritmo de incorporación de nuevos usuarios elegibles, la asignación, la maduración de la respuesta y los ciclos relevantes. En horizonte fijo, definí antes la muestra y la regla de análisis. Si necesitás decisiones intermedias, usá un procedimiento compatible. No hay una duración universal ni cualquier cierre anticipado implica por sí solo inflación de falsos positivos.
¿Qué pasa si el test no muestra significancia estadística?
No permite concluir automáticamente que el efecto sea cero, menor al MDE o irrelevante. Revisá la estimación y su intervalo: un resultado preciso puede descartar magnitudes relevantes, mientras uno impreciso puede ser inconcluso. El poder es una propiedad del diseño para un efecto específico; incluso un test con 80% de poder puede no detectar ese efecto. Para demostrar equivalencia o no inferioridad, definí márgenes y un análisis adecuado.
¿Se puede hacer A/B testing sin una herramienta dedicada?
Sí, si podés implementar y verificar la asignación, mantener una experiencia estable, medir correctamente y analizar según el diseño. Un hash adecuado del identificador del usuario y del experimento puede producir una asignación reproducible. Repartir por pares e impares de un identificador sin validar cómo se genera puede introducir sesgos; ser determinista no vuelve inválida por sí sola a una asignación. Las redirecciones y los filtros también deben comprobarse para evitar contaminación y pérdidas diferenciales.
Referencias y bibliografía.
Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press. Cap. 3–5.
Kohavi, R. et al. (2014). Seven Rules of Thumb for Web Site Experimenters. KDD 2014.
American Statistical Association (2016). Statement on Statistical Significance and P-Values. Interpretación de resultados y límites de los umbrales.
Johari, R., Pekelis, L. & Walsh, D. J. (2015). Always Valid Inference: Bringing Sequential Analysis to A/B Testing. Monitoreo y reglas de parada.
Microsoft Experimentation Platform (2020). Diagnosing Sample Ratio Mismatch in A/B Testing.
Kohavi, R., Longbotham, R., Sommerfield, D. & Henne, R. M. (2009). Controlled experiments on the web: survey and practical guide. Data Mining and Knowledge Discovery, 18, 140–181.
NIST/SEMATECH. How do you select an experimental design?
Fisher, R. A. (1935). The Design of Experiments. Oliver & Boyd.
Ries, E. (2011). The Lean Startup. Crown Business. Cap. 7.
Croll, A. & Yoskovitz, B. (2013). Lean Analytics. O'Reilly. Cap. 5.
Términos del glosario