Antes de lanzar un test, necesitas saber cuántas visitas requiere cada variante para que el resultado sea confiable. Ingresa tu tasa de conversión actual, el efecto mínimo que quieras detectar y tu tráfico diario, y obtén la muestra necesaria y la duración estimada del experimento.
Un test A/B sin cálculo previo de muestra es una moneda al aire. Puedes ver una diferencia del 15% entre variantes y estar mirando puro ruido; puedes ver una diferencia del 2% y estar frente a un ganador estadísticamente válido. La única forma de distinguir señal de ruido es partir con una muestra pre-calculada.
El tamaño de muestra depende de tres decisiones: qué tan estricto quieres ser con los falsos positivos (nivel de confianza), qué tan seguro quieres estar de detectar un efecto real (potencia estadística) y qué tan pequeño quiere ser el efecto que buscas detectar (MDE).
Fórmula (por variante)n = 2 × p̄(1−p̄) × ((Zα/2 + Zβ) ÷ Δ)²
Donde p̄ es la conversión promedio esperada entre control y variante, Δ es la diferencia absoluta esperada, Zα/2 = 1,96 para 95% de confianza y Zβ = 0,84 para 80% de potencia. Suena intimidante; la calculadora lo hace por ti.
El punto de partida. La CVR que tienes hoy en la variante de control. Mientras más bajo el baseline, más muestra necesitas para detectar diferencias.
El lift mínimo que quieres poder detectar con seguridad. Si tu MDE es 20% sobre una base de 3%, buscas detectar un movimiento a 3,6% o más. MDEs pequeños son ambiciosos: exigen muestras enormes.
La probabilidad de no cometer un falso positivo. 95% (α = 0,05) es el estándar en marketing. Bajarla a 90% recorta muestra pero eleva riesgo. Subirla a 99% multiplica muestra por 1,7.
La probabilidad de detectar un efecto que sí existe. 80% (β = 0,20) es el mínimo aceptable. Con 70% pierdes 3 de cada 10 ganadores reales por falta de sensibilidad.
| Baseline CVR | MDE 10% | MDE 20% | MDE 30% |
|---|---|---|---|
| 1% | ~118.000 | ~29.500 | ~13.100 |
| 2% | ~58.400 | ~14.600 | ~6.500 |
| 3% | ~38.600 | ~9.650 | ~4.300 |
| 5% | ~22.800 | ~5.700 | ~2.550 |
| 10% | ~10.800 | ~2.700 | ~1.200 |
Valores aproximados con 95% de confianza y 80% de potencia, dos variantes.
Es el error más caro del CRO. Detener antes de alcanzar la muestra pre-calculada eleva la tasa de falsos positivos hasta el 30-40%. Espera. Confía en la matemática.
Cada variante extra suma muestra. Con tráfico limitado, prioriza tests A/B simples (2 variantes) sobre multivariados. El aprendizaje llega antes.
Aunque la muestra se alcance en 3 días, corre el test al menos 7 para capturar variabilidad de días de la semana. Los usuarios del sábado se comportan distinto que los del martes.
Si tu página no genera tráfico para un test estadístico, no significa que no puedas optimizar: significa que debes priorizar cambios grandes de propuesta de valor, no optimizaciones de detalle. Testea reestructuraciones enteras de la landing en lugar de colores de botón. Y en paralelo, invierte en SEO y contenido para crecer la base de tráfico hasta el umbral donde el CRO cuantitativo se vuelve viable.
Para saber cuántas visitas necesitas por variante antes de que el resultado sea estadísticamente válido. Sin este cálculo, corres el riesgo de detener el test antes de tiempo y actuar sobre resultados que en realidad son ruido aleatorio.
Depende del baseline y del efecto que quieras detectar. Con CVR del 3% buscando un lift del 20% necesitas ~9.500 sesiones por variante para 95% de confianza y 80% de potencia. Con baseline menor o efectos más pequeños, la muestra crece rápido.
Es la mejora mínima que quieres poder detectar con seguridad estadística. Un MDE del 20% sobre una CVR base del 3% significa que quieres poder detectar un cambio a 3,6% (o más) con confianza. Mientras menor el MDE, mayor la muestra requerida.
95% de confianza (alpha 0,05): la probabilidad de decir 'la variante ganó' cuando en realidad no ganó es solo 5%. 80% de potencia (beta 0,20): si la variante realmente gana, hay 80% de probabilidad de que el test lo detecte. Es el estándar de la industria.
Sí, pero con matices. Con poco tráfico solo puedes detectar cambios grandes (MDE alto), lo que limita el tipo de test que tiene sentido. La regla práctica: si tu página no genera al menos 10.000 sesiones al mes, prioriza cambios grandes de propuesta de valor antes que optimizaciones de detalle.
No. Detener un test antes de alcanzar la muestra pre-calculada eleva la probabilidad de falsos positivos (llamado 'peeking problem'). El test debe correr hasta que se alcance la muestra objetivo, aunque parezca que ya hay un ganador claro.
Al menos una o dos semanas completas para capturar variabilidad de días de la semana, incluso si se alcanza la muestra antes. Nunca menos de 7 días. Un test que corre 3 días puede estar sesgado por comportamiento distinto de fin de semana o campañas puntuales.
Diseñamos programas SEO de extremo a extremo para marcas que quieren bajar su dependencia del paid, escalar tráfico orgánico predecible y dominar Google y las nuevas superficies de IA.
Estrategia SEO, SEO técnico, contenidos, autoridad y visibilidad en IA (GEO) bajo un mismo equipo senior. SEO conectado a pipeline y revenue, no a vanity metrics.
Equipo embebido en Slack, Notion y Linear. Sprints semanales, roadmap a 12-24 meses y reporting ejecutivo que conecta cada movimiento orgánico con CAC, leads e ingresos.
Crecimiento orgánico compuesto, menor dependencia del paid, share of voice creciente en LLMs y un canal de adquisición que sigue trabajando cuando dejas de pagar por clicks.
Auditoría técnica, de contenidos, de autoridad y de visibilidad en LLMs. Benchmark vs. competencia y oportunidad cuantificada en tráfico y revenue.
Universo de temas priorizado por intención, proyección de tráfico a 12-24 meses y modelo de medición conectado a negocio.
Fixes técnicos, briefs, contenidos, on-page, autoridad y GEO entregados cada semana. Operación embebida con tu equipo, sin entregables que se quedan en un PDF.
KPIs orgánicos atados a pipeline y CAC. Iteración mensual sobre lo que está moviendo el negocio, no sobre lo que sube en Search Console.
Diseñamos programas de experimentación conectados a SEO y contenido: hipótesis, pruebas con muestra suficiente y aprendizajes que se transfieren entre canales.