El mes pasado matamos un experimento que había "ganado" con 99% de confianza. Tres semanas después de implementarlo, el revenue cayó 12%. Así aprendimos que significancia estadística y éxito de negocio son cosas completamente distintas.
Según Optimizely, solo el 12% de los experimentos ganan. El 88% restante no son fracasos—son datos. El problema es que la mayoría de equipos no sabe cómo extraer ese valor porque están obsesionados con la métrica equivocada.
Tabla de contenido
- Los 5 criterios que definen un experimento exitoso
- Significancia estadística: el mínimo que debes entender
- Las métricas que importan y las que son puro ruido
- Cuándo matar un experimento vs. cuándo escalarlo
- Los errores que arruinan la medición de experimentos
- Preguntas frecuentes
Los 5 criterios que definen un experimento exitoso
Un experimento no gana porque la variante B superó a la variante A. Gana cuando responde una pregunta específica, genera conocimiento accionable, se ejecuta con rigor, y conecta con métricas de negocio. Sin estos cuatro elementos, tienes datos. No tienes un experimento.
1. Hipótesis bien formulada
Antes de preguntar si el experimento ganó, pregunta si tenías una hipótesis clara. La estructura es simple:
"Si [hacemos este cambio], entonces [esta métrica] [aumentará/disminuirá] en [X%] porque [razón basada en data]"
Ejemplo concreto: "Si agregamos social proof en la página de pricing, la conversión de trial a paid aumentará 15% porque nuestras encuestas de abandono muestran que el 43% de los usuarios dudan de la credibilidad de herramientas nuevas."
Sin hipótesis clara, cualquier resultado es interpretable de docenas de formas distintas. Y vas a interpretar la que más te convenga.
2. Métrica de éxito única y definida
Según First Venture, tener una sola métrica de éxito es lo que determina si el experimento ganó o perdió. Puedes monitorear métricas secundarias, pero solo una define el veredicto.
"Queremos aumentar signups Y mejorar retention Y reducir churn" no es un experimento. Es una lista de deseos.
3. Tamaño de muestra suficiente
No puedes declarar un ganador con 200 visitantes y 3 conversiones. El calculador de Evan Miller es el estándar de la industria.
Las variables que importan:
- Tasa de conversión base — Convertir al 2% requiere más muestra que convertir al 20%
- Efecto mínimo detectable (MDE) — Detectar cambios del 2% requiere muestras enormes
- Nivel de confianza — El estándar es 95%, algunos equipos usan 90% para mayor velocidad
- Poder estadístico — Típicamente 80%
Referencia rápida basada en cálculos estándar de AB testing con 95% confianza y 80% poder:
| Tasa Base | MDE 10% | MDE 20% | MDE 50% |
|---|---|---|---|
| 2% | ~15,000/variante | ~4,000/variante | ~700/variante |
| 5% | ~6,000/variante | ~1,600/variante | ~300/variante |
| 10% | ~3,000/variante | ~800/variante | ~150/variante |
4. Duración adecuada del test
No solo importa el volumen. Importa el tiempo. Efectos de novelty, variaciones por día de la semana, comportamiento de usuarios recurrentes—todo esto necesita tiempo para manifestarse.
Un experimento debería correr mínimo 2 semanas completas, idealmente 4. Cortarlo antes porque "ya tenemos significancia" genera más falsos positivos de los que puedes justificar en tu próxima board meeting.
5. Documentación del aprendizaje
Según Artisan Growth Strategies, sin documentación adecuada, los equipos terminan repitiendo experimentos fallidos y perdiendo insights cuando cambia el equipo.
La documentación debe incluir: hipótesis original, configuración del test, resultados cuantitativos, insights cualitativos, y próximos pasos.
Significancia estadística: el mínimo que debes entender
No necesitas un PhD en estadística. Necesitas entender tres conceptos para no tomar decisiones ridículas.
Todo lo que publico aquí es gratis. Implementarlo contigo tiene precio.
Si algo de lo que leíste te hizo pensar "esto me está pasando", hablemos. Te respondo el mismo día.
Agendar 30 min →Qué es significancia estadística
Es la probabilidad de que el resultado que observas NO sea producto del azar. El estándar de la industria es p < 0.05: menos del 5% de probabilidad de que la diferencia sea casualidad.
La trampa: significancia práctica vs. estadística
Puedes tener un resultado estadísticamente significativo que es completamente inútil para el negocio:
- Test con 500,000 usuarios
- Variante B aumenta conversión de 2.00% a 2.02%
- p-value = 0.01 (muy significativo estadísticamente)
- Impacto real: 100 conversiones extra al mes
Según CXL, los experimentos de growth verdaderos deberían tener el potencial de mover métricas clave al menos 20% si son exitosos. Si estás celebrando un 0.02%, estás optimizando centavos mientras ignoras dólares.
Las métricas que importan y las que son puro ruido
Métricas que SÍ miden éxito real
North Star Metric (NSM): La métrica que captura el valor entregado al cliente y predice revenue.
- Slack: Mensajes enviados por equipo semanalmente
- Airbnb: Noches reservadas
- Spotify: Horas de escucha
Métricas del framework AARRR:
- Acquisition: CAC, conversión de landing
- Activation: Tiempo al primer valor, onboarding completado
- Retention: D1/D7/D30 retention, churn rate
- Revenue: ARPU, LTV, conversión free-to-paid
- Referral: K-factor, tasa de referidos
Métricas que son puro ruido
Tus 50,000 seguidores de LinkedIn no pagan tu nómina. Tus 50 clientes sí.
- Pageviews sin contexto — ¿Y qué hicieron después?
- Seguidores en redes — ¿Cuántos compran?
- Tiempo en sitio aislado — Puede significar que están confundidos
- Bounce rate sin segmentar — Un blog post puede tener 80% de bounce y estar funcionando perfecto
From Doppler advierte que uno de los errores más comunes es confundir métricas con KPIs. No todo dato es accionable.
Cuándo matar un experimento vs. cuándo escalarlo
Esta es la decisión más difícil en experimentación. Equipos con budgets de 6 cifras la toman mal constantemente.
Señales para ESCALAR
- Significancia estadística alcanzada (p < 0.05)
- Efecto práctico relevante—el lift justifica el costo de implementación
- Métricas guardrail intactas—no rompiste nada mientras mejoraste algo
- Consistencia en segmentos—el efecto no viene de un único segmento raro
- Sostenibilidad—no es efecto de novelty que desaparecerá
Señales para MATAR
- Resultados negativos significativos—está dañando métricas
- Sin efecto después de muestra suficiente—el experimento corrió su curso
- Costo de oportunidad alto—recursos que deberían ir a experimentos de mayor impacto
- Complejidad insostenible—aunque gane, implementarlo es un dolor de cabeza permanente
Los "perdedores valiosos"
Según Speero, en promedio solo 1 de cada 5 experimentos alcanza significancia estadística. Pero un experimento "perdedor" es valioso si te ahorró meses de desarrollo en algo que no iba a funcionar, reveló un insight sobre comportamiento del usuario, o invalidó una hipótesis que estaba guiando otras decisiones.
El peor experimento es el que no enseña nada. Usualmente porque estaba mal diseñado desde el inicio.
Los errores que arruinan la medición de experimentos
Ordenados por cuánto dinero te cuestan. El primero destruye experimentos enteros. El último es molesto pero sobrevivible.
Error 1: Peeking
Cada vez que miras los resultados antes de tiempo y tomas una decisión, aumentas dramáticamente la tasa de falsos positivos. Si planificaste correr un test 2 semanas, corre 2 semanas.
Si absolutamente necesitas monitorear, usa sequential testing con alpha spending functions que ajustan los umbrales de significancia.
Error 2: Muestra insuficiente
"Ya tenemos 500 usuarios y B está ganando por 30%."
No. Con muestras pequeñas, la varianza es enorme. Ese 30% podría ser -15% la próxima semana. Según AB Tasty, mientras menor el efecto esperado, mayor la muestra requerida.
Error 3: Múltiples comparaciones sin corrección
Si testeas 5 variantes contra un control, tienes 5 oportunidades de obtener un falso positivo. La probabilidad de al menos un falso positivo es 1 - (0.95)^5 = 23%.
Usa correcciones como Bonferroni cuando testeas múltiples variantes.
Error 4: Optimizar la métrica equivocada
Puedes duplicar los signups mientras destruyes la retención. Siempre define:
- Métrica primaria: Lo que quieres mejorar
- Métricas guardrail: Lo que NO puede empeorar
Error 5: No documentar
Cuando el equipo cambia—y siempre cambia—los aprendizajes se pierden. Cada experimento necesita un documento con hipótesis, configuración, resultados, insights y decisión tomada.
Win rate: expectativas realistas
Según Statsig, los programas de experimentación maduros ven win rates entre 15-25%. Debajo del 10%, probablemente estás testeando ideas aleatorias. Arriba del 30%, estás jugando muy seguro con tests obvios.
Ladder.io reporta 43% de win rate comparado con el promedio de 10-15%. La diferencia: priorización rigurosa e hipótesis basadas en data.
La mentalidad correcta: no optimices el win rate. Optimiza la velocidad de aprendizaje. Un equipo que completa 20 experimentos al mes con 15% de win rate aprende más que uno que completa 5 con 30%.
Preguntas frecuentes
¿Cuánto tiempo debe correr un experimento A/B?
Mínimo 2 semanas completas. Idealmente 3-4. Nunca cortes antes del tamaño de muestra calculado.
¿Qué hago si no tengo suficiente tráfico?
Acepta detectar solo cambios grandes, usa tests secuenciales, o cambia a metodología cualitativa.
¿Cómo sé si mi resultado es un falso positivo?
No puedes saberlo con certeza. Por eso calculas tamaño de muestra antes, no haces peeking, y validas con un holdout group después.
¿Cuántos experimentos puedo correr simultáneamente?
Depende de tu tráfico y de que no interfieran entre sí. Regla general: múltiples experimentos funcionan si están en diferentes partes del funnel o afectan diferentes segmentos.
Tu próximo experimento debería tener una hipótesis escrita antes de que toques una línea de código. Si no la tienes, no corras el test.
© 2026 Andres Ospina
