Experimentos y A/B testing
Un experimento mal armado no da información: da permiso para hacer lo que ya se quería hacer. Lo que separa un experimento de una anécdota son tres cosas que se deciden antes de mirar los datos.
La promesa del A/B testing es tentadora: en vez de discutir qué botón convierte más, se prueban los dos y decide la evidencia. En la práctica, la mayoría de los experimentos que se corren en equipos chicos no pueden decidir nada, y eso se sabía antes de empezar.
No es un problema de herramientas: es que la muestra no alcanza, la métrica se elige después de ver los resultados, o se mira el tablero todos los días hasta que da lo que se esperaba. Las tres se evitan decidiendo tres cosas de antemano.
Las tres decisiones previas
Plantilla
Plan de experimento, antes de encenderlo
La hipótesis
Creemos que mostrar el costo de envío en la primera pantalla reduce el abandono en el checkout, porque hoy la gente se sorprende al final.
Con el porqué. Una hipótesis sin mecanismo no enseña nada aunque gane: no vas a saber qué otra cosa probar después.
La métrica principal, una sola
Porcentaje de sesiones con checkout iniciado que terminan en compra.
Una. Con cinco métricas y un poco de paciencia, alguna siempre da bien por azar.
El efecto mínimo que importa
Un aumento menor a 1 punto no cambiaría ninguna decisión, así que buscamos detectar 1 punto o más.
Define el tamaño de muestra necesario. Sin esto, el experimento no tiene criterio de éxito ni de fracaso.
Cuánto va a durar
Dos semanas completas, calculadas a partir del tráfico y el efecto mínimo, y se mira al final.
Semanas enteras, porque el lunes no se comporta como el sábado. Y se mira al final: espiar y cortar cuando conviene invalida el resultado.
Las métricas de seguridad
Ticket promedio, devoluciones y tiempo de carga. Si cualquiera empeora fuerte, se corta.
Existen para no ganar en lo que medís perdiendo en lo que no medís, que es la forma más común de optimizar hacia el peor resultado.
Antes de seguir, predecí
El problema del tamaño
La pregunta que hunde a la mayoría de los experimentos en productos chicos es simple: ¿alcanza el tráfico? Detectar diferencias chicas requiere muchísimas observaciones, y la relación no es lineal: detectar la mitad del efecto cuesta cuatro veces más muestra.
| Situación | Efecto buscado | Orden de magnitud necesario | Qué hacer |
|---|---|---|---|
| Producto masivo | 1% sobre una conversión del 20% | Decenas de miles por rama | A/B clásico funciona bien |
| Producto mediano | 5% sobre una conversión del 20% | Miles por rama | Sirve, con semanas enteras y paciencia |
| Producto chico | 1% sobre una conversión del 20% | Inalcanzable | No correr el experimento: decidir por criterio y medir después |
| Cambio grande y evidente | Duplicar la conversión | Cientos por rama | Alcanza, y probablemente no haga falta un test |
Cuando el A/B no sirve
La mayoría de las decisiones de producto de un equipo chico no se toman con un A/B, y está bien.
| Alternativa | Cuándo | Qué te da |
|---|---|---|
| Despliegue progresivo | Siempre que el cambio sea riesgoso | Seguridad operativa, no evidencia de valor |
| Antes y después | Poco tráfico, cambio grande | Señal débil: la estacionalidad y otros cambios contaminan |
| Cinco pruebas con usuarios | Problemas de usabilidad | Detecta la mayoría de los problemas graves, sin estadística |
| Preguntar a soporte | Casi siempre, y es gratis | La lista de lo que ya está roto, con frecuencia |
| Hacerlo y observar el uso | Cambios chicos y reversibles | Datos de uso real; alcanza para decidir si se queda |
| No medir | Cuando la decisión no depende del número | Tiempo ahorrado, que también vale |
Lo que preguntan sobre esto
Cierre
Autoevaluación
¿Lo entendiste?
Práctica