Atlasingeniería

Producto y metodologías ágilesSemi-SeniorTema 4Semi-Senior

Experimentos y A/B testing

Un experimento mal armado no da información: da permiso para hacer lo que ya se quería hacer. Lo que separa un experimento de una anécdota son tres cosas que se deciden antes de mirar los datos.

La promesa del A/B testing es tentadora: en vez de discutir qué botón convierte más, se prueban los dos y decide la evidencia. En la práctica, la mayoría de los experimentos que se corren en equipos chicos no pueden decidir nada, y eso se sabía antes de empezar.

No es un problema de herramientas: es que la muestra no alcanza, la métrica se elige después de ver los resultados, o se mira el tablero todos los días hasta que da lo que se esperaba. Las tres se evitan decidiendo tres cosas de antemano.

Las tres decisiones previas

Plantilla

Plan de experimento, antes de encenderlo

La hipótesis

Creemos que mostrar el costo de envío en la primera pantalla reduce el abandono en el checkout, porque hoy la gente se sorprende al final.

Con el porqué. Una hipótesis sin mecanismo no enseña nada aunque gane: no vas a saber qué otra cosa probar después.

La métrica principal, una sola

Porcentaje de sesiones con checkout iniciado que terminan en compra.

Una. Con cinco métricas y un poco de paciencia, alguna siempre da bien por azar.

El efecto mínimo que importa

Un aumento menor a 1 punto no cambiaría ninguna decisión, así que buscamos detectar 1 punto o más.

Define el tamaño de muestra necesario. Sin esto, el experimento no tiene criterio de éxito ni de fracaso.

Cuánto va a durar

Dos semanas completas, calculadas a partir del tráfico y el efecto mínimo, y se mira al final.

Semanas enteras, porque el lunes no se comporta como el sábado. Y se mira al final: espiar y cortar cuando conviene invalida el resultado.

Las métricas de seguridad

Ticket promedio, devoluciones y tiempo de carga. Si cualquiera empeora fuerte, se corta.

Existen para no ganar en lo que medís perdiendo en lo que no medís, que es la forma más común de optimizar hacia el peor resultado.

Los cinco renglones se escriben antes de encender el experimento y no se tocan después. Eso es casi todo el rigor que necesita un equipo de producto.

Antes de seguir, predecí

Un experimento da p menor a 0,05 después de mirar el resultado veinte veces durante la corrida. ¿Qué tan confiable es?

El problema del tamaño

La pregunta que hunde a la mayoría de los experimentos en productos chicos es simple: ¿alcanza el tráfico? Detectar diferencias chicas requiere muchísimas observaciones, y la relación no es lineal: detectar la mitad del efecto cuesta cuatro veces más muestra.

SituaciónEfecto buscadoOrden de magnitud necesarioQué hacer
Producto masivo1% sobre una conversión del 20%Decenas de miles por ramaA/B clásico funciona bien
Producto mediano5% sobre una conversión del 20%Miles por ramaSirve, con semanas enteras y paciencia
Producto chico1% sobre una conversión del 20%InalcanzableNo correr el experimento: decidir por criterio y medir después
Cambio grande y evidenteDuplicar la conversiónCientos por ramaAlcanza, y probablemente no haga falta un test
La tercera fila es la más importante: reconocer que un experimento no puede concluir es una decisión profesional, no una derrota. Lo que no se puede es correrlo igual y hacer como si el resultado significara algo.

Cuando el A/B no sirve

La mayoría de las decisiones de producto de un equipo chico no se toman con un A/B, y está bien.

AlternativaCuándoQué te da
Despliegue progresivoSiempre que el cambio sea riesgosoSeguridad operativa, no evidencia de valor
Antes y despuésPoco tráfico, cambio grandeSeñal débil: la estacionalidad y otros cambios contaminan
Cinco pruebas con usuariosProblemas de usabilidadDetecta la mayoría de los problemas graves, sin estadística
Preguntar a soporteCasi siempre, y es gratisLa lista de lo que ya está roto, con frecuencia
Hacerlo y observar el usoCambios chicos y reversiblesDatos de uso real; alcanza para decidir si se queda
No medirCuando la decisión no depende del númeroTiempo ahorrado, que también vale
Cinco pruebas de usabilidad detectan la mayor parte de los problemas de uso y no necesitan ningún tamaño de muestra. Para problemas de comprensión, son mucho mejores que un A/B.

Lo que preguntan sobre esto

Cierre

Autoevaluación

¿Lo entendiste?

¿Por qué se define una sola métrica principal?
¿Qué efecto tiene querer detectar la mitad del efecto?
¿Qué es «espiar y cortar»?
¿Cuándo se termina un experimento?