Estadística

Meta-análisis de Tests A/B: lee el programa entero

Meta-análisis de tests A/B: juntar 12 experimentos en una sola estimación, medir heterogeneidad con I cuadrado y corregir la exageración de 1,34 veces.

Ilustración plana de una columna de doce barras horizontales verdes apiladas una sobre otra, con un rombo ancho centrado justo debajo de ellas

Un programa de experimentación no es una lista de veredictos independientes, es una muestra de efectos, y tiene un promedio que ningún test aislado ve. En el ejemplo de este artículo, 12 tests con solo 2 ganadores declarados devuelven, agrupados, una ganancia media de 0,1483 puntos porcentuales con valor p de 0,009037. Aquí mostramos cómo hacer el meta-análisis de esos experimentos con el método de varianza inversa, cómo medir si están midiendo lo mismo, por qué la elección entre efecto fijo y efecto aleatorio cambia el veredicto del programa, y cuánto exagera el promedio de los ganadores (1,34 veces, medido en 5 mil programas simulados). Forma parte de nuestra guía completa de test A/B y complementa la maldición del ganador.

La pregunta que ningún test responde solo

Todo el que hace experimentación llega, tarde o temprano, a la reunión en la que alguien pregunta cuánto entregó el programa en el trimestre. La respuesta estándar es sumar las ganancias de los tests que ganaron, y es errónea por dos motivos independientes, que este artículo trata por separado: los tests que no ganaron también cargan información, y los que ganaron cargan exageración.

La herramienta correcta para esa pregunta es vieja y viene de la investigación clínica: meta-análisis. El Manual Cochrane define el método genérico de varianza inversa en una línea de álgebra: la estimación combinada es el promedio de las estimaciones individuales ponderado por el inverso del cuadrado del error estándar de cada una. Los datos necesarios, escriben los autores, son solamente una estimación del efecto y su error estándar, por estudio.

Fíjate en lo que eso significa para la experimentación online: ya tienes los dos números de todo test que ejecutaste, incluidos los que quedaron inconclusos. Nada necesita instrumentarse de nuevo.

Y existe un motivo estructural por el que la lectura del programa importa más aquí que en otros campos. Kohavi, Deng, Longbotham y Xu escriben que en sitios como Bing, donde miles de experimentos corren por año, la mayoría fracasa, y los que funcionan mejoran las métricas clave entre 0,1 y 1,0 por ciento una vez diluidos en el impacto general. El cambio pequeño con impacto enorme existe, pero los autores lo estiman en el orden de uno en 500 experimentos. Cuando el efecto típico es de ese orden, el test aislado casi nunca tiene poder para verlo, y el conjunto sí.

El programa de ejemplo

Simulamos un trimestre entero con semilla fija. Doce tests, cada uno con 25 mil visitantes por brazo y tasa de conversión base de 5 por ciento. Los efectos verdaderos de cada test fueron sorteados de una distribución normal con media de 0,10 puntos porcentuales y desviación de 0,30, es decir, un programa en el que el cambio típico es levemente positivo pero muchos cambios empeoran las cosas.

# Conv. A Conv. B Tasa A Tasa B Diferencia EE z valor p Veredicto Efecto real
1 1.240 1.278 4,960% 5,112% 0,1520 pp 0,1956 0,7771 0,437100 inconcluso 0,4718 pp
2 1.239 1.241 4,956% 4,964% 0,0080 pp 0,1942 0,0412 0,967140 inconcluso -0,1842 pp
3 1.264 1.304 5,056% 5,216% 0,1600 pp 0,1974 0,8104 0,417697 inconcluso -0,0011 pp
4 1.240 1.435 4,960% 5,740% 0,7800 pp 0,2012 3,8754 0,000107 gana 0,5993 pp
5 1.301 1.202 5,204% 4,808% -0,3960 pp 0,1950 -2,0303 0,042328 pierde -0,2265 pp
6 1.253 1.320 5,012% 5,280% 0,2680 pp 0,1976 1,3562 0,175032 inconcluso 0,1589 pp
7 1.290 1.295 5,160% 5,180% 0,0200 pp 0,1980 0,1010 0,919560 inconcluso 0,0641 pp
8 1.255 1.323 5,020% 5,292% 0,2720 pp 0,1978 1,3752 0,169073 inconcluso 0,1112 pp
9 1.281 1.184 5,124% 4,736% -0,3880 pp 0,1936 -2,0037 0,045098 pierde -0,2213 pp
10 1.229 1.215 4,916% 4,860% -0,0560 pp 0,1929 -0,2904 0,771529 inconcluso -0,3515 pp
11 1.256 1.351 5,024% 5,404% 0,3800 pp 0,1988 1,9111 0,055993 inconcluso 0,0753 pp
12 1.225 1.391 4,900% 5,564% 0,6640 pp 0,1991 3,3339 0,000856 gana 0,5136 pp

La última columna es el lujo que solo la simulación permite: el efecto verdadero de cada test, que en la vida real nadie ve. Es lo que nos va a permitir medir, al final del artículo, quién tenía razón y quién estaba exagerando.

Pega la fila 4 en la calculadora de abajo (25.000 y 1.240 contra 25.000 y 1.435) y devuelve z de 3,8754, valor p de 0,000107, ganancia relativa de 15,73 por ciento e intervalo de 0,3856 a 1,1744 puntos porcentuales. Toda la tabla anterior sale de la misma matemática.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Leyendo test por test, el trimestre parece tibio: dos ganadores, dos perdedores, ocho nadas. Un informe honesto diría que 2 de 12 funcionaron, lo que por cierto coincide con las tasas de victoria publicadas por la industria.

Juntando los doce: el modelo de efecto fijo

La agrupación de varianza inversa pesa cada test por el inverso de su varianza. Como los 12 tienen casi el mismo tamaño, los pesos quedan casi iguales (de 7,96 a 8,67 por ciento cada uno). El resultado:

Efecto combinado de 0,1483 puntos porcentuales, error estándar de 0,0568, z de 2,6107, valor p de 0,009037, intervalo de confianza de 0,0370 a 0,2596 puntos porcentuales.

Sobre una base de 5 por ciento, eso es una ganancia relativa media de 2,965 por ciento por cambio lanzado. El error estándar combinado es 3,46 veces menor que el de un test aislado, que es exactamente la raíz de 12, como se esperaba.

Gráfico de bosque de los 12 tests y del efecto combinadoDoce líneas horizontales apiladas, una por test, cada una con un cuadrado en el centro marcando la diferencia observada y barras para los límites del intervalo de confianza del 95 por ciento. Una línea vertical discontinua marca el cero. Nueve de los doce intervalos cruzan el cero. El test 4 y el test 12 quedan enteramente a la derecha del cero, el test 5 y el test 9 enteramente a la izquierda. Debajo de todos, un rombo estrecho centrado en 0,1483 puntos porcentuales representa el efecto combinado por varianza inversa, y no toca el cero.-0,800,81,6diferencia en puntos porcentualestest 1test 2test 3test 4test 5test 6test 7test 8test 9test 10test 11test 12combinado0,1483 pp
Nueve de los doce intervalos cruzan el cero. El rombo combinado, con el error estándar 3,46 veces menor, no lo cruza: el programa movió la aguja incluso con la mayoría de los tests callada.

Cuidado con la lectura equivocada más tentadora de ese resultado. La agrupación NO dice que el test 6 en realidad ganó, ni autoriza lanzar los ocho cambios inconclusos. Estima el promedio de un conjunto. Es la diferencia entre “este cambio específico funciona” y “los cambios de este tipo, en promedio, funcionan”, y solo la segunda fue respondida.

¿Están midiendo lo mismo?

El modelo de efecto fijo carga una suposición fuerte, y el Manual Cochrane la enuncia sin medias tintas: para calcular el intervalo de confianza de un meta-análisis de efecto fijo, se asume que el efecto verdadero de la intervención es el mismo valor en cada estudio, lo que implica que las diferencias observadas entre los resultados provienen exclusivamente del azar.

En experimentación de producto esa suposición es casi siempre falsa por construcción. Los 12 tests del ejemplo cambian cosas distintas en lugares distintos; no hay razón alguna para que compartan un efecto verdadero único. La pregunta es cuánto importa eso, y existen dos medidas para responderla.

Q de Cochran mide la dispersión observada entre los estudios en relación con lo que el azar por sí solo produciría. En nuestro programa, Q vale 36,2028 con 11 grados de libertad y valor p de 0,000157: los 12 tests están mucho más dispersos de lo que el error muestral explica.

I cuadrado traduce eso en fracción. Describe, en palabras del Manual, el porcentaje de la variabilidad en las estimaciones de efecto que se debe a heterogeneidad en lugar de error muestral. En nuestro programa, I cuadrado vale 69,62 por ciento. La guía aproximada del Manual para ensayos aleatorizados coloca ese valor en el rango de heterogeneidad sustancial:

I cuadrado Interpretación (guía del Manual Cochrane)
0% a 40% puede no ser importante
30% a 60% puede representar heterogeneidad moderada
50% a 90% puede representar heterogeneidad sustancial
75% a 100% heterogeneidad considerable

Los autores advierten que esos umbrales pueden engañar, porque la importancia de la inconsistencia depende de la magnitud y la dirección de los efectos y de la fuerza de la evidencia. Y hacen una observación que vale oro para quien hace experimentación: el test de heterogeneidad es irrelevante para la elección del análisis, porque la heterogeneidad siempre existe, ya sea que logremos detectarla estadísticamente o no.

En un programa de producto, un I cuadrado alto no es un defecto. Es el objetivo. Si todos tus tests tuvieran el mismo efecto verdadero, estarías probando la misma cosa doce veces.

Efecto aleatorio: la misma tabla, otro veredicto

El modelo de efectos aleatorios cambia la suposición. En vez de asumir un efecto único, asume que los efectos verdaderos varían y siguen una distribución, normalmente la normal, y estima la varianza de esa distribución, llamada tau al cuadrado. El Manual registra que la versión más simple de estimar tau al cuadrado es el método de DerSimonian y Laird, que es el que usamos aquí.

En nuestro programa, tau al cuadrado sale en 8,8687 veces 10 elevado a menos 6, es decir, tau de 0,2978 puntos porcentuales. El valor verdadero usado en la simulación era 0,30. El estimador acertó casi encima.

Rehaciendo la agrupación con ese tau incorporado en cada peso:

Modelo Efecto combinado Error estándar Estadístico valor p IC 95% Veredicto
Efecto fijo 0,1483 pp 0,0568 z 2,6107 0,009037 0,0370 a 0,2596 pp significativo
Efectos aleatorios 0,1532 pp 0,1030 z 1,4866 0,137128 -0,0488 a 0,3551 pp no significativo

Los mismos 12 tests, la misma aritmética de varianza inversa, y veredictos opuestos. El punto estimado apenas se mueve (0,1483 contra 0,1532), pero el error estándar casi se duplica, porque el modelo aleatorio ahora tiene que cargar la incertidumbre sobre hacia dónde va a empujar el próximo cambio, y no solo la incertidumbre de medida de los 12 experimentos que ya corrieron. El Manual anticipa ese comportamiento: cuando hay heterogeneidad, el intervalo del modelo aleatorio es más ancho que el del fijo, y eso ocurre siempre que el I cuadrado sea mayor que cero, incluso cuando el test de heterogeneidad no detecta nada.

Intervalo del efecto fijo contra el intervalo de los efectos aleatoriosDos barras horizontales de intervalo de confianza sobre un eje en puntos porcentuales de menos 0,1 a más 0,4. La barra del efecto fijo va de 0,0370 a 0,2596 y queda enteramente a la derecha de la línea del cero. La barra de los efectos aleatorios va de menos 0,0488 a 0,3551 y cruza la línea del cero. Los dos puntos centrales, 0,1483 y 0,1532, quedan casi en el mismo lugar.0-0,10,20,35efecto combinado en puntos porcentualesefecto fijo: p 0,0090efectos aleatorios: p 0,1371
El punto casi no se mueve, el intervalo casi se duplica. La elección del modelo no es técnica, es una declaración sobre qué pregunta quieres responder.

¿Cuál de los dos está bien? Lo medimos

El argumento no decide esto; la simulación sí. Corrimos 5 mil programas completos, cada uno con los mismos 12 tests y la misma distribución de efectos verdaderos, y preguntamos con qué frecuencia el intervalo del 95 por ciento de cada modelo contiene el promedio verdadero del proceso (0,10 puntos porcentuales).

Modelo Cobertura del IC 95% Nominal
Efecto fijo 70,86% 95%
Efectos aleatorios 92,16% 95%

El intervalo del efecto fijo falla el blanco casi tres veces más de lo que promete. El de efectos aleatorios con DerSimonian y Laird se acerca, quedando un poco por debajo del nominal, que es el comportamiento conocido del método cuando el número de estudios es modesto. El Manual dedica una sección entera a la interpretación cuidadosa de meta-análisis de efectos aleatorios con pocos estudios, justamente porque la varianza entre estudios se estima mal cuando k es pequeño.

La regla práctica que sale de ahí: si vas a combinar experimentos que probaron cosas distintas, usa efectos aleatorios. El modelo fijo solo es honesto cuando los experimentos son réplicas del mismo tratamiento, lo que en experimentación online ocurre básicamente en una situación, la de repetir literalmente el mismo test en ventanas o mercados distintos.

Otras medidas de los mismos 5 mil programas, todas útiles para calibrar expectativas:

La exageración de los ganadores, cuantificada

Llegamos al segundo motivo por el que sumar las victorias declaradas sobreestima el programa. Para que un test sea declarado ganador necesita dos cosas: efecto real y suerte. Eso significa que la porción de los ganadores está sistemáticamente enriquecida por quienes tuvieron suerte, y su ganancia observada es mayor que la ganancia verdadera. Es la maldición del ganador, y el meta-análisis permite medirla.

En los 5 mil programas simulados, 12.633 tests fueron declarados ganadores. Su ganancia media observada fue de 0,5942 puntos porcentuales. El efecto verdadero medio de esos mismos tests fue de 0,4424.

Exageración de 1,343 veces. El ganador típico entrega el 74,5 por ciento de lo que mostró en el informe.

En el ejemplo trabajado, los dos ganadores (tests 4 y 12) mostraron un promedio de 0,7220 puntos porcentuales contra un efecto verdadero medio de 0,5564, una exageración de 1,298 veces, muy cerca del valor agregado.

Ganancia observada contra ganancia verdadera de los tests declarados ganadoresGráfico de barras con dos pares. En el primer par, agregado de 12.633 ganadores en 5 mil programas simulados, la barra de la ganancia observada alcanza 0,5942 puntos porcentuales y la de la ganancia verdadera 0,4424. En el segundo par, los dos ganadores del ejemplo trabajado, la barra observada alcanza 0,7220 y la verdadera 0,5564. En ambos pares la barra observada es visiblemente más alta.0,59420,44240,72200,556412.633 ganadores (5 mil programas)2 ganadores (ejemplo de este artículo)exageración de 1,343xexageración de 1,298xobservadoverdadero
La selección por el valor p enriquece la muestra de ganadores con quienes tuvieron suerte. Sumar las ganancias declaradas para calcular el impacto anual infla el número en cerca de un tercio.

El encogimiento: la corrección que el meta-análisis entrega gratis

Estimado el tau al cuadrado, sale de regalo la corrección para cada test individual. La estimación encogida de un experimento es el promedio del programa más un pedazo de su desvío respecto a ese promedio:

estimación encogida = promedio del programa + peso por (observado menos promedio del programa)

con el peso valiendo tau al cuadrado dividido por la suma de tau al cuadrado y de la varianza de aquel test. Un test muy preciso (varianza pequeña) mantiene casi todo su desvío; un test ruidoso es empujado casi hasta el promedio. Es el mismo mecanismo de los priors bayesianos, solo que con el prior estimado de tus propios datos en vez de elegido a dedo.

En el ejemplo trabajado, con tau al cuadrado de 8,8687 veces 10 elevado a menos 6 y varianzas parecidas entre los tests, los pesos quedan todos alrededor de 0,69:

# Observado Peso Encogido Efecto real
4 0,7800 pp 0,6865 0,5820 pp 0,5993 pp
12 0,6640 pp 0,6910 0,5046 pp 0,5136 pp
11 0,3800 pp 0,6917 0,3086 pp 0,0753 pp
10 -0,0560 pp 0,7045 0,0044 pp -0,3515 pp
5 -0,3960 pp 0,6998 -0,2326 pp -0,2265 pp

Mira las dos primeras filas. El test 4 mostró 0,7800 y valía 0,5993; el encogimiento devolvió 0,5820. El test 12 mostró 0,6640 y valía 0,5136; el encogimiento devolvió 0,5046. En los dos ganadores, la estimación encogida llegó mucho más cerca de la verdad que la observada.

No funciona siempre: en los tests 10 y 11 el encogimiento empeoró, porque el efecto verdadero de aquellos dos estaba lejos del promedio del programa. La promesa del encogimiento es sobre el conjunto, no sobre cada fila. Y en el conjunto se cumple:

Estimador Error cuadrático medio Reducción
Observado, ejemplo trabajado 4,1404 veces 10 elevado a -6 referencia
Encogido, ejemplo trabajado 3,2041 veces 10 elevado a -6 22,61%
Observado, 5 mil programas 3,8571 veces 10 elevado a -6 referencia
Encogido con tau de DerSimonian y Laird 3,0219 veces 10 elevado a -6 21,65%
Encogido con el tau verdadero 2,7081 veces 10 elevado a -6 29,79%

La diferencia entre la fila de DerSimonian y Laird y la del tau verdadero (21,65 contra 29,79 por ciento) es el precio de tener que estimar la varianza entre estudios con apenas 12 experimentos. No anula la ganancia, solo la encoge, que es un chiste apropiado para el tema.

Qué se puede hacer con esto el lunes

Cinco usos concretos, todos posibles con los datos que ya tienes guardados:

  1. Reportar el programa, no la lista. Cambiar “tuvimos 2 victorias en 12” por “el conjunto entregó 0,15 puntos porcentuales en promedio, intervalo de menos 0,05 a 0,36” cambia la conversación con la dirección de anécdota a estimación.
  2. Corregir la proyección anual. Antes de multiplicar las victorias por 12 meses, aplica el encogimiento. Una exageración de 1,34 veces encima de un caso de negocio es la diferencia entre un proyecto que se paga y uno que no.
  3. Comparar áreas del producto. Corriendo el meta-análisis por superficie (checkout, onboarding, precios) descubres dónde el efecto medio de los cambios es mayor. Eso es meta-regresión, y es como se prioriza un roadmap con dato en vez de opinión.
  4. Calibrar el MDE de los próximos tests. El tau estimado es una medida directa del tamaño típico de tus cambios. Si tau vale 0,30 puntos porcentuales sobre una base de 5 por ciento, planear tests con MDE de 20 por ciento relativo es planear para no encontrar nada. Mira efecto mínimo detectable.
  5. Alimentar priors honestos. Quien usa análisis bayesiano puede dejar de inventar el prior: la distribución estimada de los efectos del propio programa es el prior empírico correcto.

Nada de esto funciona sin un repositorio de experimentos que guarde los inconclusos junto con los ganadores. Un programa que solo archiva victorias no puede ser meta-analizado, porque la muestra ya nace seleccionada, y todo número que salga de ella estará sesgado hacia arriba por el mismo mecanismo de la maldición del ganador.

Cuatro trampas

Combinar tests superpuestos en el tiempo. Si dos experimentos corrieron sobre los mismos usuarios y pudieron haber interactuado, no son observaciones independientes, y la agrupación de varianza inversa asume que lo son. Mira tests simultáneos.

Combinar métricas distintas. Solo entra en la misma olla lo que esté en la misma escala. Diferencia absoluta de tasa de conversión con diferencia absoluta de tasa de conversión; ganancia relativa con ganancia relativa. Mezclar las dos escalas produce un número sin significado.

Elegir lo que entra después de ver el resultado. Definir el conjunto de tests a combinar es una decisión de análisis, y tiene que tomarse por un criterio (todos los tests de aquella superficie en aquel trimestre) y no por conveniencia. Correr el meta-análisis, ver el valor p feo y sacar un test es el mismo peeking que criticamos a nivel del experimento.

Leer el combinado como si fuera un veredicto de lanzamiento. Vale repetirlo porque es el error que más aparece: un efecto de programa positivo no autoriza lanzar cambios individuales que no ganaron.

Hazlo automático en Donnu

El obstáculo práctico para meta-analizar un programa raramente es la matemática, es que los resultados de los tests antiguos viven en capturas de pantalla y planillas muertas, sin error estándar guardado. En Donnu todo experimento cerrado deja efecto y error estándar en el historial, así que la agrupación queda a un filtro de distancia: elige el recorte (trimestre, superficie, tipo de cambio) y el panel devuelve el efecto combinado en los dos modelos, la Q, el I cuadrado, el tau estimado y el gráfico de bosque con las estimaciones encogidas al lado de las observadas. La proyección anual de impacto usa la estimación encogida por defecto, no la observada, porque sumar victorias declaradas es la forma más silenciosa de que un programa prometa un tercio más de lo que va a entregar.

Preguntas frecuentes

Las respuestas cortas están en la sección de preguntas frecuentes de esta página, armadas a partir de los mismos cálculos presentados aquí.

Referencias

Lee también

Leia em português

Preguntas frecuentes

¿Qué es el meta-análisis de tests A/B?
Es combinar los resultados de varios experimentos en una sola estimación, ponderando cada uno por el inverso de su varianza. El Manual Cochrane describe el método genérico de varianza inversa, que solo necesita el efecto estimado y el error estándar de cada estudio. Aplicado a un programa de experimentación, responde una pregunta que ningún test aislado responde: el conjunto de lo que lanzamos en el trimestre, ¿movió la aguja?
¿El meta-análisis sirve para salvar un test que quedó inconcluso?
No, y esa es la confusión más cara. No recupera el veredicto de un experimento individual; estima el promedio del programa. En nuestro ejemplo con 12 tests, la agrupación devolvió 0,1483 puntos porcentuales con valor p de 0,009037, pero eso no significa que el test 6 haya ganado. Significa que el conjunto de los 12 cambios, tomado como bloque, produjo una ganancia media positiva.
¿Cuál es la diferencia entre efecto fijo y efecto aleatorio?
El modelo de efecto fijo asume que todos los experimentos estiman el MISMO efecto verdadero y que la diferencia entre ellos es solo azar. El de efectos aleatorios asume que los efectos verdaderos varían y siguen una distribución. En nuestro ejemplo, el fijo devolvió un valor p de 0,009037 y el aleatorio 0,137128 sobre exactamente los mismos 12 tests. En 5 mil programas simulados, el intervalo del fijo cubrió el promedio verdadero solo el 70,86 por ciento de las veces frente al 92,16 del aleatorio.
¿Qué es I cuadrado y qué valor es preocupante?
Es la fracción de la variación entre estudios que proviene de heterogeneidad real en lugar de azar muestral. El Manual Cochrane da una guía aproximada: de 0 a 40 por ciento puede no ser importante, de 30 a 60 puede ser heterogeneidad moderada, de 50 a 90 sustancial y de 75 a 100 considerable. Los programas de experimentación suelen vivir en el rango alto, porque probar cosas distintas es el objetivo. En nuestros 5 mil programas simulados el I cuadrado promedio quedó en 63,61 por ciento.
¿Por qué el promedio de los ganadores exagera el resultado?
Porque para ser declarado ganador el test necesita haber tenido suerte, además de tener efecto real. En nuestros 5 mil programas, los 12.633 ganadores declarados mostraron una ganancia media de 0,5942 puntos porcentuales cuando su efecto verdadero medio era 0,4424. El ganador típico entrega el 74,5 por ciento de lo que mostró. Sumar las victorias declaradas para calcular el impacto anual del programa es la forma más rápida de sobreestimarlo en cerca de un tercio.
¿El encogimiento realmente mejora la estimación de cada test?
Mejora, y se puede medir. Empujando cada estimación hacia el promedio del programa, con peso proporcional a su precisión, el error cuadrático medio cayó 21,65 por ciento en nuestros 5 mil programas usando la varianza entre estudios estimada por DerSimonian y Laird, y 29,79 por ciento usando la varianza verdadera. En el ejemplo trabajado la caída fue de 22,61 por ciento.