Meta-análisis de Tests A/B: lee el programa entero
Meta-análisis de tests A/B: juntar 12 experimentos en una sola estimación, medir heterogeneidad con I cuadrado y corregir la exageración de 1,34 veces.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Un programa de experimentación no es una lista de veredictos independientes, es una muestra de efectos, y tiene un promedio que ningún test aislado ve. En el ejemplo de este artículo, 12 tests con solo 2 ganadores declarados devuelven, agrupados, una ganancia media de 0,1483 puntos porcentuales con valor p de 0,009037. Aquí mostramos cómo hacer el meta-análisis de esos experimentos con el método de varianza inversa, cómo medir si están midiendo lo mismo, por qué la elección entre efecto fijo y efecto aleatorio cambia el veredicto del programa, y cuánto exagera el promedio de los ganadores (1,34 veces, medido en 5 mil programas simulados). Forma parte de nuestra guía completa de test A/B y complementa la maldición del ganador.
La pregunta que ningún test responde solo
Todo el que hace experimentación llega, tarde o temprano, a la reunión en la que alguien pregunta cuánto entregó el programa en el trimestre. La respuesta estándar es sumar las ganancias de los tests que ganaron, y es errónea por dos motivos independientes, que este artículo trata por separado: los tests que no ganaron también cargan información, y los que ganaron cargan exageración.
La herramienta correcta para esa pregunta es vieja y viene de la investigación clínica: meta-análisis. El Manual Cochrane define el método genérico de varianza inversa en una línea de álgebra: la estimación combinada es el promedio de las estimaciones individuales ponderado por el inverso del cuadrado del error estándar de cada una. Los datos necesarios, escriben los autores, son solamente una estimación del efecto y su error estándar, por estudio.
Fíjate en lo que eso significa para la experimentación online: ya tienes los dos números de todo test que ejecutaste, incluidos los que quedaron inconclusos. Nada necesita instrumentarse de nuevo.
Y existe un motivo estructural por el que la lectura del programa importa más aquí que en otros campos. Kohavi, Deng, Longbotham y Xu escriben que en sitios como Bing, donde miles de experimentos corren por año, la mayoría fracasa, y los que funcionan mejoran las métricas clave entre 0,1 y 1,0 por ciento una vez diluidos en el impacto general. El cambio pequeño con impacto enorme existe, pero los autores lo estiman en el orden de uno en 500 experimentos. Cuando el efecto típico es de ese orden, el test aislado casi nunca tiene poder para verlo, y el conjunto sí.
El programa de ejemplo
Simulamos un trimestre entero con semilla fija. Doce tests, cada uno con 25 mil visitantes por brazo y tasa de conversión base de 5 por ciento. Los efectos verdaderos de cada test fueron sorteados de una distribución normal con media de 0,10 puntos porcentuales y desviación de 0,30, es decir, un programa en el que el cambio típico es levemente positivo pero muchos cambios empeoran las cosas.
| # | Conv. A | Conv. B | Tasa A | Tasa B | Diferencia | EE | z | valor p | Veredicto | Efecto real |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 1.240 | 1.278 | 4,960% | 5,112% | 0,1520 pp | 0,1956 | 0,7771 | 0,437100 | inconcluso | 0,4718 pp |
| 2 | 1.239 | 1.241 | 4,956% | 4,964% | 0,0080 pp | 0,1942 | 0,0412 | 0,967140 | inconcluso | -0,1842 pp |
| 3 | 1.264 | 1.304 | 5,056% | 5,216% | 0,1600 pp | 0,1974 | 0,8104 | 0,417697 | inconcluso | -0,0011 pp |
| 4 | 1.240 | 1.435 | 4,960% | 5,740% | 0,7800 pp | 0,2012 | 3,8754 | 0,000107 | gana | 0,5993 pp |
| 5 | 1.301 | 1.202 | 5,204% | 4,808% | -0,3960 pp | 0,1950 | -2,0303 | 0,042328 | pierde | -0,2265 pp |
| 6 | 1.253 | 1.320 | 5,012% | 5,280% | 0,2680 pp | 0,1976 | 1,3562 | 0,175032 | inconcluso | 0,1589 pp |
| 7 | 1.290 | 1.295 | 5,160% | 5,180% | 0,0200 pp | 0,1980 | 0,1010 | 0,919560 | inconcluso | 0,0641 pp |
| 8 | 1.255 | 1.323 | 5,020% | 5,292% | 0,2720 pp | 0,1978 | 1,3752 | 0,169073 | inconcluso | 0,1112 pp |
| 9 | 1.281 | 1.184 | 5,124% | 4,736% | -0,3880 pp | 0,1936 | -2,0037 | 0,045098 | pierde | -0,2213 pp |
| 10 | 1.229 | 1.215 | 4,916% | 4,860% | -0,0560 pp | 0,1929 | -0,2904 | 0,771529 | inconcluso | -0,3515 pp |
| 11 | 1.256 | 1.351 | 5,024% | 5,404% | 0,3800 pp | 0,1988 | 1,9111 | 0,055993 | inconcluso | 0,0753 pp |
| 12 | 1.225 | 1.391 | 4,900% | 5,564% | 0,6640 pp | 0,1991 | 3,3339 | 0,000856 | gana | 0,5136 pp |
La última columna es el lujo que solo la simulación permite: el efecto verdadero de cada test, que en la vida real nadie ve. Es lo que nos va a permitir medir, al final del artículo, quién tenía razón y quién estaba exagerando.
Pega la fila 4 en la calculadora de abajo (25.000 y 1.240 contra 25.000 y 1.435) y devuelve z de 3,8754, valor p de 0,000107, ganancia relativa de 15,73 por ciento e intervalo de 0,3856 a 1,1744 puntos porcentuales. Toda la tabla anterior sale de la misma matemática.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Leyendo test por test, el trimestre parece tibio: dos ganadores, dos perdedores, ocho nadas. Un informe honesto diría que 2 de 12 funcionaron, lo que por cierto coincide con las tasas de victoria publicadas por la industria.
Juntando los doce: el modelo de efecto fijo
La agrupación de varianza inversa pesa cada test por el inverso de su varianza. Como los 12 tienen casi el mismo tamaño, los pesos quedan casi iguales (de 7,96 a 8,67 por ciento cada uno). El resultado:
Efecto combinado de 0,1483 puntos porcentuales, error estándar de 0,0568, z de 2,6107, valor p de 0,009037, intervalo de confianza de 0,0370 a 0,2596 puntos porcentuales.
Sobre una base de 5 por ciento, eso es una ganancia relativa media de 2,965 por ciento por cambio lanzado. El error estándar combinado es 3,46 veces menor que el de un test aislado, que es exactamente la raíz de 12, como se esperaba.
Cuidado con la lectura equivocada más tentadora de ese resultado. La agrupación NO dice que el test 6 en realidad ganó, ni autoriza lanzar los ocho cambios inconclusos. Estima el promedio de un conjunto. Es la diferencia entre “este cambio específico funciona” y “los cambios de este tipo, en promedio, funcionan”, y solo la segunda fue respondida.
¿Están midiendo lo mismo?
El modelo de efecto fijo carga una suposición fuerte, y el Manual Cochrane la enuncia sin medias tintas: para calcular el intervalo de confianza de un meta-análisis de efecto fijo, se asume que el efecto verdadero de la intervención es el mismo valor en cada estudio, lo que implica que las diferencias observadas entre los resultados provienen exclusivamente del azar.
En experimentación de producto esa suposición es casi siempre falsa por construcción. Los 12 tests del ejemplo cambian cosas distintas en lugares distintos; no hay razón alguna para que compartan un efecto verdadero único. La pregunta es cuánto importa eso, y existen dos medidas para responderla.
Q de Cochran mide la dispersión observada entre los estudios en relación con lo que el azar por sí solo produciría. En nuestro programa, Q vale 36,2028 con 11 grados de libertad y valor p de 0,000157: los 12 tests están mucho más dispersos de lo que el error muestral explica.
I cuadrado traduce eso en fracción. Describe, en palabras del Manual, el porcentaje de la variabilidad en las estimaciones de efecto que se debe a heterogeneidad en lugar de error muestral. En nuestro programa, I cuadrado vale 69,62 por ciento. La guía aproximada del Manual para ensayos aleatorizados coloca ese valor en el rango de heterogeneidad sustancial:
| I cuadrado | Interpretación (guía del Manual Cochrane) |
|---|---|
| 0% a 40% | puede no ser importante |
| 30% a 60% | puede representar heterogeneidad moderada |
| 50% a 90% | puede representar heterogeneidad sustancial |
| 75% a 100% | heterogeneidad considerable |
Los autores advierten que esos umbrales pueden engañar, porque la importancia de la inconsistencia depende de la magnitud y la dirección de los efectos y de la fuerza de la evidencia. Y hacen una observación que vale oro para quien hace experimentación: el test de heterogeneidad es irrelevante para la elección del análisis, porque la heterogeneidad siempre existe, ya sea que logremos detectarla estadísticamente o no.
En un programa de producto, un I cuadrado alto no es un defecto. Es el objetivo. Si todos tus tests tuvieran el mismo efecto verdadero, estarías probando la misma cosa doce veces.
Efecto aleatorio: la misma tabla, otro veredicto
El modelo de efectos aleatorios cambia la suposición. En vez de asumir un efecto único, asume que los efectos verdaderos varían y siguen una distribución, normalmente la normal, y estima la varianza de esa distribución, llamada tau al cuadrado. El Manual registra que la versión más simple de estimar tau al cuadrado es el método de DerSimonian y Laird, que es el que usamos aquí.
En nuestro programa, tau al cuadrado sale en 8,8687 veces 10 elevado a menos 6, es decir, tau de 0,2978 puntos porcentuales. El valor verdadero usado en la simulación era 0,30. El estimador acertó casi encima.
Rehaciendo la agrupación con ese tau incorporado en cada peso:
| Modelo | Efecto combinado | Error estándar | Estadístico | valor p | IC 95% | Veredicto |
|---|---|---|---|---|---|---|
| Efecto fijo | 0,1483 pp | 0,0568 | z 2,6107 | 0,009037 | 0,0370 a 0,2596 pp | significativo |
| Efectos aleatorios | 0,1532 pp | 0,1030 | z 1,4866 | 0,137128 | -0,0488 a 0,3551 pp | no significativo |
Los mismos 12 tests, la misma aritmética de varianza inversa, y veredictos opuestos. El punto estimado apenas se mueve (0,1483 contra 0,1532), pero el error estándar casi se duplica, porque el modelo aleatorio ahora tiene que cargar la incertidumbre sobre hacia dónde va a empujar el próximo cambio, y no solo la incertidumbre de medida de los 12 experimentos que ya corrieron. El Manual anticipa ese comportamiento: cuando hay heterogeneidad, el intervalo del modelo aleatorio es más ancho que el del fijo, y eso ocurre siempre que el I cuadrado sea mayor que cero, incluso cuando el test de heterogeneidad no detecta nada.
¿Cuál de los dos está bien? Lo medimos
El argumento no decide esto; la simulación sí. Corrimos 5 mil programas completos, cada uno con los mismos 12 tests y la misma distribución de efectos verdaderos, y preguntamos con qué frecuencia el intervalo del 95 por ciento de cada modelo contiene el promedio verdadero del proceso (0,10 puntos porcentuales).
| Modelo | Cobertura del IC 95% | Nominal |
|---|---|---|
| Efecto fijo | 70,86% | 95% |
| Efectos aleatorios | 92,16% | 95% |
El intervalo del efecto fijo falla el blanco casi tres veces más de lo que promete. El de efectos aleatorios con DerSimonian y Laird se acerca, quedando un poco por debajo del nominal, que es el comportamiento conocido del método cuando el número de estudios es modesto. El Manual dedica una sección entera a la interpretación cuidadosa de meta-análisis de efectos aleatorios con pocos estudios, justamente porque la varianza entre estudios se estima mal cuando k es pequeño.
La regla práctica que sale de ahí: si vas a combinar experimentos que probaron cosas distintas, usa efectos aleatorios. El modelo fijo solo es honesto cuando los experimentos son réplicas del mismo tratamiento, lo que en experimentación online ocurre básicamente en una situación, la de repetir literalmente el mismo test en ventanas o mercados distintos.
Otras medidas de los mismos 5 mil programas, todas útiles para calibrar expectativas:
- La agrupación por efecto fijo detecta el programa (valor p por debajo de 0,05) el 45,38 por ciento de las veces.
- Al menos un test individual sale significativo en el 98,52 por ciento de los programas, lo que suena excelente hasta que recuerdas que la mayoría de esos son falsos positivos o exageración.
- Al menos un ganador positivo declarado aparece en el 94,18 por ciento de los programas, incluso cuando el promedio verdadero del proceso es de meros 0,10 puntos porcentuales.
- El efecto combinado medio salió en 0,0945 puntos porcentuales contra los 0,1000 verdaderos: la agrupación es prácticamente insesgada.
- El tau al cuadrado medio estimado por DerSimonian y Laird salió en 8,9415 veces 10 elevado a menos 6, contra el verdadero 9,0000. Razón de 0,994, es decir, el estimador acierta en promedio, pero oscila bastante de programa a programa.
- El I cuadrado promedio quedó en 63,61 por ciento.
La exageración de los ganadores, cuantificada
Llegamos al segundo motivo por el que sumar las victorias declaradas sobreestima el programa. Para que un test sea declarado ganador necesita dos cosas: efecto real y suerte. Eso significa que la porción de los ganadores está sistemáticamente enriquecida por quienes tuvieron suerte, y su ganancia observada es mayor que la ganancia verdadera. Es la maldición del ganador, y el meta-análisis permite medirla.
En los 5 mil programas simulados, 12.633 tests fueron declarados ganadores. Su ganancia media observada fue de 0,5942 puntos porcentuales. El efecto verdadero medio de esos mismos tests fue de 0,4424.
Exageración de 1,343 veces. El ganador típico entrega el 74,5 por ciento de lo que mostró en el informe.
En el ejemplo trabajado, los dos ganadores (tests 4 y 12) mostraron un promedio de 0,7220 puntos porcentuales contra un efecto verdadero medio de 0,5564, una exageración de 1,298 veces, muy cerca del valor agregado.
El encogimiento: la corrección que el meta-análisis entrega gratis
Estimado el tau al cuadrado, sale de regalo la corrección para cada test individual. La estimación encogida de un experimento es el promedio del programa más un pedazo de su desvío respecto a ese promedio:
estimación encogida = promedio del programa + peso por (observado menos promedio del programa)
con el peso valiendo tau al cuadrado dividido por la suma de tau al cuadrado y de la varianza de aquel test. Un test muy preciso (varianza pequeña) mantiene casi todo su desvío; un test ruidoso es empujado casi hasta el promedio. Es el mismo mecanismo de los priors bayesianos, solo que con el prior estimado de tus propios datos en vez de elegido a dedo.
En el ejemplo trabajado, con tau al cuadrado de 8,8687 veces 10 elevado a menos 6 y varianzas parecidas entre los tests, los pesos quedan todos alrededor de 0,69:
| # | Observado | Peso | Encogido | Efecto real |
|---|---|---|---|---|
| 4 | 0,7800 pp | 0,6865 | 0,5820 pp | 0,5993 pp |
| 12 | 0,6640 pp | 0,6910 | 0,5046 pp | 0,5136 pp |
| 11 | 0,3800 pp | 0,6917 | 0,3086 pp | 0,0753 pp |
| 10 | -0,0560 pp | 0,7045 | 0,0044 pp | -0,3515 pp |
| 5 | -0,3960 pp | 0,6998 | -0,2326 pp | -0,2265 pp |
Mira las dos primeras filas. El test 4 mostró 0,7800 y valía 0,5993; el encogimiento devolvió 0,5820. El test 12 mostró 0,6640 y valía 0,5136; el encogimiento devolvió 0,5046. En los dos ganadores, la estimación encogida llegó mucho más cerca de la verdad que la observada.
No funciona siempre: en los tests 10 y 11 el encogimiento empeoró, porque el efecto verdadero de aquellos dos estaba lejos del promedio del programa. La promesa del encogimiento es sobre el conjunto, no sobre cada fila. Y en el conjunto se cumple:
| Estimador | Error cuadrático medio | Reducción |
|---|---|---|
| Observado, ejemplo trabajado | 4,1404 veces 10 elevado a -6 | referencia |
| Encogido, ejemplo trabajado | 3,2041 veces 10 elevado a -6 | 22,61% |
| Observado, 5 mil programas | 3,8571 veces 10 elevado a -6 | referencia |
| Encogido con tau de DerSimonian y Laird | 3,0219 veces 10 elevado a -6 | 21,65% |
| Encogido con el tau verdadero | 2,7081 veces 10 elevado a -6 | 29,79% |
La diferencia entre la fila de DerSimonian y Laird y la del tau verdadero (21,65 contra 29,79 por ciento) es el precio de tener que estimar la varianza entre estudios con apenas 12 experimentos. No anula la ganancia, solo la encoge, que es un chiste apropiado para el tema.
Qué se puede hacer con esto el lunes
Cinco usos concretos, todos posibles con los datos que ya tienes guardados:
- Reportar el programa, no la lista. Cambiar “tuvimos 2 victorias en 12” por “el conjunto entregó 0,15 puntos porcentuales en promedio, intervalo de menos 0,05 a 0,36” cambia la conversación con la dirección de anécdota a estimación.
- Corregir la proyección anual. Antes de multiplicar las victorias por 12 meses, aplica el encogimiento. Una exageración de 1,34 veces encima de un caso de negocio es la diferencia entre un proyecto que se paga y uno que no.
- Comparar áreas del producto. Corriendo el meta-análisis por superficie (checkout, onboarding, precios) descubres dónde el efecto medio de los cambios es mayor. Eso es meta-regresión, y es como se prioriza un roadmap con dato en vez de opinión.
- Calibrar el MDE de los próximos tests. El tau estimado es una medida directa del tamaño típico de tus cambios. Si tau vale 0,30 puntos porcentuales sobre una base de 5 por ciento, planear tests con MDE de 20 por ciento relativo es planear para no encontrar nada. Mira efecto mínimo detectable.
- Alimentar priors honestos. Quien usa análisis bayesiano puede dejar de inventar el prior: la distribución estimada de los efectos del propio programa es el prior empírico correcto.
Nada de esto funciona sin un repositorio de experimentos que guarde los inconclusos junto con los ganadores. Un programa que solo archiva victorias no puede ser meta-analizado, porque la muestra ya nace seleccionada, y todo número que salga de ella estará sesgado hacia arriba por el mismo mecanismo de la maldición del ganador.
Cuatro trampas
Combinar tests superpuestos en el tiempo. Si dos experimentos corrieron sobre los mismos usuarios y pudieron haber interactuado, no son observaciones independientes, y la agrupación de varianza inversa asume que lo son. Mira tests simultáneos.
Combinar métricas distintas. Solo entra en la misma olla lo que esté en la misma escala. Diferencia absoluta de tasa de conversión con diferencia absoluta de tasa de conversión; ganancia relativa con ganancia relativa. Mezclar las dos escalas produce un número sin significado.
Elegir lo que entra después de ver el resultado. Definir el conjunto de tests a combinar es una decisión de análisis, y tiene que tomarse por un criterio (todos los tests de aquella superficie en aquel trimestre) y no por conveniencia. Correr el meta-análisis, ver el valor p feo y sacar un test es el mismo peeking que criticamos a nivel del experimento.
Leer el combinado como si fuera un veredicto de lanzamiento. Vale repetirlo porque es el error que más aparece: un efecto de programa positivo no autoriza lanzar cambios individuales que no ganaron.
Hazlo automático en Donnu
El obstáculo práctico para meta-analizar un programa raramente es la matemática, es que los resultados de los tests antiguos viven en capturas de pantalla y planillas muertas, sin error estándar guardado. En Donnu todo experimento cerrado deja efecto y error estándar en el historial, así que la agrupación queda a un filtro de distancia: elige el recorte (trimestre, superficie, tipo de cambio) y el panel devuelve el efecto combinado en los dos modelos, la Q, el I cuadrado, el tau estimado y el gráfico de bosque con las estimaciones encogidas al lado de las observadas. La proyección anual de impacto usa la estimación encogida por defecto, no la observada, porque sumar victorias declaradas es la forma más silenciosa de que un programa prometa un tercio más de lo que va a entregar.
Preguntas frecuentes
Las respuestas cortas están en la sección de preguntas frecuentes de esta página, armadas a partir de los mismos cálculos presentados aquí.
Referencias
- Jonathan J. Deeks, Julian P. T. Higgins, Douglas G. Altman, Joanne E. McKenzie y Areti Angeliki Veroniki. Analysing data and undertaking meta-analyses, capítulo 10 del Cochrane Handbook for Systematic Reviews of Interventions, versión actual. La sección 10.3.1 es la fuente del método genérico de varianza inversa y del registro de que el meta-análisis de efecto fijo es válido bajo la suposición de que todas las estimaciones miden el mismo efecto subyacente; la 10.3.2 es la fuente del modelo de efectos aleatorios y de la identificación del método de DerSimonian y Laird de 1986 como la versión más simple; la 10.10.2 es la fuente del I cuadrado como porcentaje de la variabilidad debida a heterogeneidad en vez de azar, de la guía aproximada de interpretación (0 a 40 por ciento puede no ser importante, 30 a 60 moderada, 50 a 90 sustancial, 75 a 100 considerable, con la salvedad de que los umbrales pueden engañar) y de la afirmación de que el test de heterogeneidad es irrelevante para la elección del análisis; la 10.10.4.1 es la fuente del contraste entre el efecto fijo como efecto típico y el aleatorio como efecto medio sobre una distribución asumida, y del registro de que el intervalo del modelo aleatorio es más ancho siempre que el I cuadrado sea mayor que cero; y la 10.10.4.5 es la fuente de la advertencia sobre interpretar meta-análisis de efectos aleatorios con pocos estudios.
- Nicholas Larsen, Jonathan Stallrich, Srijan Sengupta, Alex Deng, Ron Kohavi y Nathaniel T. Stevens. Statistical Challenges in Online Controlled Experiments: A Review of A/B Testing Methodology, arXiv 2212.11366, 2024. Usado aquí como panorama del estado del arte en experimentación online, incluyendo el tratamiento de efectos heterogéneos entre subgrupos y la discusión de sesgos que exageran la diferencia medida entre tratamiento y control cuando el diseño no aísla los brazos.
- Ron Kohavi, Alex Deng, Roger Longbotham y Ya Xu. Seven Rules of Thumb for Web Site Experimenters, KDD 2014. La regla 2 es la fuente de la afirmación de que en sitios como Bing, donde miles de experimentos corren por año, la mayoría fracasa y los que funcionan mejoran las métricas clave entre 0,1 y 1,0 por ciento una vez diluidos en el impacto general; la regla 1 es la fuente del registro de que el cambio pequeño con impacto grande es la excepción, en el orden de tal vez uno en 500 experimentos en Bing, y de la advertencia contra el incrementalismo; y el resumen del artículo es la fuente de la conclusión de que la mayor parte del progreso viene de muchas mejoras pequeñas a lo largo del tiempo.
Lee también
Preguntas frecuentes
- ¿Qué es el meta-análisis de tests A/B?
- Es combinar los resultados de varios experimentos en una sola estimación, ponderando cada uno por el inverso de su varianza. El Manual Cochrane describe el método genérico de varianza inversa, que solo necesita el efecto estimado y el error estándar de cada estudio. Aplicado a un programa de experimentación, responde una pregunta que ningún test aislado responde: el conjunto de lo que lanzamos en el trimestre, ¿movió la aguja?
- ¿El meta-análisis sirve para salvar un test que quedó inconcluso?
- No, y esa es la confusión más cara. No recupera el veredicto de un experimento individual; estima el promedio del programa. En nuestro ejemplo con 12 tests, la agrupación devolvió 0,1483 puntos porcentuales con valor p de 0,009037, pero eso no significa que el test 6 haya ganado. Significa que el conjunto de los 12 cambios, tomado como bloque, produjo una ganancia media positiva.
- ¿Cuál es la diferencia entre efecto fijo y efecto aleatorio?
- El modelo de efecto fijo asume que todos los experimentos estiman el MISMO efecto verdadero y que la diferencia entre ellos es solo azar. El de efectos aleatorios asume que los efectos verdaderos varían y siguen una distribución. En nuestro ejemplo, el fijo devolvió un valor p de 0,009037 y el aleatorio 0,137128 sobre exactamente los mismos 12 tests. En 5 mil programas simulados, el intervalo del fijo cubrió el promedio verdadero solo el 70,86 por ciento de las veces frente al 92,16 del aleatorio.
- ¿Qué es I cuadrado y qué valor es preocupante?
- Es la fracción de la variación entre estudios que proviene de heterogeneidad real en lugar de azar muestral. El Manual Cochrane da una guía aproximada: de 0 a 40 por ciento puede no ser importante, de 30 a 60 puede ser heterogeneidad moderada, de 50 a 90 sustancial y de 75 a 100 considerable. Los programas de experimentación suelen vivir en el rango alto, porque probar cosas distintas es el objetivo. En nuestros 5 mil programas simulados el I cuadrado promedio quedó en 63,61 por ciento.
- ¿Por qué el promedio de los ganadores exagera el resultado?
- Porque para ser declarado ganador el test necesita haber tenido suerte, además de tener efecto real. En nuestros 5 mil programas, los 12.633 ganadores declarados mostraron una ganancia media de 0,5942 puntos porcentuales cuando su efecto verdadero medio era 0,4424. El ganador típico entrega el 74,5 por ciento de lo que mostró. Sumar las victorias declaradas para calcular el impacto anual del programa es la forma más rápida de sobreestimarlo en cerca de un tercio.
- ¿El encogimiento realmente mejora la estimación de cada test?
- Mejora, y se puede medir. Empujando cada estimación hacia el promedio del programa, con peso proporcional a su precisión, el error cuadrático medio cayó 21,65 por ciento en nuestros 5 mil programas usando la varianza entre estudios estimada por DerSimonian y Laird, y 29,79 por ciento usando la varianza verdadera. En el ejemplo trabajado la caída fue de 22,61 por ciento.