Estadística

Poder Observado: la cuenta que no responde nada

El poder observado después del test es solo el valor p reescrito. Por qué no informa nada sobre un test A/B sin significancia y qué mirar en su lugar.

Ilustración plana de una curva gruesa que baja hasta tocar una línea de base horizontal, en tonos de verde profundo sobre fondo verde menta

El poder observado, calculado después del test con el efecto que apareció, no agrega nada a la lectura del resultado, porque es una función uno a uno del valor p: mismo número, otra ropa. En el test trabajado de este artículo, con valor p de 0,4360, el poder observado es 11,88 por ciento, y ese 11,88 por ciento es consecuencia aritmética del 0,4360, no una información nueva sobre el experimento. Esta guía muestra la cuenta que lo prueba, la paradoja lógica que produce y qué preguntar en su lugar. Forma parte de nuestra guía completa de test A/B y es la pareja directa del test de equivalencia, que es la forma correcta de sostener un empate.

De dónde viene la tentación

El guion es siempre el mismo. El test termina sin significancia, alguien pregunta si la hipótesis está muerta, y un analista bienintencionado recalcula el poder usando el efecto observado. Si da bajo, la conclusión es “el test era demasiado débil, necesitamos más tráfico”. Si da alto, la conclusión es “el test era fuerte y aun así no encontró nada, entonces no existe efecto”.

La segunda lectura es la peligrosa, y es justamente la que Hoenig y Heisey desarman. Ellos resumen el argumento de los defensores de la práctica: existiría evidencia a favor de la nula cuando la significancia no se alcanza a pesar de que el poder calculado en el efecto observado sea alto. Y entonces muestran que esa cuenta nunca puede cumplir lo que promete.

El poder observado es el valor p reescrito

La demostración de Hoenig y Heisey es analítica: para cualquier test, el poder observado es una función uno a uno del valor p. Los dos salen de la misma distribución, y el poder observado sale de ella fijando el parámetro en el estadístico observado, lo que lo vuelve completamente determinado por el valor p.

Se puede ver corriendo la cuenta. Fije un test con base de 3 por ciento y 25.000 visitantes por variación, y varíe solo el número de conversiones de la variación:

conversiones en la variación tasa de la variación z valor p poder observado
750 3,000 por ciento 0,0000 1,00000 0,05000
765 3,060 por ciento 0,3914 0,69554 0,05837
780 3,120 por ciento 0,7790 0,43599 0,11880
795 3,180 por ciento 1,1630 0,24485 0,21272
810 3,240 por ciento 1,5434 0,12274 0,33849
825 3,300 por ciento 1,9203 0,05482 0,48418
840 3,360 por ciento 2,2938 0,02180 0,63077
855 3,420 por ciento 2,6640 0,00772 0,75931
870 3,480 por ciento 3,0309 0,00244 0,85793

Recorriendo las conversiones de 751 hasta 900 una a una, la relación es monótona sin excepción: siempre que el valor p cae, el poder observado sube. La única ruptura está en la línea del empate perfecto, y es de implementación, no de estadística: con diferencia exactamente cero, la función de nuestro motor devuelve el propio alfa (0,05) por convención, mientras que una conversión de diferencia (751) ya devuelve 0,0266.

Poder observado como función del valor pGráfico de línea con el valor p en el eje horizontal, de cero a uno, y el poder observado en el eje vertical, de cero a uno. La curva empieza alta a la izquierda, cerca de 0,86 de poder cuando el valor p es casi cero, y cae rápidamente: pasa alrededor de 0,48 de poder cuando el valor p está en 0,055, llega a 0,21 cuando el valor p es 0,24 y se aplana cerca de 0,03 cuando el valor p pasa de 0,97. Una línea discontinua vertical marca el valor p de 0,05 y cruza la curva cerca de la altura de medio poder. La curva es estrictamente decreciente, lo que muestra que cada valor p corresponde a un único poder observado.Cada valor p corresponde a un poder observado, y solo a élvalor p0,00,51,00,00,51,0poder observadovalor p = 0,05poder observado cerca de 0,5el test de este artículo: p 0,4360 y poder 0,1188
Poder observado contra valor p, con base de 3 por ciento y 25.000 visitantes por variación. La curva baja sin excepción: el poder observado no lleva información que el valor p no haya dado ya.

Hoenig y Heisey registran los dos puntos que esa curva vuelve visibles. Primero, un caso especial elegante: cuando el valor p es igual al alfa, el poder observado es 0,5 en el test z unilateral, y un poco mayor que 0,5 en el bilateral. Nuestra curva cae en la misma vecindad: en la línea más cercana al alfa, con valor p de 0,05482, el poder observado es 0,48418, justo por debajo de medio. Segundo, y más importante: los valores p no significantes siempre corresponden a poderes observados bajos. No existe el escenario que los defensores de la práctica imaginan, el de un resultado sin significancia con poder observado alto.

La paradoja del poder

El golpe final del artículo es lógico, no numérico. Considere dos tests que no rechazaron la nula, con el mismo tamaño de muestra. Quien usa poder observado leería el de mayor poder como evidencia más fuerte a favor de la nula: si el test era fuerte y aun así no encontró nada, la nula debe ser verdadera.

Solo que un poder observado mayor implica un estadístico de prueba mayor, es decir, un valor p menor, y un valor p menor es, por el estándar habitual, evidencia más fuerte en contra de la nula. Hoenig y Heisey llaman a esto la paradoja del enfoque del poder: un poder observado más alto no implica evidencia más fuerte a favor de una nula que no fue rechazada.

Los números de nuestro escenario vuelven concreta la contradicción. Dos tests, ambos con 25.000 visitantes por variación y ambos sin significancia:

test conversiones (control contra variación) valor p poder observado intervalo del 95 por ciento de la diferencia
A 750 contra 795 0,24485 0,21272 de -0,123 a +0,483 pp
B 750 contra 762 0,75399 0,04982 de -0,252 a +0,348 pp

Por la lectura del poder observado, el test A (poder cuatro veces mayor) sería la evidencia más fuerte de que no existe efecto. Por la lectura del valor p, el test A es el que está más cerca de detectar un efecto. Los dos no pueden estar en lo cierto, y el que está en lo cierto es el valor p: el poder observado solo reempaquetó la misma información y cambió el signo de la conclusión.

Note también la columna de los intervalos: los dos tienen prácticamente el mismo ancho, 0,607 y 0,600 punto porcentual, porque la precisión está gobernada por el tamaño de muestra y casi no depende del resultado. Es la precisión, y no el poder observado, la que responde de cuánto fue el experimento.

El test trabajado, leído de tres maneras

El caso concreto: 25.000 visitantes por variación, 750 conversiones en el control (3,0000 por ciento) y 780 en la variación (3,1200 por ciento), una ganancia relativa aparente de 4 por ciento.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

Pegando esos números en la calculadora de arriba: z de 0,7790, valor p de 0,4360, intervalo del 95 por ciento de la diferencia de menos 0,1819 a más 0,4219 punto porcentual. Sin significancia.

Lectura 1, la inútil. El poder observado en el efecto de 4 por ciento relativo es 0,1188. La frase que sale de ahí (“el test tuvo solo 12 por ciento de poder”) suena informativa y no lo es: es el 0,4360 dicho de otra manera.

Lectura 2, la correcta sobre el diseño. Con 25.000 por variación y base de 3 por ciento, el efecto mínimo detectable al 95 por ciento de confianza y 80 por ciento de poder es 0,4275 punto porcentual, o 14,25 por ciento en términos relativos. Es decir: el test fue diseñado para ver ganancias de 14 por ciento o más y nada por debajo de eso. Si la hipótesis valía una ganancia de 5 por ciento, el experimento nunca tuvo posibilidad, y eso ya se sabía antes de empezar.

Lectura 3, la correcta sobre el resultado. El intervalo del 95 por ciento va de menos 0,18 a más 0,42 punto porcentual. Descarta ganancias por encima de medio punto y pérdidas mayores que un quinto de punto, y sigue siendo compatible con una ganancia real de un tercio de punto, que en una base de 3 por ciento es una ganancia relativa de 11 por ciento, probablemente relevante para el negocio. La conclusión honesta no es “no funciona”, es “no sabemos, y este test no tenía cómo saberlo”.

Para dimensionar el próximo paso: detectar con 80 por ciento de poder un efecto del tamaño del que apareció (más 4 por ciento relativo) exigiría 323.369 visitantes por variación. Detectar el efecto planificado de más 8 por ciento exigiría 82.376. El test corrió con 25.000.

Qué responde cada pregunta después de un test sin significanciaDiagrama con tres bloques apilados. El primer bloque, marcado como pregunta inútil, contiene la frase sobre poder observado y la nota de que es el valor p reescrito. El segundo bloque, marcado como pregunta sobre el diseño, contiene el efecto mínimo detectable de 0,4275 punto porcentual y la nota de que se conocía antes de que el test empezara. El tercer bloque, marcado como pregunta sobre el resultado, contiene el intervalo de confianza de menos 0,18 a más 0,42 punto porcentual y la nota de que lista los valores que los datos no descartan.Tres preguntas sobre el mismo test sin significanciaPregunta inútil: ¿cuál era el poder, dado el efecto observado?Respuesta 0,1188, que es el valor p 0,4360 reescrito. Ninguna información nueva.Pregunta sobre el diseño: ¿qué efecto conseguía ver este test?Efecto mínimo detectable de 0,4275 pp, o 14,25 por ciento relativo. Sabido antes de empezar.Pregunta sobre el resultado: ¿qué valores no descartan los datos?Intervalo del 95 por ciento de -0,18 a +0,42 pp. Ganancias por encima de medio punto quedan fuera.
La misma pieza de datos responde bien dos preguntas y mal una. La del poder observado es la única que no agrega nada.

El error tiene una versión sofisticada

Hoenig y Heisey también derriban la variante que parece más rigurosa: la del “efecto detectable”. La práctica consiste en, después de un test sin significancia, calcular qué efecto verdadero habría dado, digamos, 90 por ciento de poder, y tratar ese número como un límite superior para el efecto real, porque la naturaleza difícilmente estaría en una región de poder tan alto sin que la significancia apareciera.

Los autores muestran que ese enfoque sufre de la misma paradoja, e ilustran con un ejemplo que vale la pena reproducir. En una muestra grande con media de 2 y error estándar de la media de 1,0255, la región crítica bilateral empieza en 2,01, entonces la nula no es rechazada; el intervalo del 95 por ciento va de menos 0,01 a 4,01, es decir, el valor 4 no es refutado por los datos. Aun así, el poder post-test calculado suponiendo media verdadera igual a 4 da cerca de 0,974, lo que sugeriría que 4 es improbable. Las dos lecturas se contradicen, y la que está equivocada es la del poder.

La conclusión de los autores es corta: una vez que el intervalo de confianza fue construido, los cálculos de poder no traen ninguna información adicional.

El poder sirve para diseñar, no para interpretar

Nada de esto vuelve inútil al poder estadístico. Es indispensable antes del test, cuando todavía se puede cambiar el diseño. Greenland y coautores ponen la frontera exactamente ahí: los cálculos de poder hechos antes del estudio no miden la compatibilidad de las alternativas con los datos que llegaron, y el poder calculado a partir de los datos observados es una transformación directa del valor p de la nula, entonces no pone a prueba ninguna alternativa.

Los mismos autores catalogan dos lecturas equivocadas que aparecen toda semana en reuniones de resultados. La primera: aceptar la nula porque el valor p pasó de 0,05 y afirmar que, con 90 por ciento de poder, la probabilidad de error es 10 por ciento. No lo es: si la nula es falsa y usted la aceptó, la probabilidad de error es 100 por ciento, y si es verdadera, es cero; el 10 por ciento describe apenas la frecuencia del error a lo largo de muchos usos del test, bajo aquella alternativa específica. La segunda: concluir que el resultado apoya la nula sobre la alternativa porque el valor p pasó de 0,05 y el poder contra la alternativa era 90 por ciento. Los autores muestran que es fácil construir contraejemplos con valor p de la nula entre 0,05 y 0,10 y alternativas cuyo propio valor p pasa de 0,10 con poder de 0,90.

Para lo que el poder sirve de verdad, los mismos autores dan el mejor ejemplo práctico: entender por qué la replicación falla tanto. Si la alternativa es correcta y dos estudios tienen poder real de 80 por ciento, la probabilidad de que los dos den significancia es, en el mejor caso, 0,80 por 0,80, es decir 64 por ciento, y la probabilidad de que uno dé y el otro no, el escenario que se vuelve “resultados conflictivos” en la conversación, es 2 por 0,80 por 0,20, es decir 32 por ciento, aproximadamente una de cada tres repeticiones. Eso es una consecuencia del diseño, no una anomalía de los datos.

Errores comunes

Haga esto automático en Donnu

El poder observado sobrevive porque el informe estándar de la mayoría de las herramientas termina en el sello de significancia, y cuando el sello es negativo el equipo se queda sin número para conversar. Ahí alguien inventa uno.

En Donnu, el informe de todo experimento trae el intervalo de la diferencia junto al efecto y el efecto mínimo detectable que el diseño soportaba, los dos desde el primer día, para que un resultado sin significancia sea leído por la precisión y no por un poder recalculado después. Si quiere rehacer cualquier cuenta, la calculadora de significancia devuelve valor p e intervalo de cualquier par de grupos, la calculadora de poder estadístico muestra el poder del diseño contra el efecto que usted declare y la calculadora de MDE dice cuál era el menor efecto visible para el tráfico que usted tenía.

Referencias

Lee también: Test de equivalencia · Efecto mínimo detectable · Significancia estadística en test A/B · Cuántos visitantes necesita un test A/B · Calculadora de poder estadístico · Leia em português

Preguntas frecuentes

¿Qué es el poder observado en un test A/B?
Es el poder estadístico recalculado después de que el test termina, usando el efecto que se observó en lugar del efecto que se había planificado. La idea detrás de él es responder a la pregunta "¿mi test tenía posibilidad de ver esto?" mirando el resultado. El problema es que la cuenta no aporta información nueva: Hoenig y Heisey muestran que el poder observado es una función uno a uno del valor p, es decir, es el mismo número escrito de otra manera.
¿Por qué el poder observado no prueba que no existe efecto?
Porque un valor p alto siempre produce un poder observado bajo, y un valor p bajo siempre produce un poder observado alto. Según Hoenig y Heisey, los resultados no significantes corresponden siempre a poderes observados bajos, y en el caso en que el valor p es igual al alfa el poder observado queda alrededor de 0,5. Como el poder observado está determinado por el valor p, calcularlo después de ver el valor p no cambia nada en la interpretación.
¿Qué es la paradoja del poder?
Es la contradicción lógica que Hoenig y Heisey bautizaron como paradoja del enfoque del poder. Entre dos tests que no rechazaron la nula, quien defiende el poder observado leería el de mayor poder observado como evidencia más fuerte a favor de la nula. Solo que un poder observado mayor significa un estadístico de prueba mayor, es decir, un valor p menor, que por el estándar habitual es evidencia más fuerte EN CONTRA de la nula. La misma pieza de datos no puede apoyar más a los dos lados al mismo tiempo.
¿Qué mirar en lugar del poder observado?
El intervalo de confianza de la diferencia y el efecto mínimo detectable del diseño. El intervalo responde directamente qué valores no descartan los datos. El efecto mínimo detectable responde cuál era el menor efecto que aquel test tenía posibilidad real de encontrar. Hoenig y Heisey concluyen exactamente en esa dirección: dentro del marco frecuentista, la lectura correcta se hace con intervalos de confianza, elección adecuada de la hipótesis nula y test de equivalencia.
¿El poder estadístico es inútil, entonces?
No. El poder es indispensable ANTES del test, para elegir el tamaño de muestra. Lo que no funciona es usarlo DESPUÉS para interpretar el resultado. Greenland y coautores ponen la frontera en el mismo lugar: pese a las limitaciones para interpretar datos ya recolectados, el poder es útil para diseñar estudios y para entender por qué la replicación de un resultado significante falla con frecuencia incluso en condiciones ideales.
¿Un test sin significancia significa que no debo tocar más esa hipótesis?
Depende enteramente del ancho del intervalo, no del valor p. En el ejemplo trabajado de este artículo, el intervalo del 95 por ciento de la diferencia va de menos 0,18 a más 0,42 punto porcentual: descarta ganancias mayores que medio punto, pero sigue siendo compatible con una ganancia relevante de un tercio de punto. Llamar a eso "no funciona" es leer en el resultado una precisión que no tiene.