Poder Observado: la cuenta que no responde nada
El poder observado después del test es solo el valor p reescrito. Por qué no informa nada sobre un test A/B sin significancia y qué mirar en su lugar.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El poder observado, calculado después del test con el efecto que apareció, no agrega nada a la lectura del resultado, porque es una función uno a uno del valor p: mismo número, otra ropa. En el test trabajado de este artículo, con valor p de 0,4360, el poder observado es 11,88 por ciento, y ese 11,88 por ciento es consecuencia aritmética del 0,4360, no una información nueva sobre el experimento. Esta guía muestra la cuenta que lo prueba, la paradoja lógica que produce y qué preguntar en su lugar. Forma parte de nuestra guía completa de test A/B y es la pareja directa del test de equivalencia, que es la forma correcta de sostener un empate.
De dónde viene la tentación
El guion es siempre el mismo. El test termina sin significancia, alguien pregunta si la hipótesis está muerta, y un analista bienintencionado recalcula el poder usando el efecto observado. Si da bajo, la conclusión es “el test era demasiado débil, necesitamos más tráfico”. Si da alto, la conclusión es “el test era fuerte y aun así no encontró nada, entonces no existe efecto”.
La segunda lectura es la peligrosa, y es justamente la que Hoenig y Heisey desarman. Ellos resumen el argumento de los defensores de la práctica: existiría evidencia a favor de la nula cuando la significancia no se alcanza a pesar de que el poder calculado en el efecto observado sea alto. Y entonces muestran que esa cuenta nunca puede cumplir lo que promete.
El poder observado es el valor p reescrito
La demostración de Hoenig y Heisey es analítica: para cualquier test, el poder observado es una función uno a uno del valor p. Los dos salen de la misma distribución, y el poder observado sale de ella fijando el parámetro en el estadístico observado, lo que lo vuelve completamente determinado por el valor p.
Se puede ver corriendo la cuenta. Fije un test con base de 3 por ciento y 25.000 visitantes por variación, y varíe solo el número de conversiones de la variación:
| conversiones en la variación | tasa de la variación | z | valor p | poder observado |
|---|---|---|---|---|
| 750 | 3,000 por ciento | 0,0000 | 1,00000 | 0,05000 |
| 765 | 3,060 por ciento | 0,3914 | 0,69554 | 0,05837 |
| 780 | 3,120 por ciento | 0,7790 | 0,43599 | 0,11880 |
| 795 | 3,180 por ciento | 1,1630 | 0,24485 | 0,21272 |
| 810 | 3,240 por ciento | 1,5434 | 0,12274 | 0,33849 |
| 825 | 3,300 por ciento | 1,9203 | 0,05482 | 0,48418 |
| 840 | 3,360 por ciento | 2,2938 | 0,02180 | 0,63077 |
| 855 | 3,420 por ciento | 2,6640 | 0,00772 | 0,75931 |
| 870 | 3,480 por ciento | 3,0309 | 0,00244 | 0,85793 |
Recorriendo las conversiones de 751 hasta 900 una a una, la relación es monótona sin excepción: siempre que el valor p cae, el poder observado sube. La única ruptura está en la línea del empate perfecto, y es de implementación, no de estadística: con diferencia exactamente cero, la función de nuestro motor devuelve el propio alfa (0,05) por convención, mientras que una conversión de diferencia (751) ya devuelve 0,0266.
Hoenig y Heisey registran los dos puntos que esa curva vuelve visibles. Primero, un caso especial elegante: cuando el valor p es igual al alfa, el poder observado es 0,5 en el test z unilateral, y un poco mayor que 0,5 en el bilateral. Nuestra curva cae en la misma vecindad: en la línea más cercana al alfa, con valor p de 0,05482, el poder observado es 0,48418, justo por debajo de medio. Segundo, y más importante: los valores p no significantes siempre corresponden a poderes observados bajos. No existe el escenario que los defensores de la práctica imaginan, el de un resultado sin significancia con poder observado alto.
La paradoja del poder
El golpe final del artículo es lógico, no numérico. Considere dos tests que no rechazaron la nula, con el mismo tamaño de muestra. Quien usa poder observado leería el de mayor poder como evidencia más fuerte a favor de la nula: si el test era fuerte y aun así no encontró nada, la nula debe ser verdadera.
Solo que un poder observado mayor implica un estadístico de prueba mayor, es decir, un valor p menor, y un valor p menor es, por el estándar habitual, evidencia más fuerte en contra de la nula. Hoenig y Heisey llaman a esto la paradoja del enfoque del poder: un poder observado más alto no implica evidencia más fuerte a favor de una nula que no fue rechazada.
Los números de nuestro escenario vuelven concreta la contradicción. Dos tests, ambos con 25.000 visitantes por variación y ambos sin significancia:
| test | conversiones (control contra variación) | valor p | poder observado | intervalo del 95 por ciento de la diferencia |
|---|---|---|---|---|
| A | 750 contra 795 | 0,24485 | 0,21272 | de -0,123 a +0,483 pp |
| B | 750 contra 762 | 0,75399 | 0,04982 | de -0,252 a +0,348 pp |
Por la lectura del poder observado, el test A (poder cuatro veces mayor) sería la evidencia más fuerte de que no existe efecto. Por la lectura del valor p, el test A es el que está más cerca de detectar un efecto. Los dos no pueden estar en lo cierto, y el que está en lo cierto es el valor p: el poder observado solo reempaquetó la misma información y cambió el signo de la conclusión.
Note también la columna de los intervalos: los dos tienen prácticamente el mismo ancho, 0,607 y 0,600 punto porcentual, porque la precisión está gobernada por el tamaño de muestra y casi no depende del resultado. Es la precisión, y no el poder observado, la que responde de cuánto fue el experimento.
El test trabajado, leído de tres maneras
El caso concreto: 25.000 visitantes por variación, 750 conversiones en el control (3,0000 por ciento) y 780 en la variación (3,1200 por ciento), una ganancia relativa aparente de 4 por ciento.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Pegando esos números en la calculadora de arriba: z de 0,7790, valor p de 0,4360, intervalo del 95 por ciento de la diferencia de menos 0,1819 a más 0,4219 punto porcentual. Sin significancia.
Lectura 1, la inútil. El poder observado en el efecto de 4 por ciento relativo es 0,1188. La frase que sale de ahí (“el test tuvo solo 12 por ciento de poder”) suena informativa y no lo es: es el 0,4360 dicho de otra manera.
Lectura 2, la correcta sobre el diseño. Con 25.000 por variación y base de 3 por ciento, el efecto mínimo detectable al 95 por ciento de confianza y 80 por ciento de poder es 0,4275 punto porcentual, o 14,25 por ciento en términos relativos. Es decir: el test fue diseñado para ver ganancias de 14 por ciento o más y nada por debajo de eso. Si la hipótesis valía una ganancia de 5 por ciento, el experimento nunca tuvo posibilidad, y eso ya se sabía antes de empezar.
Lectura 3, la correcta sobre el resultado. El intervalo del 95 por ciento va de menos 0,18 a más 0,42 punto porcentual. Descarta ganancias por encima de medio punto y pérdidas mayores que un quinto de punto, y sigue siendo compatible con una ganancia real de un tercio de punto, que en una base de 3 por ciento es una ganancia relativa de 11 por ciento, probablemente relevante para el negocio. La conclusión honesta no es “no funciona”, es “no sabemos, y este test no tenía cómo saberlo”.
Para dimensionar el próximo paso: detectar con 80 por ciento de poder un efecto del tamaño del que apareció (más 4 por ciento relativo) exigiría 323.369 visitantes por variación. Detectar el efecto planificado de más 8 por ciento exigiría 82.376. El test corrió con 25.000.
El error tiene una versión sofisticada
Hoenig y Heisey también derriban la variante que parece más rigurosa: la del “efecto detectable”. La práctica consiste en, después de un test sin significancia, calcular qué efecto verdadero habría dado, digamos, 90 por ciento de poder, y tratar ese número como un límite superior para el efecto real, porque la naturaleza difícilmente estaría en una región de poder tan alto sin que la significancia apareciera.
Los autores muestran que ese enfoque sufre de la misma paradoja, e ilustran con un ejemplo que vale la pena reproducir. En una muestra grande con media de 2 y error estándar de la media de 1,0255, la región crítica bilateral empieza en 2,01, entonces la nula no es rechazada; el intervalo del 95 por ciento va de menos 0,01 a 4,01, es decir, el valor 4 no es refutado por los datos. Aun así, el poder post-test calculado suponiendo media verdadera igual a 4 da cerca de 0,974, lo que sugeriría que 4 es improbable. Las dos lecturas se contradicen, y la que está equivocada es la del poder.
La conclusión de los autores es corta: una vez que el intervalo de confianza fue construido, los cálculos de poder no traen ninguna información adicional.
El poder sirve para diseñar, no para interpretar
Nada de esto vuelve inútil al poder estadístico. Es indispensable antes del test, cuando todavía se puede cambiar el diseño. Greenland y coautores ponen la frontera exactamente ahí: los cálculos de poder hechos antes del estudio no miden la compatibilidad de las alternativas con los datos que llegaron, y el poder calculado a partir de los datos observados es una transformación directa del valor p de la nula, entonces no pone a prueba ninguna alternativa.
Los mismos autores catalogan dos lecturas equivocadas que aparecen toda semana en reuniones de resultados. La primera: aceptar la nula porque el valor p pasó de 0,05 y afirmar que, con 90 por ciento de poder, la probabilidad de error es 10 por ciento. No lo es: si la nula es falsa y usted la aceptó, la probabilidad de error es 100 por ciento, y si es verdadera, es cero; el 10 por ciento describe apenas la frecuencia del error a lo largo de muchos usos del test, bajo aquella alternativa específica. La segunda: concluir que el resultado apoya la nula sobre la alternativa porque el valor p pasó de 0,05 y el poder contra la alternativa era 90 por ciento. Los autores muestran que es fácil construir contraejemplos con valor p de la nula entre 0,05 y 0,10 y alternativas cuyo propio valor p pasa de 0,10 con poder de 0,90.
Para lo que el poder sirve de verdad, los mismos autores dan el mejor ejemplo práctico: entender por qué la replicación falla tanto. Si la alternativa es correcta y dos estudios tienen poder real de 80 por ciento, la probabilidad de que los dos den significancia es, en el mejor caso, 0,80 por 0,80, es decir 64 por ciento, y la probabilidad de que uno dé y el otro no, el escenario que se vuelve “resultados conflictivos” en la conversación, es 2 por 0,80 por 0,20, es decir 32 por ciento, aproximadamente una de cada tres repeticiones. Eso es una consecuencia del diseño, no una anomalía de los datos.
Errores comunes
- Calcular el poder después del test para decidir si la hipótesis murió. El número devuelto es el valor p en otra escala.
- Decir “el test tuvo poco poder” como si fuera un hallazgo. Si el valor p fue alto, el poder observado será bajo por construcción. La información útil es otra: cuál era el efecto mínimo detectable del diseño.
- Usar un poder alto en el efecto observado como prueba de ausencia de efecto. Ese escenario ni siquiera existe en un resultado no significante, y cuando alguien lo produce, es señal de error de cuenta.
- Tratar el “efecto detectable” como límite superior del efecto real. Hoenig y Heisey muestran que esa variante hereda la misma paradoja.
- Cambiar el intervalo de confianza por el poder en el informe. El intervalo responde directamente lo que se quiere saber; el poder observado responde de nuevo lo que el valor p ya respondió.
- Concluir “no existe efecto” cuando lo correcto es “no sabemos”. Para sostener un empate existe un procedimiento propio, el test de equivalencia, con margen declarado antes de los datos.
Haga esto automático en Donnu
El poder observado sobrevive porque el informe estándar de la mayoría de las herramientas termina en el sello de significancia, y cuando el sello es negativo el equipo se queda sin número para conversar. Ahí alguien inventa uno.
En Donnu, el informe de todo experimento trae el intervalo de la diferencia junto al efecto y el efecto mínimo detectable que el diseño soportaba, los dos desde el primer día, para que un resultado sin significancia sea leído por la precisión y no por un poder recalculado después. Si quiere rehacer cualquier cuenta, la calculadora de significancia devuelve valor p e intervalo de cualquier par de grupos, la calculadora de poder estadístico muestra el poder del diseño contra el efecto que usted declare y la calculadora de MDE dice cuál era el menor efecto visible para el tráfico que usted tenía.
Referencias
- Hoenig, J. M. y Heisey, D. M. The Abuse of Power: The Pervasive Fallacy of Power Calculations for Data Analysis. The American Statistician, volumen 55, número 1, páginas 19 a 24, febrero de 2001. Fuente de la demostración de que el poder observado es una función uno a uno del valor p y está completamente determinado por él; del caso especial en que un valor p igual al alfa produce poder observado de 0,5 en el test z unilateral y un poco mayor en el bilateral; del resultado de que los valores p no significantes corresponden siempre a poderes observados bajos; de la paradoja del enfoque del poder (un poder observado mayor no implica evidencia más fuerte a favor de una nula no rechazada, porque implica un estadístico de prueba mayor); de la demostración de que el enfoque del “efecto detectable” sufre de la misma paradoja; del ejemplo con media 2 y error estándar 1,0255, región crítica en 2,01, intervalo del 95 por ciento de menos 0,01 a 4,01 y poder post-test de cerca de 0,974 para media verdadera 4; y de la conclusión de que, una vez construido el intervalo de confianza, los cálculos de poder no traen información adicional. stat-help.com.
- Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N. y Altman, D. G. Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, volumen 31, páginas 337 a 350, 2016. Fuente de la definición de poder como probabilidad pre-estudio; del registro de que el poder calculado a partir de los datos observados es una transformación directa del valor p de la nula y por eso no pone a prueba las alternativas; de las interpretaciones equivocadas número 24 (la probabilidad de error al aceptar la nula no es 1 menos el poder) y número 25 (un valor p por encima de 0,05 con poder de 90 por ciento no hace que el resultado apoye la nula sobre la alternativa); y del cálculo de replicación según el cual dos estudios con poder real de 80 por ciento dan significancia los dos en como máximo 64 por ciento de las veces, y discrepan entre sí en cerca de 32 por ciento. pmc.ncbi.nlm.nih.gov.
- Walker, E. y Nowacki, A. S. Understanding Equivalence and Noninferiority Testing. Journal of General Internal Medicine, volumen 26, número 2, páginas 192 a 196, 2011. Fuente del procedimiento correcto para sostener un empate (test de equivalencia con margen declarado e intervalo de 1 menos 2 alfa contenido en el margen) y de la advertencia de que usar el test comparativo tradicional para establecer equivalencia lleva con frecuencia a conclusiones incorrectas, porque la carga de la prueba está en la hipótesis equivocada. pmc.ncbi.nlm.nih.gov.
- Lakens, D. Equivalence Tests: A Practical Primer for t Tests, Correlations, and Meta-Analyses. Social Psychological and Personality Science, volumen 8, número 4, páginas 355 a 362, 2017. Fuente del encuadre de que los investigadores concluyen con frecuencia y de forma incorrecta que un efecto está ausente a partir de un resultado no significante, y de la alternativa frecuentista recomendada en su lugar. pmc.ncbi.nlm.nih.gov.
Lee también: Test de equivalencia · Efecto mínimo detectable · Significancia estadística en test A/B · Cuántos visitantes necesita un test A/B · Calculadora de poder estadístico · Leia em português
Preguntas frecuentes
- ¿Qué es el poder observado en un test A/B?
- Es el poder estadístico recalculado después de que el test termina, usando el efecto que se observó en lugar del efecto que se había planificado. La idea detrás de él es responder a la pregunta "¿mi test tenía posibilidad de ver esto?" mirando el resultado. El problema es que la cuenta no aporta información nueva: Hoenig y Heisey muestran que el poder observado es una función uno a uno del valor p, es decir, es el mismo número escrito de otra manera.
- ¿Por qué el poder observado no prueba que no existe efecto?
- Porque un valor p alto siempre produce un poder observado bajo, y un valor p bajo siempre produce un poder observado alto. Según Hoenig y Heisey, los resultados no significantes corresponden siempre a poderes observados bajos, y en el caso en que el valor p es igual al alfa el poder observado queda alrededor de 0,5. Como el poder observado está determinado por el valor p, calcularlo después de ver el valor p no cambia nada en la interpretación.
- ¿Qué es la paradoja del poder?
- Es la contradicción lógica que Hoenig y Heisey bautizaron como paradoja del enfoque del poder. Entre dos tests que no rechazaron la nula, quien defiende el poder observado leería el de mayor poder observado como evidencia más fuerte a favor de la nula. Solo que un poder observado mayor significa un estadístico de prueba mayor, es decir, un valor p menor, que por el estándar habitual es evidencia más fuerte EN CONTRA de la nula. La misma pieza de datos no puede apoyar más a los dos lados al mismo tiempo.
- ¿Qué mirar en lugar del poder observado?
- El intervalo de confianza de la diferencia y el efecto mínimo detectable del diseño. El intervalo responde directamente qué valores no descartan los datos. El efecto mínimo detectable responde cuál era el menor efecto que aquel test tenía posibilidad real de encontrar. Hoenig y Heisey concluyen exactamente en esa dirección: dentro del marco frecuentista, la lectura correcta se hace con intervalos de confianza, elección adecuada de la hipótesis nula y test de equivalencia.
- ¿El poder estadístico es inútil, entonces?
- No. El poder es indispensable ANTES del test, para elegir el tamaño de muestra. Lo que no funciona es usarlo DESPUÉS para interpretar el resultado. Greenland y coautores ponen la frontera en el mismo lugar: pese a las limitaciones para interpretar datos ya recolectados, el poder es útil para diseñar estudios y para entender por qué la replicación de un resultado significante falla con frecuencia incluso en condiciones ideales.
- ¿Un test sin significancia significa que no debo tocar más esa hipótesis?
- Depende enteramente del ancho del intervalo, no del valor p. En el ejemplo trabajado de este artículo, el intervalo del 95 por ciento de la diferencia va de menos 0,18 a más 0,42 punto porcentual: descarta ganancias mayores que medio punto, pero sigue siendo compatible con una ganancia relevante de un tercio de punto. Llamar a eso "no funciona" es leer en el resultado una precisión que no tiene.