Efecto Mínimo Detectable: cómo elegir el MDE
Qué es el efecto mínimo detectable, cómo elegir un MDE defendible, absoluto contra relativo y qué puede resolver de verdad tu tráfico.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
El efecto mínimo detectable es la menor mejora que tu test fue construido para captar de forma confiable, y es el parámetro que decide todo el resto del experimento: cuántos visitantes necesita, cuánto tiempo corre, y qué mejoras reales simplemente no va a notar. La mayoría de los equipos elige un MDE sin saber que lo eligió, al fijar una duración o aceptar el valor por defecto de una calculadora. Esta guía cubre qué significa de verdad el MDE, cómo elegir uno que puedas defender ante alguien escéptico, la trampa de lo absoluto contra lo relativo que dimensiona tests mal en silencio, y cómo leer lo que tu tráfico puede y no puede resolver. Forma parte de nuestra guía completa de test A/B y conversa directo con la aritmética de cuántos visitantes necesita un test A/B.
Qué significa el efecto mínimo detectable, con precisión
El MDE es una afirmación sobre el experimento, no sobre el mundo. Definir un MDE de 15% relativos dice: si el efecto verdadero fuera una mejora del 15%, este diseño lo detectaría con la probabilidad dada por tu poder, típicamente 80%. No dice que el efecto será del 15%, y no promete que un resultado del 15% será significativo en una corrida cualquiera.
De ahí salen dos consecuencias de inmediato, y las dos se pasan por alto con frecuencia.
Los efectos menores que el MDE no fueron refutados, quedaron sin respuesta. Un test dimensionado para 15% que encuentra un efecto verdadero del 9% normalmente termina con un intervalo de confianza cruzando el cero. El registro correcto es “inconcluso en esta muestra”, no “el cambio no hizo nada”.
Poder no es certeza. Con 80% de poder, una corrida de cada cinco pierde un efecto verdadero exactamente del tamaño para el que diseñaste. Eso es la convención estándar, no un defecto, pero significa que un único test inconcluso sobre una idea prometedora es evidencia débil en contra de la idea.
Absoluto o relativo: el mismo diseño, dos unidades
Un MDE puede declararse en puntos porcentuales (absoluto) o como fracción de la base (relativo). Convertir entre los dos es aritmética, y equivocarse en la conversión es una de las formas más rápidas de dimensionar un test un orden de magnitud más pequeño de lo que debería.
Sobre una base del 4%, las dos afirmaciones de abajo describen el mismo experimento y producen la misma exigencia:
| Afirmación | Significado | Visitantes por variación |
|---|---|---|
| MDE absoluto de 1 punto porcentual | de 4,0% a 5,0% | 6.745 |
| MDE relativo del 25% | de 4,0% a 5,0% | 6.745 |
| MDE absoluto de 0,4 punto porcentual | de 4,0% a 4,4% | 39.475 |
| MDE relativo del 10% | de 4,0% a 4,4% | 39.475 |
La trampa es que las dos unidades cargan intuiciones opuestas. “Un punto porcentual” suena a un pedido modesto; sobre una base del 4% es un cuarto de la tasa entera, un resultado que la mayoría de los cambios de página nunca produce. En cambio “10% mejor” suena ambicioso siendo, en esa base, un movimiento de 0,4 punto porcentual que cuesta casi seis veces más tráfico.
El mismo cambio absoluto también cuesta valores salvajemente distintos según dónde esté tu base:
| Base | MDE absoluto de 1 punto porcentual | Efecto relativo equivalente | Visitantes por variación |
|---|---|---|---|
| 2% | de 2,0% a 3,0% | 50% | 3.826 |
| 4% | de 4,0% a 5,0% | 25% | 6.745 |
| 10% | de 10,0% a 11,0% | 10% | 14.751 |
| 30% | de 30,0% a 31,0% | cerca de 3,3% | 33.275 |
Regla de la casa que vale adoptar: declara el MDE en términos relativos y escribe el equivalente absoluto al lado. El relativo viaja mejor entre páginas de bases distintas, y escribir los dos en el registro del experimento hace que la ambición sea imposible de malinterpretar después. Pon tus números aquí:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Cómo elegir un MDE que puedas defender
El MDE es una decisión de negocio vestida de estadística. Cuatro pasos la vuelven defendible.
1. Empieza por la decisión, no por la calculadora
Pregunta qué mejora de verdad cambiaría el comportamiento: a partir de qué ganancia subes la variación en definitiva, a partir de qué ganancia inviertes más en esa área, por debajo de qué ganancia el cambio no paga el costo de mantenimiento. Coloca el MDE justo por debajo del menor de esos umbrales. Si nadie logra nombrar un número, el test todavía no tiene propósito, y descubrirlo antes de lanzar es ahorro, no retraso.
2. Revisa la ambición contra el tamaño del cambio
Los cambios pequeños producen efectos pequeños. Color de botón, ajuste de microcopy, campo reordenado: rara vez mueven una tasa de conversión en 20%, así que un test dimensionado para MDE del 20% sobre un cambio así está prácticamente garantizado a terminar inconcluso. Reescritura completa de página, oferta diferente, etapa eliminada del flujo: esas plausiblemente pueden. Empareja la ambición del MDE con la ambición del cambio, o cuenta con no aprender nada.
3. Ponle precio al tráfico y al calendario
Ahora corre la aritmética, porque es aquí donde muere la mayoría de los MDE. La muestra escala con aproximadamente uno sobre el cuadrado del efecto.
Aproximación normal de dos proporciones, división igual entre las variaciones. La fecha usa tu zona horaria y recalcula en vivo.
| Visitantes por variación disponibles | MDE relativo que eso resuelve sobre una base del 4% | Equivalente absoluto |
|---|---|---|
| 2.500 | cerca de 42,6% | +1,70 punto porcentual |
| 5.000 | cerca de 29,3% | +1,17 punto porcentual |
| 10.000 | cerca de 20,3% | +0,81 punto porcentual |
| 25.000 | cerca de 12,6% | +0,51 punto porcentual |
| 50.000 | cerca de 8,9% | +0,35 punto porcentual |
| 100.000 | cerca de 6,2% | +0,25 punto porcentual |
Lee esa tabla al revés y se vuelve una herramienta de planificación: tu tráfico ya eligió un MDE por ti. La pregunta de diseño es solo si aceptas ese número o cambias alguna otra cosa en el test.
4. Escríbelo antes de lanzar
El MDE, la base que asume, la muestra que implica y la fecha planeada de cierre pertenecen al registro del experimento antes de que se sortee el primer visitante. Ese solo hábito es lo que separa “el test fue inconcluso” de “seguimos hasta que quedó bonito”, y es la defensa más barata que existe contra el problema del peeking.
Ejemplo trabajado: diseñado para 15%, encontró 9,5%
Una página de checkout convierte al 4,0%. El equipo quiere detectar una mejora del 15% relativo, es decir de 4,0% a 4,6%, con 95% de confianza y 80% de poder. El motor devuelve 17.943 visitantes por variación, 35.886 en total, cerca de 13 días a 20.000 visitantes elegibles por semana.
Dos formas de que esto termine, usando exactamente esa muestra.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
El efecto llega al tamaño planeado. El control termina con 718 conversiones en 17.943 visitantes (4,00%), y la variación con 826 (4,60%). Resultado: z = 2,81, valor p = 0,0050, intervalo de confianza de la diferencia de +0,18 a +1,02 punto porcentual, mejora relativa de +15,0%. Significativo, como fue diseñado.
El efecto es real, pero menor. Misma muestra, control en 718, variación en 786 (4,38%). Eso es una mejora relativa de +9,5%, que en una página de checkout es una ganancia comercial relevante. Resultado: z = 1,79, valor p = 0,0732, intervalo de confianza de -0,04 a +0,79 punto porcentual. No significativo, y el intervalo incluye el cero.
El segundo desenlace es el punto entero de entender el MDE. Nada falló. El diseño prometió resolver efectos del 15% y recibió uno del 9,5%. Leer eso como “el nuevo checkout no funciona” sería un error factual, y subir el original por eso tiraría a la basura una mejora real. El registro correcto es: inconcluso en esta muestra, dirección observada positiva, y un test capaz de resolver un efecto del 9,5% en esa base necesitaría cerca de 43.640 visitantes por variación, lo que es decisión para la próxima ronda de planificación, no extensión en pleno vuelo.
El MDE pertenece a una métrica, no al test
Un MDE cubre una métrica, y la mayoría de los experimentos sigue varias en silencio. Un test de checkout típicamente tiene una métrica primaria (compras concluidas), una secundaria (adición al carrito) y al menos un guardrail que no puede empeorar (tasa de reembolso, tiempo de carga, contactos con soporte). Cada una de ellas tiene su propia base, así que cada una tiene su propio efecto detectable en la misma muestra.
Eso tiene dos consecuencias prácticas. Primero, un test con poder para la métrica primaria normalmente está sin poder para los guardrails, porque un guardrail suele ser un evento más raro, de base más baja. Un guardrail que no muestra empeoramiento significativo en un test dimensionado para compras no fue liberado, solo no fue examinado con muestra suficiente para decir nada. Trata el guardrail como monitoreo direccional con un umbral de alarma, no como chequeo aprobado, tema de nuestra guía de métricas de guardrail.
Segundo, leer varias métricas en busca de significancia multiplica la posibilidad de que una de ellas cruce la línea por accidente. Con cinco métricas independientes a un umbral del 5%, la probabilidad de que al menos una produzca un falso positivo es de cerca del 23%, no del 5%. La corrección es nombrar la métrica primaria en el registro del experimento antes de lanzar y dejar que ella cargue la decisión, tratando el resto como contexto. Nuestra guía de errores comunes en test A/B cubre los métodos de corrección para cuando genuinamente necesitas decidir sobre más de una métrica a la vez.
Errores comunes con el MDE
| Error | Qué produce |
|---|---|
| Nunca declarar un MDE | Igual tienes uno, definido implícitamente por cuándo paraste; solo que no logras distinguir test inconcluso de idea fracasada |
| Confundir punto porcentual con porcentaje relativo | Tests dimensionados varias veces más pequeños de lo que debían, y después leídos como si fueran concluyentes |
| Definir el MDE por el tráfico disponible y reportarlo como ambición | El diseño se vuelve “lo que logramos ver”, y efectos reales pequeños se etiquetan como ausencia de efecto |
| Casar un cambio minúsculo con un MDE grande | Una forma cara de garantizar un resultado inconcluso |
| Extender el test porque el valor p está cerca | Peeking con otro nombre; la garantía que ofrecía el diseño deja de valer |
| Tratar lo inconcluso como prueba de ausencia de efecto | Mata buenas ideas y esconde que el test nunca tuvo cómo responder |
Si tu programa sigue cayendo en las dos últimas líneas, la corrección estructural es la reducción de varianza, que recorta la muestra necesaria para el mismo MDE, cubierta en nuestra guía de CUPED, o un diseño que legítimamente permita análisis intermedio, cubierto en test secuencial explicado.
Hazlo automático en Donnu
Un MDE solo te protege si queda fijo antes de que empiece el test y visible mientras corre. Donnu A/B calcula la muestra que tu tráfico real sostiene para el efecto que elegiste, mantiene la fecha planeada de cierre a la vista en vez de invitar a un veredicto diario, y reporta el intervalo de confianza al lado del efecto observado, así un resultado inconcluso se lee como inconcluso y no como casi ahí. Cuando tu tráfico no logra resolver el efecto que quieres, te lo dice antes de que gastes dos semanas descubriéndolo.
Empieza una prueba gratis de 14 días y define el MDE de tu próximo test contra tu propia base.
Referencias
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Capítulos sobre poder estadístico, efecto mínimo detectable y diseño de experimento. Material complementario en experimentguide.com.
- Gelman, A. y Carlin, J. Beyond Power Calculations: Assessing Type S (Sign) and Type M (Magnitude) Errors. Perspectives on Psychological Science, 2014. El relato formal de por qué los diseños sin poder exageran los efectos que logran detectar, vía razón de exageración. stat.columbia.edu.
- Deng, A., Xu, Y., Kohavi, R. y Walker, T. Improving the Sensitivity of Online Controlled Experiments by Utilizing Pre-Experiment Data. WSDM 2013. Reducción de varianza como camino para bajar el efecto detectable sin más tráfico. exp-platform.com.
Lee también: Cuántos visitantes necesita un test A/B · Significancia estadística en test A/B · Test secuencial explicado · Qué es CUPED · Calculadora de MDE gratis · Leia em português
Preguntas frecuentes
- ¿Qué es el efecto mínimo detectable (MDE)?
- El efecto mínimo detectable es la menor diferencia entre variaciones que tu test fue construido para detectar de forma confiable, dado el tamaño de muestra, el nivel de confianza y el poder. Es una propiedad del diseño del experimento, no una predicción del resultado. Un MDE de 15% relativos no significa que esperes una ganancia del 15%, significa que si el efecto verdadero fuera del 15%, este test lo captaría cerca del 80% de las veces con el poder elegido, y que efectos verdaderos menores pasarían con frecuencia como inconclusos.
- ¿Cómo elegir un buen MDE?
- Empieza por la decisión, no por la estadística. Pregunta qué mejora sería lo bastante grande como para cambiar lo que haces, subir, revertir, invertir más en esa área, y coloca el MDE justo por debajo de ese umbral. Después revisa la cuenta de tráfico: si ese MDE pide más visitantes de los que puedes recoger en una ventana razonable, hay un conflicto real que resolver abiertamente, sea testeando un cambio mayor, cambiando a una métrica de base más alta, o aceptando que esa página no es testeable hoy. Lo que no se puede es subir el MDE en silencio hasta que quepa en el tráfico y seguir llamando concluyente al resultado.
- ¿Cuál es la diferencia entre MDE absoluto y relativo?
- El MDE absoluto se declara en puntos porcentuales, por ejemplo pasar de 4% a 5% es 1 punto porcentual. El MDE relativo se declara como fracción de la base, así que el mismo cambio es una mejora del 25% relativo. Los dos describen el mismo experimento y producen el mismo tamaño de muestra cuando se convierten correctamente: sobre una base del 4%, tanto 1 punto porcentual absoluto como 25% relativos piden 6.745 visitantes por variación. Confundir los dos es una de las causas más comunes de que un test se dimensione diez veces más pequeño de lo que debía, porque 1 punto porcentual suena modesto cuando sobre una base del 4% es un cuarto de la tasa entera.
- ¿Qué pasa si el efecto real es menor que mi MDE?
- El test normalmente termina inconcluso, y es importante no leerlo como evidencia de que el cambio no hizo nada. Concretamente, un test dimensionado para 15% relativos sobre una base del 4% necesita 17.943 visitantes por variación. Si la mejora verdadera es de cerca del 9,5%, ese mismo test devuelve un valor p cerca de 0,073 con intervalo de confianza cruzando el cero: una ganancia real que el experimento no logra confirmar. Registrar eso como inconcluso, y no como fracaso, es lo que mantiene honesto a un programa, y el intervalo dice cuánto más grande tendría que ser el test.
- ¿Puedo bajar el MDE después de que el test ya empezó?
- No sin renunciar a la garantía que ofrecía el diseño. Extender un test en marcha porque el resultado está cerca es una forma de peeking: la decisión de seguir recogiendo datos se tomó después de mirar los datos, lo que infla la tasa de falso positivo por encima del nivel para el que diseñaste. Las alternativas disciplinadas son decidir la regla de extensión antes de lanzar, por ejemplo un diseño de dos etapas preregistrado, o usar un método secuencial construido para permitir miradas intermedias con tasa de error válida en todos los puntos.
- ¿Un MDE mayor hace mi test mejor o peor?
- Ninguno de los dos, lo hace diferente. Un MDE grande da un test rápido y barato que solo ve efectos grandes, que es el diseño correcto para un rediseño o una oferta sustancialmente distinta. Un MDE pequeño da un test lento y caro que resuelve diferencias sutiles, que es el diseño correcto para una página de mucho tráfico donde 3% de mejora vale dinero de verdad. El error no es elegir un MDE grande, es elegirlo sin darte cuenta y después interpretar un resultado inconcluso como prueba de que el cambio no tuvo valor.
- ¿Cómo se relaciona el MDE con la muestra y la duración?
- El tamaño de muestra escala con aproximadamente uno sobre el cuadrado del MDE, así que reducir a la mitad el efecto que quieres detectar multiplica los visitantes necesarios por cerca de cuatro. Sobre una base del 4%, 5.000 visitantes por variación resuelven cerca de 29,3% relativos, 25.000 resuelven cerca de 12,6% y 100.000 resuelven cerca de 6,2%. Esa curva cuadrática es el motivo de que el dimensionamiento parezca generoso en el extremo ambicioso y brutal en el extremo sutil, y de que la pregunta honesta en la mayoría de los programas no sea cuánto tiempo correr, sino qué efectos tu tráfico nunca te va a dejar ver.