Regresión Discontinua: medir efecto en un umbral
La regresión discontinua compara a quien quedó justo arriba de un corte con quien quedó justo abajo. Cuándo vale, cuándo miente y el test que lo decide.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Cuando un beneficio se otorga por una regla de corte, quien quedó justo arriba y quien quedó justo abajo son casi la misma persona, y la diferencia entre ambos en el umbral es el efecto de la regla. En la simulación de esta guía, comparar a todos los que están arriba del corte con todos los que están abajo devolvió más 20,0525 puntos con valor-p indistinguible de cero, mientras que la regresión discontinua devolvió 4,55 puntos contra una verdad de 4,50. Pero el método tiene un interruptor de encendido y apagado: si las personas pueden elegir de qué lado del corte caer, deja de funcionar, y existe una prueba que lo detecta. Esta guía muestra la cuenta, la prueba de manipulación, la sensibilidad al ancho de banda y el precio en muestra. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y control sintético.
El problema: la regla ya existe, y la aleatorización no
Todo producto tiene umbrales. Envío gratis por encima de un valor, descuento por volumen, mejora automática de plan, distintivo de vendedor, límite de uso del plan gratuito, franja de puntuación que libera un beneficio, puntaje interno que dispara una campaña.
Ninguno de ellos fue aleatorizado. Y aun así cada uno de ellos es una pregunta legítima: ¿el beneficio funciona?
La intuición detrás de la regresión discontinua es bonita y simple. Alguien con puntaje 59,8 y alguien con puntaje 60,1 son, para todos los efectos prácticos, la misma persona. Mismo perfil, mismo historial, misma intención. Lo único que los separa es que uno recibió el beneficio y el otro no, y eso lo decidió una regla rígida, no la elección de nadie.
Lee y Lemieux formalizan por qué esto es más que una intuición: cuando los individuos tienen control impreciso sobre la variable de corte, aunque algunos tengan más probabilidad de quedar cerca del umbral, todo individuo tiene aproximadamente la misma probabilidad de caer justo arriba o justo abajo del corte, algo parecido a un experimento de cara o cruz. En sus palabras, la variación del tratamiento cerca del umbral queda aleatorizada como si viniera de un experimento aleatorizado.
Esa es la promesa. Y el resto de este artículo trata de cuándo se cumple.
La lectura equivocada, y la calculadora que la confirma
Simulamos un caso de producto: un distintivo de soporte prioritario concedido automáticamente a quien tiene un puntaje interno de salud superior a 60, con el puntaje no exhibido en ningún lugar. Métrica: renovación. Sesenta mil usuarios. El efecto verdadero plantado en el corte fue de 4,50 puntos.
La lectura que cualquier persona haría primero es comparar a quien tiene el distintivo con quien no lo tiene. Pega los números en la calculadora:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
| campo | abajo del corte (A) | arriba del corte (B) |
|---|---|---|
| usuarios | 37.379 | 22.621 |
| renovaciones | 7.553 | 9.107 |
| tasa | 20,2065% | 40,2591% |
Devuelve una diferencia de más 20,0525 puntos, lift relativo de más 99,24 por ciento, valor-p que la calculadora muestra solo como menor que 0,0001, e intervalo de confianza del 95 por ciento entre 19,2948 y 20,8102 puntos, exhibido redondeado como más 19,3 a más 20,8 puntos. La cuenta detrás de eso es z igual a 53,1536.
El distintivo prácticamente duplica la renovación, dice la lectura. Y se equivoca por 4,46 veces, porque el efecto verdadero en el corte es de 4,50 puntos.
El motivo es obvio cuando se dice en voz alta: quien tiene puntaje 85 renueva más que quien tiene puntaje 30 por causa del puntaje, no por causa del distintivo. La comparación entre los dos lados del corte entero mezcla dos cosas, el efecto de la regla y el efecto de ser un usuario más saludable, y la segunda domina.
La calculadora está en lo correcto. Está respondiendo “¿estos dos grupos tienen tasas diferentes?”, y las tienen. La pregunta que interesa es otra.
La cuenta correcta: ajustar de ambos lados y leer la distancia en el corte
La regresión discontinua hace lo siguiente:
- toma solo a quien está dentro de una ventana alrededor del corte, digamos puntaje entre 52 y 68
- ajusta una recta por separado en cada lado, dando más peso a quien está más cerca del umbral
- extrapola cada recta hasta el corte exacto
- el efecto es la distancia vertical entre las dos extrapolaciones en el corte
Corriendo esto en nuestra simulación, con kernel triangular y recta local de cada lado, el resultado por ancho de banda:
| ancho | usuarios a la izquierda | a la derecha | salto estimado | error estándar | IC 95% | valor-p |
|---|---|---|---|---|---|---|
| 3 | 4.439 | 4.147 | 2,3167 pp | 2,2072 pp | de menos 2,01 a 6,64 | 0,2939 |
| 5 | 7.435 | 6.739 | 3,7461 pp | 1,7085 pp | de 0,40 a 7,10 | 0,0283 |
| 8 | 11.809 | 10.257 | 4,5482 pp | 1,3636 pp | de 1,88 a 7,22 | 0,0009 |
| 12 | 17.579 | 14.219 | 4,4038 pp | 1,1242 pp | de 2,20 a 6,61 | 0,00009 |
| 20 | 26.924 | 19.336 | 4,5585 pp | 0,8977 pp | de 2,80 a 6,32 | 0,0000004 |
| 35 | 35.512 | 22.621 | 4,7624 pp | 0,7372 pp | de 3,32 a 6,21 | 0,0000000001 |
El efecto verdadero es de 4,50 puntos, y los seis anchos contienen ese valor en el intervalo de confianza. Fíjate en lo que la tabla enseña de verdad:
- la ventana más estrecha no es la más correcta, es la más imprecisa. Con ancho 3, la estimación salió en 2,32 con error estándar de 2,21 y valor-p de 0,29. No se equivocó, no sabe.
- la ventana más ancha no es la más equivocada. Con ancho 35, devolvió 4,76 con el menor error estándar de todos. Aquí el resultado es bueno porque la curvatura real es suave. En una curva más torcida, el ancho grande introduciría sesgo.
- el patrón de estabilidad es lo que sostiene la lectura. De ancho 8 a 35, la estimación osciló entre 4,40 y 4,76, un rango ajustado. Es eso, no un número único, lo que se reporta.
Lee y Lemieux recomiendan exactamente eso en su lista de prácticas: explorar la sensibilidad de los resultados a un rango de anchos de banda y de órdenes de polinomio, y reportar una estimación “típica” junto con un rango de estimaciones puntuales. Sugieren además un recurso gráfico útil, graficar la estimación local lineal contra un continuo de anchos de banda.
Y queda registrada la regla dura: el ancho de banda se elige antes, o por un criterio mecánico como validación cruzada, o por un rango reportado por entero. Elegir el ancho que devuelve el número deseado es el mismo pecado de elegir el control después del resultado en diferencias en diferencias, y vale la misma disciplina del plan de análisis preregistrado.
El interruptor: si se puede elegir el lado, se acabó
Aquí está lo que separa a la regresión discontinua de un truco estadístico.
Lee y Lemieux son directos: la existencia de un tratamiento que es función discontinua de una variable de corte no basta para justificar la validez del diseño. Y más: si acaso, las reglas discontinuas pueden generar incentivos, causando comportamiento que invalidaría el enfoque. Su ejemplo es académico, alumnos “eligiendo” la nota por esfuerzo, pero el ejemplo de producto es aún más evidente.
Envío gratis por encima de R$ 199. El umbral está impreso en la pantalla. Quien llega a R$ 186 ve el aviso y agrega un artículo de R$ 20. No existe “casi el mismo cliente” en ambos lados del corte: quien está en R$ 195 es quien no quiso, no pudo o no vio, y quien está en R$ 201 incluye a un montón de gente que hizo esfuerzo para llegar ahí. Son poblaciones diferentes por construcción.
La prueba que detecta eso no mira el resultado, mira la distribución de la propia variable de corte. Si nadie puede controlar el lado, la densidad atraviesa el umbral sin escalón. Si las personas empujan, aparece un apilamiento.
Simulamos los dos casos con 60.000 observaciones cada uno. En el escenario del envío gratis, el 35 por ciento de quienes estaban entre R$ 179 y R$ 199 completó la canasta para pasar del umbral, lo que corresponde a 3.554 canastas, o 5,92 por ciento de la base.
| escenario | densidad a la izquierda | densidad a la derecha | razón | z | valor-p | veredicto |
|---|---|---|---|---|---|---|
| puntaje interno de salud, no exhibido | 0,024589 | 0,023671 | 0,9627 | menos 1,334 | 0,1823 | pasa |
| envío gratis a partir de R$ 199, visible | 0,005052 | 0,015881 | 3,1438 | 22,367 | indistinguible de cero | reprueba |
Tres veces más canastas justo arriba del umbral que justo abajo. No es sutil, y no necesita sofisticación para ser visto: un histograma del valor de carrito con franjas de R$ 1 lo muestra a simple vista. Lee y Lemieux recomiendan exactamente ese gráfico como primer punto de la lista de verificaciones, presentar la distribución de la variable de corte en un histograma de franjas fijas y lo más estrechas posible, y recomiendan en contra de graficar una curva suavizada de densidad en su lugar, porque el escalón desaparece en el suavizado. La prueba formal de discontinuidad en la densidad que ellos citan es la de McCrary.
Y el estrago en el resultado es exactamente el esperado. Corriendo la regresión discontinua en el escenario del envío gratis, donde el salto verdadero plantado era de 3,00 puntos:
| ancho | salto estimado | error estándar | valor-p |
|---|---|---|---|
| 3 | menos 4,0818 pp | 4,1530 pp | 0,3257 |
| 5 | menos 0,1356 pp | 3,1884 pp | 0,9661 |
| 8 | 2,5539 pp | 2,5491 pp | 0,3164 |
| 12 | 4,3948 pp | 2,0772 pp | 0,0344 |
| 20 | 4,7443 pp | 1,6111 pp | 0,0032 |
El signo cambia con el ancho de banda. De menos 4,08 a más 4,74, atravesando el cero, y con el resultado quedando “significativo” solo en los anchos grandes, que son justamente los que diluyen el apilamiento. Un analista que corriera solo el ancho 20 publicaría 4,74 puntos con valor-p de 0,0032 y estaría equivocado por 58 por ciento.
La prueba de placebo: cortes falsos
La segunda verificación obligatoria es correr la misma lectura en cortes que no existen. Si el método encuentra un salto en puntaje 55, donde no hay ninguna regla, encuentra salto en cualquier lugar.
En nuestro escenario del umbral invisible, con ancho 8:
| corte probado | salto estimado | error estándar | valor-p |
|---|---|---|---|
| 50 (falso) | menos 1,2329 pp | 1,2306 pp | 0,3164 |
| 55 (falso) | menos 1,3404 pp | 1,2690 pp | 0,2908 |
| 60 (real) | 4,5482 pp | 1,3636 pp | 0,0009 |
| 65 (falso) | menos 2,0900 pp | 1,5089 pp | 0,1660 |
| 70 (falso) | menos 1,8553 pp | 1,7302 pp | 0,2836 |
Cuatro cortes falsos, cuatro nulos. Un corte real, un efecto. Es ese contraste el que transforma un número en una evidencia.
Lee y Lemieux agregan dos verificaciones hermanas en su lista, y las dos valen cinco minutos: correr un análisis de regresión discontinua paralelo en las covariables de base, porque si la premisa de no manipulación vale no debe haber discontinuidad en variables determinadas antes de la asignación; y explorar la sensibilidad de los resultados a la inclusión de esas covariables, porque su inclusión no debería cambiar el salto estimado, por más correlacionadas con el resultado que estén. Si cambia de forma importante, eso puede indicar ordenamiento de la variable de corte.
El precio: la regresión discontinua cuesta mucha más muestra
Este es el punto que casi nunca aparece, y que decide si el método vale la pena.
La regresión discontinua solo usa a quien está dentro de la ventana, y mide el efecto solo en el corte. En nuestra simulación:
| lectura | usuarios usados | lo que se mide |
|---|---|---|
| base total disponible | 60.000 | nada, sin diseño |
| ventana de ancho 5 | 14.174 (23,62%) | efecto en el puntaje 60 |
| ventana de ancho 8 | 22.066 (36,78%) | efecto en el puntaje 60 |
| test aleatorizado con el mismo efecto | 3.386 en total | efecto en la población aleatorizada |
Con base de 30 por ciento y un efecto de 4,5 puntos absolutos, al 95 por ciento de confianza y 80 por ciento de poder, la calculadora de tamaño de muestra pide 1.693 por variación, 3.386 en total. La regresión discontinua con ancho 8 consumió 22.066 usuarios para responder la misma pregunta, es decir cerca de 6,5 veces más.
Y la respuesta que da es más estrecha. Lo que se estima es el efecto para quien está bien cerca del corte. Si el distintivo de soporte prioritario ayuda mucho a quien tiene puntaje 30, eso no aparece: aquella región no entró en la ventana, y el diseño no tiene nada que decir sobre ella.
Lee y Lemieux registran la razón estructural de eso: la estimación depende de datos lejos del corte, y por eso depende de la forma funcional elegida. Thistlethwaite y Campbell, en la primera aplicación del diseño, ya señalaban que se trata fundamentalmente de un enfoque de extrapolación.
Es decir, el cuadro completo es: más muestra, respuesta más local, y dependencia de decisiones de ajuste. Es un buen método cuando no existe alternativa. No es una alternativa cuando existe aleatorización.
Guion de regresión discontinua en ocho pasos
- Escribe la regla exacta. Qué variable, qué corte, quién la aplica, desde cuándo. Si la regla cambió de valor a mitad del período, tienes dos diseños, no uno.
- Pregunta si la persona ve el umbral. Si lo ve, el diseño probablemente está muerto antes de empezar. Envío gratis, meta de descuento y barra de progreso son casos de muerte casi segura.
- Grafica el histograma de la variable de corte con franjas estrechas y fijas. Antes de estimar cualquier salto. Eso cuesta cinco minutos y cancela la mitad de los proyectos.
- Corre la prueba formal de discontinuidad en la densidad. Si reprueba, detente. No existe arreglo estadístico para la manipulación del lado del corte.
- Corre la lectura en varios anchos de banda y publica el rango entero, con intervalos de confianza.
- Corre cortes falsos y covariables de base. Un salto donde no puede haber salto derriba el diseño.
- Di cuántos usuarios entraron en la ventana y qué fracción de la base es eso. “4,55 puntos sobre 22.066 de los 60.000 usuarios, dentro de 8 puntos del corte” es una frase completa.
- Di que el efecto es local. El número vale cerca del corte, y no es el efecto de extender el beneficio a todo el mundo.
Errores comunes
- Comparar a quien está arriba con quien está abajo del corte entero. Es el error central. En nuestra simulación exageró el efecto en 4,46 veces, con valor-p indistinguible de cero.
- Usar un umbral que la persona ve. Envío gratis, franja de descuento, meta de puntos. La prueba de densidad reprueba, y el resultado cambia de signo con el ancho de banda.
- Elegir el ancho de banda después de ver los resultados. Con seis anchos disponibles, uno de ellos cuenta la historia que querías. En el escenario manipulado, el ancho 20 devolvió 4,74 puntos con valor-p de 0,0032 y estaba equivocado.
- Leer la estimación de la ventana más estrecha como la más confiable. Con ancho 3 la estimación salió en 2,32 con valor-p de 0,29. No es más pura, es más ciega.
- Extrapolar el efecto lejos del corte. Es el error de interpretación más común, y es cercano al de generalizar un resultado de subgrupo, como en efecto heterogéneo por segmento.
- Olvidar que la regla puede haber cambiado. Un corte que era 50 el año pasado y pasó a 60 mezcla dos diseños y produce un salto donde no hay ningún efecto.
- Confundirlo con un test aleatorizado a la hora de dimensionar. La ventana es una fracción de la base. Dimensiona por la ventana, no por el total, y compara con lo que la calculadora de tamaño de muestra pediría para el test aleatorizado equivalente.
- Aplicarlo cuando el corte es difuso sin tratar eso. Si atravesar el umbral solo aumenta la PROBABILIDAD de recibir el beneficio en vez de garantizarlo, el salto en la métrica necesita ser dividido por el salto en la tasa de recepción, una lógica cercana a la de intención de tratar.
Hazlo automático en Donnu
La regresión discontinua exige algo que la mayoría de los sistemas no guarda: el valor de la variable de corte en el momento en que la regla fue aplicada. Un panel que guarda el puntaje de hoy, y no el puntaje que valía cuando el distintivo fue concedido, no permite la lectura, porque el puntaje se movió desde entonces y la ventana alrededor del corte deja de ser la ventana correcta.
Donnu guarda el valor que decidió la asignación junto con el resultado, con marca de tiempo, lo que preserva la posibilidad de leer un umbral después. Pero el consejo más valioso de este artículo es anterior a eso: si la regla todavía va a ser creada, aleatoriza. Conceder el beneficio por sorteo a una porción de los usuarios cerca de la franja relevante responde la misma pregunta con cerca de un sexto de la muestra y sin ninguna premisa sobre manipulación. Corre la cuenta en la calculadora de tamaño de muestra antes de decidir, y cierra la lectura en la calculadora de significancia.
Referencias
- Lee, D. S. y Lemieux, T. Regression Discontinuity Designs in Economics. Journal of Economic Literature 48(2), 2010. Fuente de que el diseño fue introducido por Thistlethwaite y Campbell en 1960 para estimar efectos de tratamiento fuera de un escenario experimental, cuando el tratamiento es determinado por una variable de asignación que cruza un corte conocido; de que la existencia de un tratamiento definido por una función discontinua de la variable de asignación no basta para justificar la validez del diseño, y de que las reglas discontinuas pueden generar incentivos y provocar comportamiento que invalidaría el enfoque; de que, cuando los individuos tienen control impreciso sobre la variable de asignación, todo individuo tiene aproximadamente la misma probabilidad de caer justo arriba o justo abajo del corte, algo parecido a un experimento de cara o cruz, dejando la variación cerca del umbral aleatorizada como si viniera de un experimento aleatorizado; de la recomendación de presentar la distribución de la variable de asignación en un histograma de franjas fijas y lo más estrechas posible, y en contra de graficar una curva suavizada de estimaciones de densidad en su lugar, con la prueba formal de discontinuidad en la densidad atribuida a McCrary (2008); de la recomendación de explorar la sensibilidad de los resultados a un rango de anchos de banda y de órdenes de polinomio, reportando una estimación típica junto con un rango de estimaciones puntuales, y de graficar la estimación local lineal contra un continuo de anchos; de la recomendación de correr un análisis paralelo en las covariables de base, que no deben presentar discontinuidad si no hay manipulación, y de verificar la sensibilidad a la inclusión de esas covariables, cuya inclusión no debería alterar el salto estimado por más correlacionadas que estén con el resultado; y de que la estimación depende de datos lejos del corte y por lo tanto de la forma funcional elegida, con la observación de que la primera aplicación del diseño, de Thistlethwaite y Campbell, ya señalaba tratarse fundamentalmente de un enfoque de extrapolación. princeton.edu.
- Bertrand, M., Duflo, E. y Mullainathan, S. How Much Should We Trust Differences-in-Differences Estimates? NBER Working Paper 8841, 2002. Fuente del principio de inferencia por aleatorización, que usa la distribución empírica de los efectos estimados para intervenciones ficticias como distribución de referencia, y que es la misma lógica de los cortes falsos usados aquí como prueba de placebo. nber.org.
- Abadie, A., Diamond, A. y Hainmueller, J. Synthetic Control Methods for Comparative Case Studies: Estimating the Effect of California’s Tobacco Control Program. Journal of the American Statistical Association 105(490), 2010. Fuente del principio de que un método de comparación sin aleatorización debe declarar antes el criterio de validación y no debe ser usado cuando ese criterio no se alcanza, el análogo, en el control sintético, de la prueba de densidad usada aquí. law.upenn.edu.
- Blake, T., Nosko, C. y Tadelis, S. Consumer Heterogeneity and Paid Search Effectiveness: A Large Scale Field Experiment. NBER Working Paper 20171, 2014. Fuente del contraste de magnitud entre una lectura sin aleatorización y una lectura aleatorizada sobre el mismo fenómeno: retorno sobre inversión superior al 4.100 por ciento por mínimos cuadrados ordinarios contra menos 63 por ciento por la variación experimental, con intervalo de confianza del 95 por ciento entre menos 124 y menos 3 por ciento. nber.org.
Lee también: Diferencias en diferencias · Control sintético · Intención de tratar · Efecto heterogéneo por segmento · Plan de análisis preregistrado · Calculadora de tamaño de muestra · Leer en portugués
Preguntas frecuentes
- ¿Qué es la regresión discontinua?
- Es una lectura para el caso en que un beneficio se concede por una REGLA de corte sobre una variable continua, por ejemplo un distintivo dado a quien tiene un puntaje superior a 60. Compara a quien quedó justo arriba del corte con quien quedó justo abajo, estimando el salto exactamente en el umbral. Fue introducida por Thistlethwaite y Campbell en 1960.
- ¿Por qué no basta comparar a quien está arriba con quien está abajo del corte?
- Porque el resultado normalmente crece con la propia variable de corte, así que la diferencia total mezcla el efecto de la regla con el efecto de tener un puntaje mayor. En la simulación de esta guía, esa comparación devolvió más 20,0525 puntos con valor-p indistinguible de cero, cuando el efecto verdadero en el corte era de 4,50 puntos. Exageró por 4,46 veces.
- ¿Cuándo NO vale la regresión discontinua?
- Cuando las personas logran controlar con precisión de qué lado del corte caen. Lee y Lemieux registran que la existencia de un tratamiento definido por una regla discontinua no basta para validar el diseño, y que las reglas discontinuas pueden crear incentivos y provocar comportamiento que invalida la lectura. El umbral de envío gratis es el caso clásico de invalidación.
- ¿Cómo se prueba si las personas manipularon el corte?
- Mirando la distribución de la propia variable de corte cerca del umbral, con una prueba formal de discontinuidad en la densidad. En la simulación de esta guía, en el umbral invisible la densidad a la derecha quedó en 0,9627 de la densidad a la izquierda, con valor-p de 0,1823, y en el umbral visible de envío gratis quedó en 3,1438 veces, con valor-p indistinguible de cero.
- ¿Cómo se elige el ancho de banda?
- No se elige uno solo: se reporta un rango. Lee y Lemieux recomiendan explorar la sensibilidad del resultado a un rango de anchos y de órdenes polinomiales, y reportar una estimación típica junto con un rango de estimaciones. En la simulación de esta guía, el salto estimado quedó entre 2,32 y 4,76 puntos según el ancho, contra una verdad de 4,50.
- ¿La regresión discontinua reemplaza a un test A/B?
- No. Mide el efecto solo CERCA del corte, y usa solo a quien está dentro de la ventana. En la simulación de esta guía, la ventana de 8 puntos usó 22.066 de los 60.000 usuarios, mientras que un test aleatorizado detectaría el mismo efecto con 3.386 usuarios en total, cerca de 6,5 veces menos.