Estadística

Regresión Discontinua: medir efecto en un umbral

La regresión discontinua compara a quien quedó justo arriba de un corte con quien quedó justo abajo. Cuándo vale, cuándo miente y el test que lo decide.

Ilustración plana de una nube de puntos cortada por una línea vertical, con el nivel de los puntos saltando visiblemente de un lado al otro del corte

Cuando un beneficio se otorga por una regla de corte, quien quedó justo arriba y quien quedó justo abajo son casi la misma persona, y la diferencia entre ambos en el umbral es el efecto de la regla. En la simulación de esta guía, comparar a todos los que están arriba del corte con todos los que están abajo devolvió más 20,0525 puntos con valor-p indistinguible de cero, mientras que la regresión discontinua devolvió 4,55 puntos contra una verdad de 4,50. Pero el método tiene un interruptor de encendido y apagado: si las personas pueden elegir de qué lado del corte caer, deja de funcionar, y existe una prueba que lo detecta. Esta guía muestra la cuenta, la prueba de manipulación, la sensibilidad al ancho de banda y el precio en muestra. Forma parte de nuestra guía completa de test A/B y complementa diferencias en diferencias y control sintético.

El problema: la regla ya existe, y la aleatorización no

Todo producto tiene umbrales. Envío gratis por encima de un valor, descuento por volumen, mejora automática de plan, distintivo de vendedor, límite de uso del plan gratuito, franja de puntuación que libera un beneficio, puntaje interno que dispara una campaña.

Ninguno de ellos fue aleatorizado. Y aun así cada uno de ellos es una pregunta legítima: ¿el beneficio funciona?

La intuición detrás de la regresión discontinua es bonita y simple. Alguien con puntaje 59,8 y alguien con puntaje 60,1 son, para todos los efectos prácticos, la misma persona. Mismo perfil, mismo historial, misma intención. Lo único que los separa es que uno recibió el beneficio y el otro no, y eso lo decidió una regla rígida, no la elección de nadie.

Lee y Lemieux formalizan por qué esto es más que una intuición: cuando los individuos tienen control impreciso sobre la variable de corte, aunque algunos tengan más probabilidad de quedar cerca del umbral, todo individuo tiene aproximadamente la misma probabilidad de caer justo arriba o justo abajo del corte, algo parecido a un experimento de cara o cruz. En sus palabras, la variación del tratamiento cerca del umbral queda aleatorizada como si viniera de un experimento aleatorizado.

Esa es la promesa. Y el resto de este artículo trata de cuándo se cumple.

La lectura equivocada, y la calculadora que la confirma

Simulamos un caso de producto: un distintivo de soporte prioritario concedido automáticamente a quien tiene un puntaje interno de salud superior a 60, con el puntaje no exhibido en ningún lugar. Métrica: renovación. Sesenta mil usuarios. El efecto verdadero plantado en el corte fue de 4,50 puntos.

La lectura que cualquier persona haría primero es comparar a quien tiene el distintivo con quien no lo tiene. Pega los números en la calculadora:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

campo abajo del corte (A) arriba del corte (B)
usuarios 37.379 22.621
renovaciones 7.553 9.107
tasa 20,2065% 40,2591%

Devuelve una diferencia de más 20,0525 puntos, lift relativo de más 99,24 por ciento, valor-p que la calculadora muestra solo como menor que 0,0001, e intervalo de confianza del 95 por ciento entre 19,2948 y 20,8102 puntos, exhibido redondeado como más 19,3 a más 20,8 puntos. La cuenta detrás de eso es z igual a 53,1536.

El distintivo prácticamente duplica la renovación, dice la lectura. Y se equivoca por 4,46 veces, porque el efecto verdadero en el corte es de 4,50 puntos.

El motivo es obvio cuando se dice en voz alta: quien tiene puntaje 85 renueva más que quien tiene puntaje 30 por causa del puntaje, no por causa del distintivo. La comparación entre los dos lados del corte entero mezcla dos cosas, el efecto de la regla y el efecto de ser un usuario más saludable, y la segunda domina.

La calculadora está en lo correcto. Está respondiendo “¿estos dos grupos tienen tasas diferentes?”, y las tienen. La pregunta que interesa es otra.

La diferencia total entre los dos lados del corte contra el salto en el umbralGráfico con el puntaje en el eje horizontal, de 30 a 90, y la tasa de renovación en el eje vertical. Una curva ascendente muestra que la renovación crece continuamente con el puntaje, en ambos lados del corte. Una línea vertical marca el corte en 60. En el corte, la curva salta verticalmente 4,50 puntos, que es el efecto verdadero del distintivo. Dos líneas horizontales discontinuas marcan los promedios de cada lado entero, 20,2065 por ciento abajo y 40,2591 por ciento arriba, separadas por 20,0525 puntos. Una anotación registra que esa distancia de 20 puntos mezcla el efecto del distintivo con el efecto de tener un puntaje mayor, y que solo el salto vertical exactamente en el corte aísla el efecto del distintivo.La renovación ya subía con el puntaje. Solo el salto EN el corte es efecto del distintivo.corte: puntaje 60promedio de todo el lado izquierdo: 20,2065%promedio de todo el lado derecho: 40,2591%+4,50 pp: el efecto del distintivo+20,05 pppuntaje 306090Los 20,05 puntos entre los dos promedios mezclan el distintivo con el efecto de tener puntaje mayor.La regresión discontinua lee solo el salto vertical, extrapolando cada lado hasta el corte.En la simulación, la lectura ingenua exageró por 4,46 veces.
El error de la lectura ingenua no es ruido, es confusión: le cobra al distintivo el mérito de tener puntaje alto.

La cuenta correcta: ajustar de ambos lados y leer la distancia en el corte

La regresión discontinua hace lo siguiente:

  1. toma solo a quien está dentro de una ventana alrededor del corte, digamos puntaje entre 52 y 68
  2. ajusta una recta por separado en cada lado, dando más peso a quien está más cerca del umbral
  3. extrapola cada recta hasta el corte exacto
  4. el efecto es la distancia vertical entre las dos extrapolaciones en el corte

Corriendo esto en nuestra simulación, con kernel triangular y recta local de cada lado, el resultado por ancho de banda:

ancho usuarios a la izquierda a la derecha salto estimado error estándar IC 95% valor-p
3 4.439 4.147 2,3167 pp 2,2072 pp de menos 2,01 a 6,64 0,2939
5 7.435 6.739 3,7461 pp 1,7085 pp de 0,40 a 7,10 0,0283
8 11.809 10.257 4,5482 pp 1,3636 pp de 1,88 a 7,22 0,0009
12 17.579 14.219 4,4038 pp 1,1242 pp de 2,20 a 6,61 0,00009
20 26.924 19.336 4,5585 pp 0,8977 pp de 2,80 a 6,32 0,0000004
35 35.512 22.621 4,7624 pp 0,7372 pp de 3,32 a 6,21 0,0000000001

El efecto verdadero es de 4,50 puntos, y los seis anchos contienen ese valor en el intervalo de confianza. Fíjate en lo que la tabla enseña de verdad:

Lee y Lemieux recomiendan exactamente eso en su lista de prácticas: explorar la sensibilidad de los resultados a un rango de anchos de banda y de órdenes de polinomio, y reportar una estimación “típica” junto con un rango de estimaciones puntuales. Sugieren además un recurso gráfico útil, graficar la estimación local lineal contra un continuo de anchos de banda.

Estimación del salto y su intervalo de confianza por ancho de bandaGráfico con el ancho de banda en el eje horizontal, con los valores 3, 5, 8, 12, 20 y 35, y el salto estimado en puntos porcentuales en el eje vertical. Para cada ancho hay un punto con una barra vertical de intervalo de confianza del 95 por ciento. Con ancho 3 la estimación es 2,32 con intervalo de menos 2,01 a 6,64. Con ancho 5 es 3,75 con intervalo de 0,40 a 7,10. Con ancho 8 es 4,55 con intervalo de 1,88 a 7,22. Con ancho 12 es 4,40 con intervalo de 2,20 a 6,61. Con ancho 20 es 4,56 con intervalo de 2,80 a 6,32. Con ancho 35 es 4,76 con intervalo de 3,32 a 6,21. Una línea horizontal discontinua marca el efecto verdadero de 4,50 puntos y pasa dentro de los seis intervalos. Las barras se encogen de izquierda a derecha conforme la ventana crece e incluye más usuarios.Ventana estrecha no es más honesta, es más imprecisaverdad: 4,50 pp+8+4,5+1menos 2h = 32,32h = 53,75h = 84,55h = 124,40h = 204,56h = 354,76Gris: el intervalo cruza el cero, la lectura no concluye. Verde: intervalo entero arriba de cero.Reporta el RANGO de estimaciones, nunca un ancho elegido después de ver los resultados.
El intervalo se encoge conforme la ventana crece, y la estimación queda estable de h = 8 en adelante. Esa meseta es lo que se publica.

Y queda registrada la regla dura: el ancho de banda se elige antes, o por un criterio mecánico como validación cruzada, o por un rango reportado por entero. Elegir el ancho que devuelve el número deseado es el mismo pecado de elegir el control después del resultado en diferencias en diferencias, y vale la misma disciplina del plan de análisis preregistrado.

El interruptor: si se puede elegir el lado, se acabó

Aquí está lo que separa a la regresión discontinua de un truco estadístico.

Lee y Lemieux son directos: la existencia de un tratamiento que es función discontinua de una variable de corte no basta para justificar la validez del diseño. Y más: si acaso, las reglas discontinuas pueden generar incentivos, causando comportamiento que invalidaría el enfoque. Su ejemplo es académico, alumnos “eligiendo” la nota por esfuerzo, pero el ejemplo de producto es aún más evidente.

Envío gratis por encima de R$ 199. El umbral está impreso en la pantalla. Quien llega a R$ 186 ve el aviso y agrega un artículo de R$ 20. No existe “casi el mismo cliente” en ambos lados del corte: quien está en R$ 195 es quien no quiso, no pudo o no vio, y quien está en R$ 201 incluye a un montón de gente que hizo esfuerzo para llegar ahí. Son poblaciones diferentes por construcción.

La prueba que detecta eso no mira el resultado, mira la distribución de la propia variable de corte. Si nadie puede controlar el lado, la densidad atraviesa el umbral sin escalón. Si las personas empujan, aparece un apilamiento.

Simulamos los dos casos con 60.000 observaciones cada uno. En el escenario del envío gratis, el 35 por ciento de quienes estaban entre R$ 179 y R$ 199 completó la canasta para pasar del umbral, lo que corresponde a 3.554 canastas, o 5,92 por ciento de la base.

escenario densidad a la izquierda densidad a la derecha razón z valor-p veredicto
puntaje interno de salud, no exhibido 0,024589 0,023671 0,9627 menos 1,334 0,1823 pasa
envío gratis a partir de R$ 199, visible 0,005052 0,015881 3,1438 22,367 indistinguible de cero reprueba

Tres veces más canastas justo arriba del umbral que justo abajo. No es sutil, y no necesita sofisticación para ser visto: un histograma del valor de carrito con franjas de R$ 1 lo muestra a simple vista. Lee y Lemieux recomiendan exactamente ese gráfico como primer punto de la lista de verificaciones, presentar la distribución de la variable de corte en un histograma de franjas fijas y lo más estrechas posible, y recomiendan en contra de graficar una curva suavizada de densidad en su lugar, porque el escalón desaparece en el suavizado. La prueba formal de discontinuidad en la densidad que ellos citan es la de McCrary.

Distribución de la variable de corte con y sin manipulaciónDos histogramas lado a lado. En el panel de la izquierda, rotulado umbral invisible, las barras de frecuencia atraviesan la línea vertical del corte sin escalón, siguiendo una curva suave decreciente, con densidad a la derecha igual a 0,9627 de la densidad a la izquierda y valor-p de 0,1823. En el panel de la derecha, rotulado umbral visible de envío gratis, las barras justo a la izquierda del corte están claramente rebajadas y las barras justo a la derecha del corte forman un pico alto, con densidad a la derecha igual a 3,1438 veces la densidad a la izquierda y valor-p indistinguible de cero. Una anotación registra que el panel de la izquierda permite la lectura de regresión discontinua y el panel de la derecha no la permite.La prueba no mira el resultado, mira la distribución de la propia variable de corteumbral invisible: pasarazón derecha/izquierda: 0,9627 · valor-p 0,1823la densidad atraviesa el corte sin escalónumbral visible: repruebarazón derecha/izquierda: 3,1438 · valor-p indistinguible de cero5,92% de la base fue empujada por encima del umbralEl apilamiento arriba del corte no es un detalle del dato, es la lectura entera cayéndose.Haz ese histograma ANTES de estimar cualquier salto. Cuesta cinco minutos.
A la izquierda, quien cae de cada lado del corte es comparable. A la derecha, el lado derecho está hecho de gente que hizo esfuerzo para llegar ahí.

Y el estrago en el resultado es exactamente el esperado. Corriendo la regresión discontinua en el escenario del envío gratis, donde el salto verdadero plantado era de 3,00 puntos:

ancho salto estimado error estándar valor-p
3 menos 4,0818 pp 4,1530 pp 0,3257
5 menos 0,1356 pp 3,1884 pp 0,9661
8 2,5539 pp 2,5491 pp 0,3164
12 4,3948 pp 2,0772 pp 0,0344
20 4,7443 pp 1,6111 pp 0,0032

El signo cambia con el ancho de banda. De menos 4,08 a más 4,74, atravesando el cero, y con el resultado quedando “significativo” solo en los anchos grandes, que son justamente los que diluyen el apilamiento. Un analista que corriera solo el ancho 20 publicaría 4,74 puntos con valor-p de 0,0032 y estaría equivocado por 58 por ciento.

La prueba de placebo: cortes falsos

La segunda verificación obligatoria es correr la misma lectura en cortes que no existen. Si el método encuentra un salto en puntaje 55, donde no hay ninguna regla, encuentra salto en cualquier lugar.

En nuestro escenario del umbral invisible, con ancho 8:

corte probado salto estimado error estándar valor-p
50 (falso) menos 1,2329 pp 1,2306 pp 0,3164
55 (falso) menos 1,3404 pp 1,2690 pp 0,2908
60 (real) 4,5482 pp 1,3636 pp 0,0009
65 (falso) menos 2,0900 pp 1,5089 pp 0,1660
70 (falso) menos 1,8553 pp 1,7302 pp 0,2836

Cuatro cortes falsos, cuatro nulos. Un corte real, un efecto. Es ese contraste el que transforma un número en una evidencia.

Lee y Lemieux agregan dos verificaciones hermanas en su lista, y las dos valen cinco minutos: correr un análisis de regresión discontinua paralelo en las covariables de base, porque si la premisa de no manipulación vale no debe haber discontinuidad en variables determinadas antes de la asignación; y explorar la sensibilidad de los resultados a la inclusión de esas covariables, porque su inclusión no debería cambiar el salto estimado, por más correlacionadas con el resultado que estén. Si cambia de forma importante, eso puede indicar ordenamiento de la variable de corte.

El precio: la regresión discontinua cuesta mucha más muestra

Este es el punto que casi nunca aparece, y que decide si el método vale la pena.

La regresión discontinua solo usa a quien está dentro de la ventana, y mide el efecto solo en el corte. En nuestra simulación:

lectura usuarios usados lo que se mide
base total disponible 60.000 nada, sin diseño
ventana de ancho 5 14.174 (23,62%) efecto en el puntaje 60
ventana de ancho 8 22.066 (36,78%) efecto en el puntaje 60
test aleatorizado con el mismo efecto 3.386 en total efecto en la población aleatorizada

Con base de 30 por ciento y un efecto de 4,5 puntos absolutos, al 95 por ciento de confianza y 80 por ciento de poder, la calculadora de tamaño de muestra pide 1.693 por variación, 3.386 en total. La regresión discontinua con ancho 8 consumió 22.066 usuarios para responder la misma pregunta, es decir cerca de 6,5 veces más.

Y la respuesta que da es más estrecha. Lo que se estima es el efecto para quien está bien cerca del corte. Si el distintivo de soporte prioritario ayuda mucho a quien tiene puntaje 30, eso no aparece: aquella región no entró en la ventana, y el diseño no tiene nada que decir sobre ella.

Lee y Lemieux registran la razón estructural de eso: la estimación depende de datos lejos del corte, y por eso depende de la forma funcional elegida. Thistlethwaite y Campbell, en la primera aplicación del diseño, ya señalaban que se trata fundamentalmente de un enfoque de extrapolación.

Es decir, el cuadro completo es: más muestra, respuesta más local, y dependencia de decisiones de ajuste. Es un buen método cuando no existe alternativa. No es una alternativa cuando existe aleatorización.

Guion de regresión discontinua en ocho pasos

  1. Escribe la regla exacta. Qué variable, qué corte, quién la aplica, desde cuándo. Si la regla cambió de valor a mitad del período, tienes dos diseños, no uno.
  2. Pregunta si la persona ve el umbral. Si lo ve, el diseño probablemente está muerto antes de empezar. Envío gratis, meta de descuento y barra de progreso son casos de muerte casi segura.
  3. Grafica el histograma de la variable de corte con franjas estrechas y fijas. Antes de estimar cualquier salto. Eso cuesta cinco minutos y cancela la mitad de los proyectos.
  4. Corre la prueba formal de discontinuidad en la densidad. Si reprueba, detente. No existe arreglo estadístico para la manipulación del lado del corte.
  5. Corre la lectura en varios anchos de banda y publica el rango entero, con intervalos de confianza.
  6. Corre cortes falsos y covariables de base. Un salto donde no puede haber salto derriba el diseño.
  7. Di cuántos usuarios entraron en la ventana y qué fracción de la base es eso. “4,55 puntos sobre 22.066 de los 60.000 usuarios, dentro de 8 puntos del corte” es una frase completa.
  8. Di que el efecto es local. El número vale cerca del corte, y no es el efecto de extender el beneficio a todo el mundo.

Errores comunes

Hazlo automático en Donnu

La regresión discontinua exige algo que la mayoría de los sistemas no guarda: el valor de la variable de corte en el momento en que la regla fue aplicada. Un panel que guarda el puntaje de hoy, y no el puntaje que valía cuando el distintivo fue concedido, no permite la lectura, porque el puntaje se movió desde entonces y la ventana alrededor del corte deja de ser la ventana correcta.

Donnu guarda el valor que decidió la asignación junto con el resultado, con marca de tiempo, lo que preserva la posibilidad de leer un umbral después. Pero el consejo más valioso de este artículo es anterior a eso: si la regla todavía va a ser creada, aleatoriza. Conceder el beneficio por sorteo a una porción de los usuarios cerca de la franja relevante responde la misma pregunta con cerca de un sexto de la muestra y sin ninguna premisa sobre manipulación. Corre la cuenta en la calculadora de tamaño de muestra antes de decidir, y cierra la lectura en la calculadora de significancia.

Referencias

Lee también: Diferencias en diferencias · Control sintético · Intención de tratar · Efecto heterogéneo por segmento · Plan de análisis preregistrado · Calculadora de tamaño de muestra · Leer en portugués

Preguntas frecuentes

¿Qué es la regresión discontinua?
Es una lectura para el caso en que un beneficio se concede por una REGLA de corte sobre una variable continua, por ejemplo un distintivo dado a quien tiene un puntaje superior a 60. Compara a quien quedó justo arriba del corte con quien quedó justo abajo, estimando el salto exactamente en el umbral. Fue introducida por Thistlethwaite y Campbell en 1960.
¿Por qué no basta comparar a quien está arriba con quien está abajo del corte?
Porque el resultado normalmente crece con la propia variable de corte, así que la diferencia total mezcla el efecto de la regla con el efecto de tener un puntaje mayor. En la simulación de esta guía, esa comparación devolvió más 20,0525 puntos con valor-p indistinguible de cero, cuando el efecto verdadero en el corte era de 4,50 puntos. Exageró por 4,46 veces.
¿Cuándo NO vale la regresión discontinua?
Cuando las personas logran controlar con precisión de qué lado del corte caen. Lee y Lemieux registran que la existencia de un tratamiento definido por una regla discontinua no basta para validar el diseño, y que las reglas discontinuas pueden crear incentivos y provocar comportamiento que invalida la lectura. El umbral de envío gratis es el caso clásico de invalidación.
¿Cómo se prueba si las personas manipularon el corte?
Mirando la distribución de la propia variable de corte cerca del umbral, con una prueba formal de discontinuidad en la densidad. En la simulación de esta guía, en el umbral invisible la densidad a la derecha quedó en 0,9627 de la densidad a la izquierda, con valor-p de 0,1823, y en el umbral visible de envío gratis quedó en 3,1438 veces, con valor-p indistinguible de cero.
¿Cómo se elige el ancho de banda?
No se elige uno solo: se reporta un rango. Lee y Lemieux recomiendan explorar la sensibilidad del resultado a un rango de anchos y de órdenes polinomiales, y reportar una estimación típica junto con un rango de estimaciones. En la simulación de esta guía, el salto estimado quedó entre 2,32 y 4,76 puntos según el ancho, contra una verdad de 4,50.
¿La regresión discontinua reemplaza a un test A/B?
No. Mide el efecto solo CERCA del corte, y usa solo a quien está dentro de la ventana. En la simulación de esta guía, la ventana de 8 puntos usó 22.066 de los 60.000 usuarios, mientras que un test aleatorizado detectaría el mismo efecto con 3.386 usuarios en total, cerca de 6,5 veces menos.