Interferencia entre Variantes: cuando los brazos se hablan
Interferencia entre variantes: cuando el tratamiento afecta al control, el test A/B mide la diferencia equivocada. Canales de fuga y cómo reducirla.

📚 Este artículo es parte de la guía Significancia Estadística en Tests A/B: La Guía.
Todo test A/B asume en silencio que tratar a un usuario no cambia el resultado de ningún otro. Cuando esa premisa cae, y cae siempre que los dos brazos disputan un recurso finito, el control deja de ser una línea base limpia: se convierte en un grupo al que el propio experimento ya perjudicó. La diferencia medida pasa a sumar la ganancia del tratamiento con la pérdida del control, y el resultado puede salir fácilmente por el doble del efecto real. Esta guía cubre los tres canales por donde entra la interferencia entre variantes, un ejemplo trabajado en el que un ganador de más 22 por ciento es en realidad un ganador de más 10 por ciento, lo que eBay midió en un experimento de verdad, y qué se puede hacer al respecto sin abandonar la experimentación. Forma parte de nuestra guía completa de test A/B y conversa con métricas de guardrail.
La premisa silenciosa que la interferencia entre variantes rompe
El test de dos proporciones compara la tasa del brazo A con la del brazo B y llama a la diferencia efecto del tratamiento. Eso solo es válido si el resultado de cada usuario depende únicamente del brazo en el que cayó, y no de lo que ocurrió con los demás usuarios. En la literatura de inferencia causal esa condición tiene nombre, SUTVA, la premisa de valor de tratamiento estable por unidad.
Es razonable cuando cambias el color de un botón. Es falsa cuando existe algo finito en el medio del camino.
La parte peligrosa es que la interferencia no deja rastro estadístico. Un experimento contaminado produce un valor p pequeño, un intervalo de confianza estrecho y una barra verde en el panel, exactamente como un experimento limpio. No existe corrección de valor p que lo resuelva, porque el problema no está en la varianza, está en lo que el control representa. Correr por más tiempo lo empeora, ya que más muestra estrecha el intervalo alrededor del número sesgado.
Tres canales por donde entra la fuga
| Canal | Cómo se ve | Señal típica |
|---|---|---|
| Recurso finito | Inventario, cupos, inventario de anuncio, presupuesto, agenda de atención | La métrica por usuario se mueve, el total agregado no se mueve |
| Infraestructura compartida | Caché, cola, pool de conexión, límite de tasa, modelo entrenado con datos de los dos brazos | Un test A/A con reparto desigual falla |
| Conexión entre personas | Invitación, mensaje, feed, referido, contenido público visible para los dos brazos | El efecto crece con el porcentaje expuesto |
El primer canal es el más conocido y el más fácil de explicar a quien no es del equipo de datos: si existe una cantidad fija de algo, lo que el tratamiento se lleva de más el control deja de llevárselo. El segundo es el más traicionero, porque no involucra a ningún usuario interactuando con otro. El tercero es el clásico de producto social, y es el único de los tres en el que la fuga puede inflar el control en lugar de deprimirlo, cuando el tratamiento genera contenido o invitaciones que el control consume.
Vale insistir en un punto del segundo canal, porque atrapa a equipos que juran no tener marketplace. Kohavi relata en el artículo de resultados inesperados publicado en SIGKDD Explorations un test A/A con reparto de 90 y 10 por ciento que fallaba de forma consistente. La causa era un recurso limitado: una caché de descarte por menor uso reciente en la que las entradas de control y tratamiento eran disjuntas. Como el experimento corría al 90 por ciento contra 10, el control tenía significativamente más entradas en la caché, lo que llevaba a una tasa de acierto mayor, mejor desempeño y, por consecuencia, mejores métricas. Ningún usuario habló con otro. La infraestructura hizo la fuga sola.
Ejemplo trabajado: el ganador de más 22 por ciento
Una tienda con inventario limitado testea un cambio de escaparate. Son 100.000 usuarios por variación y el periodo tiene 5.400 unidades disponibles, un techo real que no se mueve durante el test. Pega los números en la calculadora de abajo:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
Sin inventario limitado, el control convertiría a su tasa histórica de 3,000 por ciento, o 3.000 pedidos, y la variación convertiría a 3,300 por ciento, o 3.300 pedidos. Solo que el inventario no soporta los dos: la variación se lleva 3.300 unidades, y lo que sobra para el control son 2.100 más lo que ya tenía reservado, cerrando en 2.700 pedidos en lugar de 3.000. Los 300 pedidos que el control perdió no desaparecieron del mundo, se fueron al tratamiento.
Fue eso lo que mostró el panel:
| Comparación ingenua | Usuarios | Pedidos | Tasa |
|---|---|---|---|
| A, control | 100.000 | 2.700 | 2,700 por ciento |
| B, variación | 100.000 | 3.300 | 3,300 por ciento |
La calculadora devuelve más 0,600 punto porcentual, más 22,22 por ciento relativo, z = 7,865, valor p por debajo de 0,00001, con intervalo del 95 por ciento de más 0,450 a más 0,750 punto porcentual. Un ganador aplastante, para los estándares de cualquier equipo.
Ahora la comparación que importa, entre la variación y lo que el control habría hecho en un mundo sin canibalización:
| Efecto verdadero | Usuarios | Pedidos | Tasa |
|---|---|---|---|
| A, control sin interferencia | 100.000 | 3.000 | 3,000 por ciento |
| B, variación | 100.000 | 3.300 | 3,300 por ciento |
La calculadora devuelve más 0,300 punto porcentual, más 10,00 por ciento relativo, z = 3,841, valor p 0,00012, con intervalo de más 0,147 a más 0,453 punto porcentual.
El cambio es real y vale la pena subirlo. El número honesto es la mitad de lo que mostró el panel. La ganancia absoluta medida, 0,600 punto porcentual, es exactamente el doble de la verdadera, 0,300, porque cada pedido desplazado aparece dos veces en la diferencia entre los brazos: una vez sumando en el tratamiento y otra vez restando en el control. Esa duplicación es la firma aritmética de la interferencia por recurso finito, y es la razón por la cual el factor dos aparece con tanta frecuencia.
Lo que midió eBay
El ejemplo de arriba es aritmética montada para enseñar el mecanismo. La medición real existe y es mayor de lo que sugiere la intuición.
Thomas Blake y Dominic Coey, del laboratorio de investigación de eBay, publicaron en la conferencia de economía y computación de la ACM en 2014 un estudio de una campaña de correo marketing de la propia eBay. Su punto de partida es el mismo: la inferencia estadística clásica asume que el tratamiento afecta al grupo de test y no al de control, y esa premisa es violada en marketplaces por efectos de equilibrio general, porque cambiar la demanda del test altera la oferta disponible para el control.
El resultado es directo. En palabras del artículo, ignorar la interferencia entre test y control lleva a estimaciones de la efectividad de la campaña demasiado grandes por un factor de cerca de dos. La estimación a nivel de usuario apuntaba a 0,74 por ciento. Rehecha a nivel de subasta, con 1,40 participante de test y 1,39 de control por subasta en promedio, el cálculo daba aproximadamente 0,35 por ciento, sobre una muestra de más de 10,4 millones de subastas. Registran además la economía del sesgo: es mayor donde la oferta es más inelástica, y es positivo cuando la demanda es elástica, es decir, la comparación ingenua sobreestima el beneficio del tratamiento.
La recomendación que cierra el artículo es la misma que vale para cualquier equipo hoy: una estrategia mejor puede ser comparar unidades en un nivel más alto de agregación, como subastas en lugar de individuos, entre las cuales la interferencia es menos pronunciada.
Cómo reducir el sesgo
No existe corrección estadística para un control contaminado. Lo que existe es elegir una unidad de aleatorización que contenga la interacción en lugar de atravesarla.
- Aleatorizar por grupo, no por usuario. Si la interferencia ocurre dentro de una ciudad, aleatoriza ciudades. Si ocurre dentro de una cuenta corporativa, aleatoriza cuentas. Si ocurre dentro de una subasta, compara subastas. El brazo pasa a ser un conjunto cerrado y la fuga queda dentro de él.
- Aleatorizar por ventana de tiempo. Alternar el sitio entero entre control y tratamiento en bloques de horas o días elimina la fuga entre brazos simultáneos, al costo de quedar expuesto a estacionalidad y tendencia. Funciona mejor donde el recurso compartido se renueva rápido.
- Mantener el tratamiento en una fracción pequeña. Cuanto menor la exposición, menor la presión sobre el recurso compartido y menor el sesgo. Esto no elimina el problema, y el reparto desigual trae sus propios riesgos, pero sirve como lectura de sensibilidad.
- Medir el agregado, no solo el usuario. Si la métrica por usuario sube y la métrica total del mercado no se mueve, no encontraste crecimiento, encontraste desplazamiento. Esa comparación es barata y debería ser estándar en cualquier test con recurso finito.
El costo de esas alternativas es siempre el mismo: menos unidades independientes, por lo tanto menos poder. Aleatorizar 40 ciudades en lugar de 200.000 usuarios derrumba el poder del diseño de forma brutal, y hay que dimensionar con honestidad, lo que casi siempre significa correr por más tiempo. Es un intercambio de precisión por ausencia de sesgo, y vale la pena porque una estimación sesgada no mejora con más muestra.
Cómo detectar antes de que duela
- Test A/A con reparto desigual. Corre 90 y 10 y ve si pasa. Este es el detector que atrapó el problema de la caché en el relato de Kohavi, y es barato. Un test A/A con reparto igual puede pasar incluso con interferencia presente, porque el efecto es simétrico; el reparto desigual es lo que rompe la simetría. Vale leerlo junto con test A/A y validación de la plataforma.
- Rampa de exposición. Mide el efecto al 5, 20 y 50 por ciento de exposición. En un experimento limpio, el efecto estimado no debería depender del tamaño del brazo. Si encoge conforme amplías, existe interferencia.
- Panel del agregado. Coloca la métrica total al lado de la métrica por usuario en todo test que toque inventario, presupuesto o cola.
- Verificación de proporción. Un reparto desigual no intencional tiene varias causas, y la interferencia es una de ellas. El procedimiento de reparto desigual de tráfico es la primera parada.
Errores comunes
- Creer que es un problema de marketplace. Cualquier cosa finita sirve: inventario, presupuesto de medios, atención humana, caché, cupo de curso, lote promocional.
- Correr por más tiempo para resolverlo. Más tiempo estrecha el intervalo alrededor de la estimación sesgada y aumenta la confianza en la conclusión equivocada.
- Confundir interferencia con efecto de interacción entre experimentos. Son cosas diferentes. La interacción es dos experimentos distintos cuyos efectos no suman. La interferencia es un único experimento en el que el brazo A cambia el resultado del brazo B. El primer caso está en tests simultáneos y efecto de interacción.
- Aleatorizar por grupo y analizar por usuario. Si la unidad de aleatorización es la ciudad, la unidad de análisis también necesita serlo, so pena de que el intervalo de confianza salga demasiado estrecho. Ese es el mismo mecanismo descrito en métricas de ratio.
Hazlo automático con Donnu
La interferencia es un problema de diseño, así que el momento de resolverlo es antes de correr, y es exactamente cuando nadie está pensando en ello.
En Donnu, la unidad de aleatorización es una elección explícita en la creación del experimento, y no un valor por defecto silencioso: se puede aleatorizar por usuario, por cuenta o por grupo geográfico, y el análisis usa automáticamente la misma unidad, sin la inconsistencia que aprieta el intervalo de confianza. Todo experimento marcado como sensible a recurso finito lleva la métrica agregada al lado de la métrica por usuario en el mismo informe, así que un desplazamiento disfrazado de crecimiento queda visible a la hora de decidir. Para dimensionar el costo en poder de aleatorizar por grupo, la calculadora de tamaño de muestra acepta el número de unidades independientes que realmente tienes.
Referencias
- Blake, T. y Coey, D. Why Marketplace Experimentation Is Harder than it Seems: The Role of Test-Control Interference. ACM Conference on Economics and Computation, 2014. Fuente de la premisa de que la inferencia clásica asume que el tratamiento afecta al test y no al control, de la violación por efectos de equilibrio general, de la conclusión de que ignorar la interferencia produce estimaciones demasiado grandes por un factor de cerca de dos, de la estimación de 0,74 por ciento a nivel de usuario contra aproximadamente 0,35 por ciento a nivel de subasta con promedio de 1,40 y 1,39 participantes por subasta sobre más de 10,4 millones de subastas, del resultado de que el sesgo es mayor bajo oferta inelástica y positivo bajo demanda elástica, y de la recomendación de comparar unidades en un nivel más alto de agregación. dominiccoey.github.io.
- Kohavi, R. Unexpected Results in Online Controlled Experiments. SIGKDD Explorations, 12(2), 2010. Fuente del test A/A con reparto de 90 y 10 por ciento que fallaba de forma consistente por causa de una caché de descarte por menor uso reciente con entradas disjuntas entre los brazos, con el control acumulando más entradas, mayor tasa de acierto y mejores métricas, y de la recomendación de empezar por tests A/A y vigilar el desempeño. kdd.org.
- Kohavi, R., Deng, A., Longbotham, R. y Xu, Y. Seven Rules of Thumb for Web Site Experimenters. KDD 2014. Fuente del rango de 0,1 a 1,0 por ciento para experimentos exitosos después de diluidos y del principio de que los resultados deben leerse en impacto total, no en impacto de segmento. exp-platform.com.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020. Capítulos sobre fuga e interferencia entre variantes y sobre elección de la unidad de aleatorización. Material complementario en experimentguide.com.
Lee también: Test A/A y validación · Reparto desigual de tráfico · Métricas de ratio · Métricas de guardrail · Calculadora de poder estadístico · Leia em português
Preguntas frecuentes
- ¿Qué es la interferencia entre variantes en un test A/B?
- La interferencia es cuando lo que le ocurre a un usuario del tratamiento cambia el resultado de un usuario del control. El test A/B estándar asume que eso no sucede, una premisa que la literatura de inferencia causal llama SUTVA. Cuando cae, el control deja de ser una línea base limpia y pasa a ser un grupo ya afectado por el experimento, así que la diferencia medida entre los brazos ya no es el efecto del tratamiento. El problema es de diseño, no de estadística: ningún ajuste de valor p arregla un control contaminado.
- ¿Cuál es el tamaño del error que causa la interferencia?
- Depende del canal y puede ser enorme. Blake y Coey, de eBay Research Labs, estudiaron una campaña de correo de eBay y concluyeron en el artículo publicado en la conferencia de economía y computación de la ACM en 2014 que ignorar la interferencia entre test y control lleva a estimaciones de efectividad demasiado grandes por un factor de cerca de dos. La estimación a nivel de usuario daba 0,74 por ciento, mientras que el análisis a nivel de subasta apuntaba aproximadamente a 0,35 por ciento.
- ¿La interferencia solo ocurre en marketplaces?
- No. El marketplace es solo el caso más visible, porque la oferta es obviamente finita. El mismo mecanismo aparece con inventario limitado, con presupuesto de medios compartido, con atención humana compartida y con infraestructura compartida. Kohavi relata un test A/A con reparto de 90 y 10 por ciento que fallaba de forma consistente porque los dos brazos usaban una caché de descarte por menor uso reciente con entradas separadas, y el brazo mayor terminaba con mejor tasa de acierto. Ningún usuario interactuó con otro en ese caso y aun así los brazos se contaminaron.
- ¿Cómo reducir el sesgo de interferencia?
- Aleatorizando en una unidad que contenga la interacción en lugar de atravesarla. Blake y Coey sugieren exactamente eso al concluir que una estrategia mejor puede ser comparar unidades en un nivel más alto de agregación, como subastas en lugar de individuos, entre las cuales la interferencia es menos pronunciada. En la práctica eso se convierte en aleatorización por región geográfica, por mercado, por cuenta o por ventana de tiempo. Cambias poder estadístico por ausencia de sesgo, y ese cambio casi siempre vale la pena.
- ¿Se puede detectar la interferencia antes de tomar la decisión equivocada?
- Se puede, en parte. Tres señales ayudan: un test A/A con reparto desigual que falla, una métrica agregada que no se mueve mientras la métrica por usuario se mueve mucho, y un efecto que encoge cuando aumentas el porcentaje expuesto al tratamiento. Esa tercera señal es la más informativa, porque bajo interferencia el efecto medido depende del tamaño del brazo, y bajo un experimento limpio no debería depender.