Personalización con IA y Test A/B: cómo funcionan juntos
Guía completa de personalización con IA y test A/B: por qué una no sustituye a la otra, cómo medir con holdout global y el coste real en tráfico.

La personalización con IA y el test A/B no compiten: resuelven problemas diferentes y, bien combinadas, una mide a la otra. El test A/B establece si un cambio causa un efecto, comparando grupos equivalentes. La personalización decide qué entregar a cada persona, lo que por construcción acaba con el grupo de comparación natural, ya que nadie ve lo mismo. La consecuencia práctica es directa y casi siempre subestimada: un sistema de personalización sin grupo reservado no tiene cómo probar que generó negocio adicional, solo consigue mostrar cuánto acertó dentro de sus propias reglas. Esta guía cubre el diseño de medición que resuelve eso (el holdout global), su coste real en tráfico, las trampas de la lectura por segmento, cuándo un bandit es la elección correcta, y los modos de fallo específicos de sistemas que aprenden solos.
Qué es la personalización con IA, y qué no es
El término cubre cosas bastante diferentes, con costes y riesgos de medición bastante diferentes. Vale separar tres familias antes de cualquier discusión de resultado.
| Familia | Cómo decide qué mostrar | Qué suele exigir | Riesgo principal de medición |
|---|---|---|---|
| Reglas por segmento | Condiciones escritas por personas (país, dispositivo, origen, cliente nuevo o recurrente) | Poco dato, mucha curaduría | Segmentos creados después de mirar el resultado |
| Modelos de recomendación | Un modelo entrenado con histórico de comportamiento predice el artículo con más probabilidad de conversión | Volumen de eventos y pipeline de datos | Optimizar clics y degradar los ingresos por visitante |
| Bandits contextuales | El algoritmo elige la opción considerando el contexto y sigue explorando alternativas | Infraestructura de decisión en tiempo real | La asignación no aleatoria dificulta estimar el efecto causal |
Las tres se venden con frecuencia bajo la misma etiqueta, y la primera ni siquiera involucra aprendizaje automático. Eso importa porque la pregunta “la personalización está funcionando” tiene un coste de respuesta muy distinto en cada caso: las reglas por segmento pueden probarse una a una como cualquier cambio, mientras que un modelo que decide por usuario solo puede evaluarse en el agregado.
Una definición de trabajo útil para el resto de esta guía: personalización es cualquier sistema en el que la experiencia entregada depende de atributos del visitante. Si dos personas pueden ver cosas distintas en la misma URL por decisión del sistema, es personalización, y el problema de medición descrito abajo se aplica.
Por qué la personalización no sustituye al test A/B
El argumento de venta más común es seductor: “en lugar de elegir entre A y B, entrega A a quien prefiere A y B a quien prefiere B”. El problema es que la frase confunde dos preguntas.
- Pregunta del test A/B: ¿este cambio causa un efecto, y de qué tamaño? Depende de dos grupos equivalentes por sorteo, expuestos a experiencias diferentes.
- Pregunta de la personalización: dado este visitante, ¿qué variación entrego? Depende de diferenciar los grupos a propósito.
Cuando la personalización entra sin diseño de medición, lo que se pierde es la línea base. El panel del sistema muestra métricas internas (“la tasa de clic en las recomendaciones es de X”), que suben cuando el modelo mejora y también cuando el modelo simplemente aprende a recomendar aquello que la persona ya iba a comprar de todos modos. Ese segundo caso no genera un céntimo de ingreso adicional y produce un informe excelente.
El holdout global: el diseño que mide
La solución estándar es reservar una porción aleatoria y fija del público que nunca recibe personalización, y mantenerla durante un período largo. No prueba un cambio específico: mide el valor incremental del sistema entero. Las plataformas de experimentación ya lo ofrecen como funcionalidad, como el holdout global de Optimizely, y la mecánica es la misma en cualquier implementación propia.
Cuatro decisiones definen un holdout que funciona:
- Aleatorio y estable por persona. El visitante entra en el holdout por sorteo determinista de su identificador y permanece ahí entre sesiones. Un holdout sorteado por sesión mezcla los grupos y no mide casi nada.
- Porción fija y declarada antes. Cambiar el tamaño a mitad de la ventana invalida la comparación acumulada.
- Ventana larga. El efecto de la personalización suele crecer conforme el sistema aprende, así que las ventanas de uno a tres meses son comunes. Es lo opuesto a un test A/B, que tiene un final planificado.
- Métricas de negocio, no del sistema. Ingresos por visitante, conversión y retención. La tasa de clic en la recomendación es diagnóstico, no veredicto.
Ejemplo trabajado: midiendo el incremento
Un ecommerce recibe 500.000 visitantes por mes. El equipo reserva un holdout del 10%, es decir, 50.000 visitantes que ven la versión sin personalización, y deja 450.000 en el grupo personalizado. Al final de un mes:
- Holdout: 50.000 visitantes, 1.400 conversiones, tasa del 2,80%.
- Personalizado: 450.000 visitantes, 13.725 conversiones, tasa del 3,05%.
Corriendo el test z de dos proporciones, bilateral, con 95% de confianza:
- Diferencia absoluta: +0,25 punto porcentual.
- Lift relativo: +8,93%.
- Estadístico z: 3,10.
- Valor p: 0,0020.
- Intervalo de confianza de la diferencia: de +0,097 a +0,403 punto porcentual.
Compruébalo con los mismos números, o con los de tu holdout:
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
El intervalo es la parte que cambia la planificación. El punto de +8,93% es el centro de un rango que, en términos relativos, va de aproximadamente +3,5% a +14,4%. Llevar el número del medio a la dirección es prometer el centro de un intervalo amplio; llevar el rango es hacer una afirmación que los resultados del trimestre siguiente pueden sostener. La lógica completa de esa lectura está en la guía de significancia estadística en tests A/B.
Qué hacer cuando el holdout da empate
El resultado más común de un primer holdout no es victoria ni derrota, es empate: un intervalo de confianza que cruza el cero. Suele leerse como fracaso del proyecto y casi nunca es eso lo que dice la información.
Un empate tiene tres lecturas posibles, y el intervalo distingue entre ellas:
- Intervalo estrecho alrededor del cero (por ejemplo, de -0,05 a +0,08 punto porcentual). Eso es una respuesta fuerte: dentro de lo que tu tráfico alcanza a ver, la personalización no está generando incremento relevante. Vale investigar métrica objetivo equivocada, bucle de retroalimentación o arranque en frío antes de invertir más.
- Intervalo amplio cruzando el cero (por ejemplo, de -0,40 a +0,90 punto porcentual). Eso no es una respuesta, es falta de muestra. El test no tuvo poder para distinguir “nada” de “mucho”. La conducta es extender la ventana o aumentar el holdout, no concluir.
- Empate general con guardrails empeorando. Es el peor caso disfrazado de neutro: el sistema no generó incremento y degradó alguna cosa. Ingresos por visitante cayendo mientras los clics suben es la firma clásica.
La diferencia entre los dos primeros casos es exactamente por qué reportar el intervalo importa más aquí que en un test A/B común. En un test de página, un empate cierra la pregunta. En un holdout, un empate amplio es una invitación a seguir midiendo, y un empate estrecho es una decisión de negocio sobre seguir invirtiendo. Confundir los dos hace que el equipo apague un programa que funcionaba o financie un año más uno que no funcionaba.
Vale además separar el empate por tipo de visitante antes de concluir cualquier cosa, siempre que ese recorte se haya declarado antes. Los sistemas que dependen de histórico frecuentemente entregan incremento positivo para visitantes recurrentes e incremento negativo para visitantes nuevos, y los dos se anulan en el agregado. Un empate global producido por dos efectos opuestos que se cancelan es un problema totalmente distinto de un empate producido por ausencia de efecto, y la corrección también es distinta: en el primer caso, la solución suele ser apagar la personalización para quien no tiene histórico, no abandonar el programa.
Por qué el holdout cuesta más tráfico que un test 50/50
Este es el punto técnico que casi ningún material sobre personalización menciona, y decide si el diseño es viable. La asignación desigual cuesta poder estadístico, porque la precisión de la comparación está limitada por el brazo menor.
Para un efecto de +8% relativo sobre una base de 2,80%, con 95% de confianza y 80% de poder, un diseño equilibrado necesita 88.449 visitantes por variación, o 176.898 en total. Comprueba esa primera cuenta:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Manteniendo el mismo efecto y el mismo rigor, pero cambiando la proporción entre los grupos, el total necesario sube rápido:
| Proporción holdout / personalizado | Visitantes en el holdout | Visitantes en el personalizado | Tráfico total necesario | Coste respecto al 50/50 |
|---|---|---|---|---|
| 50% / 50% | 88.449 | 88.449 | 176.898 | 1,0x |
| 25% / 75% | 58.966 | 176.898 | 235.864 | 1,3x |
| 10% / 90% | 49.139 | 442.245 | 491.384 | 2,8x |
| 5% / 95% | 46.553 | 884.490 | 931.043 | 5,3x |
Muestras por aproximación normal de dos proporciones, base de 2,80%, efecto de +8% relativo, 95% de confianza y 80% de poder.
De ahí salen dos lecturas prácticas. La primera: reducir el holdout del 10% al 5% parece un ahorro (menos gente sin personalización), pero casi duplica el tráfico total necesario y, peor, apenas reduce el tamaño absoluto del brazo de control, que baja solo de 49.139 a 46.553. Es decir, el coste real de un holdout pequeño no es lo que reserva, es el tiempo hasta la respuesta.
La segunda: en el escenario de 500.000 visitantes por mes, el diseño 90/10 cierra en cerca de un mes, lo que es cómodo. Un sitio con 100.000 visitantes por mes, en el mismo diseño, tardaría cerca de cinco meses en responder la misma pregunta, y en esa ventana el sistema de personalización ya habrá cambiado varias veces. Los sitios con poco tráfico necesitan o un holdout mayor (20% a 25%), o aceptar medir solo efectos grandes, o medir en ventanas largas y asumir que están midiendo un sistema en movimiento.
La trampa de la lectura por segmento
La personalización invita a mirar recortes, y es exactamente ahí donde la mayoría de los programas convierte ruido en estrategia. Cada segmento examinado es un test adicional, y la probabilidad de encontrar al menos un falso positivo crece con el número de miradas.
Supón que el resultado general quedó plano y el equipo va a buscar dónde funcionó la personalización. Mira cinco segmentos y encuentra uno que parece óptimo: 8.000 visitantes por variación, 3,20% en el control contra 4,00% en el personalizado.
- Lift relativo: +25,0%.
- Estadístico z: 2,72.
- Valor p: 0,0066.
- Intervalo de confianza de la diferencia: de +0,22 a +1,38 punto porcentual.
Aislado, parece un hallazgo fuerte. Con cinco segmentos mirados, hay que pagar el precio de la multiplicidad:
| Segmentos examinados | Probabilidad de al menos un falso positivo | Corte de Bonferroni | ¿Sobrevive el hallazgo de p = 0,0066? |
|---|---|---|---|
| 1 | 5,0% | 0,0500 | sí |
| 3 | 14,3% | 0,0167 | sí |
| 5 | 22,6% | 0,0100 | sí, por poco |
| 10 | 40,1% | 0,0050 | no |
En este caso específico el hallazgo sobrevive a la corrección con cinco segmentos, y no sobreviviría con diez. Por eso la regla práctica no es “nunca mires segmentos”: es declarar antes de correr qué segmentos serán examinados, mantenerlos en número pequeño y aplicar la corrección. Un segmento elegido después de ver los datos no tiene corrección que lo salve, porque el número real de comparaciones hechas pasa a ser desconocido.
El tratamiento estadístico completo de la multiplicidad y de las otras amenazas a la validez está en errores comunes en tests A/B.
Cuándo un bandit es mejor que un test A/B
Los bandits reasignan tráfico durante la recogida hacia las opciones que están yendo mejor, en lugar de mantener la división fija hasta el final. Eso resuelve un problema real (la pérdida acumulada mientras el test corre) y crea otro (la asignación deja de ser aleatoria y fija, lo que complica la estimación limpia del efecto causal de cada brazo).
| Situación | Elección mejor | Por qué |
|---|---|---|
| Decisión permanente sobre una página | Test A/B | Quieres el tamaño del efecto, con intervalo, para documentar y planificar |
| Campaña corta con muchas creatividades | Bandit | La ganancia está en minimizar la pérdida durante la ventana, no en medir con precisión |
| Elección por contexto del visitante | Bandit contextual | La decisión óptima depende de atributos, que es exactamente lo que el algoritmo usa |
| Cambio arriesgado o caro de revertir | Test A/B | Necesitas el intervalo de confianza antes de comprometerte |
| Catálogo grande y cambiante | Bandit o recomendación | Probar artículo por artículo no escala |
Los bandits contextuales son el puente entre personalización y experimentación, porque exploran a propósito: una fracción de las entregas sigue siendo sorteada, lo que preserva alguna capacidad de estimar efectos. La formulación clásica del problema aplicada a recomendación de contenido está en Li et al., A Contextual-Bandit Approach to Personalized News Article Recommendation. El funcionamiento detallado está en qué es un bandit contextual y en la guía de multi-armed bandits x test A/B.
Vale registrar lo que no cambia: incluso con bandit, el holdout global sigue siendo necesario. El bandit optimiza dentro del conjunto de opciones que conoce; el holdout responde si tener ese conjunto vale más que no tener nada.
Probando dentro de la personalización: campeón contra retador
Después de que el holdout probó que tener personalización vale más que no tenerla, la pregunta cambia: ¿esta versión del sistema es mejor que la anterior? Esa es una pregunta de test A/B común, y es donde ocurre la mayor parte del trabajo continuo.
El diseño es el mismo de cualquier experimento, con una diferencia de vocabulario: el grupo de control no es la página sin personalización, es la versión actual del sistema (el campeón), y la variación es la versión nueva (el retador). Los dos personalizan; lo que cambia es el modelo, la regla o el conjunto de atributos.
| Nivel de comparación | Control | Variación | Qué significa la respuesta |
|---|---|---|---|
| Holdout global | Sin personalización | Sistema entero | ¿El programa genera negocio adicional? |
| Campeón contra retador | Modelo actual | Modelo nuevo | ¿Esta versión es mejor que la anterior? |
| Componente | Bloque actual de la página | Bloque rediseñado | ¿Este cambio de interfaz funciona dentro del sistema? |
Los tres niveles conviven, y confundirlos es el error de lectura más común en equipos que operan personalización. Un retador que vence al campeón por +3% no dice nada sobre el valor del programa; un holdout que muestra +9% no dice nada sobre qué modelo es mejor. Son preguntas en capas diferentes, y cada una necesita su propio grupo de comparación.
Un cuidado operativo: correr campeón contra retador mientras el holdout está en producción significa que el holdout se está comparando contra una mezcla de las dos versiones. Eso es aceptable y común, siempre que esté registrado, porque el holdout mide el programa tal como realmente operó en aquel período, y el programa realmente era una mezcla. Lo que no puede ocurrir es cambiar el campeón a mitad de la ventana y reportar el holdout como si el sistema hubiera sido estable.
La escalera de la personalización: por dónde empezar
Personalizar no es una decisión binaria, y el error más caro es saltar directo a modelos cuando el tráfico no sostiene ni la medición. El orden de abajo funciona porque cada escalón financia el siguiente con aprendizaje y con evidencia.
Escalón 1: una regla, probada como cualquier cambio. Elige un recorte que el equipo ya cree que es diferente (visitante nuevo contra recurrente, móvil contra escritorio, tráfico pagado contra orgánico) y trata la experiencia diferenciada como una variación normal en un test A/B. No hay modelo, no hay infraestructura nueva y el resultado ya responde si aquel recorte realmente responde de forma distinta. Muchos programas descubren aquí que el recorte del que todo el mundo estaba seguro que importaba no mueve nada, y se ahorran un trimestre de ingeniería.
Escalón 2: un conjunto pequeño de reglas, con holdout. Tres o cuatro reglas estables, con una porción reservada que no recibe ninguna de ellas. Aquí ya se aprende a operar un holdout, a sortear por identificador estable y a leer el resultado en el agregado. Es también donde aparece la primera señal honesta de techo: si cuatro reglas juntas producen un incremento pequeño y con intervalo amplio, un modelo probablemente no va a salvar el caso.
Escalón 3: modelo de recomendación, con exploración reservada. Solo tiene sentido con volumen de eventos suficiente para entrenar y con un catálogo lo bastante grande para que la elección importe. La fracción de exploración aleatoria entra desde el primer día, no como refinamiento posterior, porque sin ella el bucle de retroalimentación empieza a cerrarse de inmediato.
Escalón 4: bandit contextual. Cuando la decisión necesita tomarse en tiempo real, considerando el contexto, y el coste de servir la opción equivocada es lo bastante alto para justificar la infraestructura.
| Escalón | Tráfico mínimo cómodo | Qué responde | Coste de ingeniería |
|---|---|---|---|
| Regla única probada | Lo suficiente para un test A/B normal en el flujo | ¿Este recorte responde diferente? | Bajo |
| Pocas reglas con holdout | Tráfico para cerrar el diseño desigual en 1 a 2 meses | ¿El conjunto de reglas genera incremento? | Medio |
| Modelo de recomendación | Volumen de eventos para entrenar, además del holdout | ¿El modelo supera a las reglas? | Alto |
| Bandit contextual | Alto, con decisión en tiempo real | ¿Qué opción para este contexto ahora? | Alto |
La pregunta que decide el escalón no es “tenemos IA disponible”, es “podemos medir el escalón actual en una ventana útil”. Un sistema que no puede medirse no puede mejorarse, y un programa de personalización sin medir tiende a durar exactamente hasta la primera revisión de presupuesto.
Modos de fallo específicos de sistemas que aprenden
Un sistema de personalización con IA falla de maneras en que un test A/B no falla, porque se retroalimenta.
| Modo de fallo | Cómo se manifiesta | Qué hacer |
|---|---|---|
| Bucle de retroalimentación | Las recomendaciones se parecen cada vez más al histórico; el catálogo nuevo nunca aparece | Reservar una fracción de exploración aleatoria, siempre |
| Optimizar la métrica equivocada | Los clics suben, los ingresos por visitante caen (los artículos baratos convierten más fácil) | Elegir la métrica objetivo por el negocio y medir guardrails |
| Arranque en frío | El visitante nuevo recibe una experiencia peor que la versión sin personalización | Comparar el segmento de nuevos contra el holdout, por separado y declarado antes |
| Efecto novedad | Ganancia grande en las primeras semanas que desaparece después | Ventana larga; comparar las primeras semanas con las últimas del holdout |
| Deriva del modelo | El rendimiento cae despacio conforme cambia el comportamiento | Mantener el holdout en producción de forma permanente, no solo en la validación inicial |
| Fuga entre grupos | El usuario aparece en los dos lados por cambiar de dispositivo o navegador | Sortear por identificador estable; comprobar la división observada |
El tercero es el más frecuentemente ignorado y el más fácil de detectar: basta comparar visitantes nuevos del grupo personalizado contra visitantes nuevos del holdout. Los sistemas que dependen de histórico frecuentemente entregan a ese público una experiencia genérica peor que la página bien diseñada que la personalización sustituyó.
Privacidad y LGPD como requisito de proyecto
La personalización concentra tres riesgos de privacidad al mismo tiempo: recogida detallada de comportamiento, inferencia de características que la persona nunca declaró y decisiones automatizadas que afectan lo que ve. En Brasil, eso está bajo la Ley General de Protección de Datos, que exige base legal para el tratamiento, finalidad específica y minimización de los datos recogidos, y asegura al titular el derecho de solicitar revisión de decisiones tomadas exclusivamente con base en tratamiento automatizado.
Cuatro decisiones de proyecto que evitan retrabajo, sin sustituir la evaluación jurídica de tu caso:
- Minimiza los atributos. Cada campo recogido necesita tener una función clara en la decisión. Un atributo que no cambia la entrega es riesgo sin retorno.
- No infieras categorías sensibles. La inferencia de salud, religión, origen racial, opinión política o vida sexual es territorio de dato sensible y no debe entrar en un sistema de recomendación comercial.
- Documenta la lógica de la decisión. Registrar qué atributos entran y cómo pesan es lo que hace posible responder a una solicitud de revisión.
- Separa personalización de precio. Diferenciar el precio por atributos inferidos de una persona es una decisión de otro nivel de riesgo, jurídico y reputacional, y merece tratamiento propio.
Checklist de implementación
| Etapa | Qué garantizar antes de seguir |
|---|---|
| Definir la métrica objetivo | Métrica de negocio (ingresos por visitante o conversión), no métrica interna del sistema |
| Definir guardrails | Métricas que no pueden empeorar: ingresos por visitante, devoluciones, reclamaciones |
| Dimensionar el holdout | Calcular el tráfico necesario para la proporción elegida antes de encender el sistema |
| Sortear por identificador estable | La misma persona siempre del mismo lado, entre sesiones y dispositivos cuando sea posible |
| Declarar los segmentos | Lista cerrada y escrita antes, con corrección de multiplicidad acordada |
| Reservar exploración | Fracción de entregas aleatorias para que el modelo no quede ciego a lo que nunca intentó |
| Definir la ventana | Período de medición fijado antes, típicamente de uno a tres meses |
| Comprobar la división observada | La proporción real entre holdout y personalizado coincide con la planificada |
Errores comunes en personalización con IA
| Error | Señal de alerta | Corrección |
|---|---|---|
| Correr sin holdout | El informe solo tiene métricas internas del sistema | Reservar la porción antes de encender, no después |
| Holdout por sesión | La misma persona aparece en los dos grupos | Sortear por identificador estable del visitante |
| Encoger el holdout para “no perder ingresos” | Holdout del 2% o 3% | Calcular el tráfico total necesario antes de decidir la porción |
| Cazar segmentos después del resultado plano | Un recorte descubierto en el informe se vuelve estrategia | Declarar los segmentos antes y corregir por multiplicidad |
| Optimizar el clic como métrica objetivo | El engagement sube, los ingresos por visitante no | Métrica objetivo de negocio, clic como diagnóstico |
| Apagar el holdout tras la validación | “Ya probamos que funciona” | Mantenerlo de forma permanente para detectar deriva y efecto novedad |
| Tratar la privacidad al final | Revisión jurídica solo antes de subir | Minimización y finalidad decididas en el diseño |
Hazlo automático en Donnu
Medir personalización correctamente exige tres cosas que suelen hacerse en la hoja de cálculo: dimensionar el grupo reservado antes de encender el sistema, mantener el sorteo estable por visitante entre sesiones, y leer el resultado con intervalo de confianza en lugar de un número suelto. Donnu resuelve las tres con el mismo motor que usa en cualquier test: división determinista por visitante, duración y muestra calculadas contra tu tráfico real antes de empezar, y resultado siempre acompañado del intervalo y de las métricas de guardia. El holdout global se convierte en solo un experimento bien diseñado, con la diferencia de correr de forma permanente.
Empieza una prueba gratis de 14 días y mide el incremento de tu personalización en lugar de estimarlo. Para elegir entre medir con precisión y optimizar durante la recogida, mira la guía de multi-armed bandits x test A/B.
Referencias
- Li, L., Chu, W., Langford, J. y Schapire, R. A Contextual-Bandit Approach to Personalized News Article Recommendation. WWW 2010. arxiv.org/abs/1003.0146.
- Optimizely. Global holdouts. Documentación de soporte. support.optimizely.com/hc/en-us/articles/38941939408269-Global-holdouts.
- Kohavi, R. Online Controlled Experiments: Lessons from Running A/B/n Tests for 12 Years. Keynote, ACM SIGKDD 2015. exp-platform.com/Documents/2015-08OnlineControlledExperimentsKDDKeynoteNR.pdf.
- Kohavi, R., Tang, D. y Xu, Y. Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press, 2020 (extracto). cambridge.org.
- Brasil. Ley n.º 13.709/2018 (Ley General de Protección de Datos Personales). planalto.gov.br/ccivil_03/_ato2015-2018/2018/lei/l13709.htm.
Lee también:
Preguntas frecuentes
- ¿La personalización con IA sustituye al test A/B?
- No, porque las dos cosas responden preguntas diferentes. El test A/B responde "este cambio causa un efecto", comparando dos grupos equivalentes que ven cosas distintas. La personalización responde "qué contenido entrego a cada persona", y por definición entrega cosas distintas a personas distintas, lo que elimina el grupo de comparación natural. Sin un grupo reservado que no recibe personalización ninguna, no existe medida del efecto causal del sistema entero, solo métricas internas de él.
- ¿Qué es un holdout global en personalización?
- Es una porción fija y aleatoria del público que nunca recibe personalización, mantenida durante un período largo, para servir de control contra el cual se mide el efecto acumulado del sistema. Es distinto de un test A/B puntual: el holdout no prueba un cambio, mide el valor incremental del programa entero de personalización a lo largo del tiempo. Sin él, el sistema suele reportar cuánto acertó dentro de sus propias reglas, no cuánto negocio adicional generó.
- ¿Cuál es el tamaño ideal de un holdout global?
- El tamaño es una decisión estadística, no una convención. Las asignaciones desiguales cuestan eficiencia: para detectar el mismo efecto, un diseño 90/10 exige cerca de 2,8 veces más tráfico total que un 50/50, porque el brazo menor es el que limita la precisión. En la práctica, el 10% suele ser el menor holdout viable para sitios grandes, y los sitios con poco tráfico normalmente necesitan un 20% o ventanas de medición bastante más largas.
- ¿Por qué leer el resultado por segmento es peligroso?
- Porque cada segmento mirado es un test más, y la probabilidad de encontrar al menos un falso positivo crece rápido. Mirando 5 segmentos con 95% de confianza en cada uno, la probabilidad de al menos un falso positivo entre ellos llega a aproximadamente 22,6%. Segmentos definidos antes de correr, en número pequeño y con corrección de multiplicidad aplicada, son la única forma de leer recortes sin convertir ruido en estrategia.
- ¿Cuándo usar un bandit en lugar de un test A/B?
- Cuando el objetivo es maximizar el resultado durante la recogida y no medir el efecto con precisión. Los bandits reasignan tráfico hacia las opciones que están rindiendo mejor, lo que reduce la pérdida durante el aprendizaje y es excelente para decisiones efímeras, como qué creatividad mostrar en una campaña corta. El coste es que la asignación deja de ser aleatoria y fija, lo que dificulta una estimación limpia del efecto causal de cada variación.
- ¿La personalización con IA exige cuidado con la privacidad?
- Sí, y concentra varios riesgos a la vez: recogida de datos de comportamiento detallados, inferencia de características que la persona nunca declaró y decisiones automatizadas que afectan lo que ve y a qué precio. En Brasil, la LGPD exige base legal para el tratamiento, finalidad específica y minimización de datos, además de dar al titular el derecho de solicitar revisión de decisiones automatizadas. Tratar eso como requisito de proyecto, y no como revisión jurídica al final, evita retrabajo caro.
- ¿Cómo saber si la personalización está empeorando el resultado?
- Comparando con el holdout, y mirando las métricas de guardia junto a las métricas objetivo. Los sistemas de recomendación pueden aumentar clics y reducir ingresos por visitante cuando aprenden a promover artículos populares y baratos, y pueden degradar la experiencia de usuarios nuevos por falta de histórico. Un holdout mantenido en producción es el único instrumento que detecta ese tipo de empeoramiento, porque el panel interno del sistema tiende a mostrar exactamente lo que fue optimizado para mejorar.