CRO

Personalización con IA y Test A/B: cómo funcionan juntos

Guía completa de personalización con IA y test A/B: por qué una no sustituye a la otra, cómo medir con holdout global y el coste real en tráfico.

Ilustración de un nodo central luminoso que se ramifica en varios caminos, cada uno terminando en una silueta humana diferente

La personalización con IA y el test A/B no compiten: resuelven problemas diferentes y, bien combinadas, una mide a la otra. El test A/B establece si un cambio causa un efecto, comparando grupos equivalentes. La personalización decide qué entregar a cada persona, lo que por construcción acaba con el grupo de comparación natural, ya que nadie ve lo mismo. La consecuencia práctica es directa y casi siempre subestimada: un sistema de personalización sin grupo reservado no tiene cómo probar que generó negocio adicional, solo consigue mostrar cuánto acertó dentro de sus propias reglas. Esta guía cubre el diseño de medición que resuelve eso (el holdout global), su coste real en tráfico, las trampas de la lectura por segmento, cuándo un bandit es la elección correcta, y los modos de fallo específicos de sistemas que aprenden solos.

Qué es la personalización con IA, y qué no es

El término cubre cosas bastante diferentes, con costes y riesgos de medición bastante diferentes. Vale separar tres familias antes de cualquier discusión de resultado.

Familia Cómo decide qué mostrar Qué suele exigir Riesgo principal de medición
Reglas por segmento Condiciones escritas por personas (país, dispositivo, origen, cliente nuevo o recurrente) Poco dato, mucha curaduría Segmentos creados después de mirar el resultado
Modelos de recomendación Un modelo entrenado con histórico de comportamiento predice el artículo con más probabilidad de conversión Volumen de eventos y pipeline de datos Optimizar clics y degradar los ingresos por visitante
Bandits contextuales El algoritmo elige la opción considerando el contexto y sigue explorando alternativas Infraestructura de decisión en tiempo real La asignación no aleatoria dificulta estimar el efecto causal

Las tres se venden con frecuencia bajo la misma etiqueta, y la primera ni siquiera involucra aprendizaje automático. Eso importa porque la pregunta “la personalización está funcionando” tiene un coste de respuesta muy distinto en cada caso: las reglas por segmento pueden probarse una a una como cualquier cambio, mientras que un modelo que decide por usuario solo puede evaluarse en el agregado.

Una definición de trabajo útil para el resto de esta guía: personalización es cualquier sistema en el que la experiencia entregada depende de atributos del visitante. Si dos personas pueden ver cosas distintas en la misma URL por decisión del sistema, es personalización, y el problema de medición descrito abajo se aplica.

Por qué la personalización no sustituye al test A/B

El argumento de venta más común es seductor: “en lugar de elegir entre A y B, entrega A a quien prefiere A y B a quien prefiere B”. El problema es que la frase confunde dos preguntas.

Cuando la personalización entra sin diseño de medición, lo que se pierde es la línea base. El panel del sistema muestra métricas internas (“la tasa de clic en las recomendaciones es de X”), que suben cuando el modelo mejora y también cuando el modelo simplemente aprende a recomendar aquello que la persona ya iba a comprar de todos modos. Ese segundo caso no genera un céntimo de ingreso adicional y produce un informe excelente.

El test A/B y la personalización responden preguntas diferentesEn el test A/B, el público se sortea en dos grupos equivalentes que ven experiencias diferentes, y la comparación entre ellos mide el efecto causal. En la personalización, cada visitante recibe la experiencia elegida por el sistema según sus atributos, y no queda ningún grupo de comparación a menos que se reserve un holdout a propósito.Test A/Bpúblicogrupo Agrupo Bsorteo aleatorio, grupos equivalentesla comparación mide el efecto causalPersonalización sin holdoutpúblicoexp. 1exp. 2exp. 3exp. 4asignación decidida por los atributos del visitanteno queda grupo de comparaciónEl holdout global devuelve el grupo de comparación sin apagar la personalización para todo el mundo.Es la pieza que convierte un panel de métricas internas en una medida de negocio adicional.
La personalización elimina por construcción el grupo que el test A/B crea por sorteo. Recuperar ese grupo es el problema central de medir personalización.

El holdout global: el diseño que mide

La solución estándar es reservar una porción aleatoria y fija del público que nunca recibe personalización, y mantenerla durante un período largo. No prueba un cambio específico: mide el valor incremental del sistema entero. Las plataformas de experimentación ya lo ofrecen como funcionalidad, como el holdout global de Optimizely, y la mecánica es la misma en cualquier implementación propia.

Cuatro decisiones definen un holdout que funciona:

Ejemplo trabajado: midiendo el incremento

Un ecommerce recibe 500.000 visitantes por mes. El equipo reserva un holdout del 10%, es decir, 50.000 visitantes que ven la versión sin personalización, y deja 450.000 en el grupo personalizado. Al final de un mes:

Corriendo el test z de dos proporciones, bilateral, con 95% de confianza:

Compruébalo con los mismos números, o con los de tu holdout:

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

El intervalo es la parte que cambia la planificación. El punto de +8,93% es el centro de un rango que, en términos relativos, va de aproximadamente +3,5% a +14,4%. Llevar el número del medio a la dirección es prometer el centro de un intervalo amplio; llevar el rango es hacer una afirmación que los resultados del trimestre siguiente pueden sostener. La lógica completa de esa lectura está en la guía de significancia estadística en tests A/B.

Qué hacer cuando el holdout da empate

El resultado más común de un primer holdout no es victoria ni derrota, es empate: un intervalo de confianza que cruza el cero. Suele leerse como fracaso del proyecto y casi nunca es eso lo que dice la información.

Un empate tiene tres lecturas posibles, y el intervalo distingue entre ellas:

La diferencia entre los dos primeros casos es exactamente por qué reportar el intervalo importa más aquí que en un test A/B común. En un test de página, un empate cierra la pregunta. En un holdout, un empate amplio es una invitación a seguir midiendo, y un empate estrecho es una decisión de negocio sobre seguir invirtiendo. Confundir los dos hace que el equipo apague un programa que funcionaba o financie un año más uno que no funcionaba.

Vale además separar el empate por tipo de visitante antes de concluir cualquier cosa, siempre que ese recorte se haya declarado antes. Los sistemas que dependen de histórico frecuentemente entregan incremento positivo para visitantes recurrentes e incremento negativo para visitantes nuevos, y los dos se anulan en el agregado. Un empate global producido por dos efectos opuestos que se cancelan es un problema totalmente distinto de un empate producido por ausencia de efecto, y la corrección también es distinta: en el primer caso, la solución suele ser apagar la personalización para quien no tiene histórico, no abandonar el programa.

Por qué el holdout cuesta más tráfico que un test 50/50

Este es el punto técnico que casi ningún material sobre personalización menciona, y decide si el diseño es viable. La asignación desigual cuesta poder estadístico, porque la precisión de la comparación está limitada por el brazo menor.

Para un efecto de +8% relativo sobre una base de 2,80%, con 95% de confianza y 80% de poder, un diseño equilibrado necesita 88.449 visitantes por variación, o 176.898 en total. Comprueba esa primera cuenta:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Manteniendo el mismo efecto y el mismo rigor, pero cambiando la proporción entre los grupos, el total necesario sube rápido:

Proporción holdout / personalizado Visitantes en el holdout Visitantes en el personalizado Tráfico total necesario Coste respecto al 50/50
50% / 50% 88.449 88.449 176.898 1,0x
25% / 75% 58.966 176.898 235.864 1,3x
10% / 90% 49.139 442.245 491.384 2,8x
5% / 95% 46.553 884.490 931.043 5,3x

Muestras por aproximación normal de dos proporciones, base de 2,80%, efecto de +8% relativo, 95% de confianza y 80% de poder.

De ahí salen dos lecturas prácticas. La primera: reducir el holdout del 10% al 5% parece un ahorro (menos gente sin personalización), pero casi duplica el tráfico total necesario y, peor, apenas reduce el tamaño absoluto del brazo de control, que baja solo de 49.139 a 46.553. Es decir, el coste real de un holdout pequeño no es lo que reserva, es el tiempo hasta la respuesta.

La segunda: en el escenario de 500.000 visitantes por mes, el diseño 90/10 cierra en cerca de un mes, lo que es cómodo. Un sitio con 100.000 visitantes por mes, en el mismo diseño, tardaría cerca de cinco meses en responder la misma pregunta, y en esa ventana el sistema de personalización ya habrá cambiado varias veces. Los sitios con poco tráfico necesitan o un holdout mayor (20% a 25%), o aceptar medir solo efectos grandes, o medir en ventanas largas y asumir que están midiendo un sistema en movimiento.

Coste en tráfico total conforme el holdout se encogePara detectar el mismo efecto, un diseño equilibrado necesita 176.898 visitantes en total. Con holdout del 25 por ciento sube a 235.864, con 10 por ciento sube a 491.384 y con 5 por ciento llega a 931.043 visitantes.50% / 50%176.89825% / 75%235.86410% / 90%491.3845% / 95%931.043Tráfico total necesario para detectar el mismo efecto de +8% relativo sobre una base de 2,80%.Encoger el holdout ahorra poca gente reservada y cuesta mucho tiempo hasta la respuesta.
Holdout pequeño no es holdout barato. El brazo menor gobierna la precisión, así que recortar la porción reservada empuja el coste hacia el tráfico total y hacia el calendario.

La trampa de la lectura por segmento

La personalización invita a mirar recortes, y es exactamente ahí donde la mayoría de los programas convierte ruido en estrategia. Cada segmento examinado es un test adicional, y la probabilidad de encontrar al menos un falso positivo crece con el número de miradas.

Supón que el resultado general quedó plano y el equipo va a buscar dónde funcionó la personalización. Mira cinco segmentos y encuentra uno que parece óptimo: 8.000 visitantes por variación, 3,20% en el control contra 4,00% en el personalizado.

Aislado, parece un hallazgo fuerte. Con cinco segmentos mirados, hay que pagar el precio de la multiplicidad:

Segmentos examinados Probabilidad de al menos un falso positivo Corte de Bonferroni ¿Sobrevive el hallazgo de p = 0,0066?
1 5,0% 0,0500
3 14,3% 0,0167
5 22,6% 0,0100 sí, por poco
10 40,1% 0,0050 no

En este caso específico el hallazgo sobrevive a la corrección con cinco segmentos, y no sobreviviría con diez. Por eso la regla práctica no es “nunca mires segmentos”: es declarar antes de correr qué segmentos serán examinados, mantenerlos en número pequeño y aplicar la corrección. Un segmento elegido después de ver los datos no tiene corrección que lo salve, porque el número real de comparaciones hechas pasa a ser desconocido.

El tratamiento estadístico completo de la multiplicidad y de las otras amenazas a la validez está en errores comunes en tests A/B.

Cuándo un bandit es mejor que un test A/B

Los bandits reasignan tráfico durante la recogida hacia las opciones que están yendo mejor, en lugar de mantener la división fija hasta el final. Eso resuelve un problema real (la pérdida acumulada mientras el test corre) y crea otro (la asignación deja de ser aleatoria y fija, lo que complica la estimación limpia del efecto causal de cada brazo).

Situación Elección mejor Por qué
Decisión permanente sobre una página Test A/B Quieres el tamaño del efecto, con intervalo, para documentar y planificar
Campaña corta con muchas creatividades Bandit La ganancia está en minimizar la pérdida durante la ventana, no en medir con precisión
Elección por contexto del visitante Bandit contextual La decisión óptima depende de atributos, que es exactamente lo que el algoritmo usa
Cambio arriesgado o caro de revertir Test A/B Necesitas el intervalo de confianza antes de comprometerte
Catálogo grande y cambiante Bandit o recomendación Probar artículo por artículo no escala

Los bandits contextuales son el puente entre personalización y experimentación, porque exploran a propósito: una fracción de las entregas sigue siendo sorteada, lo que preserva alguna capacidad de estimar efectos. La formulación clásica del problema aplicada a recomendación de contenido está en Li et al., A Contextual-Bandit Approach to Personalized News Article Recommendation. El funcionamiento detallado está en qué es un bandit contextual y en la guía de multi-armed bandits x test A/B.

Vale registrar lo que no cambia: incluso con bandit, el holdout global sigue siendo necesario. El bandit optimiza dentro del conjunto de opciones que conoce; el holdout responde si tener ese conjunto vale más que no tener nada.

Probando dentro de la personalización: campeón contra retador

Después de que el holdout probó que tener personalización vale más que no tenerla, la pregunta cambia: ¿esta versión del sistema es mejor que la anterior? Esa es una pregunta de test A/B común, y es donde ocurre la mayor parte del trabajo continuo.

El diseño es el mismo de cualquier experimento, con una diferencia de vocabulario: el grupo de control no es la página sin personalización, es la versión actual del sistema (el campeón), y la variación es la versión nueva (el retador). Los dos personalizan; lo que cambia es el modelo, la regla o el conjunto de atributos.

Nivel de comparación Control Variación Qué significa la respuesta
Holdout global Sin personalización Sistema entero ¿El programa genera negocio adicional?
Campeón contra retador Modelo actual Modelo nuevo ¿Esta versión es mejor que la anterior?
Componente Bloque actual de la página Bloque rediseñado ¿Este cambio de interfaz funciona dentro del sistema?

Los tres niveles conviven, y confundirlos es el error de lectura más común en equipos que operan personalización. Un retador que vence al campeón por +3% no dice nada sobre el valor del programa; un holdout que muestra +9% no dice nada sobre qué modelo es mejor. Son preguntas en capas diferentes, y cada una necesita su propio grupo de comparación.

Un cuidado operativo: correr campeón contra retador mientras el holdout está en producción significa que el holdout se está comparando contra una mezcla de las dos versiones. Eso es aceptable y común, siempre que esté registrado, porque el holdout mide el programa tal como realmente operó en aquel período, y el programa realmente era una mezcla. Lo que no puede ocurrir es cambiar el campeón a mitad de la ventana y reportar el holdout como si el sistema hubiera sido estable.

La escalera de la personalización: por dónde empezar

Personalizar no es una decisión binaria, y el error más caro es saltar directo a modelos cuando el tráfico no sostiene ni la medición. El orden de abajo funciona porque cada escalón financia el siguiente con aprendizaje y con evidencia.

Escalón 1: una regla, probada como cualquier cambio. Elige un recorte que el equipo ya cree que es diferente (visitante nuevo contra recurrente, móvil contra escritorio, tráfico pagado contra orgánico) y trata la experiencia diferenciada como una variación normal en un test A/B. No hay modelo, no hay infraestructura nueva y el resultado ya responde si aquel recorte realmente responde de forma distinta. Muchos programas descubren aquí que el recorte del que todo el mundo estaba seguro que importaba no mueve nada, y se ahorran un trimestre de ingeniería.

Escalón 2: un conjunto pequeño de reglas, con holdout. Tres o cuatro reglas estables, con una porción reservada que no recibe ninguna de ellas. Aquí ya se aprende a operar un holdout, a sortear por identificador estable y a leer el resultado en el agregado. Es también donde aparece la primera señal honesta de techo: si cuatro reglas juntas producen un incremento pequeño y con intervalo amplio, un modelo probablemente no va a salvar el caso.

Escalón 3: modelo de recomendación, con exploración reservada. Solo tiene sentido con volumen de eventos suficiente para entrenar y con un catálogo lo bastante grande para que la elección importe. La fracción de exploración aleatoria entra desde el primer día, no como refinamiento posterior, porque sin ella el bucle de retroalimentación empieza a cerrarse de inmediato.

Escalón 4: bandit contextual. Cuando la decisión necesita tomarse en tiempo real, considerando el contexto, y el coste de servir la opción equivocada es lo bastante alto para justificar la infraestructura.

Escalón Tráfico mínimo cómodo Qué responde Coste de ingeniería
Regla única probada Lo suficiente para un test A/B normal en el flujo ¿Este recorte responde diferente? Bajo
Pocas reglas con holdout Tráfico para cerrar el diseño desigual en 1 a 2 meses ¿El conjunto de reglas genera incremento? Medio
Modelo de recomendación Volumen de eventos para entrenar, además del holdout ¿El modelo supera a las reglas? Alto
Bandit contextual Alto, con decisión en tiempo real ¿Qué opción para este contexto ahora? Alto

La pregunta que decide el escalón no es “tenemos IA disponible”, es “podemos medir el escalón actual en una ventana útil”. Un sistema que no puede medirse no puede mejorarse, y un programa de personalización sin medir tiende a durar exactamente hasta la primera revisión de presupuesto.

Modos de fallo específicos de sistemas que aprenden

Un sistema de personalización con IA falla de maneras en que un test A/B no falla, porque se retroalimenta.

El bucle de retroalimentación de un recomendadorEl modelo recomienda artículos, los usuarios interactúan solo con lo que fue recomendado, esos clics se convierten en los datos de entrenamiento del próximo ciclo, y el modelo refuerza las mismas elecciones. Los artículos nunca mostrados nunca acumulan evidencia a favor.el modelo recomiendael usuario solo interactúacon lo que fue mostradolos clics se vuelven entrenamientoel modelo refuerzalas mismas eleccioneslos artículos nunca mostradosnunca ganan evidencia
El bucle de retroalimentación es el modo de fallo más silencioso: el sistema mejora en lo que ya hacía y queda ciego a lo que nunca intentó. Exploración deliberada y holdout son los dos antídotos.
Modo de fallo Cómo se manifiesta Qué hacer
Bucle de retroalimentación Las recomendaciones se parecen cada vez más al histórico; el catálogo nuevo nunca aparece Reservar una fracción de exploración aleatoria, siempre
Optimizar la métrica equivocada Los clics suben, los ingresos por visitante caen (los artículos baratos convierten más fácil) Elegir la métrica objetivo por el negocio y medir guardrails
Arranque en frío El visitante nuevo recibe una experiencia peor que la versión sin personalización Comparar el segmento de nuevos contra el holdout, por separado y declarado antes
Efecto novedad Ganancia grande en las primeras semanas que desaparece después Ventana larga; comparar las primeras semanas con las últimas del holdout
Deriva del modelo El rendimiento cae despacio conforme cambia el comportamiento Mantener el holdout en producción de forma permanente, no solo en la validación inicial
Fuga entre grupos El usuario aparece en los dos lados por cambiar de dispositivo o navegador Sortear por identificador estable; comprobar la división observada

El tercero es el más frecuentemente ignorado y el más fácil de detectar: basta comparar visitantes nuevos del grupo personalizado contra visitantes nuevos del holdout. Los sistemas que dependen de histórico frecuentemente entregan a ese público una experiencia genérica peor que la página bien diseñada que la personalización sustituyó.

Privacidad y LGPD como requisito de proyecto

La personalización concentra tres riesgos de privacidad al mismo tiempo: recogida detallada de comportamiento, inferencia de características que la persona nunca declaró y decisiones automatizadas que afectan lo que ve. En Brasil, eso está bajo la Ley General de Protección de Datos, que exige base legal para el tratamiento, finalidad específica y minimización de los datos recogidos, y asegura al titular el derecho de solicitar revisión de decisiones tomadas exclusivamente con base en tratamiento automatizado.

Cuatro decisiones de proyecto que evitan retrabajo, sin sustituir la evaluación jurídica de tu caso:

Checklist de implementación

Etapa Qué garantizar antes de seguir
Definir la métrica objetivo Métrica de negocio (ingresos por visitante o conversión), no métrica interna del sistema
Definir guardrails Métricas que no pueden empeorar: ingresos por visitante, devoluciones, reclamaciones
Dimensionar el holdout Calcular el tráfico necesario para la proporción elegida antes de encender el sistema
Sortear por identificador estable La misma persona siempre del mismo lado, entre sesiones y dispositivos cuando sea posible
Declarar los segmentos Lista cerrada y escrita antes, con corrección de multiplicidad acordada
Reservar exploración Fracción de entregas aleatorias para que el modelo no quede ciego a lo que nunca intentó
Definir la ventana Período de medición fijado antes, típicamente de uno a tres meses
Comprobar la división observada La proporción real entre holdout y personalizado coincide con la planificada

Errores comunes en personalización con IA

Error Señal de alerta Corrección
Correr sin holdout El informe solo tiene métricas internas del sistema Reservar la porción antes de encender, no después
Holdout por sesión La misma persona aparece en los dos grupos Sortear por identificador estable del visitante
Encoger el holdout para “no perder ingresos” Holdout del 2% o 3% Calcular el tráfico total necesario antes de decidir la porción
Cazar segmentos después del resultado plano Un recorte descubierto en el informe se vuelve estrategia Declarar los segmentos antes y corregir por multiplicidad
Optimizar el clic como métrica objetivo El engagement sube, los ingresos por visitante no Métrica objetivo de negocio, clic como diagnóstico
Apagar el holdout tras la validación “Ya probamos que funciona” Mantenerlo de forma permanente para detectar deriva y efecto novedad
Tratar la privacidad al final Revisión jurídica solo antes de subir Minimización y finalidad decididas en el diseño

Hazlo automático en Donnu

Medir personalización correctamente exige tres cosas que suelen hacerse en la hoja de cálculo: dimensionar el grupo reservado antes de encender el sistema, mantener el sorteo estable por visitante entre sesiones, y leer el resultado con intervalo de confianza en lugar de un número suelto. Donnu resuelve las tres con el mismo motor que usa en cualquier test: división determinista por visitante, duración y muestra calculadas contra tu tráfico real antes de empezar, y resultado siempre acompañado del intervalo y de las métricas de guardia. El holdout global se convierte en solo un experimento bien diseñado, con la diferencia de correr de forma permanente.

Empieza una prueba gratis de 14 días y mide el incremento de tu personalización en lugar de estimarlo. Para elegir entre medir con precisión y optimizar durante la recogida, mira la guía de multi-armed bandits x test A/B.

Referencias

Lee también:

Preguntas frecuentes

¿La personalización con IA sustituye al test A/B?
No, porque las dos cosas responden preguntas diferentes. El test A/B responde "este cambio causa un efecto", comparando dos grupos equivalentes que ven cosas distintas. La personalización responde "qué contenido entrego a cada persona", y por definición entrega cosas distintas a personas distintas, lo que elimina el grupo de comparación natural. Sin un grupo reservado que no recibe personalización ninguna, no existe medida del efecto causal del sistema entero, solo métricas internas de él.
¿Qué es un holdout global en personalización?
Es una porción fija y aleatoria del público que nunca recibe personalización, mantenida durante un período largo, para servir de control contra el cual se mide el efecto acumulado del sistema. Es distinto de un test A/B puntual: el holdout no prueba un cambio, mide el valor incremental del programa entero de personalización a lo largo del tiempo. Sin él, el sistema suele reportar cuánto acertó dentro de sus propias reglas, no cuánto negocio adicional generó.
¿Cuál es el tamaño ideal de un holdout global?
El tamaño es una decisión estadística, no una convención. Las asignaciones desiguales cuestan eficiencia: para detectar el mismo efecto, un diseño 90/10 exige cerca de 2,8 veces más tráfico total que un 50/50, porque el brazo menor es el que limita la precisión. En la práctica, el 10% suele ser el menor holdout viable para sitios grandes, y los sitios con poco tráfico normalmente necesitan un 20% o ventanas de medición bastante más largas.
¿Por qué leer el resultado por segmento es peligroso?
Porque cada segmento mirado es un test más, y la probabilidad de encontrar al menos un falso positivo crece rápido. Mirando 5 segmentos con 95% de confianza en cada uno, la probabilidad de al menos un falso positivo entre ellos llega a aproximadamente 22,6%. Segmentos definidos antes de correr, en número pequeño y con corrección de multiplicidad aplicada, son la única forma de leer recortes sin convertir ruido en estrategia.
¿Cuándo usar un bandit en lugar de un test A/B?
Cuando el objetivo es maximizar el resultado durante la recogida y no medir el efecto con precisión. Los bandits reasignan tráfico hacia las opciones que están rindiendo mejor, lo que reduce la pérdida durante el aprendizaje y es excelente para decisiones efímeras, como qué creatividad mostrar en una campaña corta. El coste es que la asignación deja de ser aleatoria y fija, lo que dificulta una estimación limpia del efecto causal de cada variación.
¿La personalización con IA exige cuidado con la privacidad?
Sí, y concentra varios riesgos a la vez: recogida de datos de comportamiento detallados, inferencia de características que la persona nunca declaró y decisiones automatizadas que afectan lo que ve y a qué precio. En Brasil, la LGPD exige base legal para el tratamiento, finalidad específica y minimización de datos, además de dar al titular el derecho de solicitar revisión de decisiones automatizadas. Tratar eso como requisito de proyecto, y no como revisión jurídica al final, evita retrabajo caro.
¿Cómo saber si la personalización está empeorando el resultado?
Comparando con el holdout, y mirando las métricas de guardia junto a las métricas objetivo. Los sistemas de recomendación pueden aumentar clics y reducir ingresos por visitante cuando aprenden a promover artículos populares y baratos, y pueden degradar la experiencia de usuarios nuevos por falta de histórico. Un holdout mantenido en producción es el único instrumento que detecta ese tipo de empeoramiento, porque el panel interno del sistema tiende a mostrar exactamente lo que fue optimizado para mejorar.