CRO

Prueba Social en Test A/B: qué Testear y cómo Medir

Prueba social en test A/B: reseñas, logos, testimonios y contadores. Qué muestra la evidencia, qué testear y la métrica que no engaña.

Ilustración plana de una bolsa de compras verde oscuro en el centro, rodeada de avatares de personas en globos de conversación, un globo con líneas de texto, estrellas doradas y corazones, sobre fondo verde menta

La prueba social es toda señal de que otras personas ya eligieron, usaron o aprobaron lo que el visitante está evaluando: puntuación y cantidad de reseñas, número de clientes, testimonios, logos, actividad en tiempo real, sellos y contenido generado por usuarios. Funciona reduciendo incertidumbre, y por eso es una hipótesis frecuente en CRO y fácil de medir mal. El error típico no está en elegir el elemento, está en elegir la métrica: en el ejemplo trabajado de esta guía, un sello de reseñas en la página de producto aumenta los pedidos en 8,75 por ciento con valor-p de 0,0010, y los pedidos que no vuelven como devolución suben solo 0,99 por ciento, con valor-p de 0,7280. Esta guía forma parte de nuestra guía completa de optimización de conversión (CRO) y cubre lo que la investigación muestra (y lo que no), qué testear en ecommerce y en SaaS, los cinco errores de medición y dos ejemplos calculados de punta a punta.

Qué es la prueba social y por qué funciona

La empresa de Robert Cialdini resume el principio en una frase: especialmente cuando están inseguras, las personas miran las acciones y el comportamiento de los demás para decidir las propias. La palabra que importa en esa definición es inseguras. La prueba social no convence a nadie de nada por sí sola; le presta la experiencia de otras personas a quien todavía no tiene información suficiente para decidir.

Para quien testea, eso quiere decir que el efecto esperado depende del tamaño de la incertidumbre en ese punto de la página. Quien llegó por la búsqueda de tu marca, ya decidido, tiene poca duda que reducir; quien ve un producto caro, de marca desconocida, tiene mucha. El mismo sello puede tener efecto cero en una página y relevante en otra.

Goldstein, Cialdini y Griskevicius agregaron una segunda condición, en un experimento de campo de 2008: la prueba funcionó mejor cuando el grupo citado estaba en la misma situación del lector, lo que ellos llaman norma provinciana. En la página, “clientes de tu tamaño” o “quien compró esta talla” tiende a ser una hipótesis más fuerte que “miles de clientes”.

Los siete tipos de prueba social en una página

tipo qué señala dónde suele aparecer riesgo principal
Puntuación y cantidad de reseñas otras personas compraron y opinaron cerca del título y del precio en la página de producto puntuación perfecta con pocas reseñas parece demasiado buena
Número de clientes o usuarios escala y supervivencia de la empresa home, landing page, página de precios número inflado es publicidad engañosa
Testimonios experiencia concreta de alguien parecido landing page, página de precios, checkout testimonio genérico o de origen incierto
Logos de clientes empresas conocidas confiaron landing page B2B y página de precios SaaS logo que el visitante no reconoce o con el que no se identifica
Actividad en tiempo real otras personas están actuando ahora página de producto y carrito contador sorteado o fijo en el código
Sellos y certificaciones un tercero verificó algo checkout, pie de página, página de seguridad sello sin verificación real o fuera de contexto
Contenido generado por usuarios fotos y videos de uso real galería de la página de producto, redes sociales peso de página y curaduría que esconde lo negativo

La última columna es casi toda sobre credibilidad. La prueba social es una afirmación sobre hechos, y por eso está expuesta a dos riesgos que el panel del test no muestra: parecer falsa y ser falsa.

Qué muestra realmente la evidencia

Tres fuentes suelen citarse cuando el tema es prueba social, con calidades de evidencia muy distintas. Lee cada una por el diseño, no por el número de titular.

El experimento de las toallas: fuerte, famoso y con una replicación que falló

En el primer experimento de Goldstein, Cialdini y Griskevicius, las 190 habitaciones de un hotel de una cadena nacional en Estados Unidos fueron sorteadas entre dos tarjetas. La tarjeta estándar hablaba de proteger el medio ambiente. La tarjeta de norma descriptiva decía que casi 75 por ciento de los huéspedes participaba del programa. Considerando solo el primer día elegible de cada huésped, la reutilización fue de 44,1 por ciento con la norma contra 35,1 por ciento con el llamado ambiental, con valor-p de 0,05 en un test chi cuadrado sobre 433 observaciones.

En el segundo experimento, con 1.595 observaciones en el mismo hotel y cinco tarjetas, los cuatro mensajes de norma juntos llegaron a 44,5 por ciento contra 37,2 por ciento del mensaje ambiental, y la norma “de los huéspedes que se alojaron en esta habitación” llegó a 49,3 por ciento, contra 42,8 por ciento de las otras tres normas juntas.

La página de Cialdini presenta el resultado como aumentos de 26 y 33 por ciento. Las cuentas coinciden con el artículo (44,1 contra 35,1 da cerca de 26 por ciento relativo; 49,3 contra 37,2 da cerca de 33), pero cada número viene de un experimento distinto, con un control distinto. Es un buen recordatorio de cómo un resultado de investigación se convierte en titular.

Y existe la parte que suele quedar fuera. En 2014, Bohner y Schlüter repitieron el diseño en dos hoteles en Alemania, en PLoS ONE. En el estudio 1, con 724 observaciones, las cuatro normas juntas dieron 81,9 por ciento de reutilización contra 83,7 por ciento del mensaje ambiental, valor-p de 0,62. En el estudio 2, con 204 observaciones, el mensaje ambiental fue el mejor de todos (93,3 por ciento). La conclusión de los autores: los mensajes de norma no fueron más eficaces que el estándar, y el efecto de la proximidad fue inconsistente entre los estudios.

Reutilización de toallas en el experimento original y en la replicaciónBarras horizontales de tasa de reutilización. Goldstein y coautores, experimento 1: mensaje ambiental 35,1 por ciento, norma descriptiva 44,1 por ciento. Experimento 2: mensaje ambiental 37,2 por ciento, cuatro normas juntas 44,5 por ciento, norma de la misma habitación 49,3 por ciento. Bohner y Schlüter, estudio 1: mensaje ambiental 83,7 por ciento, cuatro normas juntas 81,9 por ciento, sin diferencia significativa.la misma idea, dos resultados: el contexto lo cambia todoGoldstein y coautores, 2008, experimento 1 (EE. UU.)mensaje ambiental35,1%norma descriptiva44,1%Goldstein y coautores, 2008, experimento 2 (EE. UU.)mensaje ambiental37,2%cuatro normas juntas44,5%norma de la misma habitación49,3%Bohner y Schlüter, 2014, estudio 1 (Alemania)mensaje ambiental83,7%cuatro normas juntas81,9%escala de 0 a 100 por ciento a partir de la línea vertical. En la replicación, valor-p de 0,62.fuentes: Journal of Consumer Research, 2008; PLoS ONE, 2014
En Alemania, la reutilización ya era alta con cualquier tarjeta, y la norma descriptiva no agregó nada. Un efecto real en un contexto no es un efecto garantizado en otro, y es exactamente por eso que la prueba social se testea en lugar de copiarse.

Hay además un detalle de diseño que le interesa a quien corre experimentos. En el hotel estadounidense, la aleatorización fue por habitación (190 habitaciones en el experimento 1), y el análisis fue por huésped. Cuando la unidad aleatorizada es mayor que la unidad analizada, las observaciones del mismo grupo tienden a parecerse entre sí, y el test que trata a cada una como independiente tiende a exagerar la precisión. El blog trata esa cuenta en aleatorización por cluster y en unidad de aleatorización.

El número del 270 por ciento: observacional y con proveedor al lado

El informe How Online Reviews Influence Sales, del Spiegel Research Center de Northwestern, hecho en alianza con PowerReviews (empresa que vende software de reseñas), es la fuente de uno de los números más repetidos sobre prueba social. Lo que dice, leído en su totalidad:

hallazgo de dónde viene cómo leerlo
probabilidad de compra con cinco reseñas 270% mayor que sin ninguna minorista de regalos de alto valor: cerca de 15,5 millones de visualizaciones, 1.800 productos, 7,8 millones de usuarios en un año, siguiendo productos a medida que acumulaban reseñas observacional; un producto que acumula reseñas también acumula tiempo de catálogo y ventas
mostrar reseñas elevó la conversión en 190% en producto barato y 380% en producto caro mismo minorista, comparando categorías la dirección (más efecto en compra arriesgada) es lo que se transfiere, no la magnitud
la probabilidad de compra suele alcanzar su pico entre 4,0 y 4,7 estrellas y caer cerca de 5,0 varias categorías de producto el propio informe también habla de 4,2 a 4,5 en el resumen final; trátalo como rango, no como objetivo
casi toda la ganancia ocurre en las primeras 10 reseñas, y las 5 primeras hacen la mayor parte minorista de regalos argumento para juntar pocas reseñas en muchos productos
una reseña de comprador verificado aumenta la probabilidad de compra en 15% frente a la anónima cerca de 13.500 productos, 57 mil reseñas anónimas y 65 mil verificadas el sello de verificado es una hipótesis de test barata

El diseño no es un test A/B. Un producto que llega a cinco reseñas es, por construcción, un producto que ya vendió y lleva más tiempo en el catálogo, así que el número no es “pon estrellas y vende 3,7 veces más”. Lo que se transfiere es la dirección: las reseñas pesan más donde la incertidumbre es mayor, la puntuación perfecta despierta desconfianza y las primeras reseñas valen más que las siguientes.

La prueba social que es mentira

Mathur y coautores, de Princeton, rastrearon cerca de 53 mil páginas de producto en cerca de 11 mil tiendas (CSCW 2019) y encontraron 1.818 ocurrencias de patrones engañosos de interfaz en 1.254 sitios. Entre las 313 notificaciones de actividad (quién acaba de comprar, cuántas personas están viendo), 29, en 20 sitios, eran engañosas: la mayoría generaba el número con sorteo aleatorio o mostraba mensajes fijos en el código. Entre los testimonios de origen incierto, en uno de los casos el mismo conjunto de testimonios aparecía en otra tienda, con nombres de clientes distintos.

Para quien testea: un contador falso puede “ganar” un test A/B. El panel mide comportamiento, no veracidad, así que “¿es verdad?” viene antes de “¿convierte?”.

Qué testear en prueba social: la matriz ecommerce x SaaS

Como la prueba social trabaja sobre la incertidumbre, la pregunta útil no es “¿pongo testimonios?”, es “¿qué duda tiene el visitante en este punto, y qué prueba la responde?”. La duda cambia entre ecommerce y SaaS, y cambia de etapa en etapa.

La duda del visitante y la prueba que la respondeDos columnas. Ecommerce, página de producto: dudas “me va a quedar bien”, “la tienda es confiable”, “llega a tiempo”, respondidas por reseñas con fotos y talla, puntuación con cantidad y sello de compra verificada. SaaS, página de precios: dudas “sirve para empresas como la mía”, “y si contrato y no funciona”, “mis datos están seguros”, respondidas por testimonio del mismo tamaño, logos del mismo sector e información de cumplimiento.la prueba correcta es la que responde la duda de ese puntoEcommerce: página de productoduda¿me va a quedar bien? ¿es como la foto?¿esta tienda entrega de verdad?¿otras personas se arrepintieron?prueba que respondereseña con foto y talla usadapuntuación con cantidad, cerca del preciosello de compra verificadaSaaS: página de preciosduda¿sirve para empresas como la mía?¿y si contrato y no funciona?¿mis datos están seguros?prueba que respondetestimonio de empresa del mismo tamañologos del sector que visitacumplimiento y dónde quedan los datos
La norma provinciana del experimento de las toallas, traducida a la página: cuanto más parecido al visitante es el grupo citado, más plausible es el efecto. Plausible, no garantizado, como mostró la replicación.

La matriz de abajo organiza las hipótesis más comunes por la palanca que mueven. La columna “trampa de medición” es la que más pesa a la hora de leer el resultado.

palanca ecommerce: qué testear SaaS: qué testear trampa de medición
Posición puntuación con cantidad justo debajo del título, cerca del precio, contra solo al final de la página logos y testimonio arriba de la tabla de planes contra debajo de ella el clic en la puntuación sube solo porque quedó visible
Especificidad reseñas filtradas por talla o uso contra lista general testimonio del mismo tamaño o sector contra testimonio genérico segmento definido después de ver el dato
Formato de la puntuación promedio con cantidad contra promedio solo; mostrar la distribución de estrellas número de clientes contra logos puntuación alta con pocas reseñas
Credibilidad sello de compra verificada; mostrar reseñas negativas testimonio con nombre, cargo y empresa contra anónimo ganancia de conversión que se vuelve devolución o churn
Actividad “vendidos en las últimas 24 horas”, si es real “empresas que empezaron este mes”, si es real contador que cambia solo durante el test
Sellos y cumplimiento sello de seguridad cerca del campo de tarjeta información de protección de datos, ubicación del dato, certificaciones reales sello que aparece en los dos brazos por otro camino
Contenido de usuarios galería de fotos de clientes en la página de producto caso de estudio con número verificable el peso de la página cambia junto con la prueba

Dos hipótesis contrarían la intuición. Mostrar reseñas negativas: Spiegel asocia una puntuación casi perfecta a menor probabilidad de compra, y la guía de test A/B de página de producto argumenta que lo negativo calibra la expectativa y tiende a reducir la devolución. Cambiar logos grandes por logos parecidos al visitante: la guía de la página de precios SaaS describe el muro de grandes marcas que convence a la empresa pequeña de que aquello no es para ella, y la guía de landing page B2B SaaS recomienda testear cuáles logos, para qué segmento.

Una nota técnica para ecommerce: Google pide que el contenido de reseña marcado con datos estructurados esté fácilmente disponible en la página marcada. Esconder las reseñas en el control, manteniendo el marcado, entra en conflicto con eso. Testear posición, formato y destaque es más seguro que testear la existencia de las reseñas.

Cómo medir prueba social sin engañarse

La prueba social es barata de implementar y cara de medir. Cinco problemas aparecen en casi todo test de este tipo, y cada uno produce un ganador falso de una forma distinta.

1. La métrica equivocada: clic, conversión, ingreso o pedido que se queda

La métrica más tentadora es la que se mueve primero: clic en las estrellas, apertura del carrusel de testimonios. Explica por qué una variación ganó y no decide si ganó, porque cualquier destaque visual aumenta el clic.

Escalera de métricas de un test de prueba socialCuatro escalones de izquierda a derecha, cada uno más alto. Ecommerce: clic en las estrellas, agregar al carrito, pedido completado, pedido no devuelto. SaaS: clic en el logo o testimonio, inicio de prueba, cuenta pagada, cuenta retenida. Una flecha indica que, subiendo la escalera, la métrica queda más cerca del dinero, la tasa base cae y la muestra necesaria sube.cuanto más cerca del dinero, más muestra pide la métricaclic en la pruebaestrellas, logodiagnósticoetapa siguientecarrito, pruebasecundariatransacciónpedido, cuenta pagadaprimariavalor que se quedano devuelto,cuenta retenidaguarda o decisióntasa base menor y maduración más lenta en cada escalón: más visitantes y más días para la misma lectura
Un test de prueba social que solo mide el primer escalón casi siempre “gana”. El trabajo honesto es dimensionar para el escalón que decide y usar los de abajo para explicar.

La regla práctica: primaria en el escalón de la transacción, guarda en el escalón del valor que se queda. En ecommerce, pedido completado decide y pedido no devuelto (o ingreso neto de devolución) protege. En SaaS, el inicio de prueba suele ser la primaria posible, y la cuenta pagada es la que decide el valor, con una muestra mucho mayor. Las métricas de guardrail explican cómo fijar el umbral antes del test, y la guía de tamaño de muestra para métricas continuas muestra por qué el ingreso por visitante pide aún más muestra que la conversión.

2. Efecto novedad: el sello nuevo llama la atención por ser nuevo

Un bloque de reseñas que aparece de repente en una página que el cliente recurrente conoce es, en la primera semana, principalmente novedad, y la ganancia inicial puede encogerse. Para separar novedad de efecto, compara nuevos y recurrentes y mira la trayectoria por semana, como en efecto novedad en test A/B.

3. Contaminación: la prueba social real cambia durante el test

Toda prueba social verdadera es un número vivo: la cantidad crece, la puntuación oscila, una reseña negativa entra arriba. Eso crea tres problemas:

Nada de eso invalida el test, pero cambia la lectura: registra por día la puntuación y la cantidad mostradas, y ten presente que el resultado vale para el rango de valores que apareció.

4. Heterogeneidad: nuevo x recurrente, móvil x escritorio

Es razonable esperar que la prueba social ayude más al visitante nuevo y que un bloque largo de testimonios se comporte distinto en una pantalla pequeña. El peligro es descubrirlo después: con diez cortes independientes testeados al 5 por ciento, la probabilidad de al menos un falso positivo pasa del 40 por ciento. Declara antes dos o tres segmentos con motivo y lee la diferencia con la cuenta correcta, en efecto heterogéneo por segmento y paradoja de Simpson.

5. Prueba social falsa: el test no la ve, la ley sí

jurisdicción regla qué dice, en resumen qué cambia en un test
Estados Unidos FTC, regla sobre uso de reseñas y testimonios de consumidores (16 CFR 465), anunciada el 14/08/2024, en vigor desde el 21/10/2024 prohíbe reseñas y testimonios falsos (incluso generados por IA), pago condicionado a una reseña con cierto sentimiento, reseña de persona vinculada a la empresa sin aviso, supresión de reseñas mediante amenaza y compra o venta de indicadores falsos de influencia, como seguidores y visualizaciones; permite acción por multa civil en violación consciente una variación con reseña seleccionada, contador inventado o testimonio de empleado no es hipótesis, es riesgo
Brasil Código de Defensa del Consumidor, Ley 8.078/1990, arts. 37, 38 y 67 prohíbe la publicidad engañosa, incluso parcialmente falsa o por omisión; la carga de probar la veracidad es de quien patrocina; hacer publicidad que se sabe o se debería saber engañosa prevé detención de tres meses a un año y multa el número de clientes, la puntuación y el contador mostrados deben ser comprobables en los dos brazos
Brasil Conar, Código Brasileño de Autorregulación Publicitaria, Anexo Q (testimoniales) el testimonio de consumidor identificado usa nombre y apellido verdaderos; los empleados del anunciante no se hacen pasar por consumidor común; el anunciante debe comprobar la veracidad del testimonial cuando se le solicite un testimonio sin autorización o de origen incierto no entra en una variación

En las preguntas y respuestas sobre la regla, la FTC aclara que organizar reseñas no es suprimir, pero que organizarlas de un modo que dificulte encontrar las negativas puede ser práctica engañosa por la ley general. Para quien testea el ordenamiento de reseñas, esa es la línea. Esto es contexto, no una opinión jurídica.

Ejemplo trabajado 1: el sello de reseñas en la página de producto

Escenario (ilustrativo). Una tienda de moda con 60.000 visitantes por semana en las páginas de producto convierte el 2,4 por ciento de las visitas en pedido. Hoy las reseñas existen, pero quedan al final de la página. La hipótesis: mostrar la puntuación media con la cantidad justo debajo del título, cerca del precio, reduce la duda en el momento en que aparece y aumenta los pedidos.

Métricas declaradas antes. Primaria: visitante con pedido completado. Guarda: visitante con pedido no devuelto en 30 días (en el escenario, cada comprador hace un pedido). Diagnóstico: clic en la puntuación. Segmentos: nuevo y recurrente. Todo en la plantilla, para todo el catálogo, porque una página de producto sola no tendría tráfico.

Muestra. El equipo quiere ver una ganancia de 8 por ciento relativo. En la calculadora de abajo, escribe: tasa de conversión actual 2,4; efecto mínimo detectable 8, relativo; confianza 95; poder 80; visitantes por semana 60000; test bilateral.

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

La pantalla muestra 103.633 visitantes por variación, 207.266 en total y 25 días. El equipo redondea a cuatro semanas completas, 28 días, lo que da 120.000 visitantes por brazo. Para sentir la sensibilidad, cambia solo el efecto mínimo:

efecto relativo que quieres detectar visitantes por variación total días a 60.000 por semana
5% 261.572 523.144 62
8% 103.633 207.266 25
10% 66.946 133.892 16
12% 46.922 93.844 11

La mirada que no se debe hacer. Al final de la primera semana, con 30.000 visitantes por brazo, eran 720 pedidos en el control y 834 en la variación: más 15,8 por ciento, valor-p de 0,0034. Parar ahí sería registrar casi el doble de la ganancia que mostró el test completo. En las semanas 2 a 4, con 90.000 por brazo, el marcador fue de 2.160 contra 2.298, más 6,4 por ciento, valor-p de 0,0364. La primera semana más fuerte es compatible con novedad y también con ruido; lo que no autoriza es una decisión. El costo de mirar antes de tiempo está en el problema del peeking.

El resultado de la métrica primaria, en 28 días.

brazo visitantes pedidos tasa
A, reseñas al final de la página 120.000 2.880 2,40%
B, puntuación con cantidad cerca del precio 120.000 3.132 2,61%

La división está limpia: 120.000 contra 120.000 no enciende ninguna alerta en el verificador de SRM. Ahora pega en la calculadora de significancia: control con 120000 visitantes y 2880 conversiones; variación con 120000 visitantes y 3132 conversiones; confianza 95.

Calculadora de significancia estadística
Control (A)
Variación (B)
Control (A) · Tasa-
Variación (B) · Tasa-
Mejora relativa-
valor-p-
IC 95% de la diferencia-

Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.

La pantalla muestra una tasa de 2,40% en el control y 2,61% en la variación, mejora relativa de +8,8%, valor-p de 0,0010, intervalo de 95 por ciento de la diferencia de +0,1% … +0,3% (pp) y el veredicto Ganadora con significancia · B gana. Con más decimales, la mejora es de 8,75 por ciento, el valor-p es 0,000997 y el intervalo va de más 0,0850 a más 0,3350 punto porcentual, o de cerca de más 3,5 a más 14,0 por ciento en términos relativos (dividiendo el intervalo por la tasa del control).

Hasta aquí, la historia de siempre: B ganó, con holgura. Son 252 pedidos más.

El giro: la guarda que solo madura 30 días después. Los pedidos de 30 días de ventana de devolución solo cierran casi dos meses después del inicio del test. Cuando cierran:

brazo pedidos devueltos tasa de devolución visitantes con pedido mantenido tasa por visitante
A 2.880 461 16,01% 2.419 2,02%
B 3.132 689 22,00% 2.443 2,04%

De los 252 pedidos extra, 228 volvieron. Para verificar las dos lecturas en la misma calculadora, escribe primero los pedidos como “visitantes” y las devoluciones como “conversiones” (2880 y 461 contra 3132 y 689): la pantalla muestra 16,01% contra 22,00%, mejora de +37,4%, valor-p menor que 0,0001 (la pantalla escribe el signo de menor antes del número), intervalo de +4,0% … +8,0% (pp) y el veredicto “Ganadora con significancia · B gana”. Aquí la calculadora solo dice que la tasa de B es mayor, y en esta métrica mayor es peor.

Después escribe la guarda: 120000 y 2419 contra 120000 y 2443. La pantalla muestra 2,02% contra 2,04%, mejora de +1,0%, valor-p de 0,7280, intervalo de -0,1% … +0,1% (pp) y Todavía sin significancia. Con más decimales, la mejora es de 0,99 por ciento y el intervalo va de menos 0,0927 a más 0,1327 punto porcentual, cerca de menos 4,6 a más 6,6 por ciento relativos.

Efecto del sello de reseñas en pedidos y en pedidos mantenidosDos intervalos de confianza de 95 por ciento sobre un eje de efecto relativo de menos 10 a más 20 por ciento. Pedidos: estimación de más 8,75 por ciento, intervalo de más 3,5 a más 14,0 por ciento, entero a la derecha del cero. Pedidos mantenidos tras 30 días: estimación de más 0,99 por ciento, intervalo de menos 4,6 a más 6,6 por ciento, cruzando el cero.el mismo test, dos preguntas: ¿vendió más? ¿se quedó más?-10%0%+10%+20%pedidos28 días+8,75%, p = 0,0010pedidos mantenidos30 días después+0,99%, p = 0,7280intervalo relativo aproximado: intervalo de la diferencia dividido por la tasa del control.escenario ilustrativo calculado con el motor de las calculadoras del blog
El intervalo de pedidos mantenidos cruza el cero y deja fuera la ganancia de 8,75 por ciento. El test tenía cerca de 79 por ciento de poder para ver una ganancia de 8 por ciento en esa métrica, así que “no apareció” aquí es informativo, no solo falta de muestra.

Qué dice el resultado. El sello llevó a la compra a gente que antes bajaba hasta las reseñas, leía sobre la talla y desistía. En el escenario, el diagnóstico sostiene esa lectura: el clic en “ver reseñas” cayó en la variación, y el motivo de devolución más citado en B es el calce. El sello respondió a la duda equivocada (confiar en la tienda) cuando la duda real era la talla. Y no es solo falta de muestra: para una ganancia de 8 por ciento en pedidos mantenidos, la base de 2,02 por ciento pide 123.628 visitantes por variación (29 días), y el test tenía 120.000.

Qué hacer con él. No lanzar B como está. La próxima variación combina la puntuación cerca del precio con el fragmento de reseñas filtrado por talla, que responde a la duda que generaba la devolución. Misma primaria, misma guarda, y esta vez con la lectura final marcada para después de la ventana de devolución.

Ejemplo trabajado 2: logos de clientes en la página de precios SaaS

Escenario (ilustrativo). Un SaaS B2B recibe 12.000 visitantes por semana en la página de precios y el 7 por ciento de ellos inicia una prueba. Cerca del 15 por ciento de las pruebas se convierte en cuenta pagada en 30 días, lo que da 1,05 por ciento de cuenta pagada por visitante. La hipótesis: una franja de logos de clientes conocidos arriba de la tabla de planes reduce el riesgo percibido de contratar.

Muestra. En la misma calculadora de tamaño de muestra de más arriba, cambia los campos: tasa actual 7; efecto mínimo 15, relativo; confianza 95; poder 80; visitantes por semana 12000; bilateral. La pantalla muestra 9.907 visitantes por variación, 19.814 en total y 12 días. El equipo corre dos semanas completas: 12.000 visitantes por brazo.

El resultado en pruebas. En la calculadora de significancia, escribe 12000 y 840 en el control y 12000 y 966 en la variación. La pantalla muestra 7,00% contra 8,05%, mejora de +15,0%, valor-p de 0,0020, intervalo de +0,4% … +1,7% (pp) y Ganadora con significancia · B gana. Son 126 pruebas más.

El resultado en cuenta pagada, 30 días después.

métrica A B mejora relativa valor-p lectura
inicio de prueba por visitante 840 de 12.000 (7,00%) 966 de 12.000 (8,05%) +15,0% 0,0020 significativo
prueba que se vuelve cuenta pagada 126 de 840 (15,00%) 130 de 966 (13,46%) -10,3% 0,3486 sin significancia
cuenta pagada por visitante 126 de 12.000 (1,05%) 130 de 12.000 (1,08%) +3,2% 0,8015 sin significancia

Para verificar la última fila, escribe 12000 y 126 contra 12000 y 130: la pantalla muestra 1,05% contra 1,08%, mejora de +3,2%, valor-p de 0,8015, intervalo de -0,2% … +0,3% (pp) y Todavía sin significancia. Con más decimales, el intervalo va de menos 0,2266 a más 0,2933 punto porcentual, algo así como menos 21,6 a más 27,9 por ciento relativos. De las 126 pruebas extra, 4 se volvieron cuenta pagada adicional.

El giro aquí es distinto al del ecommerce. El resultado en cuenta pagada no dice que los logos no funcionen. Dice que el test nunca tuvo forma de responder. Vuelve a la calculadora de muestra y escribe la métrica que decide el dinero: tasa 1,05, efecto 15 relativo, 95, 80, 12000 por semana. La pantalla muestra 70.622 por variación, 141.244 en total y 83 días. La calculadora no muestra el poder, así que la cuenta siguiente es de esta guía, con la misma fórmula: con 12.000 por brazo, el poder para detectar más 15 por ciento en cuenta pagada era de cerca del 21 por ciento, y el menor efecto que ese tamaño vería con 80 por ciento de poder es de cerca de 38 por ciento relativo.

Días necesarios por métrica en el test de logosBarras horizontales de duración a 12 mil visitantes por semana para detectar 15 por ciento relativo. Inicio de prueba, base de 7 por ciento: 9.907 visitantes por variación y 12 días. Cuenta pagada, base de 1,05 por ciento: 70.622 visitantes por variación y 83 días. Una línea vertical marca los 14 días que corrió el test.el test se dimensionó para la prueba, y la decisión es sobre la cuenta pagadainicio de pruebabase 7%, 9.907 por variación12 díascuenta pagadabase 1,05%, 70.622 por variación83 díasel test corrió 14 días050 días15% relativo, 95% de confianza, 80% de poder, 12.000 visitantes por semana, bilateral
Poder de cerca del 21 por ciento para la métrica que decide el valor. El resultado “sin significancia” en cuenta pagada es ausencia de evidencia, y el intervalo de menos 21,6 a más 27,9 por ciento relativos muestra el tamaño de la ignorancia.

Qué hacer con él. Hay tres caminos honestos, y la elección debería haberse hecho antes: aceptar la prueba como métrica de decisión, con guardrail declarado en la tasa de prueba a pago y seguimiento de la cohorte; correr 12 semanas, si la decisión vale ese calendario; o aceptar ver solo efectos grandes en cuenta pagada, por escrito. Lo que no se hace es anunciar “los logos aumentan la conversión en 15 por ciento”. Y una señal se convierte en hipótesis nueva: la tasa de prueba a pago cayó de 15,00 a 13,46 por ciento, sin significancia, pero en la dirección de “los logos grandes atrajeron pruebas de quien no era el cliente típico”. La próxima variación testea logos del mismo tamaño que el visitante típico. El razonamiento para atribuir valor a ese tipo de ganador está en atribuyendo ingresos al ganador del test A/B.

Checklist antes de testear prueba social

  1. Verdad primero. Todo número, puntuación, logo, testimonio y contador mostrado es real, comprobable y autorizado.
  2. Duda mapeada. ¿Qué incertidumbre del visitante responde la prueba en ese punto de la página?
  3. Primaria en la transacción, guarda en el valor que se queda. El clic en la prueba es solo diagnóstico.
  4. Muestra dimensionada para la métrica que decide, y lectura marcada para después de la maduración (devolución, fin de la prueba).
  5. Semanas completas, sin parar en la primera semana buena.
  6. Segmentos declarados antes, como máximo dos o tres, con motivo.
  7. Registro diario de la prueba mostrada (puntuación, cantidad, número de clientes) y de por dónde el control ya la ve.
  8. SRM verificado antes de leer cualquier efecto, sobre todo cuando el bloque de reseñas viene de una app que carga después.

Errores comunes

Haz esto automático en Donnu

El dolor específico de testear prueba social es que el ganador aparece rápido en la métrica equivocada y el perjuicio aparece despacio en la métrica correcta. Ninguna herramienta resuelve eso por magia, pero algunas elecciones de configuración hacen el error menos probable.

En Donnu, la meta de conversión puede confirmarse desde tu servidor (server-to-server), además de clics, envíos de formulario, visitas a páginas y eventos personalizados. Eso permite medir la transacción que ocurrió de verdad, como un pedido pagado confirmado por la pasarela, en lugar de un clic en el botón. En el plan Pro, la campaña puede restringirse por dispositivo y por tipo de visitante, nuevo o recurrente, lo que ayuda a declarar el segmento antes de correr en lugar de cazarlo después. El informe es bayesiano y muestra la probabilidad de que la variación sea mejor que el control, con el intervalo de confianza de la mejora; en el plan Pro, esa probabilidad aparece también día a día, y una ventaja de primera semana que cruza la franja del 95 por ciento y vuelve queda visible como ruido, en lugar de convertirse en decisión.

Lo que sigue siendo tuyo: garantizar que la prueba mostrada es verdadera, esperar la maduración de la guarda y dimensionar por la métrica que decide. Para eso, la calculadora de tamaño de muestra, la calculadora de significancia y la calculadora de ingresos por visitante hacen las cuentas de esta guía con tus números, gratis.

Referencias

Lee también: Test A/B de página de producto · Optimización de la página de precios SaaS · Test A/B de landing page B2B SaaS · Optimización de checkout · Efecto novedad · Métricas de guardrail · Calculadora de significancia · Leia em português · Read in English

Preguntas frecuentes

¿Qué es la prueba social en un sitio?
Es cualquier señal de que otras personas ya eligieron, usaron o aprobaron aquello que el visitante está evaluando: puntuación y cantidad de reseñas, número de clientes, testimonios, logos de empresas clientes, actividad en tiempo real, sellos y certificaciones, y contenido generado por usuarios. Funciona reduciendo incertidumbre, por eso tiende a pesar más en una compra cara, una marca poco conocida y una decisión arriesgada, y menos cuando el visitante ya llegó decidido.
¿Agregar reseñas aumenta la conversión?
Con frecuencia, pero uno de los números más citados no viene de un test A/B. El informe del Spiegel Research Center, de Northwestern, hecho con datos de PowerReviews, reporta que la probabilidad de compra de un producto con cinco reseñas es 270 por ciento mayor que la de un producto sin ninguna, a partir de productos que fueron acumulando reseñas a lo largo del tiempo. Es evidencia observacional fuerte, no una promesa para tu tienda. La forma de saberlo en tu caso es testear, y medir pedido que no vuelve, no solo pedido.
¿Qué métrica usar en un test de prueba social?
La que esté más cerca del dinero que puedas dimensionar. El clic en las estrellas o en el testimonio es diagnóstico, nunca métrica primaria. En ecommerce, la primaria es pedido completado y la de guarda es pedido no devuelto o ingreso neto. En SaaS, la primaria suele ser inicio de prueba y la que decide el valor es cuenta pagada. En el ejemplo de esta guía, un sello de reseñas gana 8,75 por ciento en pedidos con valor-p de 0,0010 y solo 0,99 por ciento en pedidos que se mantienen, con valor-p de 0,7280.
¿Puedo usar un contador de personas viendo el producto ahora?
Solo si el número es real y medido. Un estudio de Princeton que analizó cerca de 53 mil páginas de producto en cerca de 11 mil tiendas encontró 313 notificaciones de actividad, y 29 de ellas, en 20 sitios, eran engañosas, la mayoría generada por sorteo de número aleatorio o fija en el código. En Estados Unidos, la regla de la FTC sobre reseñas y testimonios falsos está en vigor desde el 21 de octubre de 2024. En Brasil, el Código de Defensa del Consumidor prohíbe la publicidad total o parcialmente falsa y atribuye a quien anuncia la carga de probar la veracidad.
¿Cuánto tráfico hace falta para testear prueba social?
Depende de la tasa base y del efecto que quieras ver. Con 2,4 por ciento de conversión en una página de producto, 95 por ciento de confianza y 80 por ciento de poder, detectar 8 por ciento relativo exige 103.633 visitantes por variación, 25 días a 60 mil visitantes por semana. En una página de precios SaaS con 7 por ciento de inicio de prueba, detectar 15 por ciento relativo exige 9.907 por variación. Medir cuenta pagada con base de 1,05 por ciento, con el mismo efecto relativo, exige 70.622 por variación, 83 días a 12 mil visitantes por semana.
¿Los logos de clientes funcionan en una página de precios SaaS?
Pueden aumentar el inicio de prueba y no cambiar la cuenta pagada, que es lo que ocurrió en el ejemplo trabajado de esta guía: más 15,0 por ciento en pruebas con valor-p de 0,0020, y más 3,2 por ciento en cuentas pagadas con valor-p de 0,8015, en un test que tenía solo cerca de 21 por ciento de poder para esa segunda métrica. El logo funciona como prueba cuando el visitante reconoce a la empresa y se identifica con ella, así que vale testear cuáles logos, para qué segmento, en lugar de tener o no tener logos.