Prueba Social en Test A/B: qué Testear y cómo Medir
Prueba social en test A/B: reseñas, logos, testimonios y contadores. Qué muestra la evidencia, qué testear y la métrica que no engaña.

📚 Este artículo es parte de la guía Optimización de Conversión (CRO): La Guía Completa 2026.
La prueba social es toda señal de que otras personas ya eligieron, usaron o aprobaron lo que el visitante está evaluando: puntuación y cantidad de reseñas, número de clientes, testimonios, logos, actividad en tiempo real, sellos y contenido generado por usuarios. Funciona reduciendo incertidumbre, y por eso es una hipótesis frecuente en CRO y fácil de medir mal. El error típico no está en elegir el elemento, está en elegir la métrica: en el ejemplo trabajado de esta guía, un sello de reseñas en la página de producto aumenta los pedidos en 8,75 por ciento con valor-p de 0,0010, y los pedidos que no vuelven como devolución suben solo 0,99 por ciento, con valor-p de 0,7280. Esta guía forma parte de nuestra guía completa de optimización de conversión (CRO) y cubre lo que la investigación muestra (y lo que no), qué testear en ecommerce y en SaaS, los cinco errores de medición y dos ejemplos calculados de punta a punta.
Qué es la prueba social y por qué funciona
La empresa de Robert Cialdini resume el principio en una frase: especialmente cuando están inseguras, las personas miran las acciones y el comportamiento de los demás para decidir las propias. La palabra que importa en esa definición es inseguras. La prueba social no convence a nadie de nada por sí sola; le presta la experiencia de otras personas a quien todavía no tiene información suficiente para decidir.
Para quien testea, eso quiere decir que el efecto esperado depende del tamaño de la incertidumbre en ese punto de la página. Quien llegó por la búsqueda de tu marca, ya decidido, tiene poca duda que reducir; quien ve un producto caro, de marca desconocida, tiene mucha. El mismo sello puede tener efecto cero en una página y relevante en otra.
Goldstein, Cialdini y Griskevicius agregaron una segunda condición, en un experimento de campo de 2008: la prueba funcionó mejor cuando el grupo citado estaba en la misma situación del lector, lo que ellos llaman norma provinciana. En la página, “clientes de tu tamaño” o “quien compró esta talla” tiende a ser una hipótesis más fuerte que “miles de clientes”.
Los siete tipos de prueba social en una página
| tipo | qué señala | dónde suele aparecer | riesgo principal |
|---|---|---|---|
| Puntuación y cantidad de reseñas | otras personas compraron y opinaron | cerca del título y del precio en la página de producto | puntuación perfecta con pocas reseñas parece demasiado buena |
| Número de clientes o usuarios | escala y supervivencia de la empresa | home, landing page, página de precios | número inflado es publicidad engañosa |
| Testimonios | experiencia concreta de alguien parecido | landing page, página de precios, checkout | testimonio genérico o de origen incierto |
| Logos de clientes | empresas conocidas confiaron | landing page B2B y página de precios SaaS | logo que el visitante no reconoce o con el que no se identifica |
| Actividad en tiempo real | otras personas están actuando ahora | página de producto y carrito | contador sorteado o fijo en el código |
| Sellos y certificaciones | un tercero verificó algo | checkout, pie de página, página de seguridad | sello sin verificación real o fuera de contexto |
| Contenido generado por usuarios | fotos y videos de uso real | galería de la página de producto, redes sociales | peso de página y curaduría que esconde lo negativo |
La última columna es casi toda sobre credibilidad. La prueba social es una afirmación sobre hechos, y por eso está expuesta a dos riesgos que el panel del test no muestra: parecer falsa y ser falsa.
Qué muestra realmente la evidencia
Tres fuentes suelen citarse cuando el tema es prueba social, con calidades de evidencia muy distintas. Lee cada una por el diseño, no por el número de titular.
El experimento de las toallas: fuerte, famoso y con una replicación que falló
En el primer experimento de Goldstein, Cialdini y Griskevicius, las 190 habitaciones de un hotel de una cadena nacional en Estados Unidos fueron sorteadas entre dos tarjetas. La tarjeta estándar hablaba de proteger el medio ambiente. La tarjeta de norma descriptiva decía que casi 75 por ciento de los huéspedes participaba del programa. Considerando solo el primer día elegible de cada huésped, la reutilización fue de 44,1 por ciento con la norma contra 35,1 por ciento con el llamado ambiental, con valor-p de 0,05 en un test chi cuadrado sobre 433 observaciones.
En el segundo experimento, con 1.595 observaciones en el mismo hotel y cinco tarjetas, los cuatro mensajes de norma juntos llegaron a 44,5 por ciento contra 37,2 por ciento del mensaje ambiental, y la norma “de los huéspedes que se alojaron en esta habitación” llegó a 49,3 por ciento, contra 42,8 por ciento de las otras tres normas juntas.
La página de Cialdini presenta el resultado como aumentos de 26 y 33 por ciento. Las cuentas coinciden con el artículo (44,1 contra 35,1 da cerca de 26 por ciento relativo; 49,3 contra 37,2 da cerca de 33), pero cada número viene de un experimento distinto, con un control distinto. Es un buen recordatorio de cómo un resultado de investigación se convierte en titular.
Y existe la parte que suele quedar fuera. En 2014, Bohner y Schlüter repitieron el diseño en dos hoteles en Alemania, en PLoS ONE. En el estudio 1, con 724 observaciones, las cuatro normas juntas dieron 81,9 por ciento de reutilización contra 83,7 por ciento del mensaje ambiental, valor-p de 0,62. En el estudio 2, con 204 observaciones, el mensaje ambiental fue el mejor de todos (93,3 por ciento). La conclusión de los autores: los mensajes de norma no fueron más eficaces que el estándar, y el efecto de la proximidad fue inconsistente entre los estudios.
Hay además un detalle de diseño que le interesa a quien corre experimentos. En el hotel estadounidense, la aleatorización fue por habitación (190 habitaciones en el experimento 1), y el análisis fue por huésped. Cuando la unidad aleatorizada es mayor que la unidad analizada, las observaciones del mismo grupo tienden a parecerse entre sí, y el test que trata a cada una como independiente tiende a exagerar la precisión. El blog trata esa cuenta en aleatorización por cluster y en unidad de aleatorización.
El número del 270 por ciento: observacional y con proveedor al lado
El informe How Online Reviews Influence Sales, del Spiegel Research Center de Northwestern, hecho en alianza con PowerReviews (empresa que vende software de reseñas), es la fuente de uno de los números más repetidos sobre prueba social. Lo que dice, leído en su totalidad:
| hallazgo | de dónde viene | cómo leerlo |
|---|---|---|
| probabilidad de compra con cinco reseñas 270% mayor que sin ninguna | minorista de regalos de alto valor: cerca de 15,5 millones de visualizaciones, 1.800 productos, 7,8 millones de usuarios en un año, siguiendo productos a medida que acumulaban reseñas | observacional; un producto que acumula reseñas también acumula tiempo de catálogo y ventas |
| mostrar reseñas elevó la conversión en 190% en producto barato y 380% en producto caro | mismo minorista, comparando categorías | la dirección (más efecto en compra arriesgada) es lo que se transfiere, no la magnitud |
| la probabilidad de compra suele alcanzar su pico entre 4,0 y 4,7 estrellas y caer cerca de 5,0 | varias categorías de producto | el propio informe también habla de 4,2 a 4,5 en el resumen final; trátalo como rango, no como objetivo |
| casi toda la ganancia ocurre en las primeras 10 reseñas, y las 5 primeras hacen la mayor parte | minorista de regalos | argumento para juntar pocas reseñas en muchos productos |
| una reseña de comprador verificado aumenta la probabilidad de compra en 15% frente a la anónima | cerca de 13.500 productos, 57 mil reseñas anónimas y 65 mil verificadas | el sello de verificado es una hipótesis de test barata |
El diseño no es un test A/B. Un producto que llega a cinco reseñas es, por construcción, un producto que ya vendió y lleva más tiempo en el catálogo, así que el número no es “pon estrellas y vende 3,7 veces más”. Lo que se transfiere es la dirección: las reseñas pesan más donde la incertidumbre es mayor, la puntuación perfecta despierta desconfianza y las primeras reseñas valen más que las siguientes.
La prueba social que es mentira
Mathur y coautores, de Princeton, rastrearon cerca de 53 mil páginas de producto en cerca de 11 mil tiendas (CSCW 2019) y encontraron 1.818 ocurrencias de patrones engañosos de interfaz en 1.254 sitios. Entre las 313 notificaciones de actividad (quién acaba de comprar, cuántas personas están viendo), 29, en 20 sitios, eran engañosas: la mayoría generaba el número con sorteo aleatorio o mostraba mensajes fijos en el código. Entre los testimonios de origen incierto, en uno de los casos el mismo conjunto de testimonios aparecía en otra tienda, con nombres de clientes distintos.
Para quien testea: un contador falso puede “ganar” un test A/B. El panel mide comportamiento, no veracidad, así que “¿es verdad?” viene antes de “¿convierte?”.
Qué testear en prueba social: la matriz ecommerce x SaaS
Como la prueba social trabaja sobre la incertidumbre, la pregunta útil no es “¿pongo testimonios?”, es “¿qué duda tiene el visitante en este punto, y qué prueba la responde?”. La duda cambia entre ecommerce y SaaS, y cambia de etapa en etapa.
La matriz de abajo organiza las hipótesis más comunes por la palanca que mueven. La columna “trampa de medición” es la que más pesa a la hora de leer el resultado.
| palanca | ecommerce: qué testear | SaaS: qué testear | trampa de medición |
|---|---|---|---|
| Posición | puntuación con cantidad justo debajo del título, cerca del precio, contra solo al final de la página | logos y testimonio arriba de la tabla de planes contra debajo de ella | el clic en la puntuación sube solo porque quedó visible |
| Especificidad | reseñas filtradas por talla o uso contra lista general | testimonio del mismo tamaño o sector contra testimonio genérico | segmento definido después de ver el dato |
| Formato de la puntuación | promedio con cantidad contra promedio solo; mostrar la distribución de estrellas | número de clientes contra logos | puntuación alta con pocas reseñas |
| Credibilidad | sello de compra verificada; mostrar reseñas negativas | testimonio con nombre, cargo y empresa contra anónimo | ganancia de conversión que se vuelve devolución o churn |
| Actividad | “vendidos en las últimas 24 horas”, si es real | “empresas que empezaron este mes”, si es real | contador que cambia solo durante el test |
| Sellos y cumplimiento | sello de seguridad cerca del campo de tarjeta | información de protección de datos, ubicación del dato, certificaciones reales | sello que aparece en los dos brazos por otro camino |
| Contenido de usuarios | galería de fotos de clientes en la página de producto | caso de estudio con número verificable | el peso de la página cambia junto con la prueba |
Dos hipótesis contrarían la intuición. Mostrar reseñas negativas: Spiegel asocia una puntuación casi perfecta a menor probabilidad de compra, y la guía de test A/B de página de producto argumenta que lo negativo calibra la expectativa y tiende a reducir la devolución. Cambiar logos grandes por logos parecidos al visitante: la guía de la página de precios SaaS describe el muro de grandes marcas que convence a la empresa pequeña de que aquello no es para ella, y la guía de landing page B2B SaaS recomienda testear cuáles logos, para qué segmento.
Una nota técnica para ecommerce: Google pide que el contenido de reseña marcado con datos estructurados esté fácilmente disponible en la página marcada. Esconder las reseñas en el control, manteniendo el marcado, entra en conflicto con eso. Testear posición, formato y destaque es más seguro que testear la existencia de las reseñas.
Cómo medir prueba social sin engañarse
La prueba social es barata de implementar y cara de medir. Cinco problemas aparecen en casi todo test de este tipo, y cada uno produce un ganador falso de una forma distinta.
1. La métrica equivocada: clic, conversión, ingreso o pedido que se queda
La métrica más tentadora es la que se mueve primero: clic en las estrellas, apertura del carrusel de testimonios. Explica por qué una variación ganó y no decide si ganó, porque cualquier destaque visual aumenta el clic.
La regla práctica: primaria en el escalón de la transacción, guarda en el escalón del valor que se queda. En ecommerce, pedido completado decide y pedido no devuelto (o ingreso neto de devolución) protege. En SaaS, el inicio de prueba suele ser la primaria posible, y la cuenta pagada es la que decide el valor, con una muestra mucho mayor. Las métricas de guardrail explican cómo fijar el umbral antes del test, y la guía de tamaño de muestra para métricas continuas muestra por qué el ingreso por visitante pide aún más muestra que la conversión.
2. Efecto novedad: el sello nuevo llama la atención por ser nuevo
Un bloque de reseñas que aparece de repente en una página que el cliente recurrente conoce es, en la primera semana, principalmente novedad, y la ganancia inicial puede encogerse. Para separar novedad de efecto, compara nuevos y recurrentes y mira la trayectoria por semana, como en efecto novedad en test A/B.
3. Contaminación: la prueba social real cambia durante el test
Toda prueba social verdadera es un número vivo: la cantidad crece, la puntuación oscila, una reseña negativa entra arriba. Eso crea tres problemas:
- El tratamiento cambia a mitad del test. Una variación que muestra 4,8 estrellas con 12 reseñas en la semana 1 puede mostrar 4,5 con 40 en la semana 4. Testeas un promedio de versiones.
- El control también queda expuesto. Las estrellas pueden aparecer en el resultado de búsqueda, y las reseñas circulan en marketplaces y redes. Parte del control llega habiendo visto ya la prueba, y el efecto queda diluido.
- El catálogo cambia. En un test de plantilla, productos nuevos, sin reseñas, entran en la muestra a lo largo del tiempo.
Nada de eso invalida el test, pero cambia la lectura: registra por día la puntuación y la cantidad mostradas, y ten presente que el resultado vale para el rango de valores que apareció.
4. Heterogeneidad: nuevo x recurrente, móvil x escritorio
Es razonable esperar que la prueba social ayude más al visitante nuevo y que un bloque largo de testimonios se comporte distinto en una pantalla pequeña. El peligro es descubrirlo después: con diez cortes independientes testeados al 5 por ciento, la probabilidad de al menos un falso positivo pasa del 40 por ciento. Declara antes dos o tres segmentos con motivo y lee la diferencia con la cuenta correcta, en efecto heterogéneo por segmento y paradoja de Simpson.
5. Prueba social falsa: el test no la ve, la ley sí
| jurisdicción | regla | qué dice, en resumen | qué cambia en un test |
|---|---|---|---|
| Estados Unidos | FTC, regla sobre uso de reseñas y testimonios de consumidores (16 CFR 465), anunciada el 14/08/2024, en vigor desde el 21/10/2024 | prohíbe reseñas y testimonios falsos (incluso generados por IA), pago condicionado a una reseña con cierto sentimiento, reseña de persona vinculada a la empresa sin aviso, supresión de reseñas mediante amenaza y compra o venta de indicadores falsos de influencia, como seguidores y visualizaciones; permite acción por multa civil en violación consciente | una variación con reseña seleccionada, contador inventado o testimonio de empleado no es hipótesis, es riesgo |
| Brasil | Código de Defensa del Consumidor, Ley 8.078/1990, arts. 37, 38 y 67 | prohíbe la publicidad engañosa, incluso parcialmente falsa o por omisión; la carga de probar la veracidad es de quien patrocina; hacer publicidad que se sabe o se debería saber engañosa prevé detención de tres meses a un año y multa | el número de clientes, la puntuación y el contador mostrados deben ser comprobables en los dos brazos |
| Brasil | Conar, Código Brasileño de Autorregulación Publicitaria, Anexo Q (testimoniales) | el testimonio de consumidor identificado usa nombre y apellido verdaderos; los empleados del anunciante no se hacen pasar por consumidor común; el anunciante debe comprobar la veracidad del testimonial cuando se le solicite | un testimonio sin autorización o de origen incierto no entra en una variación |
En las preguntas y respuestas sobre la regla, la FTC aclara que organizar reseñas no es suprimir, pero que organizarlas de un modo que dificulte encontrar las negativas puede ser práctica engañosa por la ley general. Para quien testea el ordenamiento de reseñas, esa es la línea. Esto es contexto, no una opinión jurídica.
Ejemplo trabajado 1: el sello de reseñas en la página de producto
Escenario (ilustrativo). Una tienda de moda con 60.000 visitantes por semana en las páginas de producto convierte el 2,4 por ciento de las visitas en pedido. Hoy las reseñas existen, pero quedan al final de la página. La hipótesis: mostrar la puntuación media con la cantidad justo debajo del título, cerca del precio, reduce la duda en el momento en que aparece y aumenta los pedidos.
Métricas declaradas antes. Primaria: visitante con pedido completado. Guarda: visitante con pedido no devuelto en 30 días (en el escenario, cada comprador hace un pedido). Diagnóstico: clic en la puntuación. Segmentos: nuevo y recurrente. Todo en la plantilla, para todo el catálogo, porque una página de producto sola no tendría tráfico.
Muestra. El equipo quiere ver una ganancia de 8 por ciento relativo. En la calculadora de abajo, escribe: tasa de conversión actual 2,4; efecto mínimo detectable 8, relativo; confianza 95; poder 80; visitantes por semana 60000; test bilateral.
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
La pantalla muestra 103.633 visitantes por variación, 207.266 en total y 25 días. El equipo redondea a cuatro semanas completas, 28 días, lo que da 120.000 visitantes por brazo. Para sentir la sensibilidad, cambia solo el efecto mínimo:
| efecto relativo que quieres detectar | visitantes por variación | total | días a 60.000 por semana |
|---|---|---|---|
| 5% | 261.572 | 523.144 | 62 |
| 8% | 103.633 | 207.266 | 25 |
| 10% | 66.946 | 133.892 | 16 |
| 12% | 46.922 | 93.844 | 11 |
La mirada que no se debe hacer. Al final de la primera semana, con 30.000 visitantes por brazo, eran 720 pedidos en el control y 834 en la variación: más 15,8 por ciento, valor-p de 0,0034. Parar ahí sería registrar casi el doble de la ganancia que mostró el test completo. En las semanas 2 a 4, con 90.000 por brazo, el marcador fue de 2.160 contra 2.298, más 6,4 por ciento, valor-p de 0,0364. La primera semana más fuerte es compatible con novedad y también con ruido; lo que no autoriza es una decisión. El costo de mirar antes de tiempo está en el problema del peeking.
El resultado de la métrica primaria, en 28 días.
| brazo | visitantes | pedidos | tasa |
|---|---|---|---|
| A, reseñas al final de la página | 120.000 | 2.880 | 2,40% |
| B, puntuación con cantidad cerca del precio | 120.000 | 3.132 | 2,61% |
La división está limpia: 120.000 contra 120.000 no enciende ninguna alerta en el verificador de SRM. Ahora pega en la calculadora de significancia: control con 120000 visitantes y 2880 conversiones; variación con 120000 visitantes y 3132 conversiones; confianza 95.
Test z bilateral de dos proporciones. "Sin significancia" casi siempre significa que falta muestra, no que las versiones sean iguales.
La pantalla muestra una tasa de 2,40% en el control y 2,61% en la variación, mejora relativa de +8,8%, valor-p de 0,0010, intervalo de 95 por ciento de la diferencia de +0,1% … +0,3% (pp) y el veredicto Ganadora con significancia · B gana. Con más decimales, la mejora es de 8,75 por ciento, el valor-p es 0,000997 y el intervalo va de más 0,0850 a más 0,3350 punto porcentual, o de cerca de más 3,5 a más 14,0 por ciento en términos relativos (dividiendo el intervalo por la tasa del control).
Hasta aquí, la historia de siempre: B ganó, con holgura. Son 252 pedidos más.
El giro: la guarda que solo madura 30 días después. Los pedidos de 30 días de ventana de devolución solo cierran casi dos meses después del inicio del test. Cuando cierran:
| brazo | pedidos | devueltos | tasa de devolución | visitantes con pedido mantenido | tasa por visitante |
|---|---|---|---|---|---|
| A | 2.880 | 461 | 16,01% | 2.419 | 2,02% |
| B | 3.132 | 689 | 22,00% | 2.443 | 2,04% |
De los 252 pedidos extra, 228 volvieron. Para verificar las dos lecturas en la misma calculadora, escribe primero los pedidos como “visitantes” y las devoluciones como “conversiones” (2880 y 461 contra 3132 y 689): la pantalla muestra 16,01% contra 22,00%, mejora de +37,4%, valor-p menor que 0,0001 (la pantalla escribe el signo de menor antes del número), intervalo de +4,0% … +8,0% (pp) y el veredicto “Ganadora con significancia · B gana”. Aquí la calculadora solo dice que la tasa de B es mayor, y en esta métrica mayor es peor.
Después escribe la guarda: 120000 y 2419 contra 120000 y 2443. La pantalla muestra 2,02% contra 2,04%, mejora de +1,0%, valor-p de 0,7280, intervalo de -0,1% … +0,1% (pp) y Todavía sin significancia. Con más decimales, la mejora es de 0,99 por ciento y el intervalo va de menos 0,0927 a más 0,1327 punto porcentual, cerca de menos 4,6 a más 6,6 por ciento relativos.
Qué dice el resultado. El sello llevó a la compra a gente que antes bajaba hasta las reseñas, leía sobre la talla y desistía. En el escenario, el diagnóstico sostiene esa lectura: el clic en “ver reseñas” cayó en la variación, y el motivo de devolución más citado en B es el calce. El sello respondió a la duda equivocada (confiar en la tienda) cuando la duda real era la talla. Y no es solo falta de muestra: para una ganancia de 8 por ciento en pedidos mantenidos, la base de 2,02 por ciento pide 123.628 visitantes por variación (29 días), y el test tenía 120.000.
Qué hacer con él. No lanzar B como está. La próxima variación combina la puntuación cerca del precio con el fragmento de reseñas filtrado por talla, que responde a la duda que generaba la devolución. Misma primaria, misma guarda, y esta vez con la lectura final marcada para después de la ventana de devolución.
Ejemplo trabajado 2: logos de clientes en la página de precios SaaS
Escenario (ilustrativo). Un SaaS B2B recibe 12.000 visitantes por semana en la página de precios y el 7 por ciento de ellos inicia una prueba. Cerca del 15 por ciento de las pruebas se convierte en cuenta pagada en 30 días, lo que da 1,05 por ciento de cuenta pagada por visitante. La hipótesis: una franja de logos de clientes conocidos arriba de la tabla de planes reduce el riesgo percibido de contratar.
Muestra. En la misma calculadora de tamaño de muestra de más arriba, cambia los campos: tasa actual 7; efecto mínimo 15, relativo; confianza 95; poder 80; visitantes por semana 12000; bilateral. La pantalla muestra 9.907 visitantes por variación, 19.814 en total y 12 días. El equipo corre dos semanas completas: 12.000 visitantes por brazo.
El resultado en pruebas. En la calculadora de significancia, escribe 12000 y 840 en el control y 12000 y 966 en la variación. La pantalla muestra 7,00% contra 8,05%, mejora de +15,0%, valor-p de 0,0020, intervalo de +0,4% … +1,7% (pp) y Ganadora con significancia · B gana. Son 126 pruebas más.
El resultado en cuenta pagada, 30 días después.
| métrica | A | B | mejora relativa | valor-p | lectura |
|---|---|---|---|---|---|
| inicio de prueba por visitante | 840 de 12.000 (7,00%) | 966 de 12.000 (8,05%) | +15,0% | 0,0020 | significativo |
| prueba que se vuelve cuenta pagada | 126 de 840 (15,00%) | 130 de 966 (13,46%) | -10,3% | 0,3486 | sin significancia |
| cuenta pagada por visitante | 126 de 12.000 (1,05%) | 130 de 12.000 (1,08%) | +3,2% | 0,8015 | sin significancia |
Para verificar la última fila, escribe 12000 y 126 contra 12000 y 130: la pantalla muestra 1,05% contra 1,08%, mejora de +3,2%, valor-p de 0,8015, intervalo de -0,2% … +0,3% (pp) y Todavía sin significancia. Con más decimales, el intervalo va de menos 0,2266 a más 0,2933 punto porcentual, algo así como menos 21,6 a más 27,9 por ciento relativos. De las 126 pruebas extra, 4 se volvieron cuenta pagada adicional.
El giro aquí es distinto al del ecommerce. El resultado en cuenta pagada no dice que los logos no funcionen. Dice que el test nunca tuvo forma de responder. Vuelve a la calculadora de muestra y escribe la métrica que decide el dinero: tasa 1,05, efecto 15 relativo, 95, 80, 12000 por semana. La pantalla muestra 70.622 por variación, 141.244 en total y 83 días. La calculadora no muestra el poder, así que la cuenta siguiente es de esta guía, con la misma fórmula: con 12.000 por brazo, el poder para detectar más 15 por ciento en cuenta pagada era de cerca del 21 por ciento, y el menor efecto que ese tamaño vería con 80 por ciento de poder es de cerca de 38 por ciento relativo.
Qué hacer con él. Hay tres caminos honestos, y la elección debería haberse hecho antes: aceptar la prueba como métrica de decisión, con guardrail declarado en la tasa de prueba a pago y seguimiento de la cohorte; correr 12 semanas, si la decisión vale ese calendario; o aceptar ver solo efectos grandes en cuenta pagada, por escrito. Lo que no se hace es anunciar “los logos aumentan la conversión en 15 por ciento”. Y una señal se convierte en hipótesis nueva: la tasa de prueba a pago cayó de 15,00 a 13,46 por ciento, sin significancia, pero en la dirección de “los logos grandes atrajeron pruebas de quien no era el cliente típico”. La próxima variación testea logos del mismo tamaño que el visitante típico. El razonamiento para atribuir valor a ese tipo de ganador está en atribuyendo ingresos al ganador del test A/B.
Checklist antes de testear prueba social
- Verdad primero. Todo número, puntuación, logo, testimonio y contador mostrado es real, comprobable y autorizado.
- Duda mapeada. ¿Qué incertidumbre del visitante responde la prueba en ese punto de la página?
- Primaria en la transacción, guarda en el valor que se queda. El clic en la prueba es solo diagnóstico.
- Muestra dimensionada para la métrica que decide, y lectura marcada para después de la maduración (devolución, fin de la prueba).
- Semanas completas, sin parar en la primera semana buena.
- Segmentos declarados antes, como máximo dos o tres, con motivo.
- Registro diario de la prueba mostrada (puntuación, cantidad, número de clientes) y de por dónde el control ya la ve.
- SRM verificado antes de leer cualquier efecto, sobre todo cuando el bloque de reseñas viene de una app que carga después.
Errores comunes
- Citar el 270 por ciento como previsión. Es observacional, de un minorista, con un proveedor de reseñas como socio. Sirve como dirección, no como meta.
- Copiar el experimento de las toallas sin leer la replicación. El mismo diseño no repitió el efecto en Alemania.
- Esconder reseñas en el control. Testea la pregunta menos útil y entra en conflicto con la directriz de Google para contenido marcado.
- Mostrar solo reseñas positivas por defecto. La puntuación perfecta despierta desconfianza, y dificultar el acceso a las negativas puede ser práctica engañosa según la FTC.
- Muro de logos grandes para un público de empresas pequeñas. El visitante concluye que el producto no es para él.
- Cambiar la prueba y el layout al mismo tiempo. El resultado queda imposible de explicar y de reaprovechar.
Haz esto automático en Donnu
El dolor específico de testear prueba social es que el ganador aparece rápido en la métrica equivocada y el perjuicio aparece despacio en la métrica correcta. Ninguna herramienta resuelve eso por magia, pero algunas elecciones de configuración hacen el error menos probable.
En Donnu, la meta de conversión puede confirmarse desde tu servidor (server-to-server), además de clics, envíos de formulario, visitas a páginas y eventos personalizados. Eso permite medir la transacción que ocurrió de verdad, como un pedido pagado confirmado por la pasarela, en lugar de un clic en el botón. En el plan Pro, la campaña puede restringirse por dispositivo y por tipo de visitante, nuevo o recurrente, lo que ayuda a declarar el segmento antes de correr en lugar de cazarlo después. El informe es bayesiano y muestra la probabilidad de que la variación sea mejor que el control, con el intervalo de confianza de la mejora; en el plan Pro, esa probabilidad aparece también día a día, y una ventaja de primera semana que cruza la franja del 95 por ciento y vuelve queda visible como ruido, en lugar de convertirse en decisión.
Lo que sigue siendo tuyo: garantizar que la prueba mostrada es verdadera, esperar la maduración de la guarda y dimensionar por la métrica que decide. Para eso, la calculadora de tamaño de muestra, la calculadora de significancia y la calculadora de ingresos por visitante hacen las cuentas de esta guía con tus números, gratis.
Referencias
- Goldstein, N. J., Cialdini, R. B. y Griskevicius, V. A Room with a Viewpoint: Using Social Norms to Motivate Environmental Conservation in Hotels. Journal of Consumer Research, 35(3), 2008. Fuente de los dos experimentos de campo (aleatorización por habitación, tasas de 44,1 contra 35,1 y de 49,3, 44,5 y 37,2 por ciento) y del concepto de norma provinciana. PDF leído en su totalidad. sparq.stanford.edu.
- Bohner, G. y Schlüter, L. E. A Room with a Viewpoint Revisited: Descriptive Norms and Hotel Guests’ Towel Reuse Behavior. PLoS ONE, 2014. Fuente de la replicación en Alemania (81,9 contra 83,7 por ciento, valor-p de 0,62) y de la conclusión de que las normas no fueron más eficaces. Artículo leído en su totalidad. pmc.ncbi.nlm.nih.gov.
- Spiegel Research Center, Northwestern University, con PowerReviews. How Online Reviews Influence Sales. 2017. Fuente de los 270, 190 y 380 por ciento, de los rangos de puntuación, del peso de las primeras reseñas, del 15 por ciento del comprador verificado y de las bases de datos. PDF leído en su totalidad. spiegel.medill.northwestern.edu.
- Influence at Work (empresa de Robert Cialdini). Principles of Persuasion. Fuente de la definición del principio de prueba social (especialmente cuando están inseguras, las personas miran el comportamiento de los demás) y de la presentación de los resultados del hotel como aumentos de 26 y 33 por ciento. Verificado el 15/09/2026. influenceatwork.com.
- Mathur, A., Acar, G., Friedman, M. J., Lucherini, E., Mayer, J., Chetty, M. y Narayanan, A. Dark Patterns at Scale: Findings from a Crawl of 11K Shopping Websites. Proceedings of the ACM on Human-Computer Interaction, CSCW, 2019. Fuente del rastreo de tiendas, de las 313 notificaciones de actividad con 29 engañosas en 20 sitios y de los testimonios de origen incierto. PDF leído en su totalidad. arxiv.org.
- Federal Trade Commission. Federal Trade Commission Announces Final Rule Banning Fake Reviews and Testimonials (14/08/2024) y The Consumer Reviews and Testimonials Rule: Questions and Answers. Fuente de las prácticas prohibidas, de la previsión de multa civil en violación consciente, de la vigencia desde el 21/10/2024 y de la distinción entre organizar y suprimir reseñas. Verificado el 15/09/2026. ftc.gov · ftc.gov.
- Brasil. Ley nº 8.078, del 11 de septiembre de 1990 (Código de Defensa del Consumidor), texto compilado. Fuente de los artículos 37 (publicidad engañosa, incluso parcial o por omisión), 38 (carga de la prueba de quien patrocina) y 67 (detención de tres meses a un año y multa). Verificado el 15/09/2026. planalto.gov.br.
- Conar. Código Brasileño de Autorregulación Publicitaria, Anexo Q: Testimoniales, Certificaciones, Endosos. Fuente de las reglas de nombre y apellido verdaderos del consumidor identificado, de la prohibición de que los empleados se hagan pasar por consumidor común y de la obligación de comprobar la veracidad del testimonial. Verificado el 15/09/2026 en la edición vigente publicada por Conar (edición 2025), en la que el Anexo Q mantiene esos puntos. conar.org.br.
- Google Search Central. Review snippet (Review, AggregateRating) structured data. Fuente de la directriz de que el contenido de reseña marcado debe estar fácilmente disponible para el usuario en la página marcada. Verificado el 15/09/2026. developers.google.com.
Lee también: Test A/B de página de producto · Optimización de la página de precios SaaS · Test A/B de landing page B2B SaaS · Optimización de checkout · Efecto novedad · Métricas de guardrail · Calculadora de significancia · Leia em português · Read in English
Preguntas frecuentes
- ¿Qué es la prueba social en un sitio?
- Es cualquier señal de que otras personas ya eligieron, usaron o aprobaron aquello que el visitante está evaluando: puntuación y cantidad de reseñas, número de clientes, testimonios, logos de empresas clientes, actividad en tiempo real, sellos y certificaciones, y contenido generado por usuarios. Funciona reduciendo incertidumbre, por eso tiende a pesar más en una compra cara, una marca poco conocida y una decisión arriesgada, y menos cuando el visitante ya llegó decidido.
- ¿Agregar reseñas aumenta la conversión?
- Con frecuencia, pero uno de los números más citados no viene de un test A/B. El informe del Spiegel Research Center, de Northwestern, hecho con datos de PowerReviews, reporta que la probabilidad de compra de un producto con cinco reseñas es 270 por ciento mayor que la de un producto sin ninguna, a partir de productos que fueron acumulando reseñas a lo largo del tiempo. Es evidencia observacional fuerte, no una promesa para tu tienda. La forma de saberlo en tu caso es testear, y medir pedido que no vuelve, no solo pedido.
- ¿Qué métrica usar en un test de prueba social?
- La que esté más cerca del dinero que puedas dimensionar. El clic en las estrellas o en el testimonio es diagnóstico, nunca métrica primaria. En ecommerce, la primaria es pedido completado y la de guarda es pedido no devuelto o ingreso neto. En SaaS, la primaria suele ser inicio de prueba y la que decide el valor es cuenta pagada. En el ejemplo de esta guía, un sello de reseñas gana 8,75 por ciento en pedidos con valor-p de 0,0010 y solo 0,99 por ciento en pedidos que se mantienen, con valor-p de 0,7280.
- ¿Puedo usar un contador de personas viendo el producto ahora?
- Solo si el número es real y medido. Un estudio de Princeton que analizó cerca de 53 mil páginas de producto en cerca de 11 mil tiendas encontró 313 notificaciones de actividad, y 29 de ellas, en 20 sitios, eran engañosas, la mayoría generada por sorteo de número aleatorio o fija en el código. En Estados Unidos, la regla de la FTC sobre reseñas y testimonios falsos está en vigor desde el 21 de octubre de 2024. En Brasil, el Código de Defensa del Consumidor prohíbe la publicidad total o parcialmente falsa y atribuye a quien anuncia la carga de probar la veracidad.
- ¿Cuánto tráfico hace falta para testear prueba social?
- Depende de la tasa base y del efecto que quieras ver. Con 2,4 por ciento de conversión en una página de producto, 95 por ciento de confianza y 80 por ciento de poder, detectar 8 por ciento relativo exige 103.633 visitantes por variación, 25 días a 60 mil visitantes por semana. En una página de precios SaaS con 7 por ciento de inicio de prueba, detectar 15 por ciento relativo exige 9.907 por variación. Medir cuenta pagada con base de 1,05 por ciento, con el mismo efecto relativo, exige 70.622 por variación, 83 días a 12 mil visitantes por semana.
- ¿Los logos de clientes funcionan en una página de precios SaaS?
- Pueden aumentar el inicio de prueba y no cambiar la cuenta pagada, que es lo que ocurrió en el ejemplo trabajado de esta guía: más 15,0 por ciento en pruebas con valor-p de 0,0020, y más 3,2 por ciento en cuentas pagadas con valor-p de 0,8015, en un test que tenía solo cerca de 21 por ciento de poder para esa segunda métrica. El logo funciona como prueba cuando el visitante reconoce a la empresa y se identifica con ella, así que vale testear cuáles logos, para qué segmento, en lugar de tener o no tener logos.