CRO

Documentación de Experimentos: un repositorio que sí se usa

Repositorio de documentación de experimentos que la gente use: los campos a registrar, cómo hacerlo buscable y qué cuesta un test duplicado.

Ilustración plana de una pared de cajones de archivo con un cajón abierto que muestra fichas apiladas y una lupa al lado

Un repositorio de experimentos es el registro buscable de todos los tests que el equipo ha corrido, con la hipótesis, los números, la decisión y la interpretación de cada uno. Casi todo equipo de experimentación empieza uno; la mayoría lo abandona en dos trimestres. El fracaso rara vez es de disciplina, es de diseño: los repositorios se construyen como archivos de solo escritura, indexados por ID de test y poblados solo con victorias, lo que los vuelve inútiles justo cuando alguien los necesita. Este artículo cubre los campos que vale la pena registrar, cómo indexar las entradas para que la gente las encuentre por la pregunta que realmente tiene, por qué las derrotas son los registros de mayor valor, y un ejemplo trabajado que le pone precio a un test duplicado en días de capacidad perdida. Forma parte de la guía sobre cómo construir una cultura de experimentación.

Por qué la mayoría de los repositorios de documentación de experimentos termina ignorada

Hay tres modos de falla distintos, y necesitan arreglos distintos. Diagnosticar cuál tienes importa más que elegir una herramienta.

Solo escritura. Las entradas entran y no sale nada. Nadie cita nunca un experimento pasado en una reunión de planificación, y nadie paga costo alguno por no hacerlo. El síntoma es fácil de comprobar: pregunta cuándo se leyó el repositorio por última vez, no cuándo se escribió. El arreglo es de proceso, y está más abajo.

No buscable. El contenido existe pero la recuperación falla. Las entradas se titulan “EXP-114” o “test de checkout del Q3”, están indexadas por fecha, y averiguar si alguien alguna vez testeó quitar el campo de cupón significa leer cincuenta documentos. El arreglo es indexar por pregunta, página y métrica.

Solo ganadores. El repositorio es un carrete de mejores momentos. Las derrotas y los empates nunca se escribieron, así que el archivo enseña que todo lo que el equipo probó funcionó, lo cual es falso y peligroso a la vez: la misma idea perdedora vuelve el trimestre siguiente sin nada registrado que la frene. El arreglo es una regla de documentación que no dependa del resultado.

Las tres formas en que falla un repositorio de experimentosUn repositorio de solo escritura recibe entradas pero nunca se lee. Un repositorio no buscable se lee pero la recuperación falla. Un repositorio de solo ganadores es buscable pero guarda cerca de un tercio de lo que el equipo aprendió, porque las derrotas y los empates nunca se escribieron.Solo escrituralas entradas entranno sale nadaNo buscableindexado por ID y fecha,no por pregunta ni páginaSolo ganadoresvictorias registradasfaltan los empatesfaltan las derrotasCada falla tiene un arreglo distinto. Adoptar una herramienta nueva no resuelve ninguna por sí sola.Diagnostica cuál tienes antes de reconstruir nada.
Tres modos de falla, tres arreglos: un ritual de lectura, un índice construido sobre preguntas y una regla de documentación independiente del resultado.

Qué registrar de cada experimento

El esquema de entrada de abajo es deliberadamente corto. Cada campo se gana su lugar respondiendo una pregunta que aparece después, y todo lo que no lo haga es fricción que al final mata el hábito.

Campo Qué va ahí La pregunta posterior que responde
Título como pregunta “¿Quitar el campo de cupón aumenta la finalización del checkout?” “¿Alguien testeó esto?”
Decisión (primera línea) Lanzado, revertido o no concluyente “¿Qué pasó?”, sin abrir la entrada
Hipótesis Como observamos X, creemos que Y causa Z, medido por W “¿Qué estábamos prediciendo en realidad?”
Página y audiencia Patrón exacto de URL, dispositivo, país, nuevo o recurrente “¿Esto aplica a mi caso?”
Métrica primaria Exactamente una, elegida antes de correr “¿La métrica se eligió después de ver los datos?”
Métricas de guardia Métricas que no pueden empeorar “¿La victoria nos costó algo en otro lado?”
Muestra y duración planificadas Muestra por variación y ventana fijada de antemano “¿Este test estaba bien dimensionado?”
Números observados Visitantes y conversiones por variación “¿Puedo recomprobar este resultado yo mismo?”
Valor p e intervalo de confianza No solo el veredicto, también el intervalo “¿Qué tan grande podría ser el efecto de verdad?”
Interpretación Un párrafo: qué creemos ahora y por qué “¿Qué aprendimos más allá del veredicto?”
Enlaces Capturas, panel, cambio de código, ítem del roadmap “¿Dónde está la evidencia?”

Dos campos merecen ser defendidos porque son los primeros en caer. Números observados importa porque un veredicto sin conteos crudos no se puede recomprobar, y los resultados se recomprueban, normalmente cuando alguien sospecha de un error de medición meses después. Interpretación importa porque el veredicto solo envejece mal: “la variación B ganó, p igual a 0,03” no le dice nada a alguien nuevo sobre qué creencia cambió. Si conservas un solo campo de prosa, conserva este.

El intervalo de confianza es el campo que más cambia cómo se lee la entrada después. Una victoria de “+4% relativo, intervalo de +0,2% a +7,8%” y una victoria de “+4% relativo, intervalo de +3,5% a +4,5%” llevan el mismo veredicto y una información completamente distinta sobre qué esperar tras el lanzamiento. El razonamiento detrás de eso está en la guía de significancia estadística en tests A/B.

La plantilla de entrada, lista para copiar

Pregunta: ¿Quitar el campo de cupón aumenta la finalización del checkout?
Decisión: Revertido (la variación tendió a peor, el intervalo incluye cero, la métrica de guardia empeoró)

Hipótesis: Como las grabaciones de sesión muestran usuarios saliendo del
checkout a buscar códigos de cupón, creemos que quitar el campo visible de
cupón va a aumentar la finalización del checkout, medida como pedidos
completados / inicios de checkout.

Alcance: /checkout, todos los dispositivos, todos los países, 2026-05-04 a 2026-05-18
Métrica primaria: tasa de finalización del checkout
Métricas de guardia: ingresos por visitante, contactos a soporte sobre descuentos

Planificado: 24.193 por variación, 14 días, 95% de confianza, 80% de poder
Observado: A 24.301 visitantes / 1.458 conversiones (6,00%)
           B 24.190 visitantes / 1.353 conversiones (5,59%)
Valor p: 0,055   IC de la diferencia: -0,82pp a +0,01pp

Interpretación: Quitar el campo no redujo la distracción, quitó una
oportunidad percibida de descuento. Los contactos a soporte sobre descuentos
también subieron. No volver a testear la eliminación; la pregunta abierta es
si esconder el campo detrás de un enlace se comporta distinto.

La última línea de la interpretación es la parte que paga todo el ejercicio. Cierra una pregunta y abre otra más afilada, que es la diferencia entre un archivo y un programa de investigación.

Hazlo encontrable por la pregunta, no por el ID

La recuperación es donde mueren los repositorios. La prueba es simple: ¿puede alguien que lleva tres semanas en la empresa averiguar, en menos de dos minutos, si el equipo alguna vez testeó la galería de la página de producto? Si no, el índice está mal.

Tres reglas de indexación cubren casi todo:

Una adición útil cuando el archivo pasa de unas treinta entradas: una sola página resumen que liste, por página del sitio, las preguntas ya respondidas y las que siguen abiertas. Esa página se convierte en lo que la gente realmente lee antes de proponer un test, y alimenta directamente la plantilla de roadmap de experimentación, porque una pregunta abierta con evidencia detrás es una candidata de roadmap mucho más fuerte que una opinión recién nacida.

Las derrotas y los empates son las entradas de mayor valor

Un repositorio que registra solo ganadores documenta una minoría de lo que el equipo aprendió. Según datos publicados por Ronny Kohavi sobre experimentos en Microsoft, aproximadamente un tercio de las ideas testeadas mejora la métrica objetivo, un tercio no cambia nada y un tercio la empeora (Kohavi, Online Controlled Experiments: Lessons from Running A/B/n Tests for 12 Years, KDD 2015). Con esa proporción, a un archivo de solo ganadores le faltan cerca de dos entradas de cada tres.

Las dos categorías ausentes tienen valores distintos:

Una regla práctica que sobrevive al contacto con la realidad: la documentación la escribe quien propuso el test, dentro de los dos días hábiles siguientes a la decisión, sin importar el resultado, y el ítem del roadmap no se cierra hasta que la entrada existe. Atar la entrada al cierre del ítem es lo que evita que dependa del ánimo de nadie.

Ejemplo trabajado: cuánto cuesta de verdad un test duplicado

Las discusiones sobre la sobrecarga de documentar terminan rápido cuando el costo de no tenerla se expresa en días. Aquí está el cálculo para un equipo de ecommerce plausible.

El equipo testea en un flujo de producto que recibe 120.000 visitantes al mes, convierte al 3,0% y dimensiona los tests para detectar un aumento de 15% relativo con 95% de confianza y 80% de poder.

Comprueba el primer paso con tu propia base:

Calculadora de tamaño de muestra
-Visitantes por variación
-Total (2 variaciones)
-Duración estimada

Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.

Ahora supongamos que tres de esos 26 tests volvieron a responder una pregunta que el equipo ya había respondido y olvidado. Eso es 3 por 14, o 42 días de capacidad de testeo, el 11,5% del año de testeo, gastados en no aprender nada nuevo. Dicho al revés: el repositorio tiene que evitar poco más de un test duplicado al año para pagar cada hora que alguien dedique a escribir entradas.

Capacidad anual de testeo perdida en tests duplicadosUn equipo con 26 tests de capacidad anual que vuelve a correr tres preguntas ya respondidas gasta 42 de sus 365 días de testeo, cerca del 11,5 por ciento del año, sin producir información nueva.26 tests de capacidad anual, a 14 días cada uno42 d323 días produciendo información nueva3 tests duplicados11,5% del año de testeogastado en volver a responder preguntas que el equipo ya había respondido y no pudo encontrar.El repositorio solo tiene que evitar un duplicado al año para valer más de lo que cuesta.Capacidad calculada con 120.000 visitantes mensuales en el flujo, base de 3,0%, MDE de 15% relativo.
La sobrecarga de documentar es barata al lado del costo de la capacidad de testeo. La comparación solo se vuelve obvia cuando la capacidad se expresa en días y no en entusiasmo.

Tu propia capacidad, y por lo tanto tu propio costo de duplicado, sale de la misma cuenta:

Calculadora de velocidad de tests A/B
-Tests por mes
-Tests por año
-Días por test

Muestra por variación al 95% de confianza y 80% de poder (bilateral), según tu tasa y MDE. Ajusta los campos y mira la capacidad en vivo.

Hay un segundo costo que rara vez se cuenta. Un test duplicado no solo consume días, consume el turno del test que habría corrido en su lugar. En una cola donde los ítems están ordenados por valor esperado, el duplicado desplaza al ítem de mayor valor que sigue esperando, así que la pérdida real es la diferencia entre lo que enseñó el duplicado (nada) y lo que habría enseñado el ítem desplazado.

Gobernanza que sobrevive a un trimestre ocupado

Regla Por qué se sostiene Qué se rompe sin ella
La entrada la escribe quien propuso el test Tiene el contexto que nadie más tiene Las entradas las escribe quien tenga tiempo, y mal
Dos días hábiles después de la decisión La memoria de la interpretación sigue fresca Las entradas se vuelven resúmenes de veredicto
El ítem del roadmap se cierra solo con la entrada Ata la documentación a un trabajo ya rastreado Documentar se vuelve opcional y después ausente
Misma plantilla para victorias, derrotas y empates Elimina cualquier fricción dependiente del resultado El archivo se convierte en silencio en un carrete de éxitos
Lectura mensual, no solo escritura mensual Crea demanda, que es lo que sostiene la oferta El repositorio se vuelve de solo escritura en un trimestre
Una entrada, un enlace estable Citar un experimento se vuelve tan fácil como pegar El conocimiento vive en hilos de chat que caducan

La lectura mensual merece la mayor atención porque es la menos intuitiva. Los equipos intentan arreglar los repositorios haciendo más fácil escribir; el arreglo duradero es hacer rutinaria la lectura. Un espacio de diez minutos en la reunión mensual de planificación donde alguien responde “qué dice ya el archivo sobre la cola de este trimestre” convierte el repositorio de tarea en herramienta, y una vez que es herramienta, la escritura se resuelve sola.

Hazlo automático con Donnu

La mayor parte de una entrada de repositorio son datos que tu herramienta de testeo ya guarda: la audiencia, la muestra planificada, los conteos observados por variación, el valor p y el intervalo. Donnu mantiene ese registro por experimento con los números congelados tal como fueron leídos, así que escribir la entrada pasa a ser cuestión de agregar la hipótesis y la interpretación en lugar de reconstruir los números desde un panel que ya siguió su curso. Lo que le pertenece al equipo es el pensamiento; lo que le pertenece a la herramienta es la evidencia.

Empieza una prueba gratis de 14 días y mantén la evidencia adjunta a cada test desde el primero. Para organizar la cola que este archivo debería alimentar, mira la plantilla de roadmap de experimentación.

Referencias

Lee también:

Read in English: Experiment Documentation: A Repository Nobody Ignores

Preguntas frecuentes

¿Qué es un repositorio de experimentos?
Es el registro buscable de todos los experimentos que un equipo ha corrido, con la hipótesis, la configuración, los números observados, la decisión tomada y lo que se aprendió. Es distinto de un roadmap, que mira hacia adelante y guarda la cola de tests por correr. El repositorio mira hacia atrás y existe para que una pregunta que los datos ya respondieron no se vuelva a discutir ni, peor aún, a testear otra vez.
¿Qué se debe registrar de cada experimento?
Como mínimo: un título en forma de pregunta, la hipótesis en formato de evidencia, cambio, efecto y métrica, la audiencia y la página exactas, la métrica primaria y las de guardia, la muestra y la duración planificadas, los números observados por variación con el valor p y el intervalo de confianza, la decisión tomada y un párrafo de interpretación. La interpretación es el campo que más se omite y el que hace que la entrada siga siendo útil un año después.
¿Hay que documentar los tests perdedores y los no concluyentes?
Sí, y son las entradas de mayor valor a largo plazo. Si aproximadamente dos tercios de las ideas testeadas no mejoran la métrica objetivo, un repositorio que guarda solo ganadores está documentando cerca de un tercio de lo que el equipo aprendió. Las derrotas impiden que la misma idea vuelva cada trimestre, y los empates registran qué tamaños de efecto el tráfico no fue capaz de detectar.
¿Cómo se evita que un repositorio de experimentos sea ignorado?
Haciéndolo buscable por la pregunta que la persona realmente tiene, no por ID de test ni por fecha. En la práctica: titula cada entrada con la pregunta que responde, etiquétala por página, elemento de página, métrica y audiencia, y pon la decisión en la primera línea para que quien escanea resultados no tenga que abrir la entrada para conocer el desenlace. Un repositorio que hay que leer entero para usar es un repositorio que la gente deja de abrir.
¿Cuánto cuesta un test duplicado?
El costo es capacidad real, medida en días. Un equipo con una duración de test de 14 días y unos 26 tests de capacidad anual que vuelve a correr tres preguntas ya respondidas quema 42 días, cerca del 11,5% del año de testeo, y no obtiene ninguna información nueva a cambio. Ese es el número que vale la pena citar internamente cuando alguien argumenta que la documentación es sobrecarga.
¿Dónde debe vivir el repositorio?
Donde el equipo ya trabaja y ya busca: la wiki existente, la base de conocimiento o una herramienta de base de datos compartida. La herramienta importa mucho menos que dos propiedades: una entrada por experimento con un enlace estable, y una búsqueda que devuelva resultados por página y por métrica. Un repositorio que vive en un lugar al que hay que recordarle a la gente entrar va a perder contra cualquier herramienta que ya tengan abierta.