Documentación de Experimentos: un repositorio que sí se usa
Repositorio de documentación de experimentos que la gente use: los campos a registrar, cómo hacerlo buscable y qué cuesta un test duplicado.

📚 Este artículo es parte de la guía Cómo Construir una Cultura de Experimentación (2026).
Un repositorio de experimentos es el registro buscable de todos los tests que el equipo ha corrido, con la hipótesis, los números, la decisión y la interpretación de cada uno. Casi todo equipo de experimentación empieza uno; la mayoría lo abandona en dos trimestres. El fracaso rara vez es de disciplina, es de diseño: los repositorios se construyen como archivos de solo escritura, indexados por ID de test y poblados solo con victorias, lo que los vuelve inútiles justo cuando alguien los necesita. Este artículo cubre los campos que vale la pena registrar, cómo indexar las entradas para que la gente las encuentre por la pregunta que realmente tiene, por qué las derrotas son los registros de mayor valor, y un ejemplo trabajado que le pone precio a un test duplicado en días de capacidad perdida. Forma parte de la guía sobre cómo construir una cultura de experimentación.
Por qué la mayoría de los repositorios de documentación de experimentos termina ignorada
Hay tres modos de falla distintos, y necesitan arreglos distintos. Diagnosticar cuál tienes importa más que elegir una herramienta.
Solo escritura. Las entradas entran y no sale nada. Nadie cita nunca un experimento pasado en una reunión de planificación, y nadie paga costo alguno por no hacerlo. El síntoma es fácil de comprobar: pregunta cuándo se leyó el repositorio por última vez, no cuándo se escribió. El arreglo es de proceso, y está más abajo.
No buscable. El contenido existe pero la recuperación falla. Las entradas se titulan “EXP-114” o “test de checkout del Q3”, están indexadas por fecha, y averiguar si alguien alguna vez testeó quitar el campo de cupón significa leer cincuenta documentos. El arreglo es indexar por pregunta, página y métrica.
Solo ganadores. El repositorio es un carrete de mejores momentos. Las derrotas y los empates nunca se escribieron, así que el archivo enseña que todo lo que el equipo probó funcionó, lo cual es falso y peligroso a la vez: la misma idea perdedora vuelve el trimestre siguiente sin nada registrado que la frene. El arreglo es una regla de documentación que no dependa del resultado.
Qué registrar de cada experimento
El esquema de entrada de abajo es deliberadamente corto. Cada campo se gana su lugar respondiendo una pregunta que aparece después, y todo lo que no lo haga es fricción que al final mata el hábito.
| Campo | Qué va ahí | La pregunta posterior que responde |
|---|---|---|
| Título como pregunta | “¿Quitar el campo de cupón aumenta la finalización del checkout?” | “¿Alguien testeó esto?” |
| Decisión (primera línea) | Lanzado, revertido o no concluyente | “¿Qué pasó?”, sin abrir la entrada |
| Hipótesis | Como observamos X, creemos que Y causa Z, medido por W | “¿Qué estábamos prediciendo en realidad?” |
| Página y audiencia | Patrón exacto de URL, dispositivo, país, nuevo o recurrente | “¿Esto aplica a mi caso?” |
| Métrica primaria | Exactamente una, elegida antes de correr | “¿La métrica se eligió después de ver los datos?” |
| Métricas de guardia | Métricas que no pueden empeorar | “¿La victoria nos costó algo en otro lado?” |
| Muestra y duración planificadas | Muestra por variación y ventana fijada de antemano | “¿Este test estaba bien dimensionado?” |
| Números observados | Visitantes y conversiones por variación | “¿Puedo recomprobar este resultado yo mismo?” |
| Valor p e intervalo de confianza | No solo el veredicto, también el intervalo | “¿Qué tan grande podría ser el efecto de verdad?” |
| Interpretación | Un párrafo: qué creemos ahora y por qué | “¿Qué aprendimos más allá del veredicto?” |
| Enlaces | Capturas, panel, cambio de código, ítem del roadmap | “¿Dónde está la evidencia?” |
Dos campos merecen ser defendidos porque son los primeros en caer. Números observados importa porque un veredicto sin conteos crudos no se puede recomprobar, y los resultados se recomprueban, normalmente cuando alguien sospecha de un error de medición meses después. Interpretación importa porque el veredicto solo envejece mal: “la variación B ganó, p igual a 0,03” no le dice nada a alguien nuevo sobre qué creencia cambió. Si conservas un solo campo de prosa, conserva este.
El intervalo de confianza es el campo que más cambia cómo se lee la entrada después. Una victoria de “+4% relativo, intervalo de +0,2% a +7,8%” y una victoria de “+4% relativo, intervalo de +3,5% a +4,5%” llevan el mismo veredicto y una información completamente distinta sobre qué esperar tras el lanzamiento. El razonamiento detrás de eso está en la guía de significancia estadística en tests A/B.
La plantilla de entrada, lista para copiar
Pregunta: ¿Quitar el campo de cupón aumenta la finalización del checkout?
Decisión: Revertido (la variación tendió a peor, el intervalo incluye cero, la métrica de guardia empeoró)
Hipótesis: Como las grabaciones de sesión muestran usuarios saliendo del
checkout a buscar códigos de cupón, creemos que quitar el campo visible de
cupón va a aumentar la finalización del checkout, medida como pedidos
completados / inicios de checkout.
Alcance: /checkout, todos los dispositivos, todos los países, 2026-05-04 a 2026-05-18
Métrica primaria: tasa de finalización del checkout
Métricas de guardia: ingresos por visitante, contactos a soporte sobre descuentos
Planificado: 24.193 por variación, 14 días, 95% de confianza, 80% de poder
Observado: A 24.301 visitantes / 1.458 conversiones (6,00%)
B 24.190 visitantes / 1.353 conversiones (5,59%)
Valor p: 0,055 IC de la diferencia: -0,82pp a +0,01pp
Interpretación: Quitar el campo no redujo la distracción, quitó una
oportunidad percibida de descuento. Los contactos a soporte sobre descuentos
también subieron. No volver a testear la eliminación; la pregunta abierta es
si esconder el campo detrás de un enlace se comporta distinto.
La última línea de la interpretación es la parte que paga todo el ejercicio. Cierra una pregunta y abre otra más afilada, que es la diferencia entre un archivo y un programa de investigación.
Hazlo encontrable por la pregunta, no por el ID
La recuperación es donde mueren los repositorios. La prueba es simple: ¿puede alguien que lleva tres semanas en la empresa averiguar, en menos de dos minutos, si el equipo alguna vez testeó la galería de la página de producto? Si no, el índice está mal.
Tres reglas de indexación cubren casi todo:
- Titula cada entrada como una pregunta. La gente busca preguntas, no nombres de test. “¿Agregar el número de reseñas a la tarjeta de producto aumenta el clic?” es encontrable; “Test PDP v3” no lo es.
- Etiqueta en cuatro ejes. Página o flujo, elemento de página, métrica movida, segmento de audiencia. Cuatro etiquetas por entrada bastan para responder casi toda consulta de recuperación, y son pocas como para que la gente realmente las complete.
- Pon la decisión en la primera línea. Quien escanea ocho resultados de búsqueda debería enterarse de ocho desenlaces sin abrir nada.
Una adición útil cuando el archivo pasa de unas treinta entradas: una sola página resumen que liste, por página del sitio, las preguntas ya respondidas y las que siguen abiertas. Esa página se convierte en lo que la gente realmente lee antes de proponer un test, y alimenta directamente la plantilla de roadmap de experimentación, porque una pregunta abierta con evidencia detrás es una candidata de roadmap mucho más fuerte que una opinión recién nacida.
Las derrotas y los empates son las entradas de mayor valor
Un repositorio que registra solo ganadores documenta una minoría de lo que el equipo aprendió. Según datos publicados por Ronny Kohavi sobre experimentos en Microsoft, aproximadamente un tercio de las ideas testeadas mejora la métrica objetivo, un tercio no cambia nada y un tercio la empeora (Kohavi, Online Controlled Experiments: Lessons from Running A/B/n Tests for 12 Years, KDD 2015). Con esa proporción, a un archivo de solo ganadores le faltan cerca de dos entradas de cada tres.
Las dos categorías ausentes tienen valores distintos:
- Las derrotas son la mejor defensa contra las ideas recicladas. Una idea que perdió con un intervalo documentado y una interpretación escrita deja de ser cuestión de opinión. Sin el registro, la misma propuesta vuelve en cada ciclo de planificación con la misma confianza.
- Los empates registran la sensibilidad de tu tráfico. Un empate con un intervalo de confianza que va de -2% a +3% no es “ningún efecto”, es “cualquier efecto mayor a aproximadamente 3% probablemente se habría visto”. Esa es una afirmación sobre lo que tu tráfico puede y no puede ver, y evita que el equipo vuelva a correr el mismo test sin poder con las mismas expectativas. La mecánica de esa lectura está en errores comunes en tests A/B y amenazas a la validez.
Una regla práctica que sobrevive al contacto con la realidad: la documentación la escribe quien propuso el test, dentro de los dos días hábiles siguientes a la decisión, sin importar el resultado, y el ítem del roadmap no se cierra hasta que la entrada existe. Atar la entrada al cierre del ítem es lo que evita que dependa del ánimo de nadie.
Ejemplo trabajado: cuánto cuesta de verdad un test duplicado
Las discusiones sobre la sobrecarga de documentar terminan rápido cuando el costo de no tenerla se expresa en días. Aquí está el cálculo para un equipo de ecommerce plausible.
El equipo testea en un flujo de producto que recibe 120.000 visitantes al mes, convierte al 3,0% y dimensiona los tests para detectar un aumento de 15% relativo con 95% de confianza y 80% de poder.
- Muestra por variación: 24.193 visitantes.
- Muestra total (2 variaciones): 48.386 visitantes.
- Tráfico diario: 120.000 dividido por 30, es decir 4.000 visitantes por día.
- Días exigidos por el tráfico: 48.386 dividido por 4.000 da 12,1, redondeado hacia arriba en días enteros de recolección, es decir 13 días.
- Duración real: 14 días, porque el piso de dos semanas es mayor que 13.
- Capacidad anual: 365 dividido por 14, cerca de 26 tests por año.
Comprueba el primer paso con tu propia base:
Cálculo por aproximación normal de dos proporciones, 2 variaciones (50/50). Cambia los campos y mira el impacto en vivo.
Ahora supongamos que tres de esos 26 tests volvieron a responder una pregunta que el equipo ya había respondido y olvidado. Eso es 3 por 14, o 42 días de capacidad de testeo, el 11,5% del año de testeo, gastados en no aprender nada nuevo. Dicho al revés: el repositorio tiene que evitar poco más de un test duplicado al año para pagar cada hora que alguien dedique a escribir entradas.
Tu propia capacidad, y por lo tanto tu propio costo de duplicado, sale de la misma cuenta:
Muestra por variación al 95% de confianza y 80% de poder (bilateral), según tu tasa y MDE. Ajusta los campos y mira la capacidad en vivo.
Hay un segundo costo que rara vez se cuenta. Un test duplicado no solo consume días, consume el turno del test que habría corrido en su lugar. En una cola donde los ítems están ordenados por valor esperado, el duplicado desplaza al ítem de mayor valor que sigue esperando, así que la pérdida real es la diferencia entre lo que enseñó el duplicado (nada) y lo que habría enseñado el ítem desplazado.
Gobernanza que sobrevive a un trimestre ocupado
| Regla | Por qué se sostiene | Qué se rompe sin ella |
|---|---|---|
| La entrada la escribe quien propuso el test | Tiene el contexto que nadie más tiene | Las entradas las escribe quien tenga tiempo, y mal |
| Dos días hábiles después de la decisión | La memoria de la interpretación sigue fresca | Las entradas se vuelven resúmenes de veredicto |
| El ítem del roadmap se cierra solo con la entrada | Ata la documentación a un trabajo ya rastreado | Documentar se vuelve opcional y después ausente |
| Misma plantilla para victorias, derrotas y empates | Elimina cualquier fricción dependiente del resultado | El archivo se convierte en silencio en un carrete de éxitos |
| Lectura mensual, no solo escritura mensual | Crea demanda, que es lo que sostiene la oferta | El repositorio se vuelve de solo escritura en un trimestre |
| Una entrada, un enlace estable | Citar un experimento se vuelve tan fácil como pegar | El conocimiento vive en hilos de chat que caducan |
La lectura mensual merece la mayor atención porque es la menos intuitiva. Los equipos intentan arreglar los repositorios haciendo más fácil escribir; el arreglo duradero es hacer rutinaria la lectura. Un espacio de diez minutos en la reunión mensual de planificación donde alguien responde “qué dice ya el archivo sobre la cola de este trimestre” convierte el repositorio de tarea en herramienta, y una vez que es herramienta, la escritura se resuelve sola.
Hazlo automático con Donnu
La mayor parte de una entrada de repositorio son datos que tu herramienta de testeo ya guarda: la audiencia, la muestra planificada, los conteos observados por variación, el valor p y el intervalo. Donnu mantiene ese registro por experimento con los números congelados tal como fueron leídos, así que escribir la entrada pasa a ser cuestión de agregar la hipótesis y la interpretación en lugar de reconstruir los números desde un panel que ya siguió su curso. Lo que le pertenece al equipo es el pensamiento; lo que le pertenece a la herramienta es la evidencia.
Empieza una prueba gratis de 14 días y mantén la evidencia adjunta a cada test desde el primero. Para organizar la cola que este archivo debería alimentar, mira la plantilla de roadmap de experimentación.
Referencias
- Kohavi, R. Online Controlled Experiments: Lessons from Running A/B/n Tests for 12 Years. Keynote, ACM SIGKDD 2015. exp-platform.com/Documents/2015-08OnlineControlledExperimentsKDDKeynoteNR.pdf.
- Thomke, S. Building a Culture of Experimentation. Harvard Business Review, marzo-abril 2020. hbr.org/2020/03/building-a-culture-of-experimentation.
- Kohavi, R. y Thomke, S. The Surprising Power of Online Experiments. Harvard Business Review, 2017. hbr.org/2017/09/the-surprising-power-of-online-experiments.
- Bing Search Quality Insights. Large Scale Experimentation at Bing. Microsoft. blogs.bing.com/search-quality-insights/August-2013/Large-Scale-Experimentation-at-Bing.
- Kohavi, R. ExP Platform: accelerating innovation through trustworthy experimentation. exp-platform.com.
Lee también:
- Cómo Construir una Cultura de Experimentación: un framework práctico
- Plantilla de Roadmap de Experimentación (gratis)
- ¿Cuántos Tests A/B Deberías Hacer por Mes?
Read in English: Experiment Documentation: A Repository Nobody Ignores
Preguntas frecuentes
- ¿Qué es un repositorio de experimentos?
- Es el registro buscable de todos los experimentos que un equipo ha corrido, con la hipótesis, la configuración, los números observados, la decisión tomada y lo que se aprendió. Es distinto de un roadmap, que mira hacia adelante y guarda la cola de tests por correr. El repositorio mira hacia atrás y existe para que una pregunta que los datos ya respondieron no se vuelva a discutir ni, peor aún, a testear otra vez.
- ¿Qué se debe registrar de cada experimento?
- Como mínimo: un título en forma de pregunta, la hipótesis en formato de evidencia, cambio, efecto y métrica, la audiencia y la página exactas, la métrica primaria y las de guardia, la muestra y la duración planificadas, los números observados por variación con el valor p y el intervalo de confianza, la decisión tomada y un párrafo de interpretación. La interpretación es el campo que más se omite y el que hace que la entrada siga siendo útil un año después.
- ¿Hay que documentar los tests perdedores y los no concluyentes?
- Sí, y son las entradas de mayor valor a largo plazo. Si aproximadamente dos tercios de las ideas testeadas no mejoran la métrica objetivo, un repositorio que guarda solo ganadores está documentando cerca de un tercio de lo que el equipo aprendió. Las derrotas impiden que la misma idea vuelva cada trimestre, y los empates registran qué tamaños de efecto el tráfico no fue capaz de detectar.
- ¿Cómo se evita que un repositorio de experimentos sea ignorado?
- Haciéndolo buscable por la pregunta que la persona realmente tiene, no por ID de test ni por fecha. En la práctica: titula cada entrada con la pregunta que responde, etiquétala por página, elemento de página, métrica y audiencia, y pon la decisión en la primera línea para que quien escanea resultados no tenga que abrir la entrada para conocer el desenlace. Un repositorio que hay que leer entero para usar es un repositorio que la gente deja de abrir.
- ¿Cuánto cuesta un test duplicado?
- El costo es capacidad real, medida en días. Un equipo con una duración de test de 14 días y unos 26 tests de capacidad anual que vuelve a correr tres preguntas ya respondidas quema 42 días, cerca del 11,5% del año de testeo, y no obtiene ninguna información nueva a cambio. Ese es el número que vale la pena citar internamente cuando alguien argumenta que la documentación es sobrecarga.
- ¿Dónde debe vivir el repositorio?
- Donde el equipo ya trabaja y ya busca: la wiki existente, la base de conocimiento o una herramienta de base de datos compartida. La herramienta importa mucho menos que dos propiedades: una entrada por experimento con un enlace estable, y una búsqueda que devuelva resultados por página y por métrica. Un repositorio que vive en un lugar al que hay que recordarle a la gente entrar va a perder contra cualquier herramienta que ya tengan abierta.