Estatística

Parada por Futilidade: quando desligar um teste A/B

Parada por futilidade usa o poder condicional para desligar um teste A/B que não vai concluir. Como calcular, onde colocar o limiar e o custo do erro.

Ilustração plana de uma trilha estreita que atravessa um campo aberto e termina numa porteira fechada, com uma linha de árvores ao fundo, em tons de verde

Um teste A/B que já rodou metade do tráfego planejado e está empatado normalmente não vai virar: no caso trabalhado deste artigo, o poder condicional na metade do caminho é de 29,2 por cento supondo que o efeito planejado apareça no trecho restante, e de apenas 1,1 por cento se a tendência observada continuar. Desligar esse teste devolve 82.376 visitantes e 14 dias de calendário para a próxima hipótese. Este guia mostra a parada por futilidade ponta a ponta: como calcular o poder condicional, onde colocar o limiar, quanto de poder a decisão custa e por que a evidência recomenda cautela. Faz parte do nosso guia completo de teste A/B e é o complemento do teste sequencial, que trata da outra metade do problema: parar cedo quando o resultado é bom.

Duas paradas antecipadas, dois problemas diferentes

Parar cedo por vitória é o assunto de todo material sobre peeking: olhar o resultado várias vezes e parar na primeira vez que o valor-p cruza 0,05 infla o falso positivo, e é por isso que existem métodos sequenciais.

Parar cedo por futilidade é o problema espelhado, e ele é mais fácil em um aspecto e mais difícil em outro. Mais fácil porque não há risco de falso positivo: ninguém está declarando vencedor. A FDA registra isso de forma explícita ao tratar de desenhos sequenciais: acrescentar diretrizes de futilidade não obrigatórias a um estudo de amostra fixa, ou a um com fronteiras sequenciais adequadas para eficácia, não aumenta a probabilidade de erro tipo I e é frequentemente apropriado.

Mais difícil porque o custo aparece do outro lado: cada parada por futilidade é uma chance a mais de abandonar um efeito verdadeiro. O erro tipo II sobe, e a decisão só é defensável quando esse aumento está quantificado e aceito antes do teste começar.

Poder condicional: a conta que sustenta a decisão

A quantidade que responde “vale continuar?” é o poder condicional. Zhang e Clarke definem: é a probabilidade de a análise final rejeitar a hipótese nula, dados os dados observados na análise interina e uma suposição sobre o efeito. O complemento, 1 menos o poder condicional, é chamado de índice de futilidade desde Ware, Muller e Braunwald.

A conta usa o B-value, ferramenta de monitoramento formalizada por Lan e Wittes. Sendo t a fração de informação (a parcela da amostra planejada já coletada) e z o valor da estatística de teste naquele momento:

// Poder condicional na fração de informação t (Zhang e Clarke, 2009)
// zAlpha: limiar de vitoria (1,9600 no bicaudal de 5%)
// drift: efeito suposto no trecho restante, na escala do z final
function poderCondicional(z, t, drift, zAlpha = 1.959964) {
  const numerador = z * Math.sqrt(t) + drift * (1 - t) - zAlpha;
  return normCdf(numerador / Math.sqrt(1 - t));
}
// drift do efeito PLANEJADO = zAlpha + zBeta = 1,9600 + 0,8416 = 2,8016
// drift da TENDENCIA ATUAL = z / Math.sqrt(t)

Uma adaptação precisa ficar declarada: Zhang e Clarke desenvolvem o método para um teste unilateral, com o percentil de 1 menos alfa no lugar do zAlpha. Aqui o zAlpha é o limiar bicaudal de 1,9600, porque é o limiar de vitória do teste A/B padrão deste blog. A fórmula é a mesma; o que muda é a régua de vitória contra a qual o poder condicional é projetado.

A escolha do drift é a decisão conceitual do método, e ela muda tudo. Supor que o efeito planejado vai aparecer no trecho restante é a suposição otimista, e é a padrão na literatura clínica. Supor que a tendência observada continua é a suposição realista, e produz números bem menores. Zhang e Clarke explicam por que o primeiro caminho demora tanto a acusar futilidade: em tempos iniciais, o poder condicional pondera implicitamente mais os dados futuros supostos sob a alternativa planejada do que os dados já acumulados, então ele cai devagar do valor de desenho até abaixo do limiar.

O teste trabalhado

O desenho: base de conversão de 3 por cento, efeito mínimo detectável de mais 8 por cento relativo, 95 por cento de confiança e 80 por cento de poder. Isso pede 82.376 visitantes por variação, 164.752 no total, o que a 40.000 visitantes por semana dá 29 dias.

Na metade do caminho, com 41.188 visitantes por variação, o placar está em 1.236 conversões no controle (3,0009 por cento) contra 1.248 na variação (3,0300 por cento).

Calculadora de significância estatística
Controle (A)
Variação (B)
Controle (A) · Taxa-
Variação (B) · Taxa-
Melhora relativa-
valor-p-
IC 95% da diferença-

Teste z bilateral de duas proporções. "Sem significância" quase sempre quer dizer que falta amostra, não que as versões são iguais.

Colando esses números na calculadora: z de 0,2445 e valor-p de 0,8069. O poder condicional na metade do caminho fica assim:

A distância entre os dois números é a conversa que a equipe precisa ter. O primeiro pergunta “e se a hipótese estiver certa e a primeira metade tiver sido azar?”. O segundo pergunta “e se o que estamos vendo for a realidade?”. Nenhum dos dois está errado; eles descrevem cenários diferentes, e é por isso que o método pede que o limiar seja escolhido antes, junto da suposição de drift.

Poder condicional ao longo do teste, sob duas suposiçõesGráfico com a fração de informação no eixo horizontal, de zero a um, e o poder condicional no eixo vertical, de zero a um. Duas curvas partem da esquerda. A curva superior, marcada como efeito planejado, começa alta perto de 0,8 e desce de forma suave, passando por cerca de 0,29 na metade do teste e caindo para perto de zero perto do fim. A curva inferior, marcada como tendência observada, desce muito mais rápido: já está perto de 0,05 no primeiro quarto e praticamente encostada no eixo a partir da metade. Uma linha horizontal tracejada marca o limiar de 0,2 de poder condicional, e um ponto destacado na metade do teste mostra o caso trabalhado com poder condicional de 0,2924 sob o efeito planejado.A mesma evidência, duas suposições sobre o que vem pela frentefração da amostra já coletada00,250,500,751,000,00,51,0limiar 0,20caso trabalhado: 0,2924efeito planejado (otimista)tendência observada (realista)
Poder condicional de um teste empatado, calculado sob a suposição do efeito planejado e sob a continuidade da tendência. A escolha da suposição decide o veredito muito antes do limiar.

As tabelas de decisão

Com o desenho fixado (base de 3 por cento, mais 8 por cento relativo, 95 por cento e 80 por cento), o poder condicional depende só de duas coisas: onde o teste está e qual o z do momento. Supondo o efeito planejado no trecho restante:

z na análise interina 25 por cento do caminho metade do caminho 75 por cento do caminho
-1,0 0,3393 0,0367 0,0000
-0,5 0,4500 0,0984 0,0004
0,0 0,5648 0,2145 0,0059
+0,5 0,6743 0,3856 0,0492
+1,0 0,7705 0,5829 0,2156
+1,5 0,8483 0,7609 0,5315

Supondo, em vez disso, que a tendência observada continua:

z na análise interina 25 por cento do caminho metade do caminho 75 por cento do caminho
-1,0 0,0000 0,0000 0,0000
-0,5 0,0003 0,0001 0,0000
0,0 0,0118 0,0028 0,0000
+0,5 0,1338 0,0382 0,0028
+1,0 0,5184 0,2201 0,0536
+1,5 0,8851 0,5903 0,3243

Duas leituras saltam das duas tabelas. Primeira: no primeiro quarto, quase nada é futilidade sob a suposição planejada. Um z de menos 1,0 (variação perdendo) ainda devolve 34 por cento de poder condicional, porque três quartos do experimento ainda estão por vir. É o efeito que Zhang e Clarke descrevem, e é a razão de análises de futilidade muito cedo raramente valerem a pena.

Segunda: a partir de 75 por cento do caminho, o veredito é quase binário. Com z abaixo de 1,0 a essa altura, o poder condicional já está em 21 por cento ou menos mesmo sob a suposição otimista. Só que a essa altura restam 25 por cento do tráfego, então a economia é pequena e o risco de errar continua.

O ponto útil é o do meio do caminho. Invertendo a fórmula, dá para publicar a fronteira diretamente em z, que é o número que a equipe enxerga no painel:

limiar de poder condicional pare se o z for menor que (25 por cento) pare se o z for menor que (metade) pare se o z for menor que (75 por cento)
0,10 -2,5022 -0,4908 +0,7145
0,20 -1,7402 -0,0508 +0,9685
0,30 -1,1907 +0,2664 +1,1517

O caso trabalhado tinha z de 0,2445 na metade do caminho, logo abaixo da fronteira de 0,2664 que corresponde a um limiar de 30 por cento, e bem acima da fronteira de menos 0,4908 que corresponde ao limiar conservador de 10 por cento. Ou seja: com a regra frouxa o teste morre, com a regra conservadora ele continua. A regra precisa estar escolhida antes, e não depois de ver esse número.

O preço da parada, em poder

A futilidade não sai de graça, e o preço é conhecido. Zhang e Clarke citam o resultado de Lan, Simon e Halperin: com monitoramento contínuo e regra de parada quando o poder condicional fica abaixo de gama, o erro tipo II total fica limitado por beta dividido por 1 menos gama.

limiar gama erro tipo II máximo (partindo de 20 por cento) poder final mínimo inflação relativa do erro tipo II
0,10 22,22 por cento 77,78 por cento 11,11 por cento
0,20 25,00 por cento 75,00 por cento 25,00 por cento
0,30 28,57 por cento 71,43 por cento 42,86 por cento
0,50 40,00 por cento 60,00 por cento 100,00 por cento

É por isso que a literatura chama o limiar de 0,1 de conservador: ele custa no máximo 11,11 por cento de inflação no erro tipo II, o que na prática é quase nada, mas em troca quase nunca dispara. Subir para 0,3 dobra a agressividade e cobra 42,86 por cento de inflação. Zhang e Clarke recomendam manter gama abaixo de 0,5 e citam evidência numérica de que fronteiras agressivas fazem os dois erros, tipo I e tipo II, se afastarem substancialmente dos níveis nominais.

O que a parada devolve

O outro lado da conta é o que a equipe ganha. No desenho trabalhado, o teste inteiro consome 164.752 visitantes e 29 dias:

momento da parada tráfego já gasto tráfego devolvido dias devolvidos
25 por cento do caminho 41.188 123.564 21
metade do caminho 82.376 82.376 14
75 por cento do caminho 123.564 41.188 7

Duas semanas de tráfego devolvidas equivalem a metade de outro experimento completo no mesmo fluxo. Num programa que roda um teste por vez, isso é o teto de velocidade se mexendo: não é economia de custo, é uma hipótese a mais testada por trimestre.

A evidência recomenda cautela

Aqui entra o contraponto honesto, e ele vem de dados, não de opinião. Jitlal, Khan, Lee e Hackshaw reanalisaram retrospectivamente dez estudos randomizados de câncer que atingiram o tamanho de amostra planejado, aplicando análises de futilidade em 25, 50 e 75 por cento dos eventos observados. O resultado tem os dois lados.

Do lado favorável: depois de 50 por cento do número alvo de eventos, três dos cinco estudos sem benefício poderiam ter parado cedo, com poder condicional de 15 por cento ou menos. Em dois deles a duração cairia entre 4 e 24 meses, com economia entre 44 mil e 231 mil libras (o terceiro já tinha encerrado o recrutamento, então não haveria economia).

Do lado desfavorável, e é o que importa mais: dois dos quatro estudos com efeito de tratamento moderado também poderiam ter sido parados em algum momento, embora tenham terminado mostrando benefício real. A conclusão dos autores é a que deve orientar a política do programa: a futilidade deve ser usada com mais frequência, porque evita expor participantes futuros a um tratamento ineficaz, mas, sem evidência muito boa de futilidade, costuma ser melhor continuar até o fim planejado.

A tradução para experimentação de produto é direta. O custo de errar aqui não é ético, é de portfólio: matar cedo um teste que ia vencer significa arquivar uma hipótese boa com o carimbo de testada, e ela dificilmente volta à fila.

Regra obrigatória contra regra diretriz

A FDA separa dois tipos de regra de futilidade, e a distinção importa também fora do contexto clínico:

Para um programa de experimentação de produto, a regra diretriz é quase sempre a escolha certa: ela dá à equipe o direito de continuar quando o contexto justifica (um feriado atípico no meio do teste, uma campanha que mudou o mix de tráfego), sem custo estatístico. O que ela exige é honestidade sobre o critério ter sido escrito antes.

Vale registrar a ordem de grandeza do ganho que a análise interina traz, também segundo a FDA: um desenho sequencial com uma única análise interina e uma fronteira de parada por eficácia comumente usada reduz o tamanho de amostra esperado em cerca de 15 por cento em relação a um estudo de amostra fixa comparável. É um ganho real e modesto, não uma revolução, e serve de referência para calibrar expectativa.

Como colocar isso no plano

Quatro linhas no plano de análise pré-registrado resolvem:

  1. Quantas análises interinas e quando, em fração de informação (por exemplo, uma única na metade). Fixar por fração, não por data, evita que o calendário decida a estatística.
  2. A suposição de drift: efeito planejado ou tendência observada. Publicar as duas no relatório e decidir por uma.
  3. O limiar gama e a inflação de erro tipo II que ele implica, escrita em número.
  4. Se a regra é diretriz ou obrigatória e quem tem autoridade para não segui-la.

Uma observação sobre disciplina: análise interina de futilidade não é licença para olhar o valor-p todo dia. A fronteira de futilidade é sobre poder condicional, é unidirecional e está declarada previamente. Ficar espiando o resultado à procura de vitória continua sendo peeking, com o custo de falso positivo de sempre.

Erros comuns

Faça isso automático na Donnu

A decisão de desligar um teste que não vai concluir costuma ser tomada tarde, e por cansaço, porque o painel só mostra o valor-p do momento e o valor-p não responde a pergunta “vale continuar?”.

Na Donnu, todo experimento nasce com a amostra planejada e a fração de informação visível no painel, então a análise interina acontece no ponto combinado em vez de acontecer quando alguém lembra, e o relatório mostra a distância que falta em vez de só o veredito atual. Para refazer as contas na mão, a calculadora de significância devolve o z de qualquer corte interino, a calculadora de duração converte a amostra que falta em dias de calendário e a calculadora de quantos testes por mês mostra o que o tráfego devolvido compra em hipóteses testadas.

Referências

Leia também: Teste sequencial explicado · O problema do peeking · Teste de equivalência · Plano de análise pré-registrado · Calculadora de duração · Read in English

Perguntas frequentes

O que é parada por futilidade num teste A/B?
É desligar o teste antes do fim quando a chance de ele terminar com significância virou pequena demais para justificar o tráfego restante. A decisão é diferente de parar por vitória: aqui ninguém declara vencedor, apenas se aceita que a pergunta não vai ser respondida com o desenho atual. A conta que sustenta a decisão chama-se poder condicional.
O que é poder condicional?
É a probabilidade de o teste terminar rejeitando a hipótese nula, dado o que já foi observado até o momento da análise interina e uma suposição sobre o efeito no trecho restante. Zhang e Clarke definem exatamente assim e registram que a quantidade complementar, 1 menos o poder condicional, é chamada de índice de futilidade desde Ware, Muller e Braunwald. A conta usa o B-value do movimento browniano, formalizado por Lan e Wittes.
Qual limiar de poder condicional usar para parar?
A escolha é subjetiva e tem um preço declarado. Segundo Zhang e Clarke, a prática comum entre investigadores é parar quando o poder condicional calculado no efeito originalmente planejado cai abaixo de 0,1, e essa regra é conservadora: dificilmente recomenda parada. Lan, Simon e Halperin mostraram que, com monitoramento contínuo e limiar gama, o erro tipo II fica limitado por beta dividido por 1 menos gama, o que com gama de 0,1 significa inflação de no máximo 11,11 por cento.
Parar por futilidade estraga a estatística do teste?
Não, se a regra for do tipo não obrigatória. A FDA registra que acrescentar regras de futilidade não obrigatórias a um estudo de amostra fixa, ou a um estudo com fronteiras sequenciais adequadas para eficácia, não aumenta a probabilidade de erro tipo I e é frequentemente apropriado. O que a futilidade custa é poder, não taxa de falso positivo: a chance de perder um efeito verdadeiro sobe, e essa é a conta que precisa estar declarada antes.
Qual a diferença entre regra obrigatória e não obrigatória?
A não obrigatória é uma diretriz: pode ou não ser seguida conforme o conjunto dos resultados interinos. A obrigatória exige que o estudo pare sempre que o critério for atingido. Segundo a FDA, regras obrigatórias trazem alguma vantagem na análise de eficácia, mas o controle do erro tipo I só vale se elas forem seguidas, e um estudo que continua depois de cruzar uma fronteira obrigatória tende a ser considerado sem evidência de eficácia, independentemente do resultado final.
Parar por futilidade pode matar um teste que ia vencer?
Pode, e existe evidência empírica disso. Jitlal, Khan, Lee e Hackshaw reanalisaram dez estudos randomizados de câncer e encontraram os dois lados: metade dos estudos sem benefício poderia ter parado cedo com poder condicional baixo, economizando meses e dezenas de milhares de libras, mas dois dos quatro estudos com efeito moderado também teriam sido interrompidos em algum ponto, apesar de terem terminado mostrando benefício. A conclusão dos autores é direta: sem evidência muito boa de futilidade, costuma ser melhor ir até o fim planejado.