Todo estudo de acurácia diagnóstica se resume, no fim, a uma tabela 2×2: o resultado do
teste índice cruzado com a classificação pelo padrão de referência. Desta tabela saem as medidas
que o STARD 2015 pede que sejam relatadas com seus intervalos de
confiança — sensibilidade, especificidade, valores preditivos, razões de verossimilhança. Esta
calculadora faz as contas com métodos adequados (intervalo de Wilson para proporções, método
logarítmico para razões) e devolve tanto a tabela quanto o parágrafo pronto para a seção de resultados.
Um limite importante, dito com todas as letras: a ferramenta trata de um estudo, uma tabela.
A síntese de vários estudos em uma revisão sistemática — o cenário do
PRISMA-DTA (McInnes et al., JAMA, 2018, doi:10.1001/jama.2017.19163; explicação e
elaboração em Salameh et al., BMJ, 2020, doi:10.1136/bmj.m2632) — exige modelos
bivariados ou HSROC em software estatístico dedicado, e esta calculadora não substitui isso.
É gratuita, não pede cadastro e não armazena o que você preenche: as contagens ficam no seu
próprio navegador.
Perguntas frequentes
Como usar esta ferramenta
Preencha as quatro células da tabela 2×2 com as contagens do seu estudo:
verdadeiro-positivos (a), falso-positivos (b), falso-negativos (c) e verdadeiro-negativos (d).
Todas as medidas aparecem à direita com os respectivos intervalos de confiança de 95%.
Ajuste, se quiser, a probabilidade pré-teste para ver a probabilidade pós-teste em outros
cenários de prevalência. Ao final, copie a tabela de medidas ou o parágrafo pronto para a
seção de resultados do artigo.
O que significam sensibilidade e especificidade?
Sensibilidade é a proporção de doentes que o teste índice identifica corretamente
como positivos; especificidade é a proporção de não doentes corretamente identificados como
negativos. As duas descrevem o comportamento do teste dentro de cada grupo definido pelo
padrão de referência e, por isso, em tese não mudam com a prevalência — embora na prática
possam variar entre populações com espectros clínicos diferentes.
Por que VPP e VPN dependem da prevalência?
Os valores preditivos respondem à pergunta clínica direta — dado um resultado
positivo (ou negativo), qual a probabilidade de doença? — e essa resposta depende de quantos
doentes existem na população testada. O mesmo teste tem VPP alto onde a doença é comum e VPP
baixo onde ela é rara. Os VPP e VPN desta calculadora valem para a prevalência observada na
amostra; para transportar o resultado a outra população, use as razões de verossimilhança e
a probabilidade pós-teste.
Para que servem as razões de verossimilhança?
A razão de verossimilhança positiva (LR+) diz quantas vezes um resultado positivo
é mais provável em quem tem a doença do que em quem não tem; a negativa (LR−), o análogo para
o resultado negativo. Elas combinam sensibilidade e especificidade em um único número que não
depende da prevalência e permitem converter qualquer probabilidade pré-teste em probabilidade
pós-teste, multiplicando as odds pré-teste pela razão correspondente. Como regra prática,
LR+ acima de 10 e LR− abaixo de 0,1 produzem mudanças grandes na probabilidade.
Como os intervalos de confiança são calculados?
Para as proporções (sensibilidade, especificidade, VPP, VPN, acurácia e
prevalência), usa-se o intervalo de escore de Wilson (1927), que se comporta bem com amostras
pequenas e proporções próximas de 0% ou 100%, ao contrário do intervalo de Wald tradicional.
Para as razões de verossimilhança usa-se o método logarítmico de Simel, Samsa e Matchar
(1991), e para a odds ratio diagnóstica, o método logarítmico clássico descrito em Altman,
Statistics with Confidence (2000). Quando alguma célula da tabela é zero, soma-se 0,5
a todas as células no cálculo das razões — a correção é avisada na interface. O intervalo do
índice de Youden é aproximado, combinando as variâncias de sensibilidade e especificidade.
Posso usar esta calculadora em uma revisão sistemática (PRISMA-DTA)?
Apenas em parte. Ela é útil para recalcular e conferir as medidas de cada estudo
primário incluído na revisão, a partir das tabelas 2×2 extraídas. A síntese quantitativa,
porém, é outra coisa: a meta-análise de acurácia diagnóstica exige modelos hierárquicos que
tratam sensibilidade e especificidade em conjunto — o modelo bivariado ou o HSROC —,
disponíveis em softwares estatísticos dedicados (R, Stata, SAS). Esta ferramenta não
substitui esses modelos nem faz meta-análise: somar as tabelas 2×2 de vários estudos como se
fossem um só é um erro metodológico conhecido.
Qual a relação com o STARD?
O STARD 2015 é a diretriz de relato para estudos primários de acurácia
diagnóstica: ele pede exatamente a tabulação cruzada dos resultados do teste índice contra o
padrão de referência (a tabela 2×2 desta calculadora) e as estimativas de acurácia com seus
intervalos de confiança. Para revisões sistemáticas de acurácia, a diretriz correspondente é
o PRISMA-DTA. Use o checklist STARD e o
diagrama de fluxo STARD, também disponíveis nas
nossas ferramentas.
Meus dados ficam salvos em algum servidor?
Não. Todo o cálculo acontece no seu navegador e não há banco de dados nem serviço
nosso recebendo o que você digita. As contagens ficam apenas na memória local do navegador,
para que a tabela reapareça quando você voltar, e somem quando você usa o botão Limpar.
A página usa medição de audiência e anúncios do Google, como o restante do site.