Medicina general
Calculadora de estadística bayesiana II: tabla 2×2 de una prueba diagnóstica
Esta calculadora toma los cuatro recuentos de una tabla 2×2 —verdaderos positivos, falsos positivos, verdaderos negativos y falsos negativos— y devuelve el perfil completo de rendimiento de una prueba diagnóstica: sensibilidad = VP/(VP+FN), especificidad = VN/(VN+FP), valor predictivo positivo = VP/(VP+FP), valor predictivo negativo = VN/(VN+FN), razón de verosimilitud positiva = sensibilidad/(1−especificidad) y negativa = (1−sensibilidad)/especificidad, tal como las define StatPearls y las imprime la guía metodológica de la AHRQ para revisiones de pruebas médicas. Sobre esas cifras arma la cadena de Bayes que el CEBM de Oxford describe: convierte la prevalencia en odds preprueba, la multiplica por cada razón de verosimilitud y devuelve la probabilidad posprueba con odds/(1+odds). Sirve para responder la pregunta que de verdad importa junto a la cama del paciente: si esta prueba salió positiva (o negativa), ¿cuánto cambió realmente la probabilidad de enfermedad? El resultado se entrega sin semáforo de riesgo, porque lo que hace «suficiente» a una sensibilidad o a un LR+ depende de la enfermedad y del costo de equivocarse en cada dirección, no de un umbral universal.
Calculadora de estadística bayesiana II: tabla 2×2 de una prueba diagnóstica
Fecha: ________________ · Paciente: ______________________________
Calculadora
Completa todos los campos para ver el resultado.
Herramienta de referencia para profesionales de la salud, con fines educativos. No sustituye el juicio clínico ni establece un diagnóstico o un tratamiento: la decisión sobre un paciente concreto es del médico que lo atiende.
¿Te pareció útil esta herramienta?
Límites de esta herramienta
- El VPP, el VPN, la exactitud global y toda la cadena bayesiana se calculan con la prevalencia de la muestra que escribiste. MedCalc lo advierte de forma explícita: esos valores dependen de la prevalencia de la enfermedad. Si tus datos vienen de un diseño de casos y controles, de una serie enriquecida o de un centro de referencia, la prevalencia de la muestra no es la de tu consulta y esos cuatro resultados no se trasladan sin rehacerlos con la probabilidad preprueba real.
- Todas estas medidas se definen contra un patrón de referencia. Las columnas «con enfermedad» y «sin enfermedad» de la tabla 2×2 salen de ese patrón, así que si el patrón de oro es imperfecto o se aplicó solo a una parte de los evaluados, el error se propaga a las nueve cifras por igual. La calculadora no puede detectarlo: solo ve los cuatro números.
- La tabla 2×2 obliga a que la prueba sea dicotómica. Si tu prueba entrega un valor continuo, cada punto de corte genera una tabla distinta y un par sensibilidad/especificidad distinto; esta herramienta describe UN corte, no la curva ROC completa.
- Son estimadores puntuales, sin intervalos de confianza. Una casilla con pocos casos produce porcentajes muy inestables y la herramienta no lo señala con un número: revisa los recuentos crudos antes de citar una cifra.
- Si una casilla queda en cero, alguna razón de verosimilitud se vuelve indefinida —el cociente divide entre cero— y con ella el odds y la probabilidad posprueba correspondientes. La calculadora los marca como «no estimable» en vez de imprimir un infinito: que no haya habido ningún falso positivo en la muestra no significa que la prueba nunca los produzca.
- No se entregan bandas de interpretación. Ninguna de las fuentes consultadas publica un umbral universal de sensibilidad, especificidad o razón de verosimilitud: lo que basta para descartar una faringitis no basta para descartar una disección aórtica. La interpretación se explica en prosa y se deja al criterio clínico.
- La calculadora describe el rendimiento de la prueba, no su utilidad. Una prueba puede tener un LR+ excelente y aun así no cambiar ninguna decisión, si la probabilidad posprueba se queda del mismo lado del umbral en el que se trata o no se trata.
Fuentes. Shreffler J, Huecker MR. Diagnostic Testing Accuracy: Sensitivity, Specificity, Predictive Values and Likelihood Ratios. En: StatPearls. Treasure Island (FL): StatPearls Publishing; 2026. Actualizado el 6 de marzo de 2023. Fuente de las definiciones de sensibilidad, especificidad, VPP, VPN, LR+ y LR− sobre la tabla 2×2. (enlace) · Chang SM, Matchar DB, Smetana GW, Umscheid CA, eds. Methods Guide for Medical Test Reviews. Rockville (MD): Agency for Healthcare Research and Quality (AHRQ); 2012. Tabla del apéndice «2×2 table used in the calculation of test performance measures», que imprime sensibilidad, especificidad, VPP, VPN, LR+, LR− y la razón de odds diagnóstica. (enlace) · Centre for Evidence-Based Medicine, University of Oxford. Likelihood Ratios. Fuente de la cadena bayesiana: odds preprueba = probabilidad/(1−probabilidad), odds posprueba = odds preprueba × LR, probabilidad posprueba = odds posprueba/(odds posprueba+1), y del ejemplo trabajado con sensibilidad 90 % y especificidad 85 %. (enlace) · MedCalc Software. Diagnostic test evaluation calculator — manual de referencia estadística. Fuente de la dependencia del VPP, el VPN y la exactitud respecto de la prevalencia, y de la forma exactitud = sensibilidad × prevalencia + especificidad × (1 − prevalencia). (enlace) · MSD Manuals. Multicalculadora de estadística bayesiana II. Consultada únicamente como referencia de qué medidas reúne la herramienta y en qué orden; las ecuaciones se verificaron contra las fuentes anteriores y la redacción de esta ficha es propia. (enlace) · Contenido revisado el 18 de julio de 2026.
Preguntas frecuentes
Se leen en direcciones opuestas de la tabla. La sensibilidad se lee por columnas: entre las personas que SÍ tienen la enfermedad, qué proporción da positivo, VP/(VP+FN). El valor predictivo positivo se lee por filas: entre las personas que dieron POSITIVO, qué proporción realmente tiene la enfermedad, VP/(VP+FP). La distinción es práctica, no académica: la sensibilidad es una propiedad de la prueba y no cambia con la prevalencia, mientras que el VPP sí cambia, y mucho. Una prueba con 99 % de sensibilidad y 99 % de especificidad aplicada a una enfermedad muy rara devuelve un VPP bajísimo, porque casi todos los positivos son falsos positivos de una población enorme de sanos. Cuando un paciente pregunta «¿qué tan probable es que yo la tenga?», la respuesta es el VPP o la probabilidad posprueba, no la sensibilidad.
En los tres pasos que describe el Centre for Evidence-Based Medicine de Oxford. Primero se convierte la probabilidad preprueba en odds: odds preprueba = probabilidad / (1 − probabilidad). Segundo, se multiplica por la razón de verosimilitud del resultado obtenido: odds posprueba = odds preprueba × LR. Tercero, se vuelve a probabilidad: probabilidad posprueba = odds posprueba / (odds posprueba + 1). El ejemplo del propio CEBM lo resume: una prueba con 90 % de sensibilidad y 85 % de especificidad tiene un LR+ de 90/15 = 6; en un paciente con probabilidad preprueba del 50 % (odds 1:1), el positivo lleva los odds a 6 y la probabilidad a 6/7, alrededor del 86 %. Esta calculadora hace ese mismo recorrido tomando la prevalencia de tu tabla como probabilidad preprueba.
No, es su complemento, y confundirlos invierte la lectura. La probabilidad posprueba con resultado negativo es la probabilidad de que la enfermedad SIGA presente a pesar de que la prueba salió negativa: es el resultado de actualizar los odds preprueba con el LR− en lugar del LR+. El valor predictivo negativo es lo contrario, la probabilidad de estar realmente sano tras un negativo. Las dos suman 1: si el VPN es 94,4 %, la probabilidad posprueba tras un negativo es 5,6 %. La calculadora muestra las dos a propósito, porque la cadena de Bayes produce naturalmente la primera y la práctica clínica suele citar la segunda, y verlas juntas evita el error de leer un 5,6 % como si fuera un mal resultado.
Porque no dependen de la prevalencia. El LR+ = sensibilidad/(1−especificidad) y el LR− = (1−sensibilidad)/especificidad se construyen solo con propiedades de la prueba, así que el valor publicado en un estudio hecho en otro país, con otra proporción de enfermos, sigue siendo válido para tu paciente. El VPP y el VPN de ese mismo artículo, en cambio, solo valen para la prevalencia de esa muestra. La forma correcta de usar un artículo es entonces: tomar sus razones de verosimilitud, estimar la probabilidad preprueba de tu paciente con tu propia epidemiología y tu examen clínico, y hacer la actualización bayesiana tú mismo. El CEBM señala como orientación que, con una probabilidad preprueba entre 30 % y 70 %, un LR por encima de 10 permite confirmar la enfermedad y un LR por debajo de 0,1 prácticamente la descarta; fuera de ese rango de probabilidad preprueba la misma razón de verosimilitud concluye menos.
Porque mezcla los aciertos en enfermos y en sanos ponderándolos por la prevalencia, y en enfermedades poco frecuentes ese promedio queda dominado por los sanos. La exactitud global es (VP+VN)/total, que es lo mismo que sensibilidad × prevalencia + especificidad × (1 − prevalencia), la forma en que la escribe MedCalc. Si en tu muestra solo el 1 % tiene la enfermedad, una prueba que siempre dijera «negativo» acertaría el 99 % de las veces y tendría una exactitud del 99 %, con una sensibilidad de cero. Por eso la calculadora la reporta pero no la usa como cifra principal: sensibilidad y especificidad por separado, y las razones de verosimilitud, describen mucho mejor lo que hace la prueba.
Porque ninguna de las fuentes consultadas —StatPearls, la guía metodológica de la AHRQ para revisiones de pruebas médicas, el CEBM de Oxford— publica un umbral universal para estas medidas, y fabricar uno daría una precisión falsa. Lo que hace «suficiente» a una sensibilidad depende de la enfermedad y del costo de pasarla por alto: para descartar una embolia pulmonar se exige un valor que sería exagerado para una faringitis. Lo mismo con las razones de verosimilitud, cuya capacidad de confirmar o descartar cambia con la probabilidad preprueba del paciente concreto. La herramienta entrega las cifras y explica cómo se leen; la decisión de si la prueba alcanza para tu escenario es clínica, no aritmética.
Depende de cuál. Si no hubo ningún falso positivo, la especificidad es del 100 % y el LR+ divide entre cero: la calculadora lo marca como «no estimable» en lugar de imprimir un infinito, porque cero falsos positivos en tu muestra no demuestra que la prueba nunca los produzca, solo que no aparecieron con ese tamaño de muestra. Lo mismo ocurre con el LR− si no hubo verdaderos negativos. Las demás medidas que se leen directo de la tabla se siguen mostrando: con cero falsos positivos, por ejemplo, el VPP es del 100 % y esa cifra sí es correcta. Si la tabla no tiene ningún enfermo o ningún sano, la calculadora no devuelve ningún número y avisa qué revisar, porque esa tabla no puede describir el rendimiento de una prueba.
Calculadoras relacionadas
Menos cuentas, más consulta.
Cliini escucha tu consulta y entrega la nota estructurada con códigos sugeridos, récipe e indicaciones — lista para tu historia clínica.