IA diagnóstica: qué significa realmente el 52.1% de precisión
Un metaanálisis de 83 estudios encontró 52.1% de precisión diagnóstica con IA generativa. Te explicamos sus límites y por qué el experto sigue siendo indispensable.
SaludTotal
Digitaliza tu consultorio con agenda, expediente y facturación
Conoce cómo SaludTotal ayuda a clínicas y consultorios a operar con más orden y menos trabajo manual.
Una herramienta de inteligencia artificial puede redactar una respuesta diagnóstica convincente en segundos. Eso no significa que pueda sustituir a un médico experto. Un metaanálisis publicado en npj Digital Medicine reunió 83 estudios y encontró una precisión diagnóstica global de 52.1% para modelos generativos.
El número es llamativo, pero aislado dice poco. Para interpretarlo hay que revisar el intervalo de confianza, contra quién se comparó la IA, qué tipo de pruebas resolvió y qué tan parecidas eran esas pruebas a una consulta clínica real.
Qué midió el metaanálisis
Los autores revisaron estudios publicados entre junio de 2018 y junio de 2024 que evaluaron modelos generativos en tareas diagnósticas. La precisión agrupada fue de 52.1%, con un intervalo de confianza de 95% entre 47.0% y 57.1%.
No se encontró una diferencia estadísticamente significativa entre los modelos y los médicos considerados en conjunto, ni frente a médicos no expertos. Sin embargo, cuando la comparación se hizo con médicos expertos, la IA quedó significativamente por debajo: los expertos tuvieron una ventaja de 15.8 puntos porcentuales (IC 95%: 4.4–27.1; p=0.007).
Fuente primaria: A systematic review and meta-analysis of diagnostic performance of generative AI in healthcare, npj Digital Medicine.
Por qué “sin diferencia significativa” no significa “son iguales”
Una prueba estadística que no detecta diferencia no demuestra equivalencia. El resultado también depende del tamaño de las muestras, la variabilidad entre estudios y la precisión de cada comparación.
Además, “médicos en conjunto” mezcla niveles de experiencia. Un profesional que empieza su formación, un médico general y un especialista con años de práctica no resuelven la misma tarea desde el mismo contexto. El contraste más útil del metaanálisis es que la experiencia especializada todavía produjo una ventaja clara.
Tres límites que cambian cómo leer el 52.1%
1. No todos los modelos ni tareas eran iguales
Los estudios evaluaron diferentes modelos, especialidades, formatos de pregunta y criterios de calificación. Agruparlos ofrece una vista general, pero no garantiza que el porcentaje describa una herramienta específica en una población concreta.
2. Muchos estudios tuvieron alto riesgo de sesgo
La evaluación de calidad encontró que la mayoría de los estudios tenía alto riesgo de sesgo. También se detectó una señal de posible sesgo de publicación. Esto obliga a evitar titulares como “la IA ya diagnostica como un médico” o “la IA falla la mitad de las veces” sin explicar el diseño.
3. Un benchmark no es una consulta
Buena parte de la evidencia proviene de viñetas clínicas, preguntas de examen o conjuntos de casos. En la práctica, el diagnóstico exige obtener una historia completa, reconocer datos ausentes, explorar al paciente, interpretar pruebas, estimar probabilidades y decidir cuándo pedir ayuda.
Un modelo responde a la información que recibe. El médico también detecta qué falta, qué dato no concuerda y qué cambio clínico obliga a abandonar una hipótesis.

Lo que el experto aporta y el modelo no puede asumir
El criterio experto no consiste sólo en recordar diagnósticos. Integra:
- historia clínica y evolución temporal;
- exploración física y lenguaje no verbal;
- prevalencia local, edad, medicamentos y comorbilidades;
- calidad y oportunidad de laboratorios o imágenes;
- consecuencias de equivocarse y necesidad de seguimiento;
- comunicación de incertidumbre con el paciente.
La respuesta correcta en una viñeta puede ser insuficiente si no identifica una urgencia, una interacción o una limitación del dato. Por eso la supervisión no debe ser un paso decorativo al final: forma parte de todo el proceso.
Dónde sí puede aportar la IA
El hallazgo no vuelve inútil a la IA. Puede ayudar a organizar información, sugerir posibilidades para revisión, resumir evidencia o apoyar educación. La condición es definir el propósito, validar el desempeño para el entorno real y mantener una ruta clara de responsabilidad humana.
La pregunta útil no es “¿la IA diagnostica?”, sino:
- ¿Qué tarea específica resuelve?
- ¿Con qué población y datos fue evaluada?
- ¿Contra qué comparador se midió?
- ¿Qué errores son más probables y qué daño podrían causar?
- ¿Quién revisa, corrige y responde por la decisión?
Cómo se relaciona con SaludTotal
SaludTotal no se presenta como una herramienta que sustituye el diagnóstico médico. La plataforma ayuda a mantener información clínica estructurada y disponible para revisión. La tecnología puede apoyar la captura y organización; el médico valida la información y conserva el criterio clínico.
La regla editorial y de producto es directa: la IA apoya la captura y el trabajo documental; el profesional diagnostica y decide.
Guarda esta regla antes de implementar IA médica
Un porcentaje de precisión nunca debe viajar solo. Acompáñalo con población, tarea, comparador, intervalo de confianza, riesgo de sesgo y condiciones de uso. Si una herramienta no puede explicar esos elementos, todavía no ofrece la evidencia necesaria para delegarle una decisión clínica.
Conoce cómo SaludTotal organiza el contexto clínico en saludtotal.mx.
Recursos para avanzar
Demo SaludTotal
Digitaliza tu consultorio con agenda, expediente y facturación
Conoce cómo SaludTotal ayuda a clínicas y consultorios a operar con más orden y menos trabajo manual.
Comenzar ahora