$GOOGLB
La IA de uso general supera las herramientas clínicas especializadas: estudio de Nature revela una sorpresa en la IA médica

En el campo de la medicina, la “IA a medida” no necesariamente gana a la “IA de propósito general”. Un estudio publicado en Nature Medicine descubrió que tres modelos de lenguaje grandes (LLM) de uso general y de vanguardia superaron por completo a dos herramientas de IA clínica especializadas y dominantes en varios puntos de referencia médicos y en preguntas reales planteadas por médicos; y el rendimiento de estas últimas incluso solo fue comparable al de los resúmenes de la IA de Google. En la comparación, los tres modelos generales se enfrentaron a dos herramientas clínicas: OpenEvidence y UpToDate Expert AI. La evaluación se dividió en tres rondas: la primera fue MedQA con 500 preguntas, para medir conocimientos médicos; la segunda fue HealthBench con 500 ítems, para evaluar la consistencia con médicos clínicos; y la tercera fue la base RCQ de “preguntas clínicas reales”, tomada de 100 preguntas desidentificadas que los médicos plantean en entornos clínicos reales a los modelos de uso general. Luego, 12 médicos clínicos de Estados Unidos realizaron calificaciones aleatorias y a ciegas, lo que arrojó un total de 1.800 anotaciones. Los modelos de propósito general ganaron las tres rondas. El resultado más alto, MedQA, alcanzó un 97,4%, lo que demuestra que los modelos de uso general superaron globalmente a los de uso especializado. Por ejemplo, en MedQA, la precisión más alta fue la de Gemini, con un 97,4%; GPT obtuvo 94,2% y Claude 90,2%. En comparación, OpenEvidence obtuvo 89,6% y UpToDate 88,4%. Lo más importante es que, en la RCQ, la más cercana a la práctica, el rendimiento de estas dos herramientas clínicas solo fue comparable al de la IA de Google al activar los resúmenes automáticos.

Una señal de alerta para la “muralla” de la IA médica vertical
Este resultado desafía una suposición común: que en un ámbito tan altamente especializado como la medicina, la IA confiable debe ser “diseñada especialmente e impregnada con datos profesionales”. El estudio muestra que cuando los modelos generales de vanguardia ya son lo suficientemente potentes, si las herramientas especializadas no aportan un valor claramente adicional, su “ventaja competitiva” queda en entredicho. También pone de manifiesto una brecha regulatoria: algunas herramientas de IA clínica ya han obtenido certificación de la FDA de Estados Unidos, pero en las pruebas no superaron a modelos generales que no fueron ajustados especialmente para la medicina, lo que evidencia que los criterios de verificación actuales quizá no estén al ritmo del avance de los modelos. Hay que recordar que este es un estudio centrado principalmente en evaluaciones por estándares y calificaciones a ciegas, y no significa que los modelos generales puedan “usarse directamente para atender pacientes”. La responsabilidad, el cumplimiento normativo y la seguridad en el entorno clínico siguen necesitando validaciones clínicas más rigurosas. Pero al menos en el aspecto de “responder preguntas médicas”, la IA de propósito general ya alcanzó e incluso superó a las herramientas especializadas.

Este artículo, La IA de uso general supera las herramientas clínicas especializadas: el estudio de Nature revela una sorpresa en la IA médica, apareció por primera vez en .