Filtrar por tipo de entrada
Filtrar por categorías
Modelos de lenguaje como jueces de IA clínica coinciden con médicos en fidelidad y exhaustividad, pero no en razonamiento ni seguridad  

Un estudio, comparó las calificaciones de cinco pediatras con las de siete modelos de lenguaje al evaluar respuestas de un sistema de apoyo a la decisión.

Investigadores internacionales evaluaron qué tanto coinciden los modelos de lenguaje con los médicos cuando se les pide calificar las respuestas de una inteligencia artificial clínica. El trabajo, publicado en npj Digital Medicine, analizó el enfoque conocido como LLM-as-a-Judge, en el que un modelo de lenguaje revisa las respuestas de otro sistema con base en criterios predefinidos, como alternativa a la revisión manual de expertos, que consume muchos recursos y no puede aplicarse de forma continua.

El sistema evaluado fue PANDA, un asistente basado en generación aumentada por recuperación que responde consultas de residentes de pediatría a partir de más de 500 protocolos clínicos del hospital. Dos residentes senior y pediatras certificados redactaron 118 preguntas clínicas con una respuesta de referencia cada una, principalmente sobre protocolos de urgencias y de cuidados neonatales. Cinco pediatras y siete modelos, entre ellos GPT-4o, GPT-5, Gemini 3 Flash y Claude Sonnet 4.5, calificaron todas las respuestas en siete criterios: fidelidad, seguridad, aplicabilidad, razonamiento, concisión, exhaustividad y puntuación total. En conjunto se generaron 4130 calificaciones de médicos, 17,346 calificaciones ordinales de los modelos y 8496 evaluaciones binarias de aprobado o reprobado.

Los resultados muestran que la coincidencia entre modelos y médicos depende del criterio evaluado. En fidelidad y exhaustividad, que consisten en comparar el texto con el contexto y la respuesta de referencia, el acuerdo fue alto, con coeficientes que en fidelidad superaron con frecuencia 0.8. En cambio, el acuerdo fue menor en las dimensiones interpretativas, con una mediana de 0.48 en razonamiento y de -0.51 en concisión. En este último criterio, 66.1% de las medianas del panel de médicos fue de 5, mientras que las de los modelos se concentraron en 1 o 2. Los autores atribuyen esta brecha a que los modelos siguieron las instrucciones de forma estricta y los médicos las aplicaron con más flexibilidad, lo que podría corregirse aclarando la redacción del criterio.

El estudio también probó estrategias para mejorar el alineamiento, como que repetir tres veces la evaluación de un mismo modelo produjo cambios menores a 0.07 unidades en 44 de 49 comparaciones, y los paneles de varios modelos no superaron al mejor modelo individual, que fue Gemini 3 Flash. Los investigadores concluyen que la elección del modelo juez pesa más que la estrategia de agregación.

Entre las limitaciones, los autores señalan que los datos provienen de un solo hospital pediátrico y de un periodo de noviembre de 2025 a enero de 2026, que las medianas de los médicos son un estándar de referencia imperfecto y que uno de los evaluadores participó en la definición de dos de los criterios. Recomiendan que los equipos que desarrollan IA generativa médica utilicen modelos jueces solo en criterios ya validados, incorporen juicios binarios para detectar desajustes y sigan verificando las evaluaciones a medida que cambian los modelos y los protocolos.

Contenidos Relacionados

Secured By miniOrange