MultiMed-RAG, un marco con agentes especializados que consultan bases de conocimiento estructurado, literatura médica, sitios web clínicos y la memoria interna de los modelos de lenguaje, mostró mejoras de hasta 7% frente a sistemas de generación directa en nueve pruebas médicas estandarizadas.
Un equipo de investigadores de la Universidad de Pekín, el Instituto de Tecnología de Georgia y el Centro Médico de la Universidad de Texas Southwestern desarrolló MultiMed-RAG, un sistema de inteligencia artificial diseñado para apoyar tareas de decisión clínica mediante la integración de múltiples fuentes de conocimiento médico. El trabajo fue publicado en npj Digital Medicine.
El sistema utiliza una arquitectura de múltiples agentes de inteligencia artificial que trabajan de forma coordinada. Un agente planificador clasifica cada consulta médica según su complejidad y, cuando el caso lo requiere, un segundo agente la divide en preguntas más simples. Posteriormente, un agente recuperador selecciona dos de ocho fuentes de conocimiento disponibles, que incluyen grafos de conocimiento como LMKG, HKG y PrimeKG, bases de datos textuales sobre síntomas y medicamentos, los sitios Wikipedia y Mayo Clinic, y el conocimiento interno del propio modelo de lenguaje. Un agente verificador filtra la información recuperada para descartar contenido irrelevante o inexacto antes de que un último agente redacte la respuesta final con las referencias utilizadas.
Los autores evaluaron el sistema en nueve bases de datos médicas que abarcan preguntas de opción múltiple, diagnóstico de enfermedades y respuestas abiertas, utilizando seis modelos de lenguaje distintos, entre ellos GPT-4o, DeepSeek-V3.2 y Claude Sonnet 4.5. MultiMed-RAG obtuvo el mejor desempeño promedio en cinco de los seis modelos evaluados, con mejoras de entre 4% y 7% respecto a la generación directa sin herramientas de consulta, y de entre 2% y 4% frente a otros métodos de recuperación aumentada existentes. El mejor resultado global se alcanzó con Claude Sonnet 4.5 como modelo base, con una precisión promedio de 82.79%.
El estudio también incluyó una evaluación cualitativa basada en cuatro principios que los autores denominan STAR, correspondientes a seguridad, confiabilidad, capacidad de acción y responsabilidad. Según los resultados reportados, MultiMed-RAG superó a la generación directa en 66.41% de los casos evaluados en seguridad, en 65.85% en confiabilidad, en 60.96% en capacidad de acción y en 59.56% en responsabilidad. El análisis de las fuentes utilizadas mostró que Mayo Clinic fue el recurso más consultado por el sistema, mientras que el conocimiento interno de los modelos de lenguaje se empleó con menor frecuencia, reservado como respaldo cuando las fuentes externas resultaban insuficientes.
Los propios autores reconocen limitaciones en el sistema. El agente verificador, encargado de descartar información poco confiable, en ocasiones eliminó contenido válido, lo que refleja una tensión entre precisión y cobertura de la información recuperada. También identificaron errores derivados de la similitud semántica entre enfermedades con síntomas parecidos, lo que puede llevar al sistema a recuperar información relacionada pero no del todo pertinente para la consulta original.



