MerMED-FM, desarrollado por investigadores de Singapur, fue entrenado con 3.3 millones de imágenes y superó a modelos especializados en radiología, oftalmología y otras disciplinas usando solo 10% de datos etiquetados.
Un equipo de investigadores liderado por instituciones de Singapur, entre ellas el Instituto de Computación de Alto Rendimiento, la Agencia para la Ciencia, la Tecnología y la Investigación y el Instituto Nacional del Ojo de Singapur, desarrolló un modelo de inteligencia artificial capaz de interpretar siete modalidades distintas de imágenes médicas dentro de una sola arquitectura. El modelo, llamado MerMED-FM (Multimodal, Multi-Disease Medical Imaging Foundation Model), fue descrito en un estudio publicado en The Lancet Digital Health.
A diferencia de los modelos de inteligencia artificial (IA) actuales para imagenología médica, que en su mayoría se entrenan para una sola modalidad y una sola enfermedad, MerMED-FM fue diseñado para operar de forma simultánea en radiografías de tórax, tomografía computarizada, ultrasonido, histopatología, fotografía de fondo de ojo a color, tomografía de coherencia óptica y dermatoscopia. Según los autores, los modelos actuales más avanzados en cada una de estas áreas, entre ellos RAD-DINO para radiografías de tórax, Merlin para tomografía, USFM para ultrasonido, UNI para histopatología, RETFound para oftalmología y PanDerm para dermatología, funcionan de manera aislada y limitan la capacidad de los hospitales para integrar flujos de trabajo entre especialidades.
El modelo fue preentrenado con aproximadamente 3.3 millones de imágenes médicas sin etiquetar provenientes de 53 bases de datos disponibles públicamente, que abarcan 12 especialidades. Este conjunto incluyó 713,931 radiografías de tórax, 292,353 cortes de tomografía computarizada, 389,885 cuadros de ultrasonido, 1,017,712 parches de patología, 333,099 imágenes de fondo de ojo, 176,719 cortes de tomografía de coherencia óptica y 401,059 imágenes de dermatoscopia. El entrenamiento se basó en aprendizaje autosupervisado combinado con un módulo de memoria que permite al sistema conservar representaciones de imágenes previamente observadas mediante un mecanismo de primero en entrar, primero en salir, lo cual ayuda a estabilizar el aprendizaje entre modalidades distintas.
Tras el preentrenamiento, el modelo fue ajustado, validado y evaluado en el diagnóstico de diversas enfermedades utilizando 26 bases de datos públicas y cinco privadas de radiología, histopatología y oftalmología. Con una fracción de datos etiquetados de apenas 10%, MerMED-FM alcanzó un área bajo la curva ROC (AUROC) promedio de 0.854, por encima de BiomedCLIP, un modelo multiespecialidad comparado en el estudio, que obtuvo 0.829, y de DINO, un modelo de dominio general, que obtuvo 0.843. Por modalidad, los valores promedio de AUROC fueron de 0.844 para radiografías de tórax, 0.906 para tomografía computarizada, 0.818 para ultrasonido, 0.908 para histopatología, 0.810 para fotografía de fondo de ojo, 0.962 para tomografía de coherencia óptica y 0.827 para dermatoscopia.
En comparaciones específicas, MerMED-FM superó a Merlin, el modelo especializado en tomografía computarizada, por 9.89% en un conjunto de datos real sobre enfermedad hepática, y superó a RAD-DINO, especializado en radiografías de tórax, por 7.52% en la detección de neumonía. En tomografía de coherencia óptica, el modelo superó a RETFound, considerado un modelo líder en imagenología oftalmológica, por márgenes de entre 14.06% y 29.5% según la base de datos evaluada. En dermatología, sin embargo, el modelo especializado PanDerm mostró un desempeño superior a MerMED-FM en dos de cuatro bases de datos evaluadas, con diferencias de hasta 4.66%.
Los investigadores también generaron mapas de calor de saliencia, revisados por médicos generales y especialistas certificados en radiología, patología y oftalmología, para verificar que las regiones de la imagen utilizadas por el modelo para sus predicciones fueran clínicamente relevantes. Además, evaluaron el desempeño del modelo por edad y sexo en las tres modalidades donde había información demográfica disponible, y encontraron diferencias moderadas en fotografía de fondo de ojo, con un AUROC promedio más alto en mujeres que en hombres y en personas mayores de 60 años frente a personas de 60 años o menos.
Entre las posibles aplicaciones clínicas que plantean los autores se encuentran la clasificación automática por gravedad en servicios de urgencias, el apoyo a juntas médicas multidisciplinarias de tumores, la evaluación combinada de complicaciones renales y retinianas en pacientes con diabetes, y el tamizaje en atención primaria para derivar a pacientes con alto riesgo hacia evaluación especializada.
Los propios investigadores reconocen varias limitaciones del modelo. MerMED-FM no superó de manera consistente a los modelos especializados de una sola modalidad, que suelen entrenarse con conjuntos de datos más grandes y curados para tareas específicas. El modelo opera únicamente con cortes bidimensionales y no es compatible con imagenología volumétrica, y todavía no ha sido evaluado en validación clínica prospectiva ni en términos de su relación costo-beneficio dentro de un sistema de salud real. Los autores señalan que trabajos futuros deberán incorporar capacidades de segmentación de imágenes, pronóstico de enfermedades y generación automática de reportes, además de someter el modelo a pruebas de equidad y de estrés con imágenes de baja calidad antes de su posible adopción clínica.




