Filtrar por tipo de entrada
Filtrar por categorías
EpiScreen, un sistema basado en modelos de lenguaje, detecta epilepsia a partir de notas clínicas y mejora el desempeño de neurólogos

Investigadores de la Universidad de Minnesota ajustaron modelos de lenguaje de gran tamaño con notas de expedientes electrónicos para distinguir la epilepsia de las crisis psicógenas no epilépticas, un diagnóstico que hoy depende de estudios costosos y con semanas de espera.

Un equipo de la Universidad de Minnesota desarrolló EpiScreen, un enfoque de bajo costo para la detección temprana de epilepsia que utiliza las notas clínicas que ya se registran de manera rutinaria en los expedientes electrónicos. El trabajo fue publicado en npj Digital Medicine. Según los autores, el sistema apoya la detección temprana y podría reducir los retrasos diagnósticos y evitar intervenciones innecesarias, sobre todo en regiones con pocos recursos.

El problema de partida es que la epilepsia y las crisis psicógenas no epilépticas (PNES, en inglés), también llamadas crisis funcionales o disociativas, pueden presentarse con manifestaciones parecidas, pero requieren tratamientos distintos. La epilepsia afecta a unos 50 millones de personas en el mundo, entre ellas cerca de 2.9 millones con epilepsia activa en Estados Unidos. El error diagnóstico es frecuente: según estudios citados en el artículo, entre 20% y 30% de los pacientes remitidos a centros de epilepsia de tercer nivel por una presunta epilepsia resistente a fármacos terminan con un diagnóstico de PNES. El estándar de referencia es la video-electroencefalografía (vEEG) prolongada, pero una sola hospitalización para este estudio supera con frecuencia los 15 000 dólares en Estados Unidos, se realiza en unidades especializadas con capacidad limitada y suele implicar esperas de 8 a 12 semanas, además de 1 a 5 días de monitoreo.

Para desarrollar EpiScreen, los investigadores ajustaron grandes modelos de lenguaje de código abierto: Llama-3.3-70B, Qwen-2.5-32B, DeepSeek-R1-32B y Med42-70B, con notas clínicas etiquetadas, de modo que el sistema analice la narrativa completa y no descriptores aislados. Además, utilizaron dos conjuntos de datos de los cuales 2 mil 651 correspondían a epilepsia y 800 a PNES, y una cohorte privada de la Universidad de Minnesota con 10 182 casos, 8 mil 011 de epilepsia y 2 mil 171 de PNES. Las notas se procesaron para reflejar el momento previo al diagnóstico, y se eliminaron los reportes de vEEG y la información sobre el diagnóstico actual, el alta y el tratamiento. EpiScreen está pensado para usarse en la etapa de atención especializada, con las notas generadas durante y después de la remisión a neurología y antes de la confirmación con vEEG.

En las pruebas con datos de la misma institución, las versiones de EpiScreen alcanzaron un área bajo la curva (AUC) de hasta 0.891 en una de las bases de datos, MIMIC-IV y de hasta 0.992 en la cohorte de Minnesota. Los autores reportan que el ajuste fino aumentó el AUC de forma absoluta en promedio 13.2% y 11.6% en cada conjunto. En la evaluación entre instituciones, es decir, con modelos entrenados en un centro y probados en el otro, EpiScreen alcanzó AUC de hasta 0.875 en MIMIC-IV y de hasta 0.980 en Minnesota, mientras que FSLS cayó a 0.498 en MIMIC-IV y BERT obtuvo 0.701 en Minnesota. Los investigadores señalan que la mejora en la evaluación entre instituciones frente a los métodos comparativos fue de 14.2% y 24.2%, respectivamente.

El estudio también evaluó el trabajo conjunto entre personas y sistema, con 300 casos seleccionados de la base MIMIC-IV y ocho médicos divididos en cuatro grupos de dos: tres de residentes de neurología, con cuatro años de formación en promedio, y uno de neurólogos con más de 10 años de experiencia. Cada grupo decidió por consenso, con acceso a internet. Sin apoyo, la exactitud de los tres grupos de residentes fue de 0.793, 0.763 y 0.767, y la de los neurólogos de 0.817, sin diferencias significativas respecto a la de EpiScreen por sí solo, de 0.810. Con el apoyo del sistema, que mostraba su predicción y las oraciones de la nota que más influyeron en ella, la exactitud subió a 0.880, 0.890 y 0.877 en los residentes y a 0.893 en los neurólogos. Los falsos negativos de los residentes bajaron de 36 a 14 y los falsos positivos de los neurólogos, de 37 a 19. Los autores reportan ganancias absolutas de hasta 14.3% frente a los médicos sin apoyo y de hasta 10.2% frente al sistema por sí solo.

Para analizar qué partes de la nota pesaban en cada predicción, los investigadores aplicaron una técnica de atribución a nivel de oración. En MIMIC-IV, las categorías con mayor influencia fueron las comorbilidades neurológicas y médicas, como migraña o enfermedad cerebrovascular, y el perfil de pruebas diagnósticas, como un electroencefalograma normal. En la cohorte de Minnesota destacaron los datos demográficos y de antecedentes, los rasgos psiquiátricos y psicológicos, las comorbilidades y las pruebas diagnósticas. Las descripciones de las crisis también aparecieron entre las oraciones de mayor peso. En pruebas de robustez, el desempeño se mantuvo razonable con solo 5% de los datos de entrenamiento, se mantuvo estable con un desequilibrio de clases de hasta 5 a 1 y disminuyó con desequilibrios mayores y con modelos más pequeños. Los autores sugieren que modelos de al menos 32,000 millones de parámetros ofrecen un equilibrio entre precisión y costo computacional. En un subconjunto de 679 casos de Minnesota confirmados por vEEG, 502 de epilepsia y 177 de PNES, los resultados fueron consistentes.

Los investigadores reconocen varias limitaciones. No pueden descartarse sesgos de los médicos o de la forma de documentar en las notas, y las notas reales pueden contener información inexacta o contradictoria. El grupo de comparación incluyó sobre todo casos de PNES y no otras condiciones que simulan una crisis, como el síncope o los trastornos del sueño. El análisis de atribución se planteó como prueba de concepto y su utilidad clínica requiere más evaluación. Como siguiente paso, plantean ampliar el sistema a un diagnóstico diferencial más amplio y realizar una validación prospectiva en entornos clínicos reales. Los autores precisan que EpiScreen no sustituye las pruebas definitivas, pero podría orientar la urgencia y la asignación de la vEEG o reducir la exposición innecesaria a medicamentos antiepilépticos en pacientes con probable PNES, y estiman que, de validarse, podría acortar el proceso diagnóstico en aproximadamente 8 a 12 semanas.

Noticias destacadas

Mantente actualizado

Noticias por país

Contenidos Relacionados

Secured By miniOrange