Investigadores de Google Research evaluaron a SymptomAI, un agente conversacional desplegado a través de la aplicación Fitbit, y encontraron que sus diagnósticos superaron en precisión a los de médicos de familia con más de 35 años de experiencia.
Un equipo de Google Research desarrolló SymptomAI, un agente de inteligencia artificial (IA) conversacional diseñado para entrevistar a pacientes sobre sus síntomas y generar una lista de posibles diagnósticos. El sistema, construido sobre el modelo Gemini, fue evaluado en un estudio que reclutó a 13 mil 917 participantes a través de la aplicación Fitbit entre junio de 2025 y abril de 2026, lo que según los autores representa la evaluación más grande realizada hasta la fecha sobre IA conversacional para autoevaluación de síntomas con usuarios reales.
“Los sistemas precisos de verificación de síntomas, como SymptomAI, tienen el potencial de permitir el etiquetado de referencia automatizado de diagnósticos clínicos de calidad, lo que puede facilitar el análisis a gran escala de datos fisiológicos, una tarea que actualmente resulta imposible a gran escala”, Jake Sunshine, científico de Google Research.
Del grupo, mil 228 participantes reportaron haber recibido posteriormente un diagnóstico de un profesional de salud, y 517 de esos casos fueron sometidos a una revisión clínica más rigurosa. Un panel de tres médicos de familia certificados, con más de 35 años de experiencia combinada en atención primaria, urgencias y medicina académica, evaluó a ciegas las listas de diagnósticos diferenciales generadas tanto por SymptomAI como por otros médicos que revisaron las mismas conversaciones sin conocer el diagnóstico final.
Los resultados mostraron que las listas de SymptomAI incluyeron el diagnóstico correcto entre sus primeras cinco opciones en 73% de los casos, frente a 60% en las listas elaboradas por los médicos evaluadores. Además, cuando los médicos calificadores debían elegir cuál de las tres listas presentadas preferían, sin saber su origen, seleccionaron la de SymptomAI como la mejor opción en 53,3% de los casos, frente a un resultado esperado de 33% si la elección fuera aleatoria.
Un hallazgo particular del estudio es que la ventaja de SymptomAI sobre los médicos aumentó en los casos donde estos últimos expresaron menor confianza en su propio diagnóstico, lo que sugiere que el sistema mantiene un desempeño más estable ante información limitada o ambigua proporcionada por los pacientes.
La investigación también comparó distintas estrategias de conversación. Los agentes que formulaban preguntas de seguimiento de manera activa para obtener más información antes de emitir un diagnóstico obtuvieron una precisión 27,57% superior, en promedio, respecto a una versión base que simplemente respondía según lo que el usuario decidiera compartir, sin insistir en preguntas adicionales. Los autores señalan que este enfoque contrasta con el de la mayoría de los modelos conversacionales de uso comercial disponibles actualmente, que no están diseñados para exigir una entrevista estructurada antes de responder.
Para verificar que los resultados no se limitaran a la población de usuarios de Fitbit, generalmente más orientada a la tecnología, el equipo condujo un estudio auxiliar con 1.509 personas reclutadas a través de un panel independiente de población general. Pese a que este grupo presentó una distribución distinta de enfermedades, la precisión de SymptomAI se mantuvo consistente, con 72,6% de aciertos en el top 5, frente a 77,7% en la población original del estudio.
Los investigadores utilizaron además los diagnósticos generados por SymptomAI como referencia para analizar más de 500.000 días de datos biométricos captados por dispositivos portátiles en casi 400 condiciones médicas distintas. Encontraron asociaciones marcadas entre infecciones agudas y cambios fisiológicos previos al reporte de síntomas, como en el caso de la influenza, cuya razón de momios superó 7 en relación con cambios en la frecuencia cardíaca en reposo.
“Presentamos SymptomAI, un agente de IA conversacional en fase de investigación para realizar entrevistas a pacientes y evaluaciones de síntomas en situaciones reales. Demostramos el rendimiento integral de SymptomAI en entornos reales mediante la precisión del diagnóstico diferencial en una muestra poblacional, y mostramos cómo los diagnósticos de SymptomAI permiten analizar señales a escala poblacional, como las bioseñales de dispositivos portátiles, para identificar asociaciones entre señales fisiológicas y enfermedades reportadas”, Sunshine.
Asimismo, el equipo advierte que SymptomAI es un prototipo de investigación y no constituye un dispositivo médico ni ha pasado por validación regulatoria. Los diagnósticos generados durante el estudio no fueron compartidos con los proveedores de salud de los participantes ni influyeron en su tratamiento clínico. Los autores también reconocen limitaciones, entre ellas que los diagnósticos de referencia utilizados provienen de reportes de los propios pacientes, lo que introduce cierto margen de imprecisión, y que los médicos evaluadores basaron sus diagnósticos en conversaciones ya conducidas por la inteligencia artificial, sin haber dirigido ellos mismos la entrevista.



