More
    InicioHoy en Saludiario¿ChatGPT y Gemini son mejores que OpenEvidence y UpToDate Expert AI para...

    ¿ChatGPT y Gemini son mejores que OpenEvidence y UpToDate Expert AI para responder preguntas de medicina?

    Publicado

    Las plataformas que funcionan con inteligencia artificial (IA) cada vez son más comunes. La oferta actual es bastante amplia y de manera constante aparecen nuevas versiones con una capacidad mayor. ¿Pero qué ocurre al comparar algunas generales como ChatGPT, Gemini y Claude con otras especializadas en medicina y salud como OpenEvidence y UpToDate Expert AI?

    La diferencia entre ambas es que las primeras están diseñadas para que las utilice cualquiera y pueden ofrecer respuestas acerca de prácticamente cualquier tema. Mientras que las segundas son exclusivas para el uso de los profesionales de la salud e incluso solicitan el número de cédula médica para abrir una cuenta.

    También lee: Los 5 CEO de la industria farmacéutica mejor pagados del mundo: ¿Cuál es el salario de cada uno?

    ¿Entre ChatGPT y OpenEvidence quién es mejor?

    Para obtener una respuesta a la pregunta se llevó a cabo el estudio General-purpose large language models outperform specialized clinical AI tools on medical benchmarks y las conclusiones se publicaron en la revista Nature Medicine.

    El estudio consistió en realizar una evaluación cuantitativa e independiente para comparar el rendimiento de herramientas de IA especializadas en el ámbito clínico contra modelos de lenguaje de propósito general, también conocidos como modelos de frontera.

    • Modelos Clínicos Especializados: OpenEvidence y UpToDate Expert AI.
    • Modelos de Frontera: OpenAI GPT-5.2, Google Gemini 3.1 Pro y Anthropic Claude Opus 4.6.
    • Control de comparación: Se incluyó también a Google Search AI Overview por ser una herramienta común en consultas médicas cotidianas.

    4 herramientas que aumentan la probabilidad de pasar el ENARM: desde manuales hasta simuladores

    Metodología de la evaluación

    La investigación se dividió en tres etapas fundamentales para evaluar conocimiento, criterio y uso real.

    • MedQA: 500 preguntas de opción múltiple basadas en los exámenes de la Licencia Médica de Estados Unidos (USMLE, por sus siglas en inglés) para medir el conocimiento médico puro.
    • HealthBench: 500 ítems destinados a medir la alineación y el acuerdo con el criterio de médicos expertos, evaluados mediante un panel de jueces de IA.
    • Consultas Clínicas Reales (RCQ): 100 consultas anónimas reales hechas por médicos en entornos clínicos en vivo. Las respuestas de los modelos fueron evaluadas a ciegas y de forma aleatorizada por un comité de 12 médicos estadounidenses a través de cuatro dimensiones: precisión clínica, nivel de completitud, seguridad (evitación de daños) y claridad.

    Resultados obtenidos

    Los modelos generalistas superaron consistentemente a las herramientas especializadas en salud en las tres áreas de evaluación.

    • Rendimiento en MedQA (Conocimiento): Gemini obtuvo la precisión más alta con un 97.4%, seguido por ChatGPT (94.2%) y Claude (90.2%). Por su parte, las herramientas clínicas obtuvieron puntuaciones inferiores: OpenEvidence alcanzó un 89.6% y UpToDate un 88.4%.
    • Rendimiento en HealthBench (Alineación): ChatGPT lideró con un puntaje de 88.0, seguido de Gemini (79.3) y Claude (77.0). Ambas herramientas clínicas se rezagaron significativamente con puntuaciones de 62.6 (OpenEvidence) y 61.3 (UpToDate).
    • Resultados en Entornos Reales (RCQ): Los médicos identificaron dos niveles de rendimiento muy claros. El primer bloque lo ocuparon los modelos generalistas: Gemini (3.62), ChatGPT (3.54) y Claude (3.52). El segundo bloque estuvo compuesto por las herramientas clínicas especializadas y los motores de búsqueda, los cuales no mostraron diferencias significativas entre sí: Google AI Overview (3.27), OpenEvidence (3.24) y UpToDate AI (3.17).

    También lee: IMSS Bienestar estrena la Sala de Urgencias más moderna de Latinoamérica: ¿En qué hospital se encuentra?

    Hallazgos sobre comportamiento y seguridad

    • Negativas a responder: El modelo UpToDate Expert AI se negó a contestar el 19% de las preguntas clínicas reales, una tasa considerablemente más alta que el resto de los modelos (que rondaron entre el 1% y el 3%).
    • Problemas de comunicación: OpenEvidence obtuvo la puntuación más baja en la dimensión de “claridad” (2.84), lo que sugiere que sus deficiencias radican principalmente en la forma de comunicar la información y no necesariamente en la falta de conocimiento médico.
    • Seguridad general: No se registraron diferencias estadísticas significativas entre todos los modelos en cuanto a la generación de respuestas dañinas o alucinaciones (datos falsos).

    Conclusiones e implicaciones clínicas

    • La paradoja de la especialización: El menor rendimiento de las herramientas especializadas frente a los modelos masivos puede deberse a complicaciones con sus sistemas RAG (generación aumentada por recuperación), los cuales a veces integran erróneamente material irrelevante en las respuestas.
    • Ventaja de escala: La escala de entrenamiento, los ciclos rápidos de actualización y la capacidad de razonamiento transversal de los modelos generales de frontera demostraron ser determinantes más poderosos para la competencia médica que el ajuste fino especializado (domain-specific tuning).
    • Necesidad de auditorías: Los autores enfatizan que, dado el auge de la IA en la salud y la opacidad de los modelos comerciales, existe una necesidad crítica de establecer evaluaciones estandarizadas e independientes en el mundo real antes de implementar estas tecnologías en entornos clínicos que afecten de manera directa a los pacientes.

    A partir de todo lo anterior se obtiene que los modelos de lenguaje de propósito general como Gemini 3.1 Pro, GPT-5.2 y Claude Opus 4.6 superaron consistentemente a las herramientas de IA diseñadas específicamente para el ámbito clínico como OpenEvidence y UpToDate Expert AI en todas las pruebas de conocimiento médico, juicio clínico y consultas reales de médicos.

    Por su parte, las herramientas de IA especializadas en medicina mostraron un rendimiento similar al del sistema automático Google Search AI Overview, lo que demuestra que su optimización clínica no les otorgó una ventaja significativa en el entorno de consulta real.

    Más recientes

    Pacient centrity, ¿qué es y por qué los médicos lo deben aplicar con sus pacientes?

    El patient centricity es un modelo que sitúa las necesidades, experiencias, valores y preferencias del paciente en el centro de todas las decisiones.

    Dosificación de paracetamol en niños: por qué las indicaciones médicas no siempre se siguen correctamente

    La mejor manera para evitar errores de dosificación de paracetamol en niños es mantener una comunicación constante con los padres de familia.

    Ranking con las 10 farmacéuticas más valiosas del mundo en 2026: desde Eli Lilly hasta Roche y AstraZeneca

    Las farmacéuticas más valiosas del mundo han aumentado sus ingresos al enfocarse en tratamientos contra la obesidad, diabetes y el cáncer.

    CHRISTUS MUGUERZA anuncia la construcción de un nuevo hospital: ubicación y características principales

    El nuevo centro médico de CHRISTUS MUGUERZA tendrá áreas de urgencias, imagenología, laboratorio clínico y un Wellness Center.

    Más contenido de salud

    Pacient centrity, ¿qué es y por qué los médicos lo deben aplicar con sus pacientes?

    El patient centricity es un modelo que sitúa las necesidades, experiencias, valores y preferencias del paciente en el centro de todas las decisiones.

    Dosificación de paracetamol en niños: por qué las indicaciones médicas no siempre se siguen correctamente

    La mejor manera para evitar errores de dosificación de paracetamol en niños es mantener una comunicación constante con los padres de familia.

    Ranking con las 10 farmacéuticas más valiosas del mundo en 2026: desde Eli Lilly hasta Roche y AstraZeneca

    Las farmacéuticas más valiosas del mundo han aumentado sus ingresos al enfocarse en tratamientos contra la obesidad, diabetes y el cáncer.