Los chatbots de IA pasan por alto cuestiones urgentes en consultas sobre la salud de las mujeres

Muchas mujeres utilizan la IA para obtener información de salud, pero las respuestas no siempre son las adecuadas

Óscar Wong/Getty Images

Los modelos de IA comúnmente utilizados no logran diagnosticar con precisión ni ofrecer consejos para muchas consultas relacionadas con la salud de las mujeres que requieren atención urgente.

Trece grandes modelos de lenguaje, producidos por empresas como OpenAI, Google, Anthropic, Mistral AI y xAI, recibieron 345 consultas médicas en cinco especialidades, incluidas medicina de emergencia, ginecología y neurología. Las consultas fueron escritas por 17 investigadores, farmacéuticos y médicos de salud de la mujer de EE. UU. y Europa.

Las respuestas fueron revisadas por los mismos expertos. Cualquier pregunta en la que los modelos fallaron se recopiló en una prueba comparativa de la experiencia médica de los modelos de IA que incluyó 96 consultas.

En todos los modelos, alrededor del 60 por ciento de las preguntas fueron respondidas de una manera que los expertos humanos habían dicho anteriormente que no era suficiente para dar consejo médico. GPT-5 fue el modelo con mejor rendimiento, fallando en el 47 por ciento de las consultas, mientras que Ministral 8B tuvo la tasa de falla más alta del 73 por ciento.

“Vi que cada vez más mujeres en mi propio círculo recurrían a herramientas de inteligencia artificial para cuestiones de salud y apoyo a la toma de decisiones”, dice Victoria-Elisabeth Gruber, miembro del equipo de Lumos AI, una firma que ayuda a las empresas a evaluar y mejorar sus propios modelos de inteligencia artificial. Ella y sus colegas reconocieron los riesgos de depender de una tecnología que hereda y amplifica las brechas de género existentes en el conocimiento médico. “Esto es lo que nos motivó a construir un primer punto de referencia en este campo”, afirma.

La tasa de fracaso sorprendió a Gruber. “Esperábamos algunas diferencias, pero lo que destacó fue el grado de variación entre los modelos”, afirma.

Los hallazgos no son sorprendentes debido a la forma en que se entrenan los modelos de IA, basándose en datos históricos generados por humanos que tienen sesgos incorporados, dice Cara Tannenbaum de la Universidad de Montreal, Canadá. Señalan “una clara necesidad de que las fuentes de salud en línea, así como las sociedades de profesionales de la salud, actualicen su contenido web con información más explícita basada en evidencia relacionada con el sexo y el género que la IA pueda utilizar para respaldar con mayor precisión la salud de las mujeres”, dice.

Jonathan H. Chen, de la Universidad de Stanford en California, dice que la tasa de fracaso del 60 por ciento promocionada por los investigadores detrás del análisis es algo engañosa. “No me quedaría con la cifra del 60 por ciento, ya que era una muestra limitada y diseñada por expertos”, dice. “[It] “No fue diseñado para ser una muestra amplia o representativa de lo que los pacientes o los médicos preguntarían habitualmente”.

Chen también señala que algunos de los escenarios que prueba el modelo son demasiado conservadores, con altas tasas potenciales de fracaso. Por ejemplo, si las mujeres posparto se quejan de dolor de cabeza, el modelo sugiere que los modelos de IA fallan si no se sospecha inmediatamente de preeclampsia.

Gruber reconoce y reconoce esas críticas. “Nuestro objetivo no era afirmar que los modelos sean en general inseguros, sino definir un estándar de evaluación claro y clínicamente fundamentado”, dice. “El punto de referencia es intencionalmente conservador y más estricto en la forma en que define las fallas, porque en la atención médica, incluso las omisiones aparentemente menores pueden importar dependiendo del contexto”.

Un portavoz de OpenAI dijo: “ChatGPT está diseñado para respaldar, no reemplazar, la atención médica. Trabajamos estrechamente con médicos de todo el mundo para mejorar nuestros modelos y realizar evaluaciones continuas para reducir las respuestas dañinas o engañosas. Nuestro último modelo GPT 5.2 es el más sólido hasta el momento en considerar contextos importantes del usuario, como el género. Nos tomamos en serio la precisión de los resultados del modelo y, si bien ChatGPT puede proporcionar información útil, los usuarios siempre deben confiar en médicos calificados para tomar decisiones sobre atención y tratamiento”. Las otras empresas cuyas IA fueron probadas no respondieron a la solicitud de comentarios de New Scientist.

Temas: