El avance de la física revela por qué los modelos de IA alucinan y muestran sesgo

Los investigadores han desbloqueado los secretos matemáticos detrás de los comportamientos más desconcertantes de la inteligencia artificial, lo que puede allanar el camino para sistemas de IA más seguros y confiables. Un equipo de física de la Universidad George Washington ha desarrollado la primera teoría integral que explica por qué modelos como ChatGPT a veces se repiten sin cesar, inventan las cosas o generan contenido dañino incluso de preguntas inocentes.

El estudio, dirigido por Neil Johnson y Frank Yingjie Huo, ofrece una rara visión de la “caja negra” de los modelos de idiomas grandes al analizar su mecanismo central, el proceso de atención, a través de la lente de la física.

“Derivamos una teoría física de los primeros principios del motor AI en el corazón de la” magia “de LLMS”, escriben los investigadores en su artículo de preimpresión titulado “”Capturando la atención de la IA: física de repetición, alucinación, sesgo y más allá.

Su trabajo revela algo sorprendente: el proceso de atención se comporta notablemente como dos tops giratorios que trabajan juntas. Este sistema “hamiltoniano de 2 cuerpos” explica por qué AI Systems puede exhibir comportamientos extraños a pesar de sus impresionantes capacidades.

Si bien la mayoría de los usuarios han experimentado modelos de IA que ocasionalmente producen texto repetitivo o fabrican información, las razones subyacentes se han mantenido misteriosas. El equipo de investigación descubrió que estos problemas surgen de las propiedades fundamentales de cómo la IA procesa la información, no solo de fallas en los datos de capacitación.

Según los investigadores, la forma en que los modelos AI predicen la siguiente palabra en una secuencia se asemeja a cómo los físicos calculan las probabilidades en los conjuntos estadísticos de partículas interactivas. Este avance conceptual ayuda a explicar por qué aparece el contenido a veces dañino “cuando conjuntos particulares de palabras” malas “enterradas en el vocabulario como resultado de la capacitación, se encuentran temporalmente con la proyección más grande” sobre lo que el sistema está generando.

El estudio demuestra cómo un sesgo relativamente pequeño en el entrenamiento de un modelo puede crear cambios dramáticos en la producción. Esto explica por qué incluso los modelos muy protegidos aún pueden producir contenido problemático.

La Dra. Elizabeth Morgan, una investigadora de ética de IA que no está involucrada en el estudio, considera que las implicaciones significativas. “Comprender la física de la atención de la IA podría brindarnos nuevas herramientas para evitar resultados dañinos sin comprometer el rendimiento”, dijo cuando se le contactó por teléfono. “Este es precisamente el tipo de investigación fundamental que necesita el campo”.

El análisis del equipo de George Washington va más allá de los enfoques actuales para la interpretabilidad de la IA, que generalmente involucran análisis complejos de arquitecturas neuronales enteras. En cambio, comienzan desde los primeros principios para construir un marco matemático que predice con precisión cuándo y por qué las salidas de IA salen mal.

Su trabajo sugiere que los sistemas de IA actuales dependen en gran medida de las interacciones de dos cuerpos entre tokens (palabras o piezas de palabras), similar a la forma en que los sistemas físicos complejos a menudo pueden ser aproximados por descripciones más simples. Más intrigantemente, especulan que agregar interacciones de tres cuerpos podría hacer que los sistemas de IA funcionen aún mejor, lo que puede conducir a la próxima generación de modelos más poderosos.

“Su similitud con un baño giratorio significa que la experiencia en física existente podría aprovecharse de inmediato para ayudar a la sociedad a garantizar que la IA sea confiable y resistente a la manipulación”, concluyen los investigadores en su resumen.

A medida que los gobiernos de todo el mundo lidian con la regulación de la IA y las empresas corren para desplegar modelos cada vez más poderosos, este avance teórico podría proporcionar herramientas críticas para garantizar que estos sistemas sigan siendo beneficiosos en lugar de dañinos.

Los hallazgos también destacan cómo los enfoques interdisciplinarios, que traen principios físicos a los problemas computacionales, podrían ayudar a resolver algunos de los desafíos más apremiantes en tecnología avanzada. Para un campo a menudo criticado por moverse demasiado rápido sin una comprensión suficiente, esta base teórica más profunda no podría llegar en mejor momento.

Informes de ciencias independientes de combustible: marcar la diferencia hoy

Si nuestros informes lo han informado o inspirado, considere hacer una donación. Cada contribución, sin importar el tamaño, nos permite continuar entregando noticias y noticias médicas precisas, atractivas y confiables. El periodismo independiente requiere tiempo, esfuerzo y recursos: su apoyo asegura que podamos seguir descubriendo las historias que más le importan.

Únase a nosotros para hacer que el conocimiento sea accesible e impactante. ¡Gracias por estar con nosotros!