¿Pueden los usuarios arreglar el sesgo de IA? Explorando la alineación de valor impulsada por el usuario en AI Companions

Los compañeros de IA basados ​​en el Modelo de Lenguaje Grande (LLM) han evolucionado desde chatbots simples hasta entidades que los usuarios perciben como amigos, socios o incluso miembros de la familia. Sin embargo, a pesar de su capacidad humana, los compañeros de IA a menudo hacen afirmaciones parciales, discriminatorias y dañinas. Estos sesgos son capaces de hacer cumplir los estereotipos inherentes y causar sufrimiento psicológico, particularmente en las comunidades marginadas. Los métodos convencionales de alineación de valor, controlados predominantemente por los desarrolladores, no pueden prever y acomodar las necesidades de los usuarios en escenarios comunes. Los usuarios con frecuencia están sujetos a una producción de IA discriminatoria en desacuerdo con sus valores, creando sentimientos de frustración e impotencia. En contraste, este documento investiga un nuevo paradigma donde los usuarios toman la iniciativa de corregir los sesgos en la IA por múltiples mecanismos. Comprender cómo los usuarios navegan y minimizan estos sesgos es esencial para elaborar sistemas de IA que empoderen a las comunidades en concierto con el compromiso ético.

Las estrategias convencionales para reducir los sesgos de IA, como el ajuste fino, la ingeniería rápida y el aprendizaje de refuerzo utilizando la retroalimentación humana, se basan en la intervención de arriba hacia abajo por parte de los desarrolladores. Aunque estos mecanismos intentan realinear las acciones de AI con normas éticas preestablecidas, en su mayoría son incapaces de administrar las modalidades diversas y dinámicas por las cuales los usuarios se involucran con los compañeros de IA. Los intentos actuales de auditoría de algoritmos están destinados principalmente a descubrir los sesgos de IA y no pueden analizar cómo los usuarios hacen un esfuerzo consciente para corregirlos. Estas deficiencias son un testimonio de la necesidad de un mecanismo más elástico y participativo en el que los usuarios tengan un mejor control sobre la dirección de comportamiento de IA.

Investigadores de la Universidad de Stanford, la Universidad Carnegie Mellon, la Universidad de la Ciudad de Hong Kong y la Universidad de Tsinghua introducen un marco impulsado por el usuario donde las personas asuman un papel activo en la identificación y corrección de los prejuicios de IA. Esta investigación analiza cómo los usuarios realizan esta actividad a través del análisis de 77 informes de redes sociales de respuestas discriminatorias de IA y entrevistas semiestructuradas con 20 usuarios de IA experimentados. A diferencia de la alineación convencional de desarrollador, este método se refiere a la agencia de usuarios en la configuración del comportamiento de la IA. La investigación descubre seis tipos de respuestas de IA sesgadas, tres modelos conceptuales por los cuales los usuarios representan el comportamiento de la IA y siete métodos distintos utilizan los usuarios para contrarrestar los sesgos. La investigación contribuye a la conversación general sobre la interacción Human-AI al mostrar que los usuarios no solo detectan sesgo sino que también replantean las respuestas de AI a sus valores.

Se utilizó un enfoque de métodos mixtos, integrando el análisis de contenido de las quejas de los usuarios y entrevistas cualitativas de los usuarios. Los investigadores reunieron 77 quejas de los usuarios sobre declaraciones discriminatorias de IA en sitios como Reddit, Tiktok, Xiaohongshu y Douban. Se reclutaron veinte usuarios a largo plazo de usar y realinearse compañeros de IA, y cada uno participó en entrevistas de 1 a 2 horas con tareas de retiro y ejercicios de “pensamiento en voz alta” en los que conversaron con compañeros de IA sesgados. El análisis temático reflexivo se utilizó para codificar las quejas de los usuarios y estrategias de alineación. Se encontraron seis categorías amplias de declaraciones discriminatorias de IA, que incluyen misoginia, sesgo LGBTQ+, sesgo de apariencia, capaz, racismo y sesgo socioeconómico. Los usuarios también pensaron en el comportamiento de IA de tres maneras diferentes. Algunos pensaron en la IA como una máquina, culpando al sesgo a los errores técnicos causados ​​por datos de capacitación y restricciones algorítmicas. Otros pensaron en la IA como un bebé, tratando a la IA como un ser inmaduro que podría moldearse y educarse sobre lo que estaba bien y mal. Un tercer pensó en la IA como un cosplayer, culpando al sesgo a los entornos de juego de roles en lugar del algoritmo. Siete estrategias prevalecientes se identificaron como estrategias de alineación impulsadas por el usuario, que se clasificaron en tres enfoques amplios. Las estrategias técnicas fueron modificaciones de respuesta de IA, incluidas las declaraciones de regeneración o reescritura y retroalimentación negativa. Las estrategias argumentativas implican razonamiento, persuasión o expresión de ira para corregir los sesgos. Las estrategias de caracteres fueron modificaciones de ajuste de IA o el uso de intervenciones “fuera de lugar” para reconstruir las interacciones.

Los resultados muestran que la alineación de valor iniciada por el usuario es un proceso recursivo impulsado por interpretaciones personales del comportamiento de la IA y que resulta en diferentes estrategias de mitigación de sesgo. Las personas que piensan en la IA como un sistema de máquinas dependen principalmente de soluciones técnicas, como la regeneración de la respuesta o la señalización de contenido ofensivo. Las personas que piensan en la IA como un niño prefieren razonamiento y estrategias persuasivas para corregir los prejuicios, mientras que las personas que piensan que la IA como un artista ajustan los parámetros de los carácter para reducir las oportunidades de respuestas sesgadas. De las siete estrategias de alineación identificadas, la persuasión y el razonamiento suaves fueron los más efectivos para lograr un cambio de comportamiento a largo plazo, mientras que las expresiones de ira y las soluciones técnicas como la regeneración de respuesta produjeron resultados mixtos. Si bien los usuarios pueden influir en el comportamiento de la IA a largo plazo, los obstáculos persisten, como la carga emocional de corregir constantemente la IA y la persistencia de los sesgos debido a la retención de memoria del sistema. Estos hallazgos sugieren que las plataformas de IA deben incluir modelos de aprendizaje más adaptativos y enfoques basados ​​en la comunidad que capaciten a los usuarios con un mayor control sobre la corrección de sesgos al tiempo que reducen las cargas cognitivas y emocionales.

La alineación de valores centrada en el usuario redefine la interacción humana-AI en un enfoque centrado en las personas para la modulación del comportamiento de la IA como agentes activos. A partir de un análisis de las quejas de los usuarios y la práctica de alineación real, esta investigación destaca las limitaciones de los marcos impulsados ​​por expertos y enfatiza el valor de los enfoques participativos que involucran la participación directa del usuario. Los resultados sugieren que las plataformas de IA deben integrar capacidades de alineación colaborativas y comunitarias que permitan a los usuarios compartir estrategias y trabajar con los desarrolladores para mejorar las respuestas de IA. La investigación futura debe abordar el desafío de identificar métodos escalables para incorporar la retroalimentación de los usuarios en la capacitación de IA, junto con la mitigación de preocupaciones éticas en torno al uso indebido potencial y los impactos psicológicos en los usuarios. Al cambiar el enfoque de las intervenciones impulsadas por el desarrollador a la participación activa del usuario, este marco proporciona una base para los sistemas de IA que son más receptivos, éticamente responsables y sintonizados con múltiples perspectivas del usuario.


Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 75k+ ml de subreddit.

🚨 Plataforma de IA de código abierto recomendada: ‘Intellagent es un marco de múltiples agentes de código abierto para evaluar el complejo sistema de IA conversacional‘ (Promocionado)


Aswin AK es un pasante de consultoría en MarktechPost. Está persiguiendo su doble título en el Instituto de Tecnología Indio, Kharagpur. Le apasiona la ciencia de datos y el aprendizaje automático, aportando una sólida experiencia académica y una experiencia práctica en la resolución de desafíos de dominio de la vida real.