Los investigadores de la Universidad de Michigan proponen G-ACT: un marco de aprendizaje automático escalable para dirigir el sesgo de lenguaje de programación en LLMS

LLMS y la necesidad de control de código científico

Los LLM se han convertido rápidamente en procesadores de lenguaje natural complejos, lo que permite el desarrollo de sistemas de agente que administran flujos de trabajo complejos. Sin embargo, el uso de agentes LLM para generar código científico no está explorado. El software científico depende principalmente de C ++, CUDA y otros idiomas de bajo nivel, que están subrepresentados en la mayoría de los conjuntos de datos previos al pretratrenamiento. Como resultado, las implementaciones generadas por LLM contienen errores sintácticos o semánticos, lo que conduce a problemas de compilación o un comportamiento de tiempo de ejecución inestable. Los agentes existentes dependen en gran medida de las primitivas de control especificadas por el usuario y las indicaciones cuidadosamente elaboradas, que son propensas a la interpretación errónea y pueden conducir a flujos de ejecución erráticos.

Limitaciones de los métodos de dirección existentes

Se han desarrollado enfoques recientes para abordar los desafíos de dirección de LLM al descubrir vínculos causales dentro de las activaciones del modelo y facilitar las intervenciones precisas a nivel de neuronas. SFT, técnicas de modulación de peso y RLHF representan una intervención directa para la dirección del modelo, pero tienen una sobrecarga computacional significativa y pueden reducir la robustez y el rendimiento general del modelo. El parche de activación, que utiliza entradas corruptas como una distribución de referencia, se adopta ampliamente para el control de salida de grano fino. Sin embargo, estos métodos exigen extensos barridos de modelos que involucran millones de evaluaciones y se utilizan en puntos de referencia de preguntas de opción múltiple, en lugar de escenarios de implementación del mundo real.

Introducción del marco G-ACT

Investigadores de la Universidad de Michigan han propuesto un Marco de Dirección de Activación Adaptativa (G-ACT) refinada por el gradiente para abordar el desafío de dirigir la generación de código científico hacia lenguajes de programación específicos en LLMS. Surge de evaluar cinco LLM causales en las indicaciones de codificación científica. G-ACT clústeres por promt-Diferencias de activación en las direcciones de dirección y utiliza sondas livianas por capa que están capacitadas y refinadas en línea para seleccionar vectores de dirección adecuados. El marco respalda el control del nivel de concepto al tiempo que garantiza la escalabilidad e interpretabilidad, proporcionando un método práctico para lograr un comportamiento reproducible en sistemas de agente que requieren opciones de lenguaje de programación consistentes para tareas de computación científica.

Evaluación del modelo y sesgos de referencia

Los investigadores evalúan cinco LLMS ajustadas a la instrucción, incluidos Llama-3.2-3b-Instructo, Llama-3.3-70b-Instructo, QWEN2.5-Coder-32B-Instructo, QWEN2.5-14b-Instructo-1M y QWQ-32B. Cada modelo se prueba en 84 preguntas de referencia con 25 repeticiones por aviso a la temperatura de muestreo 1.0 para garantizar la estabilidad estadística. Los resultados para las preferencias del lenguaje revelan que Llama-3.2-3b es muy incumplimiento de Java (76.2%), mientras que LLAMA-3.3-70B favorece a Python (73.8%). Los modelos QWEN muestran diferentes sesgos con QWEN2.5 codificador que prefiere Python (59.5%) y Qwen2.5-14b favoreciendo a Julia (66.7%). Estas mediciones de referencia muestran que la escala de modelos, el diseño arquitectónico y los datos de ajuste fino crean colectivamente sesgos reproducibles.

Activación de neuronas estáticas y sesgo del lenguaje

El análisis del método estático implica inducir el sesgo de preferencia del lenguaje y las pruebas de generación de código. Los resultados para el sesgo de preferencia muestran que la activación selectiva de las neuronas MLP individuales en las pruebas de línea de base con LLAMA-3.2-3B-Instructo gana un fuerte control causal sobre la selección del lenguaje de programación. Cuando se dirige a la generación de CPP, los resultados muestran una salida de CPP de casi el 100% en la mayoría de los problemas, eliminando prácticamente las salidas de Python, Java y Julia. Además, las pruebas de generación de códigos revelan dos regímenes de comportamiento distintos: las tareas de inclinación de pitón muestran salidas de 40-80% de Python para operaciones de alto nivel, mientras que las tareas dominantes de CPP exhiben preferencia CPP del 60-90% por rutinas críticas de rendimiento. El modelo logra ~ 73% de generación CPP con más frecuencia que Python, pero aún por defecto a Python para una porción significativa de indicaciones.

Resultados de la dirección de activación refinada por gradiente

En este artículo, los investigadores presentan una dirección de activación adaptativa refinada por gradiente que puede controlar la selección del lenguaje de programación en la generación de código científico. El marco logra mejoras sustanciales, aumentando la precisión de la clasificación de la sonda del 0% al 61.5% en las primeras capas de LLAMA-3.2 3B. A pesar de una sobrecarga de tiempo de ejecución modesta de 1.3-1.4 veces más lenta de la generación, el marco sigue siendo práctico a través de la dirección selectiva de la capa y las optimizaciones de almacenamiento en caché. G-ACT ofrece un enfoque escalable e interpretable para el control a nivel de concepto que va más allá de la programación de lenguajes al incorporar matrices de transformación persistentes. Esto garantiza un comportamiento del modelo consistente entre los usuarios e introduce un nuevo estándar para la dirección confiable de LLM en contextos de computación científica.


Mira el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.