Symbolic-MOE: Marco MOE de la mezcla de expertos para la mezcla adaptativa a nivel de instancia de expertos en LLM previamente capacitados

Al igual que los humanos, los modelos de idiomas grandes (LLM) a menudo tienen habilidades y fortalezas diferentes derivadas de las diferencias en sus arquitecturas y regímenes de entrenamiento. Sin embargo, luchan por combinar experiencia especializada en diferentes dominios, lo que limita sus capacidades de resolución de problemas en comparación con los humanos. Modelos especializados como Metamath, Wizardmath y Qwenmath se destacan en el razonamiento matemático, pero a menudo tienen un rendimiento inferior en las tareas que requieren sentido común o conocimiento médico. Incluso dentro de dominios específicos, como las matemáticas, los modelos muestran variaciones matizadas en la capacidad, por ejemplo, uno podría sobresalir en el álgebra, mientras que otra geometría de maestría. Crea la necesidad de marcos que puedan identificar y seleccionar los modelos expertos más apropiados para problemas específicos.

Los enfoques existentes como los modelos de mezcla de expertos (MOE) distribuyen el cálculo en múltiples componentes especializados, con un énfasis reciente en enfoques escasos que activan solo los expertos más relevantes por entrada. El método de MOE disperso (SMOE) ha mejorado la eficiencia entre la visión, el lenguaje y las tareas multimodales, pero requiere combinar modelos en el espacio de parámetros a través de la capacitación conjunta. Los marcos más recientes como MOA (mezcla de agentes) intentan abordar esto combinando salidas LLM simbólicamente. Además, los enfoques de razonamiento de múltiples agentes han surgido como alternativas, como la técnica de estudiante-maestro que destila las capacidades de razonamiento de agentes más fuertes a más débiles, mientras que los marcos de debates permiten a múltiples agentes refinar argumentos colectivamente.

Investigadores de UNC Chapel Hill han propuesto Symbolic-MoE, un marco simbólico, basado en texto y sin gradiente de expertos de la mezcla de expertos en texto para permitir la mezcla adaptativa a nivel de instancia de expertos en LLM previamente capacitados. Se necesita una perspectiva de grano fino al enfatizar las habilidades especializadas dentro de dominios más amplios como el álgebra dentro de las matemáticas o la biología molecular dentro del razonamiento biomédico. También introdujeron una estrategia de reclutamiento basada en habilidades que selecciona dinámicamente los LLM de expertos más relevantes para cada tarea de razonamiento específica en función de sus fortalezas demostradas. Además, Symbolic-MoE supera a los LLM fuertes como GPT4O-Mini, así como enfoques multiagentes, con una mejora promedio absoluta de 8.15% sobre la mejor línea de base de múltiples agentes.

Symbolic-MoE consta de tres etapas: creación de perfil de modelo y selección de agregador seguida de reclutamiento de expertos y generación de respuestas finales, las cuales tienen lugar durante la inferencia. Para maximizar el rendimiento y la eficiencia, Symbolic-MoE introduce una estrategia de lotes innovadora donde se analizan primero todas las instancias para determinar qué LLM se necesitarán. Luego, el sistema agrupa de manera inteligente las instancias problemáticas en función de sus expertos requeridos, lo que permite que cada modelo experto activo reciba todas las instancias relevantes en un solo lote y garantice que cada experto se cargue solo una vez. Esta solución permite una inferencia eficiente por lotes en una sola GPU al tiempo que admite un grupo diverso de 16 LLM, con la flexibilidad de agregar más GPU para una mayor paralelización.

Symbolic-Moe muestra un rendimiento excepcional en diversos puntos de referencia. Supera constantemente todos los enfoques de referencia, superando las estrategias de un solo modelo, debates de múltiples agentes con un solo modelo y marcos de múltiples agentes de múltiples modelos como MOA y reconciliados. Supere la línea de base múltiple más fuerte (auto-MOA) mediante una impresionante mejora promedio absoluta del 8.15%, 8.28% en MMLU-Pro, 13.45% en AIME, 4.92% en GPQA y 6.08% en MEDMCQA. Symbolic-MoE alcanza un rendimiento comparable o superior a modelos más grandes con parámetros 70B mediante el uso de cuatro modelos de parámetros 7-8B. Superenta a Llama3.3 70B en AIME y GPQA mientras coincide con su rendimiento en Medmcqa. Las pruebas de eficiencia revelan que opera un 44% más rápido en una sola GPU que MOA mientras logran una mejor precisión.

En conclusión, los investigadores introdujeron Symbolic-MoE, un marco de MOE escalable que combina modelos a través de su producción simbólica. Este método identifica las habilidades necesarias para un problema dado y recluta agentes basados ​​en esas habilidades para participar en una discusión sobre un aporte dado. Symbolic-MoE supera a los métodos estándar de escala de inferencia de inferencia, así como otros marcos de debate y otros métodos de mezcla de agentes, lo que lleva a un rendimiento fuerte en los dominios sin intervención humana. Su rendimiento promedio en las tareas heterogéneas es, de hecho, más fuerte que el de los modelos propietarios avanzados como GPT4O-Mini. Sin embargo, este método tiene limitaciones: (a) implica ejecutar múltiples modelos, lo que aumenta el costo de inferencia, y (b) se basa en las habilidades inferidas de un pequeño conjunto de validación para establecer los perfiles de los agentes.


    Verificar el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 80k+ ml.


    Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.