Microsoft AI lanzó LongRope2: un método casi pérdida para extender las ventanas de contexto del modelo de idioma grande a 128k tokens mientras conserva más del 97% de precisión de contexto corto

Los modelos de lenguaje grande (LLM) han avanzado significativamente, pero una limitación clave sigue siendo su incapacidad para procesar secuencias de contexto largo de manera efectiva. Mientras que modelos como GPT-4O y LLAMA3.1 admiten ventanas de contexto de hasta 128k tokens, mantener un alto rendimiento en extensión es un desafío. Incrustos posicionales rotativos (cuerda) codifican información posicional en LLM pero sufren problemas fuera de distribución (OOD) cuando se aplican más allá de sus límites previamente entrenados. Estos valores OOD aparecen en incrustaciones de cuerdas de dimensiones más altas, lo que lleva a un rendimiento degradado. Las ventanas de contexto más largas son esenciales para aplicaciones de IA, como conversaciones múltiples, análisis de documentos y razonamiento de forma larga. LLMS lucha con eficiencia y precisión al escalar más allá de sus longitudes predeterminadas sin un método de extensión efectivo.

La mayoría de los métodos existentes para extender las ventanas de contexto se basan en el reescalado de la cuerda basada en la heurística, lo que no aborda los problemas de OOD por completo y a menudo no alcanza la longitud de contexto efectiva del objetivo. Enfoques como el hilo, NTK y Longrope derivan factores de reescalado de los modelos teóricos, pero las pruebas del mundo real revelan compensaciones significativas de rendimiento. Por ejemplo, cuando LLAMA3.1 extiende su ventana de contexto utilizando el hilo, el rendimiento cae bruscamente más allá de 64K tokens, como se muestra en el punto de referencia de la regla. La extensión de la longitud del contexto también reduce con frecuencia el rendimiento de corto contexto, lo que hace que estos métodos sean poco prácticos para aplicaciones de procesamiento de corto y largo alcance. Este problema es particularmente severo en modelos como PHI3-MINI-3.8B, donde las extensiones de cuerda ingenuas reducen las puntuaciones de MMLU en 7.56 puntos.

Los investigadores de Microsoft han introducido Longrope2 para superar estas limitaciones. LongRope2 está diseñado para extender la ventana de contexto de LLM a 128k tokens al tiempo que preserva más del 98.5% de la precisión de contexto corto. Logra esto abordando tres problemas centrales. Primero, el equipo de investigación planteó la hipótesis de que las dimensiones de cuerda más altas reciben capacitación insuficiente, lo que lleva a valores de OOD inesperados al extender posiciones de token. Para mitigar esto, LongRope2 introduce una evaluación de perplejidad impulsada por la aguja (PPL) que se dirige específicamente a los tokens que requieren una comprensión contextual profunda, a diferencia de las medidas de perplejidad tradicionales que no pueden distinguir entre tokens esenciales y no esenciales. En segundo lugar, Longrope2 adopta un algoritmo de reescalado evolutivo de cuerdas basadas en la búsqueda, que optimiza los factores de reescalado más allá de los supuestos teóricos, asegurando una mejor alineación con contextos extendidos. Finalmente, incorpora el entrenamiento de ventanas de contexto mixto, en el que el modelo está ajustado en secuencias cortas y largas, evitando así la pérdida de rendimiento en las tareas de corto contexto al tiempo que garantiza una adaptación efectiva de contexto largo.

El enfoque técnico de Longrope2 comienza con la identificación de la verdadera dimensión crítica en los incrustaciones de la cuerda. El estudio encontró que las dimensiones críticas teóricas subestiman las verdaderas necesidades de escala de la cuerda, como lo demuestran las observaciones empíricas donde las dimensiones de la cuerda requerían factores de escala más grandes que predichos para un rendimiento óptimo. Esto condujo al desarrollo de un método de reescalado adaptativo que ajuste los factores de escala de cuerda utilizando una búsqueda evolutiva iterativa. A diferencia de los métodos de escala estática anteriores, LongRope2 ajusta dinámicamente la reescalado en función de las evaluaciones de perplejidad por token, lo que garantiza que los incrustaciones permanezcan dentro del rango previamente capacitado al tiempo que maximiza su efectividad en contextos largos. El algoritmo identifica los factores de reescalado óptimos para dimensiones de cuerda más altas mientras se aplica la escala NTK a dimensiones más bajas, asegurando un proceso de adaptación suave. Este método extiende efectivamente los tokens LLAMA3-8B a 128K, manteniendo más del 97% de su precisión de contexto corto mientras superan los métodos anteriores en los puntos de referencia de contexto largo.

Las evaluaciones de rendimiento revelan la superioridad de Longrope2 en varios puntos de referencia. Las extensas pruebas PHI3-MINI-3.8B y LLAMA3-8B muestran que LongRope2 logra resultados de vanguardia, Longbench e Infinitebench. En el punto de referencia de la regla, que evalúa las capacidades de procesamiento de contexto largo de LLMS, LongRope2 extendió Llama3-8B a 128k tokens mientras conserva una puntuación de 82.03, en comparación con 73.40 para Longrope y 49.39 para el hilo. Phi3-Mini-3.8b exhibió mejoras aún mayores, con una puntuación de token de 128k de 58.81, superando significativamente a NTK, que solo logró 49.37 a la misma longitud de contexto. Uno de los hallazgos más sorprendentes fue que el enfoque de Meta requirió tokens de entrenamiento 800B para alcanzar los 128k tokens, mientras que LongRope2 logró esto utilizando solo tokens de 10B, una ganancia de eficiencia de 80x. Además, LongRope2 logró una precisión casi perfecta en la aguja en una prueba de presión de pajar, lo que demuestra su capacidad para recuperar información profundamente integrada en secuencias largas, donde los métodos anteriores como NTK a menudo fallaban en longitudes extendidas.

Una de las conclusiones clave de esta investigación es que la extensión de las ventanas de contexto de LLM no es solo una cuestión de aumentar la longitud del token, sino que requiere abordar limitaciones fundamentales en las incrustaciones posicionales. Los hallazgos sugieren que las dimensiones de la cuerda más altas están insuficientemente capacitadas, lo que requiere una escala adaptativa en lugar de factores de reescalado fijos. La evaluación de la PPL impulsada por la aguja demostró ser crucial para identificar los factores óptimos de escala de la cuerda, asegurando que los modelos mantengan la precisión en las dependencias de largo alcance. La técnica de entrenamiento de ventanas de contexto mixto aseguró que los modelos conservaron más del 97.6% de su rendimiento de cortaffusión, lo que convierte a Longrope2 en el primer método de extensión casi sin pérdida. Además, la búsqueda evolutiva de Longrope2 de factores de reescalado de cuerdas reveló que los métodos analíticos anteriores subestimaron las necesidades de escala en las incrustaciones de alta dimensión, lo que condujo al rendimiento subóptimo en enfoques anteriores.

Algunos destacados clave de la investigación incluyen:

  1. LongRope2 extendió con éxito Llama3-8b a 128k tokens con una precisión del 82.03%, superando todos los métodos anteriores.
  2. A diferencia del enfoque de Meta, que requirió tokens de entrenamiento 800B, LongRope2 logró la misma extensión utilizando solo tokens de 10B, lo que lo convierte en 80x más eficiente.
  3. El modelo retuvo el 97.6% del rendimiento de corto contexto, mientras que los métodos anteriores se degradaron significativamente.
  4. La evaluación de perplejidad impulsada por la aguja introdujo un método novedoso para determinar los factores de reescalado óptimos de la cuerda, lo que permite una adaptación precisa a contextos largos.
  5. En el punto de referencia de la regla, Longrope2 obtuvo 82.03 a 128k, en comparación con 73.40 para Longrope y 49.39 para hilo.
  6. El modelo logró una precisión de recuperación casi perfecta en la aguja en una prueba de pajar, superando significativamente los enfoques basados ​​en NTK.
  7. Longrope2 demostró que la escala adaptativa basada en la búsqueda evolutiva es muy superior a las técnicas de reescalado estático.

Verificar el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 80k+ ml.

🚨 Lectura de lectura recomendada Liberaciones de investigación de IA: un sistema avanzado que integra el sistema de IA del agente y los estándares de cumplimiento de datos para abordar las preocupaciones legales en los conjuntos de datos de IA


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.