Meta Fair lanzó el Modelo Mundial (CWM), una LLM de decodificador denso de 32 mil millones de paramétricos que solo inyecta el modelado mundial en la generación de códigos mediante la capacitación en trazas de ejecución e interacciones de agente-entorno de orificio largo, no solo un texto de fuente estática.
¿Qué hay de nuevo: código de aprendizaje predecir la ejecución?
CWM Mid-Trains en dos familias numerosas de trayectorias de observación-acción: (1) intérpretes de Python trazas que registran estados variables locales después de cada línea ejecutada, y (2) interacciones de agente dentro de repositorios dockerizados que capturan ediciones, comandos de shell y retroalimentación de pruebas. Esta base está destinada a enseñar semántica (cómo evoluciona el estado) en lugar de solo sintaxis.
Para escalar la colección, el equipo de investigación creó imágenes de repositorio ejecutable de miles de proyectos de GitHub y trayectorias de múltiples pasos forrajadas a través de un agente de ingeniería de software (“Forageragent”). El lanzamiento informa ~ 3m trayectorias a través de ~ 10k imágenes y 3.15K repos, con variantes de mutate-fix y fix.
Modelo y ventana de contexto
CWM es un transformador denso solo de decodificador (sin MOE) con 64 capas, GQA (48Q/8KV), Swiglu, RMSNORM y cuerda escalada. La atención alterna los bloques de ventana deslizante Local 8K y Global 131K, lo que permite el contexto efectivo de 131k tokens; La capacitación utiliza el enmascaramiento de documentos y el enmascaramiento.
Receta de entrenamiento (Pre → Mid → Post)
Pretraimiento general: tokens 8T (código pesado) en un contexto de 8k. Entrenamiento medio: +5T tokens, contexto largo (131k) con trazas de ejecución de Python, datos de formación en busca de relaciones públicas, diferencias derivadas de PR, IR/compiladores, núcleos Triton y matemáticas Lean. Post-Training: 100B-Token SFT para instrucción + razonamiento, luego RL de tareas múltiples (~ 172b-token) a través de entornos SWE de codificación, matemáticas y múltiples giros verificables utilizando un algoritmo de estilo GRPO y un conjunto de herramientas mínimo (BASH/Editar/Creación/Subt). La inferencia cuantificada se ajusta en un solo 80 GB H100.
Puntos de referencia
El equipo de investigación cita el siguiente pase@1 / puntajes (escalado de tiempo de prueba observado cuando corresponda):
SWE-Bench Verificado: 65.8% (con escala de tiempo de prueba). LivecodeBench-V5: 68.6%; LCB-V6: 63.5%. Math-500: 96.6%; AIME-24: 76.0%; AIME-25: 68.2%. Cruxeval-Output: 94.3%.
El equipo de investigación posiciona CWM como competitivo con líneas de base de peso abierto de tamaño similar e incluso con modelos más grandes o cerrados en el banco SWE verificados.
Para el contexto en el diseño y las métricas de tareas de SWE-Bench Verified, consulte los recursos oficiales de referencia.
¿Por qué el modelado mundial es importante para el código?
El lanzamiento enfatiza dos capacidades operativas:
Predicción de ejecución-traza: dada una función y un inicio de rastreo, CWM predice marcos de pila (locales) y la línea ejecutada en cada paso a través de un formato estructurado, utilizado como un “depurador neural” para un razonamiento fundamental sin ejecución en vivo. Codificación de agente: razonamiento múltiple con el uso de la herramienta contra repos reales, verificado por pruebas ocultas y recompensas de similitud de parche; La configuración entrena el modelo para localizar fallas y generar parches de extremo a extremo (Git Diff) en lugar de fragmentos.
Algunos detalles que vale la pena señalar
Tokenizer: familia Llama-3 con tokens de control reservados; Las ID reservadas se utilizan para demarcar segmentos de trazas y razonamiento durante SFT. Diseño de atención: el 3: 1 local: el intercambio global se repite en la profundidad; El entrenamiento de contexto largo ocurre en grandes tamaños de token para estabilizar los gradientes. Escalado de cómputo: los horarios de tasas de aprendizaje/tamaño por lotes se derivan de barridos internos de leyes de escala adaptadas para sobrecargas de contexto largo.
Resumen
CWM es un paso pragmático hacia la generación de código fundamentado: Meta vincula un transformador denso de 32B para el aprendizaje de la ejecución-trace y el parche verificado de la prueba, los puntos de control intermedios/posttrados y el uso de GATES bajo la licencia de investigación no comercial justa, lo que le resulta una plataforma útil para ablaciones de ABLA en larga duración en la investigación de la investigación de la producción.
Echa un vistazo al papel, la página de GitHub y modela en la cara de abrazo. No dude en consultar nuestra página de GitHub para obtener tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro subreddit de 100k+ ml y suscribirse a nuestro boletín.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.
🔥[Recommended Read] NVIDIA AI Open-Sources Vipe (motor de pose de video): una herramienta de anotación de video 3D potente y versátil para AI espacial