Conozca Llemma: el modelo matemático de lenguaje abierto de próxima generación que supera los puntos de referencia actuales

Los modelos de lenguaje entrenados en diversas mezclas de texto muestran capacidades de generación y comprensión del lenguaje notablemente generales, y sirven como modelos base que se adaptan a una amplia gama de aplicaciones.

En este estudio, un equipo de investigadores de la Universidad de Princeton, EleutherAI, la Universidad de Toronto, el Vector Institute, la Universidad de Cambridge, la Universidad Carnegie Mellon y la Universidad de Washington han desarrollado un modelo de lenguaje de dominio específico adaptado a las matemáticas. Han articulado varias motivaciones para llevar a cabo este esfuerzo. En primer lugar, la resolución de problemas matemáticos requiere la capacidad de discernir patrones dentro de un corpus sustancial de conocimientos previos especializados, lo que lo convierte en un contexto ideal para la adaptación del dominio. En segundo lugar, el razonamiento matemático en sí mismo representa una tarea central dentro del campo de la inteligencia artificial y continúa siendo un tema de investigación contemporánea. En tercer lugar, el desarrollo de modelos de lenguaje capaces de realizar un razonamiento matemático sólido tiene implicaciones más amplias para diversas áreas de investigación, incluidos los modelos de recompensa, el aprendizaje por refuerzo para el razonamiento en el contexto y el razonamiento algorítmico.

La imagen de arriba demuestra que el entrenamiento previo continuo en ProofPile-2 produce LLEMMA, un modelo base con capacidades matemáticas mejoradas. Las aportaciones realizadas por los autores son las siguientes:

  • Han entrenado y puesto a disposición los modelos LLEMMA, que comprenden modelos de lenguaje de parámetros 7B y 34B que están diseñados específicamente para tareas matemáticas. Estos modelos LLEMMA representan un nuevo estado del arte en el ámbito de los modelos base para matemáticas publicados públicamente.
  • Han presentado AlgebraicStack, un conjunto de datos que abarca 11.000 millones de tokens de código que está estrechamente vinculado a contextos matemáticos.
  • Su investigación muestra la competencia de los modelos LLEMMA en el empleo de herramientas computacionales para resolver problemas matemáticos, incluido el intérprete de Python y los demostradores de teoremas formales.

A diferencia de modelos anteriores de lenguaje matemático como Minerva (Lewkowycz et al., 2022), los modelos LLEMMA son de acceso abierto y los autores han hecho que sus datos y código de entrenamiento sean de código abierto. Esta decisión facilita el papel de LLEMMA como plataforma para avanzar en futuras investigaciones en el campo del razonamiento matemático.

Su trabajo amplía la investigación realizada en Minerva, como lo describen Lewkowycz et al. (2022), con varias distinciones notables:

(1) Su modelo, LLEMMA, abarca un espectro más amplio de datos y tareas tanto durante la capacitación como durante la evaluación. Esto incluye la incorporación de datos de código, como AlgebraicStack, la utilización de diversas herramientas y la participación en tareas matemáticas formales.

(2) El enfoque de los autores se basa únicamente en herramientas y fuentes de datos de acceso público.

(3) Introducen nuevos análisis relacionados con aspectos como la composición de la combinación de datos de entrenamiento, los patrones de memorización y el ajuste fino supervisado suplementario.

(4) Es importante destacar que todos los artefactos relacionados con su trabajo se ponen a disposición del público abiertamente.

Los investigadores anticipan que LLEMMA y Proof-Pile-2 proporcionarán una base sólida para futuras investigaciones. Estos recursos están preparados para respaldar los esfuerzos de investigación en áreas como la generalización de modelos de lenguaje, el análisis de la composición de conjuntos de datos, la extensión de modelos de lenguaje de dominios específicos, la utilización de modelos de lenguaje como herramientas para matemáticos y la mejora de las capacidades matemáticas de los modelos de lenguaje.


Revisar la Papel y enlace de github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 32k+ ML, Comunidad de Facebook de más de 40.000 personas, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.

También estamos en WhatsApp. Únase a nuestro canal de IA en Whatsapp.


Janhavi Lande, se graduó en Ingeniería Física del IIT Guwahati, promoción de 2023. Es una futura científica de datos y ha estado trabajando en el mundo de la investigación ml/ai durante los últimos dos años. Lo que más le fascina es este mundo en constante cambio y su constante exigencia de que los humanos se mantengan al día. En su pasatiempo le gusta viajar, leer y escribir poemas.