Snowflake propone Excot: un nuevo marco de IA que optimiza iterativamente las LLM de código abierto combinando el razonamiento de COT con DPO fuera de política y en política, confiando únicamente en la precisión de la ejecución como retroalimentación

La traducción de texto a SQL, la tarea de transformar consultas de lenguaje natural en declaraciones SQL estructuradas, es esencial para facilitar las interacciones de la base de datos fáciles de usar. Sin embargo, la tarea implica complejidades significativas, en particular la vinculación del esquema, el manejo de la sintaxis SQL compositiva y la resolución de ambigüedades en las consultas de los usuarios. Mientras que los modelos de lenguaje grande (LLM) han mostrado capacidades robustas en varios dominios, la eficacia de las técnicas de razonamiento estructurado, como la cadena de pensamiento (COT) dentro de los contextos de texto a SQL, sigue siendo limitada. Los intentos anteriores de emplear cot cero o optimización de preferencia directa (DPO) sin razonamiento estructurado arrojaron mejoras marginales, lo que indica la necesidad de metodologías más rigurosas.

Snowflake introduce Excot, un marco estructurado diseñado para optimizar los LLM de código abierto a través de la combinación de razonamiento de COT y optimización de preferencias iterativas, utilizando específicamente el DPO fuera de la política y la política guiada exclusivamente por la retroalimentación de la demanda de ejecución. Excot prescinde de modelos de recompensas externas y anotaciones humanas, confiando en su lugar en pasos de razonamiento generados internamente y resultados de ejecución. El método funciona en dos fases principales: inicialmente, genera datos de cot candidatos validados a través de DPO fuera de política, formando la base para el ajuste fino supervisado. Posteriormente, el modelo genera y refina los datos de COT a través de DPO en política, mejorando incrementalmente la precisión a través de la retroalimentación derivada de la corrección de la ejecución.

Excot emplea un razonamiento detallado de COT, particularmente adoptando una estrategia de división y conquista en la que las consultas complejas se descomponen en subterías más simples. Cada subcontrol se analiza y se resuelve independientemente antes de integrarse en una consulta final coherente. Esta descomposición estructurada permite al modelo gestionar la complejidad y las estructuras anidadas comunes en las operaciones SQL de manera más efectiva. La verificación basada en la ejecución sirve como el mecanismo central para la evaluación de la corrección, donde las consultas generadas se validan al comparar sus salidas de ejecución con resultados de verdad por tierra. Las consultas incorrectas y correctas se emparejan sistemáticamente, proporcionando señales explícitas para el aprendizaje basado en preferencias. El refinamiento iterativo en la fase DPO en política mejora progresivamente la precisión de razonamiento del modelo.

La evaluación experimental de Excot demostró mejoras significativas en la precisión de la ejecución. Específicamente, con el modelo LLAMA-3.1 70B, la precisión de ejecución elevada de Excot en el conjunto de desarrollo de aves de 57.37% a 68.51%, y un aumento del rendimiento del conjunto de pruebas de araña de 78.81% a 86.59%. Se registraron mejoras de rendimiento comparables con el modelo 32B de codificadores QWEN-2.5. Estos resultados posicionan el excotor como un enfoque principal en las evaluaciones de un solo modelo para estos puntos de referencia, superando los métodos establecidos como Xiyansql y modelos patentados, incluidas las variantes de OpenAI. En particular, las mejoras mantuvieron consistentemente altas tasas de validez de consultas (superiores al 98%), lo que confirma mejoras en la corrección semántica junto con la precisión sintáctica.

En conclusión, Excot representa un avance metódico en la optimización de razonamiento estructurado para LLM de código abierto aplicados a tareas de texto a SQL. Al integrar el razonamiento de COT estructurado con optimización de preferencias, guiado únicamente por la retroalimentación basada en la ejecución, Excot aborda efectivamente las limitaciones identificadas en métodos anteriores. Su capacidad de refinamiento iterativo asegura una mejora continua sin dependencia de las estructuras de recompensa externas o las anotaciones manuales. La investigación adicional podría explorar extender este marco a entornos de esquema más intrincados y tareas de razonamiento estructurado adicional, ampliando así la aplicabilidad y confiabilidad de los LLM en contextos de generación de consultas estructuradas.


Verificar el Papel, Página de Github y Detalles. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 85k+ ml de subreddit.

🔥 [Register Now] Conferencia virtual de Minicon sobre código abierto AI: Registro gratuito + Certificado de Asistencia + Evento corto de 3 horas (12 de abril, 9 a.m. a 12 p.m. PST) + Hands on Workshop [Sponsored]


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.