¿Qué pasaría si pudiera controlar cuánto tiempo “piensa” un modelo de razonamiento? Los investigadores de CMU introducen L1-1.5b: el aprendizaje de refuerzo optimiza el proceso de pensamiento de IA
Los modelos de lenguaje de razonamiento han demostrado la capacidad de mejorar el rendimiento mediante la generación de secuencias de cadena de pensamiento más largas durante la inferencia, aprovechando efectivamente…