Nous Research lanza entrenamiento de superposición de tokens para acelerar el entrenamiento previo de LLM hasta 2,5 veces en modelos de parámetros de 270 millones a 10 mil millones
La capacitación previa de modelos de lenguaje grandes es lo suficientemente costosa como para que incluso mejoras modestas en la eficiencia puedan traducirse en ahorros significativos de costos y tiempo.…