Acelerar la inferencia de LLM con peso y activación posteriores al entrenamiento usando AWQ y GPTQ en Amazon SageMaker AI
Los modelos básicos (FM) y los modelos de lenguaje grande (LLM) se han ampliado rápidamente y, a menudo, duplicaron el recuento de parámetros en cuestión de meses, lo que generó…