Este artículo de IA de Bytedance presenta Megascale-Infer: un sistema de paralelismo experto desagregado para servir LLM eficiente y escalable con sede en MOE
Los modelos de idiomas grandes se basan en arquitecturas de transformadores y aplicaciones de potencia como el chat, la generación de códigos y la búsqueda, pero su creciente escala con…