Z.ai ha lanzado GLM-5.3-Flash, el primer modelo multimodal nativo de la serie GLM-5 y el modelo de codificación con capacidad más barato que ha enviado el laboratorio. Es un modelo de combinación de expertos con 320 mil millones de parámetros totales y 18 mil millones activos por token, una ventana de contexto de 1,048,576 tokens y entrada de imágenes y videos, publicado bajo una licencia del MIT con pesos en Hugging Face. Según los informes de Z.ai, supera al GLM-5.2 en puntos de referencia y cargas de trabajo reales a aproximadamente una décima parte del precio, mientras que queda a medio punto del Claude Opus 4.8 en su punto de referencia de codificación interna. El modelo pasó su primera semana ejecutándose de forma anónima como “Ox Alpha” en OpenCode y OpenRouter, y se utilizó íntegramente en chips de IA chinos de producción nacional.
¿Es desplegable?
Sí, en dos pistas. Los pesos están disponibles en Hugging Face bajo una licencia del MIT, y una API alojada ya tiene precio y servicio.
¿Qué empresas pueden, de manera realista, autohospedarse? No todos. El punto de control predeterminado de FP8 es aproximadamente 306 GiB de pesos antes del caché KV, y la ruta vLLM actual solo admite NVIDIA Hopper y versiones más recientes. Esto pone el autohospedaje al alcance de organizaciones medianas y grandes con al menos un nodo de 8 GPU (o una bandeja de GB200 en TP4), además de empresas emergentes nativas de IA que alquilan capacidad de GPU. Todos los que están debajo de esa línea lo consumen como una API, donde la economía, no el hardware, es la historia. Industrias con ajuste inmediato: software y herramientas de desarrollo, automatización de TI/BPO, servicios financieros y operaciones de documentos de seguros, BI empresarial y trabajo de conocimientos administrativos, comercio electrónico y cualquier equipo que envíe UI en volumen. Aplicaciones: agentes de codificación a escala de repositorio, agentes de uso de terminal y navegador/computadora, análisis de contratos y registros de millones de tokens, verificación de regresión de la interfaz de usuario a partir de capturas de pantalla y razonamiento de hoja de cálculo/plataforma/panel de control que de otro modo necesitaría una canalización de OCR a texto.