Prime Intellect ha lanzado Prime Inference, una plataforma de servicio para modelos de código abierto de vanguardia. Ofrece puntos finales sin servidor y capacidad reservada en las propias GPU de Prime en múltiples centros de datos. Antes de su lanzamiento público, procesaba internamente casi un billón de tokens por día. Ese tráfico provino de implementaciones de RL, generación de datos sintéticos, evaluaciones y agentes de codificación de larga duración.
¿Qué es la inferencia prima?
Prime Inference es la capa de servicio de la pila de entrenamiento abierta de Prime Intellect. La empresa ya envía herramientas posteriores a la capacitación, como prime-rl, verificadores y sandboxes. El servicio cierra ese círculo: los modelos implementados generan rastros de producción que pueden retroalimentar la capacitación. Prime informa que su punto final GLM-5.3 se encuentra entre los más rápidos en OpenRouter. También cita una tasa de error de llamada de herramientas cercana a cero y un tiempo de actividad del 100 % desde el lanzamiento.
Dos modos: puntos finales sin servidor para demanda variable, capacidad reservada para cargas de trabajo sostenidas. Compatible con OpenAI: apunte cualquier SDK de OpenAI a https://api.pinference.ai/api/v1 (docs). Tiempo de actividad: la conmutación por error automática entre centros de datos dirige el tráfico a implementaciones saludables. Hardware: NVIDIA Blackwell hoy, con Vera Rubin en la lista próximamente. Facturación: facturación unificada con seguimiento de uso a nivel de equipo. Los precios por modelo aún no están publicados en su totalidad en los documentos.
Cómo funciona la pila de servicio
La pila combina NVIDIA Dynamo, vLLM, Mooncake y FlashInfer. Fue creado con Inferact y NVIDIA, y las correcciones se aportan en sentido ascendente.
La carga de trabajo objetivo es agente. Un turno típico de agente agrega alrededor de 6.000 tokens a un mensaje de 140.000 tokens. Prime compara esta mezcla con SemiAnalysis AgentX y llegadas en frío inyectadas.
Desglose de precarga/decodificación: el precarga y la decodificación se ejecutan en grupos de GPU separados. Dynamo maneja el enrutamiento y vLLM ejecuta el modelo en cada grupo. Los decodificadores extraen KV calculado a través de NIXL. Prime informa una latencia entre tokens p90 casi un 40% menor en sus pruebas.
Enrutamiento compatible con caché: el enrutador compatible con KV de Dynamo compara la superposición de prefijos almacenados en caché con el trabajo en cola. Las sesiones permanecen en el mismo decodificador entre turnos. Mooncake agrega un segundo nivel KV en la DRAM del host.
GLM-5.3 en GB200 NVL72: los números
El objetivo de interactividad era 100 tokens de un extremo a otro por segundo por usuario. En ese bar, una proporción de precarga/decodificación de 1:4 sirvió a la mayoría de los usuarios. Alcanzó 66 sesiones por grupo de precarga a 101 tok/s por usuario y 100 tok/s de salida por GPU.
Topología de precarga de DEP8: aproximadamente 5 veces más capacidad de caché de prefijo utilizable que TEP8 en el mismo hardware. Presupuesto de precarga más pequeño: reducir a la mitad los tokens por paso de 8K a 4K por GPU redujo la espera media de cola de 550 ms a 110 ms. El tiempo medio hasta el primer token cayó aproximadamente un 20%. Compresión NVFP4 KV: cada fila de caché MLA se redujo de 576 a 352 bytes. Los tokens almacenados en caché por decodificador aumentaron de 1,09 millones a 1,63 millones. Kernel MLA disperso nativo: alrededor de 12,0 μs con 15 tokens de consulta, frente a 17,7 μs en etapas y 13,7 μs en FP8. Prime señala que esto es específico de la carga de trabajo. Diseño BLHNC KV: los descriptores de transferencia cayeron de 19.559 a aproximadamente 1.940. El tiempo medio de transferencia se redujo de 146 ms a 78 ms.
Los agentes fallan cuando las llamadas a herramientas tienen nombres incorrectos o argumentos incompletos. El equipo de Prime Intellect contribuyó con un generador de etiquetas estructurales a Dynamo para el formato de herramienta de GLM. Luego, vLLM usa xgrammar para enmascarar tokens que violan el esquema de la herramienta. El equipo también corrigió errores de análisis, incluido el < que se decodifica en < código interno.