StepFun ha lanzado Step 5 Preview, su nuevo modelo insignia para el trabajo de agencia. Las cargas de trabajo objetivo son ingeniería de software, trabajo de conocimiento profesional y finanzas. El argumento principal es el costo. El equipo de StepFun afirma que el modelo ofrece inteligencia comparable a un costo de tarea sustancialmente menor. Ése es el marco de la ‘frontera de Pareto’ en el título del lanzamiento.
¿Es desplegable? Sí, como API alojada y en la plataforma StepFun. El autohospedaje espera pesas abiertas. StepFun dice que los pesos abiertos llegarán el 15 de octubre de 2026. Por simple aritmética, los parámetros 600B necesitan alrededor de 1,2 TB en BF16, antes del caché KV. Planifique el hardware de servidor multi-GPU una vez que se envíen los pesos.
Qué envió StepFun
La vista previa del paso 5 es un modelo escaso de mezcla de expertos (MoE). Tiene alrededor de 600 mil millones de parámetros totales y activa alrededor de 27 mil millones por token. Eso es aproximadamente el 4,5% del peso por token.
La documentación oficial del modelo enumera estas especificaciones:
ID del modelo: vista previa del paso 5 Ventana de contexto: 1 millón de tokens Entrada: texto, imágenes y vídeo Salida: texto Esfuerzo de razonamiento: bajo, medio y alto Transmisión, llamada de herramientas, modo JSON, esquema JSON y almacenamiento en caché de mensajes
En las tareas de investigación, el equipo de StepFun afirma que el modelo coordinó 950 búsquedas web en una acción de un solo agente. El equipo de StepFun también documenta la integración de Claude Code a través de su Plan de pasos.
Arquitectura: estrecha y profunda
StepFun no amplió la red. Según Pandaily, apiló 92 capas de Transformer en un diseño estrecho y profundo. El equipo de investigación sostiene que las pilas más profundas ofrecen caminos más largos para el razonamiento implícito de múltiples saltos. Esto es importante durante el llenado previo prolongado, cuando los agentes buscan, ejecutan código y leen los resultados de la herramienta.
La formación se basa en el aprendizaje reforzado a largo plazo y centrado en las políticas. StepFun cita la alineación de inferencia y tren bit a bit en el enrutamiento del MoE. Otras técnicas enumeradas incluyen decodificación especulativa MTP-3, FP8 MoE y descarga de caché KV. StepFun informa una aceleración de extremo a extremo de más de 3 veces para RL de largo horizonte.