Conozca el ‘North Mini Code’: el modelo 30B de combinación de expertos de peso abierto de Cohere con parámetros activos 3B para codificación agente

Esta semana, el equipo de Cohere AI lanzó su primer modelo de codificación orientado al desarrollador llamado ‘North Mini Code’. ‘North Mini Code’ es de peso abierto y está enfocado a ingenieros de software. Es un modelo de combinación de expertos (MoE) con 30 mil millones de parámetros totales. Solo 3 mil millones de esos parámetros se activan por token.

El comunicado se centra en la IA “soberana”. La idea es simple: ejecute modelos capaces en sus propios términos. Los modelos de codificación pequeños y eficientes permiten a los equipos autohospedarse sin grandes grupos de GPU. North Mini Code apunta directamente a esa brecha.

Mini Código Norte

North Mini Code es un modelo de parámetros 30B-A3B. El A3B representa tres mil millones de parámetros activos por pase hacia adelante. Cohere lo optimizó para tres trabajos: generación de código, ingeniería de software agente y tareas de terminal. El modelo es entrada y salida de texto. No hay entrada de imagen o video.

La ventana de contexto es de 256.000 tokens. La longitud máxima de salida es de 64 KB. Cohere enumera una barra de hardware mínima de un H100 en el FP8. Los pesos se envían bajo Apache 2.0 en Hugging Face. También puede acceder a él a través de Cohere API, Model Vault y OpenRouter.

FieldNorth-Mini-Code-1.0LicenciaApache 2.0 Tamaño del modelo30B en total; 3B longitud del contexto activo256K en total; Generación máxima de 64KOptimizado paraGeneración de código, ingeniería de software agente, tareas de terminalDisponibilidadHugging Face, Cohere API, Cohere Model Vault, OpenRouterHardware (mínimo)1× H100 @ FP8

La Arquitectura

North Mini Code es un transformador solo decodificador con escasas capas MoE. Su atención entrelaza dos tipos en una proporción de 3:1. La atención de ventana corredera utiliza RoPE para las posiciones. La atención global no utiliza ninguna incrustación posicional. El bloque feed-forward cuenta con 128 expertos. Ocho expertos se activan por ficha. Cada experto es un FFN con activación SwiGLU.

El enrutador aplica un sigmoide antes de la selección top-k. Una única capa densa se sitúa delante de las capas escasas. Esa combinación mantiene la computación activa pequeña al tiempo que amplía la capacidad total. Cohere lanzó los pesos en BF16.

El post-entrenamiento se desarrolló en dos fases. Primero vino el ajuste fino supervisado en cascada (SFT) de dos etapas. Luego vino el aprendizaje reforzado con recompensas verificables (RLVR). La capacitación posterior se centró en la codificación agente. El modelo también admite el pensamiento entrelazado y el uso de herramientas nativas.

Puntos de referencia

Cohere informa un 33,4 en el índice de codificación de análisis artificial. Describe esto como una posición competitiva entre modelos de tamaño similar. La empresa evaluó en SWE-Bench Verified, SWE-Bench Pro y Terminal-Bench v2. También utilizó Terminal-Bench Hard, SciCode y LiveCodeBench v6.

La metodología es específica. SWE-Bench utilizó el arnés de agente SWE v1.1.0. Terminal-Bench v2 utilizó un arnés ReAct simple con una herramienta terminal. Terminal-Bench Hard usó el arnés Terminus-2. Cada punto de referencia se ejecutó con tres semillas y luego se promedió. El muestreo utilizó temperatura 1,0 y top_p 0,95.

La velocidad

En las pruebas internas de Cohere, North Mini Code alcanzó un rendimiento de salida hasta 2,8 veces mayor. Eso se mantuvo con idéntica simultaneidad y hardware. También mostró una ventaja del 30% en la latencia entre tokens. El tiempo para obtener la primera ficha estuvo más cerca entre los dos. Devstral Small 2 mantuvo una ligera ventaja en TTFT.

MetricNorth Mini Code frente a Devstral Small 2Rendimiento de salidaHasta 2,8 veces mayor (misma concurrencia y hardware)Latencia entre tokens30% mejor para North Mini CodeTiempo hasta el primer tokenLigeramente por detrás de Devstral Small 2

Casos de uso con ejemplos

Cohere creó North Mini Code para flujos de trabajo agentes.

En su propio encuadre destacan tres estampados:

Orquestación de subagente: un agente principal delega subtareas a los ayudantes. Ejemplo: un agente escribe pruebas unitarias mientras otro corrige el código defectuoso. Mapeo de arquitectura de sistemas: el modelo lee un repositorio y esboza su estructura. Ejemplo: rastrear cómo los servicios se llaman entre sí antes de una gran refactorización. Revisiones de código: el modelo escanea una diferencia en busca de problemas. Ejemplo: marcar una desreferencia nula no protegida antes de una fusión.

Las tareas terminales también se ajustan al modelo. Ejemplo: enumerar archivos, ejecutar una compilación y luego analizar el resultado en busca de errores.

Empezando

El camino más rápido es Hugging Face Transformers. Instale Transformers desde la fuente para este modelo. El muestreo recomendado es temperatura 1,0 y top_p 0,95.

# Instalar Transformers desde la fuente (requerido para este modelo): # pip install “git+https://github.com/huggingface/transformers.git” desde transformadores import AutoTokenizer, AutoModelForCausalLM model_id = “CohereLabs/North-Mini-Code-1.0″ tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, device_map=”auto”) Prompt = “Escribe un programa en Python para comprobar si una cadena es un palíndromo o no.” mensajes = [{“role”: “user”, “content”: prompt}]

# return_dict=True produce un dictado (input_ids + atención_mask), por lo que **inputs descomprime limpiamente inputs = tokenizer.apply_chat_template( mensajes, tokenize=True, add_generación_prompt=True, return_dict=True, return_tensors=”pt”, ).to(model.device) gen_tokens = model.generate( **inputs, max_new_tokens=1024, do_sample=True, Temperature=1.0, top_p=0.95, ) # Decodifica solo los tokens recién generados, no la salida del mensaje = tokenizer.decode(gen_tokens[0][inputs[“input_ids”].forma[-1]:]) imprimir(salida)

Para servir, vLLM funciona. Necesita vLLM main más la biblioteca de melodías de Cohere. El análisis preciso de la respuesta depende de ello.

uv pip install “git+https://github.com/vllm-project/vllm.git” uv pip install “cohere_melody>=0.9.0” vllm server CohereLabs/North-Mini-Code-1.0 \ -tp 2 \ –max-model-len 320000 \ –tool-call-parser cohere_command4 \ –reasoning-parser cohere_command4 \ –enable-auto-tool-choice

Existen compilaciones cuantificadas para Ollama, LM Studio y llama.cpp. También puedes probar el modelo antes de descargarlo. Cohere ofrece acceso gratuito a través de OpenCode y un Hugging Face Space alojado.

Conclusiones clave

El primer modelo de codificación de Cohere, North Mini Code, es una combinación de 30 mil millones de expertos que activa solo 3 mil millones de parámetros por token. Se ejecuta en un solo H100 en FP8, con contexto de 256K y salida máxima de 64K. Los pesos se envían bajo Apache 2.0, aunque la tarjeta Hugging Face agrega una nota no comercial. El lanzamiento oficial de Cohere informa 33,4 en el índice de codificación de análisis artificial y un rendimiento de hasta 2,8 veces mayor que Devstral Small 2. Creado para codificación agente: orquestación de subagente, mapeo de arquitectura, revisiones de código con uso de herramientas nativas.

Explicador interactivo de Marktechpost

Cohere · Modelo de codificación de peso abierto

Mini Código Norte

El primer modelo de codificación para desarrolladores de Cohere: una combinación de 30 mil millones de expertos que activa solo 3 mil millones de parámetros por token, creado para ingeniería de software agente y tareas de terminal.

30 mil millones de parámetros totales
3B activo/token
Contexto de 256K
Salida máxima de 64K
1× H100 @ FP8

Instantánea Cómo funciona Rendimiento Ejecutarlo

El modelo de un vistazo

Pesos abiertos, publicado el 9 de junio de 2026. Entrada de mensajes de texto, salida de mensajes de texto.

Tamaño

30 mil millones en total / 3 mil millones activos

Arquitectura

MoE disperso (solo decodificador)

Hardware mínimo

1× H100 @ FP8

Licencia

Apache 2.0 ver nota

Ventana contextual · arrastrar para explorar

128K fichas

una base de código de tamaño mediano

8KLímite de salida de 64K256K máximo

Los tamaños relacionados son aproximados. Los límites exactos son contexto de 256K y generación máxima de 64K.

Optimizado para

Generación de código
Ingeniería de software agente
Tareas terminales

Casos de uso agentes

Orquestación de subagente
Mapeo de arquitectura de sistemas
Revisiones de código

Nota de licencia: el blog de Cohere indica Apache 2.0. La tarjeta Hugging Face agrega una extensión de uso aceptable y una nota no comercial. Verifique ambos antes de implementar.

El pase hacia adelante

Toca cualquier etapa para ver qué hace. El bloque del MoE es donde ocurre la escasez.

Fichas de entrada

capa densa

Atención (3:1)

bloque MoE

Producción

Fichas de entrada

El texto se tokeniza y se envía a un transformador solo decodificador. El modelo es entrada de texto, salida de texto.

Prueba el enrutador

Cada bloque del Ministerio de Educación cuenta con 128 expertos. El enrutador selecciona 8 por token. Enrute tokens y observe cómo crece la cobertura.

Coral = los 8 expertos disparando ahora. Melocotón = expertos utilizados anteriormente en la ejecución. Pase el cursor sobre un cuadrado para inspeccionarlo.

8 / 128 expertos

El 6,25 % de los expertos ejecutan por token, por lo que el cálculo sigue siendo pequeño.

Expertos únicos utilizados0 / 128

Tokens enrutados0

Enrutar un token → Auto

Restablecer cobertura

Rendimiento informado

Las figuras son de Cohere. Las ejecuciones independientes con tu propia carga de trabajo siguen siendo importantes.

0

Índice de codificación de análisis artificial

0

Rendimiento de salida frente a Devstral Small 2

0

Mejor latencia entre tokens

Rendimiento Latencia entre tokens

Cuanto más alto es mejor

Mini Código Nortehasta 2,8×

Devstral Pequeño 21,0× (valor inicial)

El tiempo hasta el primer token estuvo muy igualado, con Devstral Small 2 manteniendo una ligera ventaja.

Puntos de referencia: SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench v2, Terminal-Bench Hard, SciCode, LiveCodeBench v6. Arneses: SWE-agent v1.1.0 (SWE-Bench), un arnés ReAct con una herramienta terminal (Terminal-Bench v2), Terminus-2 (Terminal-Bench Hard). En cada experimento se utilizaron 3 semillas, en promedio, a una temperatura de 1,0 y top_p 0,95.

Inicio rápido

Hugging Face Transformers, instalado desde la fuente. Muestreo recomendado: temperatura 1,0, top_p 0,95.

Copiar
# Instale Transformers desde la fuente, luego:
de transformadores importar AutoTokenizer, AutoModelForCausalLM medio = “CohereLabs/North-Mini-Code-1.0”
tok = AutoTokenizer.from_pretrained(mid) model = AutoModelForCausalLM.from_pretrained(mid, device_map=“auto”) mensajes = [{“role”: “user”, “content”: “Write a Python palindrome checker.”}]
entradas = tok.apply_chat_template( mensajes, add_generación_prompt=Verdaderoreturn_dict=Verdaderoreturn_tensores=“pt”).to(model.device) out = model.generate(**inputs, max_new_tokens=1024, do_sample=Verdaderotemperatura=1,0, top_p=0,95)
imprimir(tok.decode(fuera[0][inputs[“input_ids”].forma[-1]:]))

Servir con vLLM (+ cohere_melody)
Capacitado para OpenCode
Uso de herramientas nativas + pensamiento entrelazado

Cuantizado: Ollama, LM Studio, llama.cpp
También en Cohere API, Model Vault, OpenRouter

Consulta los pesos de los modelos y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros