Esta semana, el equipo de Cohere AI lanzó su primer modelo de codificación orientado al desarrollador llamado ‘North Mini Code’. ‘North Mini Code’ es de peso abierto y está enfocado a ingenieros de software. Es un modelo de combinación de expertos (MoE) con 30 mil millones de parámetros totales. Solo 3 mil millones de esos parámetros se activan por token.
El comunicado se centra en la IA “soberana”. La idea es simple: ejecute modelos capaces en sus propios términos. Los modelos de codificación pequeños y eficientes permiten a los equipos autohospedarse sin grandes grupos de GPU. North Mini Code apunta directamente a esa brecha.
Mini Código Norte
North Mini Code es un modelo de parámetros 30B-A3B. El A3B representa tres mil millones de parámetros activos por pase hacia adelante. Cohere lo optimizó para tres trabajos: generación de código, ingeniería de software agente y tareas de terminal. El modelo es entrada y salida de texto. No hay entrada de imagen o video.
La ventana de contexto es de 256.000 tokens. La longitud máxima de salida es de 64 KB. Cohere enumera una barra de hardware mínima de un H100 en el FP8. Los pesos se envían bajo Apache 2.0 en Hugging Face. También puede acceder a él a través de Cohere API, Model Vault y OpenRouter.
La Arquitectura
North Mini Code es un transformador solo decodificador con escasas capas MoE. Su atención entrelaza dos tipos en una proporción de 3:1. La atención de ventana corredera utiliza RoPE para las posiciones. La atención global no utiliza ninguna incrustación posicional. El bloque feed-forward cuenta con 128 expertos. Ocho expertos se activan por ficha. Cada experto es un FFN con activación SwiGLU.
El enrutador aplica un sigmoide antes de la selección top-k. Una única capa densa se sitúa delante de las capas escasas. Esa combinación mantiene la computación activa pequeña al tiempo que amplía la capacidad total. Cohere lanzó los pesos en BF16.
El post-entrenamiento se desarrolló en dos fases. Primero vino el ajuste fino supervisado en cascada (SFT) de dos etapas. Luego vino el aprendizaje reforzado con recompensas verificables (RLVR). La capacitación posterior se centró en la codificación agente. El modelo también admite el pensamiento entrelazado y el uso de herramientas nativas.
Puntos de referencia
Cohere informa un 33,4 en el índice de codificación de análisis artificial. Describe esto como una posición competitiva entre modelos de tamaño similar. La empresa evaluó en SWE-Bench Verified, SWE-Bench Pro y Terminal-Bench v2. También utilizó Terminal-Bench Hard, SciCode y LiveCodeBench v6.
La metodología es específica. SWE-Bench utilizó el arnés de agente SWE v1.1.0. Terminal-Bench v2 utilizó un arnés ReAct simple con una herramienta terminal. Terminal-Bench Hard usó el arnés Terminus-2. Cada punto de referencia se ejecutó con tres semillas y luego se promedió. El muestreo utilizó temperatura 1,0 y top_p 0,95.
La velocidad
En las pruebas internas de Cohere, North Mini Code alcanzó un rendimiento de salida hasta 2,8 veces mayor. Eso se mantuvo con idéntica simultaneidad y hardware. También mostró una ventaja del 30% en la latencia entre tokens. El tiempo para obtener la primera ficha estuvo más cerca entre los dos. Devstral Small 2 mantuvo una ligera ventaja en TTFT.
Casos de uso con ejemplos
Cohere creó North Mini Code para flujos de trabajo agentes.
En su propio encuadre destacan tres estampados:
Orquestación de subagente: un agente principal delega subtareas a los ayudantes. Ejemplo: un agente escribe pruebas unitarias mientras otro corrige el código defectuoso. Mapeo de arquitectura de sistemas: el modelo lee un repositorio y esboza su estructura. Ejemplo: rastrear cómo los servicios se llaman entre sí antes de una gran refactorización. Revisiones de código: el modelo escanea una diferencia en busca de problemas. Ejemplo: marcar una desreferencia nula no protegida antes de una fusión.
Las tareas terminales también se ajustan al modelo. Ejemplo: enumerar archivos, ejecutar una compilación y luego analizar el resultado en busca de errores.
Empezando
El camino más rápido es Hugging Face Transformers. Instale Transformers desde la fuente para este modelo. El muestreo recomendado es temperatura 1,0 y top_p 0,95.
# return_dict=True produce un dictado (input_ids + atención_mask), por lo que **inputs descomprime limpiamente inputs = tokenizer.apply_chat_template( mensajes, tokenize=True, add_generación_prompt=True, return_dict=True, return_tensors=”pt”, ).to(model.device) gen_tokens = model.generate( **inputs, max_new_tokens=1024, do_sample=True, Temperature=1.0, top_p=0.95, ) # Decodifica solo los tokens recién generados, no la salida del mensaje = tokenizer.decode(gen_tokens[0][inputs[“input_ids”].forma[-1]:]) imprimir(salida)
Para servir, vLLM funciona. Necesita vLLM main más la biblioteca de melodías de Cohere. El análisis preciso de la respuesta depende de ello.
Existen compilaciones cuantificadas para Ollama, LM Studio y llama.cpp. También puedes probar el modelo antes de descargarlo. Cohere ofrece acceso gratuito a través de OpenCode y un Hugging Face Space alojado.
Conclusiones clave
El primer modelo de codificación de Cohere, North Mini Code, es una combinación de 30 mil millones de expertos que activa solo 3 mil millones de parámetros por token. Se ejecuta en un solo H100 en FP8, con contexto de 256K y salida máxima de 64K. Los pesos se envían bajo Apache 2.0, aunque la tarjeta Hugging Face agrega una nota no comercial. El lanzamiento oficial de Cohere informa 33,4 en el índice de codificación de análisis artificial y un rendimiento de hasta 2,8 veces mayor que Devstral Small 2. Creado para codificación agente: orquestación de subagente, mapeo de arquitectura, revisiones de código con uso de herramientas nativas.
Explicador interactivo de Marktechpost
Cohere · Modelo de codificación de peso abierto
Mini Código Norte
El primer modelo de codificación para desarrolladores de Cohere: una combinación de 30 mil millones de expertos que activa solo 3 mil millones de parámetros por token, creado para ingeniería de software agente y tareas de terminal.
30 mil millones de parámetros totales
3B activo/token
Contexto de 256K
Salida máxima de 64K
1× H100 @ FP8
Instantánea Cómo funciona Rendimiento Ejecutarlo
El modelo de un vistazo
Pesos abiertos, publicado el 9 de junio de 2026. Entrada de mensajes de texto, salida de mensajes de texto.
Tamaño
30 mil millones en total / 3 mil millones activos
Arquitectura
MoE disperso (solo decodificador)
Hardware mínimo
1× H100 @ FP8
Licencia
Apache 2.0 ver nota
Ventana contextual · arrastrar para explorar
128K fichas
una base de código de tamaño mediano
8KLímite de salida de 64K256K máximo
Los tamaños relacionados son aproximados. Los límites exactos son contexto de 256K y generación máxima de 64K.
Optimizado para
Generación de código
Ingeniería de software agente
Tareas terminales
Casos de uso agentes
Orquestación de subagente
Mapeo de arquitectura de sistemas
Revisiones de código
Nota de licencia: el blog de Cohere indica Apache 2.0. La tarjeta Hugging Face agrega una extensión de uso aceptable y una nota no comercial. Verifique ambos antes de implementar.
El pase hacia adelante
Toca cualquier etapa para ver qué hace. El bloque del MoE es donde ocurre la escasez.
Fichas de entrada
→
capa densa
→
Atención (3:1)
→
bloque MoE
→
Producción
Fichas de entrada
El texto se tokeniza y se envía a un transformador solo decodificador. El modelo es entrada de texto, salida de texto.
Prueba el enrutador
Cada bloque del Ministerio de Educación cuenta con 128 expertos. El enrutador selecciona 8 por token. Enrute tokens y observe cómo crece la cobertura.
Coral = los 8 expertos disparando ahora. Melocotón = expertos utilizados anteriormente en la ejecución. Pase el cursor sobre un cuadrado para inspeccionarlo.
8 / 128 expertos
El 6,25 % de los expertos ejecutan por token, por lo que el cálculo sigue siendo pequeño.
Expertos únicos utilizados0 / 128
Tokens enrutados0
Enrutar un token → Auto
Restablecer cobertura
Rendimiento informado
Las figuras son de Cohere. Las ejecuciones independientes con tu propia carga de trabajo siguen siendo importantes.
0
Índice de codificación de análisis artificial
0
Rendimiento de salida frente a Devstral Small 2
0
Mejor latencia entre tokens
Rendimiento Latencia entre tokens
Cuanto más alto es mejor
El tiempo hasta el primer token estuvo muy igualado, con Devstral Small 2 manteniendo una ligera ventaja.
Puntos de referencia: SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench v2, Terminal-Bench Hard, SciCode, LiveCodeBench v6. Arneses: SWE-agent v1.1.0 (SWE-Bench), un arnés ReAct con una herramienta terminal (Terminal-Bench v2), Terminus-2 (Terminal-Bench Hard). En cada experimento se utilizaron 3 semillas, en promedio, a una temperatura de 1,0 y top_p 0,95.
Inicio rápido
Hugging Face Transformers, instalado desde la fuente. Muestreo recomendado: temperatura 1,0, top_p 0,95.
Copiar
# Instale Transformers desde la fuente, luego:
de transformadores importar AutoTokenizer, AutoModelForCausalLM medio = “CohereLabs/North-Mini-Code-1.0”
tok = AutoTokenizer.from_pretrained(mid) model = AutoModelForCausalLM.from_pretrained(mid, device_map=“auto”) mensajes = [{“role”: “user”, “content”: “Write a Python palindrome checker.”}]
entradas = tok.apply_chat_template( mensajes, add_generación_prompt=Verdaderoreturn_dict=Verdaderoreturn_tensores=“pt”).to(model.device) out = model.generate(**inputs, max_new_tokens=1024, do_sample=Verdaderotemperatura=1,0, top_p=0,95)
imprimir(tok.decode(fuera[0][inputs[“input_ids”].forma[-1]:]))
Servir con vLLM (+ cohere_melody)
Capacitado para OpenCode
Uso de herramientas nativas + pensamiento entrelazado
Cuantizado: Ollama, LM Studio, llama.cpp
También en Cohere API, Model Vault, OpenRouter
Consulta los pesos de los modelos y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros