Alguien afinó el MiniCPM5-1B de OpenBMB en Claude Fable 5 Traces para enviar un modelo de pensamiento local de 657 MB

Un desarrollador comunitario, GnLOLot, ha publicado un modelo 1B que se ejecuta completamente en hardware local. El modelo es MiniCPM5-1B-Claude-Opus-Fable5-Thinking, con compilaciones GGUF para tiempos de ejecución compatibles con llama.cpp. No necesita clave API y no realiza llamadas a la nube.

El modelo propuesto

El modelo está construido en openbmb/MiniCPM5-1B. Esa base es una versión real y documentada de OpenBMB. Es un modelo denso de 1.08B de parámetros que utiliza una arquitectura estándar LlamaForCausalLM. Tiene 24 capas, atención de consultas agrupadas y una longitud de contexto de 131.072 tokens. OpenBMB reporta SOTA de código abierto de clase 1B dentro de su propio conjunto de comparación.

La base ya incluye una plantilla de pensamiento nativa. El razonamiento se alterna a través de enable_thinking, lo que proporciona un modo Pensar y No Pensar. El modelo derivado mantiene esa plantilla y el formato de llamada a herramientas de MiniCPM5.

Sobre esa base, el desarrollador aplicó un ajuste fino. La tarjeta indica que el modelo está “ajustado aún más con los datos de Fable 5” para mejorar la codificación y el seguimiento de instrucciones. La tarjeta GGUF repite esto como “posentrenada con datos de Fable 5”.

Cómo está realmente construido

El método descrito no es una destilación clásica. No encoge el modelo original. En cambio, generas muchas conversaciones con un modelo de profesor. Captas sus respuestas y rastros de razonamiento como texto. Luego supervisó y ajustó un modelo base más pequeño en esos rastros.

Esta distinción es importante para la precisión. La destilación clásica transfiere señales de los logits o pesos de un maestro. Nadie tiene acceso a los pesos o logits de Claude. Por lo tanto, se trata de un ajuste fino supervisado de los resultados generados, no de una destilación a nivel de peso. El propio modelo base de OpenBMB, por el contrario, utiliza una etapa documentada de Destilación de Políticas entre sus propios puntos de control de profesores y estudiantes.

El efecto práctico es que el modelo 1B aprende a imitar el formato y estilo de respuesta. No absorbe la capacidad subyacente del profesor. Un presupuesto de parámetros 1B no puede contener un razonamiento a escala de frontera.

Las especificaciones que revisan

La ventana de contexto tiene 128.000 tokens, heredados del config.json base (131,072). El repositorio GGUF incluye cuatro cuantificaciones. Q4_K_M tiene aproximadamente 657 MB y está etiquetado como el tamaño más pequeño. Q5_K_M tiene aproximadamente 751 MB. Q8_0 tiene aproximadamente 1,1 GB y es el valor predeterminado recomendado por el mantenedor. F16 tiene aproximadamente 2,1 GB.

La ‘huella de 657 MB’ es la cantidad más pequeña, no la compilación predeterminada. El modelo se carga directamente en llama.cpp, Ollama, LM Studio, jan y KoboldCpp.

Interactivo: cómo funciona la construcción

La siguiente explicación recorre el proceso de construcción, las compensaciones de la huella y la división honesta de lo que un ajuste fino puede y no puede transferir.