Thinking Machines Lab puso su API de capacitación Tinker en disponibilidad general y agregó 3 capacidades principales: soporte para el modelo de razonamiento Kimi K2 Thinking, muestreo compatible con OpenAI e ingreso de imágenes a través de modelos de lenguaje de visión Qwen3-VL. Para los ingenieros de IA, esto convierte a Tinker en una forma práctica de ajustar modelos de frontera sin construir una infraestructura de capacitación distribuida.
¿Qué hace realmente Tinker?
Tinker es una API de capacitación que se centra en el ajuste fino de modelos de lenguajes grandes y oculta el trabajo pesado de la capacitación distribuida. Escribe un bucle Python simple que se ejecuta en una máquina que solo tiene CPU. Usted define los datos o el entorno de RL, la pérdida y la lógica de entrenamiento. El servicio Tinker asigna ese bucle a un grupo de GPU y ejecuta el cálculo exacto que usted especifica.
La API expone un pequeño conjunto de primitivas, como forward_backward para calcular gradientes, optim_step para actualizar pesos, muestra para generar resultados y funciones para guardar y cargar estados. Esto mantiene la lógica de entrenamiento explícita para las personas que desean implementar aprendizaje supervisado, aprendizaje por refuerzo u optimización de preferencias, pero no desean administrar fallas y programación de GPU.
Tinker utiliza una adaptación de rango bajo, LoRA, en lugar de un ajuste fino completo para todos los modelos compatibles. LoRA entrena pequeñas matrices adaptadoras sobre pesos base congelados, lo que reduce la memoria y hace que sea práctico ejecutar experimentos repetidos en una gran mezcla de modelos expertos en el mismo grupo.
Disponibilidad general y pensamiento Kimi K2
El cambio principal en la actualización de diciembre de 2025 es que Tinker ya no tiene lista de espera. Cualquiera puede registrarse, ver la gama de modelos y precios actuales y ejecutar ejemplos de libros de cocina directamente.
En cuanto al modelo, los usuarios ahora pueden ajustar moonshotai/Kimi-K2-Thinking en Tinker. Kimi K2 Thinking es un modelo de razonamiento con aproximadamente 1 billón de parámetros totales en una combinación de arquitectura experta. Está diseñado para largas cadenas de pensamiento y uso intensivo de herramientas, y actualmente es el modelo más grande del catálogo de Tinker.
En la línea de modelos Tinker, Kimi K2 Thinking aparece como un modelo Reasoning MoE, junto con Qwen3 denso y una mezcla de variantes expertas, modelos de generación Llama-3 y DeepSeek-V3.1. Los modelos de razonamiento siempre producen cadenas internas de pensamiento antes de la respuesta visible, mientras que los modelos de instrucción se centran en la latencia y las respuestas directas.
Muestreo compatible con OpenAI durante el entrenamiento
Tinker ya tenía una interfaz de muestreo nativa a través de su SamplingClient. El patrón de inferencia típico crea un ModelInput a partir de identificadores de token, pasa SamplingParams y llama a sample para obtener un futuro que se resuelva en salidas.
La nueva versión agrega una segunda ruta que refleja la interfaz de finalización de OpenAI. Se puede hacer referencia a un punto de control de modelo en Tinker a través de un URI como:
Entrada de visión con Qwen3-VL en Tinker
La segunda capacidad importante es la entrada de imágenes. Tinker ahora expone 2 modelos de lenguaje de visión Qwen3-VL, Qwen/Qwen3-VL-30B-A3B-Instruct y Qwen/Qwen3-VL-235B-A22B-Instruct. Están listados en la línea de modelos Tinker como modelos Vision MoE y están disponibles para entrenamiento y muestreo a través de la misma superficie API.
Para enviar una imagen a un modelo, construye un ModelInput que intercala un ImageChunk con fragmentos de texto. El blog de investigación utiliza el siguiente ejemplo mínimo:
tinker.types.ImageChunk(data=image_data, format=”png”),
tinker.types.EncodedTextChunk(tokens=tokenizer.encode(“What is this?”)),
])
Aquí image_data son bytes sin formato y el formato identifica la codificación, por ejemplo png o jpeg. Puede utilizar la misma representación para el aprendizaje supervisado y para el ajuste fino de RL, lo que mantiene las canalizaciones multimodales coherentes a nivel de API. Las entradas de visión son totalmente compatibles con la configuración de entrenamiento LoRA de Tinker.
Qwen3-VL versus DINOv2 en clasificación de imágenes
Para mostrar lo que puede hacer la nueva ruta de visión, el equipo de Tinker ajustó Qwen3-VL-235B-A22B-Instruct como clasificador de imágenes. Utilizaron 4 conjuntos de datos estándar:
Caltech 101 Coches de Stanford Flores de Oxford Mascotas de Oxford
Debido a que Qwen3-VL es un modelo de lenguaje con entrada visual, la clasificación se enmarca como generación de texto. El modelo recibe una imagen y genera el nombre de la clase como una secuencia de texto.
Como punto de partida, perfeccionaron un modelo base DINov2. DINOv2 es un transformador de visión autosupervisado que codifica imágenes en incrustaciones y se utiliza a menudo como columna vertebral para tareas de visión. Para este experimento, se adjunta un cabezal de clasificación encima de DINOv2 para predecir una distribución sobre las N etiquetas en cada conjunto de datos.
Tanto la base Qwen3-VL-235B-A22B-Instruct como la base DINov2 se entrenan utilizando adaptadores LoRA dentro de Tinker. La atención se centra en la eficiencia de los datos. El experimento barre el número de ejemplos etiquetados por clase, comenzando con solo 1 muestra por clase y aumentando. Para cada entorno, el equipo mide la precisión de la clasificación.
Conclusiones clave
Tinker ahora está disponible de forma generalizada, por lo que cualquiera puede registrarse y ajustar los LLM de peso abierto a través de un ciclo de capacitación de Python mientras Tinker maneja el backend de capacitación distribuida. La plataforma es compatible con Kimi K2 Thinking, una combinación de 1 billón de parámetros de modelo de razonamiento de expertos de Moonshot AI, y lo expone como un modelo de razonamiento ajustable en la línea Tinker. Tinker agrega una interfaz de inferencia compatible con OpenAI, que le permite tomar muestras de los puntos de control de entrenamiento utilizando un URI modelo tinker://… a través de herramientas y clientes de estilo OpenAI estándar. La entrada de visión se habilita a través de los modelos Qwen3-VL, Qwen3-VL 30B y Qwen3-VL 235B, por lo que los desarrolladores pueden crear canales de capacitación multimodales que combinen entradas de ImageChunk con texto utilizando la misma API basada en LoRA. Thinking Machines demuestra que Qwen3-VL 235B, ajustado en Tinker, logra un rendimiento de clasificación de imágenes de pocas tomas más fuerte que una línea base DINOv2 en conjuntos de datos como Caltech 101, Stanford Cars, Oxford Flowers y Oxford Pets, destacando la eficiencia de los datos de los modelos de lenguaje de visión grande.
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.