El equipo Qwen de Alibaba ha lanzado Qwen3.6-27B, el primer modelo denso y de peso abierto de la familia Qwen3.6, y posiblemente el modelo de 27 mil millones de parámetros más capaz disponible en la actualidad para agentes de codificación. Aporta mejoras sustanciales en codificación agente, un novedoso mecanismo de preservación del pensamiento y una arquitectura híbrida que combina la atención lineal Gated DeltaNet con la autoatención tradicional, todo bajo una licencia Apache 2.0.
El lanzamiento se produce semanas después del Qwen3.6-35B-A3B, un modelo escaso de Mezcla de Expertos (MoE) con solo 3B de parámetros activos que a su vez siguió la serie más amplia Qwen3.5. Qwen3.6-27B es el segundo modelo de la familia y la primera variante completamente densa, y en varios puntos de referencia clave, en realidad supera tanto al Qwen3.6-35B-A3B como al modelo MoE Qwen3.5-397B-A17B, mucho más grande. El equipo de Qwen describe el lanzamiento como una prioridad de “estabilidad y utilidad en el mundo real”, moldeada por comentarios directos de la comunidad en lugar de optimización de referencia.
El equipo de Qwen lanza dos variantes de peso en Hugging Face Hub: Qwen/Qwen3.6-27B en BF16 y Qwen/Qwen3.6-27B-FP8, una versión cuantificada que utiliza cuantificación FP8 de grano fino con un tamaño de bloque de 128, con métricas de rendimiento casi idénticas al modelo original. Ambas variantes son compatibles con SGLang (>=0.5.10), vLLM (>=0.19.0), KTransformers y Hugging Face Transformers.
Novedades: dos características clave
Agentic Coding es la primera actualización importante. El modelo se ha optimizado específicamente para manejar flujos de trabajo frontend y razonamiento a nivel de repositorio: tareas que requieren comprender una gran base de código, navegar por estructuras de archivos, editar en múltiples archivos y producir resultados consistentes y ejecutables. En QwenWebBench, un punto de referencia interno bilingüe (EN/CN) de generación de código front-end que abarca siete categorías: diseño web, aplicaciones web, juegos, SVG, visualización de datos, animación y 3D, Qwen3.6-27B obtiene una puntuación de 1487, un salto significativo de 1068 para Qwen3.5-27B y 1397 para Qwen3.6-35B-A3B. En NL2Repo, que prueba la generación de código a nivel de repositorio, el modelo obtiene una puntuación de 36,2 frente a 27,3 para Qwen3.5-27B. En SWE-bench Verified, el estándar comunitario para agentes autónomos de ingeniería de software, alcanza 77,2, frente a 75,0, y es competitivo con el 80,9 de Claude 4.5 Opus.
Thinking Preservation es la segunda incorporación, y posiblemente la más interesante desde el punto de vista arquitectónico. De forma predeterminada, la mayoría de los LLM solo conservan el razonamiento de cadena de pensamiento (CoT) generado para el mensaje del usuario actual; Se descarta el razonamiento de giros anteriores. Qwen3.6 introduce una nueva opción, habilitada a través de “chat_template_kwargs”: {“preserve_thinking”: True} en la API, para retener y aprovechar los rastros de pensamiento de los mensajes históricos a lo largo de toda la conversación. Para los flujos de trabajo de agentes iterativos, esto es prácticamente significativo: el modelo lleva adelante el contexto de razonamiento anterior en lugar de volver a derivarlo en cada turno. Esto puede reducir el consumo general de tokens al minimizar el razonamiento redundante y también mejorar la utilización de la caché KV.
Debajo del capó: una arquitectura híbrida
Qwen3.6-27B es un modelo de lenguaje causal con un codificador de visión. Es nativamente multimodal y admite entradas de texto, imágenes y video, y se entrena a través de etapas previas y posteriores a la capacitación.
El modelo tiene 27B parámetros distribuidos en 64 capas, con una dimensión oculta de 5120 y un espacio de incrustación de tokens de 248,320 (relleno). El diseño oculto sigue un patrón repetitivo distintivo: 16 bloques, cada uno estructurado como 3 × (DeltaNet cerrado → FFN) → 1 × (Atención cerrado → FFN). Esto significa que tres de cada cuatro subcapas utilizan Gated DeltaNet, una forma de atención lineal, y solo una de cada cuatro subcapas utiliza Gated Attention estándar.
¿Qué es DeltaNet cerrado? La autoatención tradicional calcula las relaciones entre cada par de tokens, lo que escala cuadráticamente (O(n²)) con la longitud de la secuencia, lo cual es costoso para contextos largos. Los mecanismos de atención lineal como DeltaNet se aproximan a esto con complejidad lineal (O(n)), lo que los hace significativamente más rápidos y más eficientes en memoria. Gated DeltaNet agrega un mecanismo de activación en la parte superior, que esencialmente aprende cuándo actualizar o retener información, similar en espíritu a la activación de LSTM pero aplicado al cálculo de la atención. En Qwen3.6-27B, las subcapas Gated DeltaNet utilizan 48 cabezales de atención lineales para valores (V) y 16 para consultas y claves (QK), con una dimensión de cabezal de 128.
Las subcapas de atención cerrada utilizan 24 cabezales de atención para consultas (Q) y solo 4 para claves y valores (KV), una configuración que reduce significativamente la memoria caché de KV en el momento de la inferencia. Estas capas tienen una dimensión de cabeza de 256 y utilizan incrustación de posición giratoria (RoPE) con una dimensión de rotación de 64. La dimensión intermedia FFN es 17,408.
El modelo también utiliza Predicción de múltiples tokens (MTP), entrenada con múltiples pasos. En el momento de la inferencia, esto permite la decodificación especulativa, donde el modelo genera múltiples tokens candidatos simultáneamente y los verifica en paralelo, mejorando el rendimiento sin comprometer la calidad.
Ventana de contexto: 262K nativo, 1M con YaRN
De forma nativa, Qwen3.6-27B admite una longitud de contexto de 262,144 tokens, suficiente para contener una base de código grande o un documento del tamaño de un libro. Para tareas que superan esto, el modelo admite el escalado de YaRN (otra extensión más de RoPE), extensible hasta 1.010.000 tokens. El equipo de Qwen aconseja mantener en contexto al menos 128.000 tokens para preservar las capacidades de pensamiento del modelo.
Rendimiento de referencia
En los puntos de referencia de codificación agente, las ganancias con respecto a Qwen3.5-27B son sustanciales. SWE-bench Pro obtiene una puntuación de 53,5 frente a 51,2 para el Qwen3.5-27B y 50,9 para el Qwen3.5-397B-A17B, mucho más grande, lo que significa que el modelo denso de 27B supera un MoE de 397B en esta tarea. SWE-bench Multilingual obtiene una puntuación de 71,3 frente a 69,3 para Qwen3.5-27B. Terminal-Bench 2.0, evaluado con un tiempo de espera de 3 horas con 32 CPU y 48 GB de RAM, alcanza 59,3, igualando exactamente a Claude 4.5 Opus y superando a Qwen3.6-35B-A3B (51,5). SkillsBench Avg5 muestra la ganancia más sorprendente: 48,2 frente a 27,2 de Qwen3.5-27B, una mejora relativa del 77%, también muy por encima de los 28,7 de Qwen3.6-35B-A3B.
En los puntos de referencia de razonamiento, GPQA Diamond alcanza 87,8 (frente a 85,5), AIME26 alcanza 94,1 (frente a 92,6) y LiveCodeBench v6 obtiene una puntuación de 83,9 (frente a 80,7).
Los puntos de referencia visión-lenguaje muestran una paridad o mejora constante con respecto a Qwen3.5-27B. VideoMME (con subtítulos) alcanza 87,7, AndroidWorld (comparación de agentes visuales) obtiene una puntuación de 70,3 y VlmsAreBlind, que busca modos comunes de falla en la comprensión visual, obtiene una puntuación de 97,0.
Conclusiones clave
Qwen3.6-27B es el primer modelo denso y abierto de Alibaba en la familia Qwen3.6, creado para priorizar la utilidad de codificación del mundo real sobre el rendimiento de referencia, con licencia Apache 2.0. El modelo presenta Thinking Preservation, una nueva característica que retiene los rastros de razonamiento a lo largo del historial de conversaciones, lo que reduce la generación de tokens redundantes y mejora la eficiencia de la caché KV en flujos de trabajo de agentes de múltiples turnos. El rendimiento de la codificación agente es la fortaleza clave: Qwen3.6-27B obtiene una puntuación de 77,2 en SWE-bench Verified, 59,3 en Terminal-Bench 2.0 (que coincide con Claude 4.5 Opus) y 1487 en QwenWebBench, superando a su predecesor Qwen3.5-27B y al modelo MoE más grande Qwen3.5-397B-A17B en varias tareas. La arquitectura utiliza un diseño híbrido Gated DeltaNet + Gated Attention en 64 capas: tres de cada cuatro subcapas utilizan atención lineal eficiente (Gated DeltaNet), con predicción de múltiples tokens (MTP) que permite la decodificación especulativa en el momento de la entrega. Hay dos variantes de peso disponibles en Hugging Face Hub: Qwen3.6-27B (BF16) y Qwen3.6-27B-FP8 (FP8 de grano fino con tamaño de bloque 128), ambos compatibles con SGLang, vLLM, KTransformers y Hugging Face Transformers, con una ventana de contexto nativa de 262,144 tokens extensible a 1,010,000 tokens a través de YaRN.
Consulte los detalles técnicos, Qwen/Qwen3.6-27B y Qwen/Qwen3.6-27B-FP8. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros