Google DeepMind lanza Gemma 4 12B: un modelo multimodal sin codificador con audio nativo que se ejecuta en una computadora portátil de 16 GB

Google DeepMind acaba de lanzar Gemma 4 12B, un modelo multimodal denso que elimina por completo los codificadores tradicionales. La visión y el audio fluyen directamente hacia la columna vertebral de LLM. El resultado es un modelo que ejecuta flujos de trabajo agentes en una computadora portátil de consumo con 16 GB de RAM. Se envía bajo la licencia Apache 2.0.

Descripción general y acceso al modelo

Gemma 4 12B es un transformador decodificador de 12 mil millones de parámetros únicamente. Maneja texto, imágenes, audio y video de forma nativa. No hay codificadores de visión o audio separados. El decodificador utiliza la misma estructura que el modelo Gemma 4 31B Dense. Cierra la brecha entre el E4B amigable con los bordes y la variante 26B Mixture of Experts más grande.

Arquitectura: Transformador unificado, sin codificador, solo decodificador. Modalidades: Entrada de texto, imagen, video y audio nativo: la primera Gemma de tamaño mediano con audio. Requisito de hardware: 16 GB de VRAM o memoria unificada. Se ejecuta en portátiles con GPU de consumo y Apple Silicon Macs. Licencia: Apache 2.0. Las ponderaciones están abiertas y se pueden descargar públicamente. Pila de inferencia: Compatible con llama.cpp, MLX, vLLM, Ollama, SGLang, Unsloth y LM Studio. Descargar: Hugging Face y Kaggle. La variante de instrucción es google/gemma-4-12B-it. Integración: Hugging Face Transformers, LiteRT-LM CLI y un servidor API local compatible con OpenAI a través de litert-lmserve.

También se lanza un modelo de redacción de predicción de múltiples tokens (MTP) dedicado. Reduce la latencia de inferencia en el hardware local.

Arquitectura: el diseño sin codificadores

Todos los modelos Gemma de tamaño mediano anteriores utilizaban codificadores Transformer separados para visión y audio. Esos codificadores agregaron latencia y sobrecarga de parámetros. Los modelos Gemma 4 de tamaño mediano llevan un codificador de visión de parámetros 550M. Los modelos E2B y E4B incluyen un codificador de audio de 300M de parámetros. Todo eso desapareció en el 12B.

Integrador de visión (parámetros de 35 millones): las imágenes sin procesar se dividen en parches de 48 × 48 píxeles. Cada parche se proyecta a la dimensión oculta del LLM con una única multiplicación de matrices. No hay una capa de atención; cada parche se procesa de forma independiente. La posición espacial se inyecta mediante una búsqueda de coordenadas factorizada: una matriz X aprendida y una matriz Y aprendida. Para un parche en (x, y), el modelo busca dos incorporaciones aprendidas y las suma para formar un vector de posición. Esto se agrega a la incorporación del parche, seguido de la normalización. Ese es todo el proceso de visión.

Proyección de ondas de audio: el audio sin procesar de 16 kHz se divide en fotogramas de 40 ms. Cada cuadro contiene 640 valores. Esos valores se proyectan linealmente en el mismo espacio de incrustación que los tokens de texto. No hay extracción de características ni capas de conformadores. La incrustación de posición rotativa (RoPE) existente del LLM maneja la secuencia temporal 1-D. El codificador de audio en E2B y E4B utilizó 12 capas de conformadores. Todo eso se elimina.

Importancia: El espacio de peso unificado significa que ya no es necesario sintonizar codificadores congelados separados. El ajuste posterior con LoRA o el ajuste completo actualizan el procesamiento de visión, audio y texto en una sola pasada. Hugging Face Transformers y Unsloth ya lo admiten.

El diseño sin codificador reduce la latencia multimodal. La red troncal de LLM comienza a procesar inmediatamente. Ningún codificador debe terminar primero.

Capacidades y rendimiento

El equipo de Google DeepMind no ha publicado los resultados completos de las pruebas comparativas en los materiales de lanzamiento iniciales. Las notas de la versión oficial indican que el modelo 12B tiene un rendimiento cercano al modelo 26B MoE en puntos de referencia estándar, con menos de la mitad del espacio total de memoria.

https://blog.google/innovation-and-ai/technology/developers-tools/introduciendo-gemma-4-12b/

Las capacidades demostradas del modelo incluyen:

Reconocimiento automático de voz. Transcribe audio de forma nativa sin una canalización ASR externa. Razonamiento agente. Ejecuta flujos de trabajo de varios pasos localmente, con un rendimiento que se acerca al modelo de 26 mil millones de MoE. Diarización. Distingue los altavoces en la entrada de audio. Comprensión de vídeo. Procesa fotogramas de vídeo junto con el audio. Una demostración analizó un segmento de discurso de apertura de Google I/O de 5 minutos utilizando 313 fotogramas a 1 FPS con un presupuesto de token visual de 70 por fotograma. Codificación. Creó una aplicación de procesamiento de imágenes Gradio utilizando su propia generación de código, servida localmente con llama.cpp. Flujos de trabajo agentes multimodales. El repositorio oficial de Gemma Skills en github.com/google-gemma/gemma-skills proporciona capacidades de agente prediseñadas.

En la aplicación Google AI Edge Eloquent de Google, el cambio a Gemma 4 12B produjo lo que Google informa como un aumento de más del 60 % en la calidad general, con un mejor seguimiento de las instrucciones y cumplimiento del alcance.

Explicador visual de Marktechpost

Publicado el 3 de junio de 2026

Gema 4 12B

Modelo multimodal unificado y sin codificadores de Google DeepMind

Un transformador decodificador de 12 mil millones de parámetros que coloca codificadores de audio y visión separados. La visión y el audio fluyen directamente hacia la columna vertebral de LLM. Se ejecuta localmente en una computadora portátil de 16 GB con una licencia Apache 2.0.

Sin codificador: sin codificadores de audio o visión separados. Primera Gemma de tamaño mediano con entrada de audio nativa; agrega video Listo para local: 16 GB de VRAM o memoria unificada

Descripción general y acceso

que barcos

Especificaciones, pesos y pila de inferencias

Arquitectura: solo decodificador, la misma estructura que Gemma 4 31B Modalidades densas: texto, imagen, video y audio nativo Hardware: 16 GB de VRAM/memoria unificada; Portátiles con GPU y licencia Apple Silicon: Apache 2.0; pesos en la variante Hugging Face y Kaggle Instruct – google/gemma-4-12B-it Speed ​​- también se lanza un redactor de predicción de múltiples tokens (MTP) dedicado

Arquitectura · Visión

Un integrador de visión de 35M

Reemplazo del codificador de visión 550M de los modelos de tamaño mediano

Imágenes sin procesar divididas en parches de 48 × 48 píxeles Cada parche se proyecta en la dimensión oculta de LLM con una única multiplicación de matriz Sin capa de atención: cada parche se procesa de forma independiente Posición mediante una búsqueda de coordenadas X/Y factorizada, luego normalización Ese es el proceso de visión completo

Arquitectura · Audio

Proyección directa de ondas de audio

Sin capas conformadoras, sin extracción de características

Elimina las 12 capas conformadoras utilizadas en Gemma 4 E2B y E4B Audio sin procesar de 16 kHz dividido en cuadros de 40 ms (640 valores cada uno) Cuadros proyectados en el mismo espacio de incrustación como tokens de texto El RoPE existente del LLM maneja la secuencia temporal La primera Gemma de tamaño mediano que ingiere audio de forma nativa

Capacidades y rendimiento

Razonamiento cercano a 26B, la mitad de la memoria

Google informa un rendimiento cercano a los 26 mil millones de MoE con menos de la mitad del uso de memoria

ASR y diarización: transcripción nativa, separación de hablantes Razonamiento agente: flujos de trabajo de varios pasos ejecutados localmente Video: demostración en una conferencia magistral de E/S de 5 minutos: 313 fotogramas a 1 FPS, presupuesto simbólico de 70 Codificación: creación de una aplicación Gradio a través de gemma-skills, servida con llama.cpp No se publicaron tablas de referencia completas en el lanzamiento

Ejecútelo localmente

Tres caminos el primer día

Aplicaciones nativas de macOS más un servidor local directo

Google AI Edge Gallery (macOS): bucle de ejecución de Python en espacio aislado Google AI Edge Eloquent (macOS): dictado y edición en el dispositivo LiteRT-LM CLI: el servicio litert-lm expone un punto final compatible con OpenAI Funciona con Continuar, Aider, OpenCode, Open WebUI También LM Studio, Ollama, Transformers, Unsloth, vLLM, SGLang, MLX Implementación en Cloud Run, GKE o Gemini Enterprise Agent Platform Model Garden

Conclusiones clave

El resultado final

Lo que te ofrece el diseño sin codificador

Sin codificadores separados de visión (550M) o audio (300M) Integrador de visión de 35M más proyección directa de ondas de audio El ajuste fino actualiza la visión, el audio y el texto en una sola pasada Rendimiento cercano a los 26B con menos de la mitad de la memoria; se ejecuta en Apache 2.0 de 16 GB con un amplio soporte de ecosistema desde el principio

Marktechpost
— Investigación de IA, lanzamientos de modelos y herramientas de desarrollo para más de 1 millón de profesionales.
marktechpost.com

Conclusiones clave

Google DeepMind lanzó Gemma 4 12B, un modelo multimodal sin codificador denso bajo la licencia Apache 2.0. La visión y el audio se alimentan directamente a la red troncal de LLM, sin codificadores separados de visión (550M) o audio (300M). Un integrador de visión 35M utiliza un único matmul más una búsqueda de posición X/Y factorizada; El audio proyecta fotogramas sin procesar de 16 kHz directamente. Es el primer Gemma de tamaño mediano con audio nativo y agrega video, ejecutándose en una computadora portátil de 16 GB. El rendimiento de referencia se acerca al modelo de 26B MoE con menos de la mitad del consumo de memoria.

Consulte los pesos del modelo y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros