Google DeepMind acaba de lanzar Gemma 4 12B, un modelo multimodal denso que elimina por completo los codificadores tradicionales. La visión y el audio fluyen directamente hacia la columna vertebral de LLM. El resultado es un modelo que ejecuta flujos de trabajo agentes en una computadora portátil de consumo con 16 GB de RAM. Se envía bajo la licencia Apache 2.0.
Descripción general y acceso al modelo
Gemma 4 12B es un transformador decodificador de 12 mil millones de parámetros únicamente. Maneja texto, imágenes, audio y video de forma nativa. No hay codificadores de visión o audio separados. El decodificador utiliza la misma estructura que el modelo Gemma 4 31B Dense. Cierra la brecha entre el E4B amigable con los bordes y la variante 26B Mixture of Experts más grande.
Arquitectura: Transformador unificado, sin codificador, solo decodificador. Modalidades: Entrada de texto, imagen, video y audio nativo: la primera Gemma de tamaño mediano con audio. Requisito de hardware: 16 GB de VRAM o memoria unificada. Se ejecuta en portátiles con GPU de consumo y Apple Silicon Macs. Licencia: Apache 2.0. Las ponderaciones están abiertas y se pueden descargar públicamente. Pila de inferencia: Compatible con llama.cpp, MLX, vLLM, Ollama, SGLang, Unsloth y LM Studio. Descargar: Hugging Face y Kaggle. La variante de instrucción es google/gemma-4-12B-it. Integración: Hugging Face Transformers, LiteRT-LM CLI y un servidor API local compatible con OpenAI a través de litert-lmserve.
También se lanza un modelo de redacción de predicción de múltiples tokens (MTP) dedicado. Reduce la latencia de inferencia en el hardware local.
Arquitectura: el diseño sin codificadores
Todos los modelos Gemma de tamaño mediano anteriores utilizaban codificadores Transformer separados para visión y audio. Esos codificadores agregaron latencia y sobrecarga de parámetros. Los modelos Gemma 4 de tamaño mediano llevan un codificador de visión de parámetros 550M. Los modelos E2B y E4B incluyen un codificador de audio de 300M de parámetros. Todo eso desapareció en el 12B.
Integrador de visión (parámetros de 35 millones): las imágenes sin procesar se dividen en parches de 48 × 48 píxeles. Cada parche se proyecta a la dimensión oculta del LLM con una única multiplicación de matrices. No hay una capa de atención; cada parche se procesa de forma independiente. La posición espacial se inyecta mediante una búsqueda de coordenadas factorizada: una matriz X aprendida y una matriz Y aprendida. Para un parche en (x, y), el modelo busca dos incorporaciones aprendidas y las suma para formar un vector de posición. Esto se agrega a la incorporación del parche, seguido de la normalización. Ese es todo el proceso de visión.
Proyección de ondas de audio: el audio sin procesar de 16 kHz se divide en fotogramas de 40 ms. Cada cuadro contiene 640 valores. Esos valores se proyectan linealmente en el mismo espacio de incrustación que los tokens de texto. No hay extracción de características ni capas de conformadores. La incrustación de posición rotativa (RoPE) existente del LLM maneja la secuencia temporal 1-D. El codificador de audio en E2B y E4B utilizó 12 capas de conformadores. Todo eso se elimina.
Importancia: El espacio de peso unificado significa que ya no es necesario sintonizar codificadores congelados separados. El ajuste posterior con LoRA o el ajuste completo actualizan el procesamiento de visión, audio y texto en una sola pasada. Hugging Face Transformers y Unsloth ya lo admiten.
El diseño sin codificador reduce la latencia multimodal. La red troncal de LLM comienza a procesar inmediatamente. Ningún codificador debe terminar primero.
Capacidades y rendimiento
El equipo de Google DeepMind no ha publicado los resultados completos de las pruebas comparativas en los materiales de lanzamiento iniciales. Las notas de la versión oficial indican que el modelo 12B tiene un rendimiento cercano al modelo 26B MoE en puntos de referencia estándar, con menos de la mitad del espacio total de memoria.
Las capacidades demostradas del modelo incluyen:
Reconocimiento automático de voz. Transcribe audio de forma nativa sin una canalización ASR externa. Razonamiento agente. Ejecuta flujos de trabajo de varios pasos localmente, con un rendimiento que se acerca al modelo de 26 mil millones de MoE. Diarización. Distingue los altavoces en la entrada de audio. Comprensión de vídeo. Procesa fotogramas de vídeo junto con el audio. Una demostración analizó un segmento de discurso de apertura de Google I/O de 5 minutos utilizando 313 fotogramas a 1 FPS con un presupuesto de token visual de 70 por fotograma. Codificación. Creó una aplicación de procesamiento de imágenes Gradio utilizando su propia generación de código, servida localmente con llama.cpp. Flujos de trabajo agentes multimodales. El repositorio oficial de Gemma Skills en github.com/google-gemma/gemma-skills proporciona capacidades de agente prediseñadas.
En la aplicación Google AI Edge Eloquent de Google, el cambio a Gemma 4 12B produjo lo que Google informa como un aumento de más del 60 % en la calidad general, con un mejor seguimiento de las instrucciones y cumplimiento del alcance.
Explicador visual de Marktechpost
— Investigación de IA, lanzamientos de modelos y herramientas de desarrollo para más de 1 millón de profesionales.
marktechpost.com
Conclusiones clave
Google DeepMind lanzó Gemma 4 12B, un modelo multimodal sin codificador denso bajo la licencia Apache 2.0. La visión y el audio se alimentan directamente a la red troncal de LLM, sin codificadores separados de visión (550M) o audio (300M). Un integrador de visión 35M utiliza un único matmul más una búsqueda de posición X/Y factorizada; El audio proyecta fotogramas sin procesar de 16 kHz directamente. Es el primer Gemma de tamaño mediano con audio nativo y agrega video, ejecutándose en una computadora portátil de 16 GB. El rendimiento de referencia se acerca al modelo de 26B MoE con menos de la mitad del consumo de memoria.
Consulte los pesos del modelo y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros