Tras los emocionantes lanzamientos de Gemma 3 y Gemma 3 QAT, nuestra familia de modelos abiertos de última generación capaces de ejecutarse en una única nube o acelerador de escritorio, estamos impulsando aún más nuestra visión de una IA accesible. Gemma 3 brindó capacidades poderosas para los desarrolladores, y ahora estamos ampliando esa visión a una IA en tiempo real de alta capacidad que opera directamente en los dispositivos que usa todos los días: sus teléfonos, tabletas y computadoras portátiles.
Para impulsar la próxima generación de IA en el dispositivo y admitir una amplia gama de aplicaciones, incluido el avance de las capacidades de Gemini Nano, diseñamos una arquitectura nueva y de vanguardia. Esta base de próxima generación se creó en estrecha colaboración con líderes de hardware móvil como Qualcomm Technologies, MediaTek y el negocio System LSI de Samsung, y está optimizada para una IA multimodal ultrarrápida, lo que permite experiencias verdaderamente personales y privadas directamente en su dispositivo.
Gemma 3n es nuestro primer modelo abierto construido sobre esta innovadora arquitectura compartida, lo que permite a los desarrolladores comenzar a experimentar con esta tecnología hoy en una vista previa temprana. La misma arquitectura avanzada también impulsa la próxima generación de Gemini Nano, que lleva estas capacidades a una amplia gama de funciones en las aplicaciones de Google y nuestro ecosistema en el dispositivo, y estará disponible a finales de este año. Gemma 3n le permite comenzar a construir sobre esta base que llegará a las principales plataformas como Android y Chrome.
Este gráfico clasifica los modelos de IA según las puntuaciones de Chatbot Arena Elo; Las puntuaciones más altas (números superiores) indican una mayor preferencia del usuario. Gemma 3n ocupa un lugar destacado entre los modelos abiertos y propietarios más populares.
Gemma 3n aprovecha una innovación de Google DeepMind llamada Per-Layer Embeddings (PLE) que ofrece una reducción significativa en el uso de RAM. Si bien el recuento de parámetros sin procesar es 5B y 8B, esta innovación le permite ejecutar modelos más grandes en dispositivos móviles o transmitir en vivo desde la nube, con una sobrecarga de memoria comparable a un modelo 2B y 4B, lo que significa que los modelos pueden operar con una huella de memoria dinámica de solo 2 GB y 3 GB. Obtenga más información en nuestra documentación.
Al explorar Gemma 3n, los desarrolladores pueden obtener una vista previa de las capacidades principales del modelo abierto y de las innovaciones arquitectónicas móviles que estarán disponibles en Android y Chrome con Gemini Nano.
En esta publicación, exploraremos las nuevas capacidades de Gemma 3n, nuestro enfoque hacia el desarrollo responsable y cómo puede acceder a la vista previa hoy.
Capacidades clave de Gemma 3n
Diseñado para experiencias de IA rápidas y que ocupan poco espacio ejecutándose localmente, Gemma 3n ofrece:
Rendimiento y eficiencia optimizados en el dispositivo: Gemma 3n comienza a responder aproximadamente 1,5 veces más rápido en dispositivos móviles con una calidad significativamente mejor (en comparación con Gemma 3 4B) y una huella de memoria reducida lograda a través de innovaciones como incrustaciones por capa, uso compartido de KVC y cuantificación de activación avanzada. Flexibilidad muchos en 1: un modelo con una huella de memoria activa de 4B que incluye de forma nativa un submodelo anidado de huella de memoria activa de 2B de última generación. (gracias a la formación de MatFormer). Esto proporciona flexibilidad para equilibrar dinámicamente el rendimiento y la calidad sobre la marcha sin alojar modelos separados. Además, presentamos la capacidad de mezclar y combinar en Gemma 3n para crear dinámicamente submodelos a partir del modelo 4B que puedan adaptarse de manera óptima a su caso de uso específico y a la relación calidad/latencia asociada. Manténgase atento a más información sobre esta investigación en nuestro próximo informe técnico. Privacidad primero y listo sin conexión: la ejecución local habilita funciones que respetan la privacidad del usuario y funcionan de manera confiable, incluso sin una conexión a Internet. Comprensión multimodal ampliada con audio: Gemma 3n puede comprender y procesar audio, texto e imágenes, y ofrece una comprensión de video significativamente mejorada. Sus capacidades de audio permiten que el modelo realice reconocimiento automático de voz (transcripción) y traducción (voz a texto traducido) de alta calidad. Además, el modelo acepta entradas entrelazadas entre modalidades, lo que permite comprender interacciones multimodales complejas. (Implementación pública próximamente) Capacidades multilingües mejoradas: rendimiento multilingüe mejorado, particularmente en japonés, alemán, coreano, español y francés. El sólido rendimiento se refleja en puntos de referencia multilingües como el 50,1 % en WMT24++ (ChrF).
Este gráfico muestra el rendimiento de MMLU frente al tamaño del modelo de la capacidad de combinación y combinación (preentrenada) de Gemma 3n.
Desbloquear nuevas experiencias sobre la marcha
Gemma 3n impulsará una nueva ola de aplicaciones inteligentes y móviles al permitir a los desarrolladores:
Cree experiencias interactivas en vivo que comprendan y respondan a señales visuales y auditivas en tiempo real del entorno del usuario.
2. Impulse una comprensión más profunda y la generación de texto contextual utilizando entradas combinadas de audio, imagen, video y texto, todo procesado de forma privada en el dispositivo.
3. Desarrollar aplicaciones avanzadas centradas en audio, incluidas la transcripción y traducción de voz en tiempo real e interacciones enriquecidas impulsadas por voz.
A continuación se ofrece una descripción general y los tipos de experiencias que puede crear:
Construyendo responsablemente, juntos
Nuestro compromiso con el desarrollo responsable de la IA es primordial. Gemma 3n, como todos los modelos Gemma, se sometió a rigurosas evaluaciones de seguridad, gobernanza de datos y ajuste de alineación con nuestras políticas de seguridad. Abordamos modelos abiertos con una cuidadosa evaluación de riesgos y perfeccionamos continuamente nuestras prácticas a medida que evoluciona el panorama de la IA.
Comience: obtenga una vista previa de Gemma 3n hoy
Estamos emocionados de tener Gemma 3n en tus manos a través de una vista previa que comienza hoy:
Acceso inicial (disponible ahora):
Exploración basada en la nube con Google AI Studio: pruebe Gemma 3n directamente en su navegador en Google AI Studio, sin necesidad de configuración. Explore sus capacidades de entrada de texto al instante. Desarrollo en el dispositivo con Google AI Edge: para los desarrolladores que buscan integrar Gemma 3n localmente, Google AI Edge proporciona herramientas y bibliotecas. Puede comenzar hoy mismo con las capacidades de generación/comprensión de texto e imágenes.
Gemma 3n marca el siguiente paso en la democratización del acceso a una IA eficiente y de vanguardia. Estamos increíblemente entusiasmados de ver lo que creará a medida que hagamos que esta tecnología esté disponible progresivamente, comenzando con la vista previa de hoy.
Explore este anuncio y todas las actualizaciones de Google I/O 2025 en io.google a partir del 22 de mayo.