Los investigadores están reinventando cómo funcionan los modelos como demanda de skyrockets para IA más rápidas, más inteligentes y más privadas en teléfonos, tabletas y computadoras portátiles. La próxima generación de IA no es solo más ligera y más rápida; Es local. Al integrar la inteligencia directamente en dispositivos, los desarrolladores desbloquean la capacidad de respuesta casi instantánea, reducen las demandas de memoria y vuelven a poner la privacidad en las manos de los usuarios. Con el hardware móvil avanzando rápidamente, la carrera está activada para construir modelos compactos y de rayo que son lo suficientemente inteligentes como para redefinir las experiencias digitales cotidianas.
Una preocupación importante es ofrecer inteligencia multimodal de alta calidad dentro de los entornos restringidos de los dispositivos móviles. A diferencia de los sistemas basados en la nube que tienen acceso a una amplia potencia computacional, los modelos en el dispositivo deben funcionar bajo estrictos límites de procesamiento de RAM y procesamiento. La IA multimodal, capaz de interpretar texto, imágenes, audio y video, generalmente requiere modelos grandes, que la mayoría de los dispositivos móviles no pueden manejar de manera eficiente. Además, la dependencia de la nube introduce problemas de latencia y privacidad, lo que hace que sea esencial diseñar modelos que puedan ejecutarse localmente sin sacrificar el rendimiento.
Modelos anteriores como Gemma 3 y Gemma 3 Qat intentaron cerrar esta brecha reduciendo el tamaño mientras mantienen el rendimiento. Diseñados para su uso en GPU de nubes o de escritorio, mejoraron significativamente la eficiencia del modelo. Sin embargo, estos modelos aún requerían hardware robusto y no podían superar completamente las limitaciones de memoria y capacidad de respuesta de las plataformas móviles. A pesar de apoyar las funciones avanzadas, a menudo involucraban compromisos que limitan la usabilidad de su teléfono inteligente en tiempo real.
Investigadores de Google y Google Deepmind introdujeron Gemma 3n. La arquitectura detrás de Gemma 3n ha sido optimizada para la implementación móvil primero, dirigiendo el rendimiento en las plataformas Android y Chrome. También forma la base subyacente para la próxima versión de Gemini Nano. La innovación representa un salto significativo hacia adelante al apoyar las funcionalidades multimodales de IA con una huella de memoria mucho más baja mientras se mantiene las capacidades de respuesta en tiempo real. Esto marca el primer modelo abierto basado en esta infraestructura compartida y se pone a disposición de los desarrolladores en vista previa, lo que permite la experimentación inmediata.
La innovación central en Gemma 3n es la aplicación de incrustaciones por capa (PLE), un método que reduce drásticamente el uso de RAM. Si bien los tamaños de modelo sin procesar incluyen 5 mil millones y 8 mil millones de parámetros, se comportan con huellas de memoria equivalentes a 2 mil millones y 4 mil millones de modelos de parámetros. El consumo de memoria dinámica es de solo 2 GB para el modelo 5B y 3GB para la versión 8B. Además, utiliza una configuración de modelo anidada donde un modelo de huella de memoria activa 4B incluye un submodelo 2B entrenado a través de una técnica conocida como Matformer. Esto permite a los desarrolladores cambiar dinámicamente los modos de rendimiento sin cargar modelos separados. Otros avances incluyen el intercambio de KVC y la cuantificación de activación, que reducen la latencia y aumentan la velocidad de respuesta. Por ejemplo, el tiempo de respuesta en el móvil mejoró en 1.5x en comparación con Gemma 3 4B mientras mantiene una mejor calidad de salida.
Las métricas de rendimiento logradas por Gemma 3n refuerzan su idoneidad para la implementación móvil. Excelente en el reconocimiento y traducción automáticos de voz, lo que permite la conversión de habla perfecta a texto traducido. En puntos de referencia multilingües como WMT24 ++ (CHRF), obtiene un 50.1%, destacando su fuerza en japonés, alemán, coreano, español y francés. Su capacidad Mix’n’match permite la creación de submodelos optimizados para varias combinaciones de calidad y latencia, ofreciendo a los desarrolladores una mayor personalización. La arquitectura admite entradas entrelazadas de diferentes modalidades, texto, audio, imágenes y video, lo que permite interacciones más naturales y ricas en contexto. También funciona fuera de línea, asegurando la privacidad y la confiabilidad incluso sin conectividad de red. Los casos de uso incluyen comentarios visuales y auditivos en vivo, generación de contenido consciente de contexto y aplicaciones avanzadas basadas en la voz.
Varias conclusiones clave de la investigación sobre Gemma 3n incluyen:
- Construido utilizando la colaboración entre Google, DeepMind, Qualcomm, MediaTek y Samsung System LSI. Diseñado para la implementación móvil primero.
- Tamaño del modelo sin procesar de los parámetros 5B y 8B, con huellas operativas de 2GB y 3GB, respectivamente, utilizando incrustaciones por capa (PLE).
- 1.5x Respuesta más rápida en Mobile vs Gemma 3 4B. Puntaje de referencia multilingüe de 50.1% en WMT24 ++ (CHRF).
- Acepta y comprende audio, texto, imagen y video, lo que permite el procesamiento multimodal complejo y las entradas entrelazadas.
- Apoya las compensaciones dinámicas utilizando la capacitación de mator con submodelos anidados y capacidades de mezcla.
- Opera sin conexión a Internet, asegurando la privacidad y la confiabilidad.
- La vista previa está disponible a través de Google AI Studio y Google AI Edge, con capacidades de procesamiento de texto y imágenes.
En conclusión, esta innovación proporciona una vía clara para hacer que AI de alto rendimiento sea portátil y privado. Al abordar las limitaciones de RAM a través de la arquitectura innovadora y mejorar las capacidades multilingües y multimodales, los investigadores ofrecen una solución viable para llevar directamente la IA sofisticada a los dispositivos cotidianos. El cambio de submodelo flexible, la preparación fuera de línea y el tiempo de respuesta rápido marcan un enfoque integral para la IA móvil primero. La investigación aborda el equilibrio de eficiencia computacional, privacidad del usuario y capacidad de respuesta dinámica. El resultado es un sistema capaz de ofrecer experiencias de IA en tiempo real sin sacrificar la capacidad o la versatilidad, expandiendo fundamentalmente lo que los usuarios pueden esperar de la inteligencia en el dispositivo.
Mira el Detalle técnico y Pruébalo aquí. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 95k+ ml de subreddit y suscribirse a Nuestro boletín.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.