Google lanza los modelos de la serie Gemma 2: modelos LLM avanzados en tamaños 9B y 27B entrenados en tokens 13T

Google ha presentado dos nuevos modelos en su Serie Gemma 2: el 27B y el 9BEstos modelos muestran avances significativos en el procesamiento del lenguaje mediante IA y ofrecen un alto rendimiento con una estructura liviana.

Gema 2 27B

El modelo Gemma 2 27B es el más grande de los dos, con 27 mil millones de parámetros. Este modelo está diseñado para manejar tareas más complejas, brindando mayor precisión y profundidad en la comprensión y generación del lenguaje. Su mayor tamaño le permite capturar más matices en el lenguaje, lo que lo hace ideal para aplicaciones que requieren una comprensión profunda del contexto y las sutilezas.

Gemma 2 9B

Por otro lado, el modelo Gemma 2 9B, con 9 mil millones de parámetros, ofrece una opción más liviana que aún ofrece un alto rendimiento. Este modelo es particularmente adecuado para aplicaciones donde la eficiencia y la velocidad computacionales son críticas. A pesar de su tamaño más pequeño, el modelo 9B mantiene un alto nivel de precisión y es capaz de realizar una amplia gama de tareas de manera efectiva.

Aquí hay algunos puntos clave y actualizaciones sobre estos modelos:

Rendimiento y eficiencia

  • Supera a los competidores: Gemma 2 supera a Llama3 70B, Qwen 72B y Command R+ en el área de chat de LYMSYS. El modelo 9B es actualmente el modelo con mejor rendimiento en parámetros 15B.
  • Más pequeño y eficiente: Los modelos Gemma 2 son aproximadamente 2,5 veces más pequeños que Llama 3 y fueron entrenados con solo dos tercios de la cantidad de tokens.
  • Datos de entrenamiento: El modelo 27B se entrenó con 13 billones de tokens, mientras que el modelo 9B se entrenó con 8 billones de tokens.
  • Contexto Longitud y RoPE: Ambos modelos cuentan con una longitud de contexto 8192 y utilizan incrustaciones de posición giratoria (RoPE) para un mejor manejo de secuencias largas.

Actualizaciones importantes de Gemma

  • Destilación del conocimiento: Esta técnica se utilizó para entrenar los modelos más pequeños 9B y 2B con la ayuda de un modelo docente más grande, mejorando su eficiencia y rendimiento.
  • Intercalando capas de atención: Los modelos incorporan una combinación de capas de atención local y global, lo que mejora la estabilidad de la inferencia para contextos prolongados y reduce el uso de la memoria.
  • Limitación de atención suave: Este método ayuda a mantener un entrenamiento estable y un ajuste fino al evitar explosiones de gradiente.
  • Fusión de modelos WARP: Técnicas como la media móvil exponencial (EMA), la interpolación lineal esférica (SLERP) y la interpolación lineal con inferencia truncada (LITI) se emplean en varias etapas de entrenamiento para mejorar el rendimiento.
  • Atención de consultas grupales: Implementada con dos grupos para facilitar una inferencia más rápida, esta característica mejora la velocidad de procesamiento de los modelos.

Aplicaciones y casos de uso

Los modelos Gemma 2 son versátiles y se adaptan a diversas aplicaciones como:

  • Automatización del servicio al cliente: Su alta precisión y eficiencia hacen que estos modelos sean adecuados para automatizar las interacciones con los clientes, proporcionando respuestas rápidas y precisas.
  • Creación de contenido: Estos modelos ayudan a generar contenido escrito de alta calidad, incluidos blogs y artículos.
  • Traducción de idiomas: Las capacidades avanzadas de comprensión del lenguaje hacen que estos modelos sean ideales para producir traducciones precisas y apropiadas al contexto.
  • Herramientas educativas: La integración de estos modelos en aplicaciones educativas puede ofrecer experiencias de aprendizaje personalizadas y ayudar en el aprendizaje de idiomas.

Implicaciones futuras

La introducción de la serie Gemma 2 marca un avance significativo en la tecnología de IA, destacando la dedicación de Google al desarrollo de herramientas de IA potentes pero eficientes. A medida que estos modelos se adopten más ampliamente, se espera que impulsen la innovación en diversas industrias, mejorando la forma en que interactuamos con la tecnología.

En resumen, los modelos Gemma 2 27B y 9B de Google presentan mejoras innovadoras en el procesamiento del lenguaje de IA, equilibrando el rendimiento con la eficiencia. Estos modelos están preparados para transformar numerosas aplicaciones, demostrando el inmenso potencial de la IA en nuestra vida cotidiana.


Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.