Presentamos los modelos Gemma 4 en Amazon Bedrock

Hoy anunciamos la disponibilidad de la familia Gemma 4 en Amazon Bedrock. Creado por Google DeepMind y lanzado bajo la licencia Apache 2.0, Gemma 4 es una familia de modelos abiertos diseñados con un enfoque en inteligencia por parámetro en una amplia gama de escenarios de implementación. La familia incluye tres variantes adaptadas a las instrucciones: Gemma 4 31B, Gemma 4 26B-A4B y Gemma 4 E2B. Estos cubren arquitecturas densas y de mezcla de expertos (MoE), donde solo una fracción de los parámetros del modelo se activan por solicitud. Las variantes ofrecen razonamiento integrado, llamada a funciones nativas y entrada multimodal en texto e imágenes.

Los puntos de referencia independientes reflejan el enfoque de inteligencia por parámetro de Gemma 4: el análisis artificial informa un índice de inteligencia de 39 para Gemma 4 31B, muy por encima de la mediana de 15 en la clase de pesos abiertos 4B-40B.

Las organizaciones que adoptan modelos básicos (FM) abiertos para la producción se enfrentan a una compensación constante: acceder a los modelos líderes, pero sin comprometer la protección de datos, la alineación regulatoria o el control operativo. Amazon Bedrock elimina esa compensación. Le brinda FM líderes de peso abierto a través de un servicio totalmente administrado, con inferencia ejecutándose completamente en la infraestructura operada por AWS y los controles de seguridad y privacidad que espera de Amazon Bedrock.

En esta publicación, explicamos cómo comenzar con los modelos Gemma 4 en Amazon Bedrock. Cubrimos las capacidades admitidas por estos modelos, los niveles de servicio disponibles, cómo se escala la inferencia bajo demanda para manejar sus cargas de trabajo y las diferentes API que puede usar para acceder a ellas. Con estos modelos, puede crear agentes multimodales, aplicaciones livianas, canales de comprensión de documentos y flujos de trabajo de ingeniería de software en Amazon Bedrock. Sus indicaciones y completaciones no se utilizan para entrenar ningún modelo y su contenido no se comparte con terceros.

Capacidades clave de Gemma 4

La familia Gemma 4 en Amazon Bedrock abarca desde un modelo compacto con 2.3B de parámetros efectivos hasta un modelo denso con 30.7B de parámetros, lo que le brinda una variedad de variantes para adaptarse a diferentes perfiles de costos y latencia. Todas las variantes admiten un modo de razonamiento integrado, una función nativa que solicita flujos de trabajo agentes, entrada multimodal que combina texto e imagen y soporte listo para usar para más de 35 idiomas con capacitación previa en más de 140. Debido a que los modelos son de peso abierto, puede evaluar de forma independiente la arquitectura del modelo y la metodología de capacitación, comparar sus propias cargas de trabajo y ajustar los datos propietarios cuando se requiere personalización. Puede acceder a los modelos a través de un servicio de AWS totalmente administrado sin necesidad de aprovisionar infraestructura, alojar pesos de modelos ni operar pilas de inferencia usted mismo.anno

Para obtener la lista más reciente de modelos compatibles, consulte el catálogo de modelos de Amazon Bedrock.

La familia Gemma 4 en Amazon Bedrock de un vistazo

La familia incluye tres variantes ajustadas a instrucciones optimizadas para diferentes perfiles de costo y latencia. La siguiente tabla resume las especificaciones clave para cada modelo en Amazon Bedrock:

Gemma 4 31B Gemma 4 26B-A4B Gemma 4 E2B ID de modelo google.gemma-4-31b google.gemma-4-26b-a4b google.gemma-4-e2b Arquitectura Densa Mezcla de expertos Densa (PLE) Total / Parámetros activos 30.7B 25.2B / 3.8B activo 5.1B total / 2.300 millones de ventanas de contexto efectivas 256 000 tokens 256 000 tokens 128 000 tokens Modalidades Texto, imagen Texto, imagen Texto, imagen Modo de razonamiento Sí Sí Sí Llamada a funciones Nativo Nativo Nativo Niveles de servicio Estándar, Prioridad, Flex Estándar, Prioridad, Flex Estándar, Prioridad, Flex

Elegir una variante

Seleccione la variante que mejor se adapte a los requisitos de costo y rendimiento de su carga de trabajo. La siguiente tabla proporciona orientación sobre qué modelo elegir según su caso de uso:

Si su carga de trabajo es… Elija por qué Mucho razonamiento o mucha codificación con un único modelo denso Gemma 4 31B La variante densa más grande de la familia; Sólido rendimiento de razonamiento y codificación con una ventana de contexto de 256K. Sensible a los costos con alto rendimiento, con requisitos de amplitud de conocimiento El diseño MoE Gemma 4 26B-A4B significa que el costo de inferencia y la latencia se acercan más a un modelo denso 4B, al tiempo que se conserva la capacidad de conocimiento de uno mucho más grande. Clasificación multimodal, sensible a la latencia o estilo en el dispositivo Gemma 4 E2B Variante más pequeña y rápida; Adecuado para cargas de trabajo multimodales de menor costo o respuesta más rápida. Establezca Reasoning_effort=high para esta variante (consulte Habilitar modo de razonamiento).

En toda la familia, los modelos Gemma 4 comparten una interfaz común: indicaciones del sistema, llamadas estructuradas a herramientas, entrada de imágenes y un modo de pensamiento que se puede alternar según la solicitud. Puede desarrollar una aplicación contra la superficie API una vez y cambiar entre variantes según el costo y el perfil de latencia que se ajuste a la carga de trabajo.

Aspectos destacados de la arquitectura

Todas las variantes de Gemma 4 utilizan un diseño de atención híbrido que entrelaza la atención local y global, admitiendo contextos largos de hasta 256.000 tokens en 31B y 26B-A4B y manteniendo una pequeña huella de memoria. La variante 26B-A4B es un modelo de mezcla de expertos: 25,2 mil millones de parámetros totales pero solo 3,8 mil millones activos por token, lo que brinda aproximadamente un costo y latencia de clase 4 mil millones con la capacidad de conocimiento de un modelo más grande. La variante E2B utiliza incrustaciones por capa (PLE) para mantener pequeño su recuento de parámetros efectivos (2,3 B de 5,1 B en total), lo que reduce la memoria y el costo de computación. Para obtener detalles sobre la arquitectura, consulte la tarjeta del modelo Gemma 4.

Nota: Utilice el punto final del lecho rocoso para los modelos Gemma 4.

modo de razonamiento

Gemma 4 incluye un modo de razonamiento incorporado. Cuando está habilitado, el modelo emite su proceso de pensamiento interno antes de producir la respuesta final. En el punto final de Bedrock-Mantle, habilita el razonamiento a través del parámetro de razonamiento de la API de Respuestas y el proceso de pensamiento se devuelve como un elemento de razonamiento separado junto con la respuesta final (consulte Habilitar el modo de razonamiento en el tutorial).

En conversaciones de varios turnos, envíe solo las respuestas finales de turnos anteriores, no sus elementos de razonamiento. Reproducir razonamientos anteriores en el modelo puede degradar sus respuestas. Aún puede conservar el razonamiento en sus propios registros o registro de auditoría. Quítalo del historial que envíes en el siguiente turno.

Accediendo a los modelos Gemma 4 en Amazon Bedrock

Puede acceder a los modelos Gemma 4 en Amazon Bedrock a través del punto final Bedrock-Mantle, la API compatible con OpenAI diseñada específicamente para el motor de inferencia de próxima generación de Amazon Bedrock. La URL de su punto final es https://bedrock-mantle.{region}.api.aws/openai/v1 y expone las API de respuestas y terminaciones de chat.

Es útil mantener distintos el punto final y el motor: el motor es la infraestructura de servicio subyacente (diseñada con aislamiento de cuenta de implementación modelo y cero acceso de operador) y el punto final es la superficie API HTTPS a la que llama. El punto final del manto de roca es la API pública para ese motor de inferencia de próxima generación y expone su conjunto completo de funciones. Para obtener una visión más profunda del motor de inferencia subyacente, consulte Exploración del diseño de acceso sin operador del motor de inferencia de próxima generación de Amazon Bedrock.

El punto final de Bedrock-Mantle utiliza la misma interfaz que los SDK de OpenAI Python y TypeScript, por lo que los equipos que ya utilizan esos SDK pueden cambiar a los modelos Gemma 4 en Amazon Bedrock actualizando solo la URL base y el ID del modelo. También admite claves API, proyectos y llamadas a herramientas del lado del cliente de Amazon Bedrock.

Comience con los modelos de la familia Gemma 4 en Amazon Bedrock

Complete los siguientes pasos para comenzar a usar Gemma 4 en Amazon Bedrock.

Requisitos previos

Para utilizar los modelos Gemma 4, necesita una cuenta de AWS con permisos para ejecutar inferencias en el punto final del manto de roca. La forma más sencilla de otorgarlos es adjuntar la política administrada de AWS AmazonBedrockMantleInferenceAccess a su entidad principal de AWS Identity and Access Management (IAM). Otorga acceso de lectura y creación de inferencias en Mantle, los permisos que necesitan los ejemplos de esta publicación. Estos incluyen bedrock-mantle:CreateInference (que autoriza las llamadas de inferencia de respuestas y finalizaciones de chat) y bedrock-mantle:CallWithBearerToken (que autoriza llamar al punto final con una clave API de Amazon Bedrock). Para obtener detalles sobre la creación y administración de claves API, consulte Claves API de Amazon Bedrock.

Si también necesita administrar proyectos, realizar ajustes, modelos personalizados y más, adjunte AmazonBedrockMantleFullAccess, que otorga el conjunto completo de acciones de manto de roca.

Consola de juegos

La consola de Amazon Bedrock incluye un área de chat/texto donde puede probar modelos rápidamente sin escribir ningún código. Siga estos pasos para cargar un modelo Gemma 4 y prepararlo para la interacción:

Navegue hasta la consola de Amazon Bedrock. En el menú de la izquierda, elija Probar áreas de juego. Elija la zona de juegos Chat/Texto. Elija Seleccionar modelo en la esquina superior izquierda del patio de juegos. En la lista de categorías, elija Google. Elige un modelo Gemma 4. Elija Aplicar para cargar el modelo. Verifique que el modelo se cargó correctamente: el nombre del modelo aparece en el encabezado del área de juegos y la interfaz de chat está lista para ingresar.

Para demostrar las capacidades de razonamiento y generación de código de Gemma 4 31B, pruebe el siguiente mensaje en el patio de juegos: "Diseñe un microservicio de Python que exponga una API REST para administrar una cola de tareas. Incluya manejo de errores, validación de entradas y escriba pruebas unitarias. Explique sus decisiones de diseño".

Llame al punto final del manto de roca desde el SDK de OpenAI

El siguiente ejemplo utiliza el SDK de OpenAI Python como biblioteca cliente para llamar al punto final bedrock-mantle. Cuando utiliza el SDK de OpenAI, necesita una clave API de Amazon Bedrock. Para cargas de trabajo de producción, utilice claves API a corto plazo. Caducan automáticamente (máximo 12 horas) y heredan los permisos del rol de IAM que los generó. Si ya utiliza credenciales nativas de AWS y no tiene una clave API, el paquete aws-bedrock-token-generator genera un token de portador a corto plazo a partir de esas credenciales.

from openai import OpenAI client = OpenAI( api_key="", base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1", ) respuesta = client.chat.completions.create( model="google.gemma-4-31b", mensajes=[ {"role": "user", "content": "Explicar los beneficios de las arquitecturas mixtas de expertos para la inferencia de producción."} ], max_tokens=512, ) print(respuesta.opciones[0].mensaje.contenido)

Si está migrando una aplicación existente que ya usa el formato OpenAI SDK con un modelo diferente, la migración normalmente requiere actualizar solo la URL base y el ID del modelo. Para controlar los permisos para generar y usar claves API, consulte Controlar permisos para generar y usar claves API de Amazon Bedrock.

Nota: Los ejemplos de código de esta publicación leen la clave API de una variable de entorno solo con fines de demostración. En producción, almacene y recupere credenciales de un servicio de secretos administrado, como AWS Secrets Manager o AWS Systems Manager Parameter Store, en lugar de variables de entorno.

Entrada multimodal (imagen)

Debido a que Gemma 4 admite la entrada de imágenes en todas las variantes, la misma API Chat Completions funciona para tareas de visión. El punto final bedrock-mantle acepta imágenes como URL de datos codificadas en base64 en línea o como URL de Amazon Simple Storage Service (Amazon S3) (s3://); No se admiten URL de imágenes https:// públicas arbitrarias. El siguiente ejemplo lee un archivo de imagen local, lo codifica como una URL de datos base64 y lo incluye en el contenido del mensaje junto con el mensaje de texto:

importar base64 # Leer un archivo de imagen local y codificarlo como una URL de datos base64. con open("chart.png", "rb") como archivo_imagen: image_b64 = base64.b64encode(image_file.read()).decode("utf-8") data_url = f"data:image/png;base64,{image_b64}" respuesta = client.chat.completions.create( model="google.gemma-4-31b", mensajes=[{ "role": "usuario", "content": [ {"type": "image_url", "image_url": {"url": data_url}}, {"type": "text", "text": "Describe la tendencia que se muestra en este gráfico."} ] }], ) print(response.choices[0].mensaje.contenido)

Como alternativa, puede hacer referencia a una imagen almacenada en Amazon S3 pasando una URL s3:// en lugar de la URL de datos (por ejemplo, {"url": "s3://my-bucket/chart.png"}). Esto evita incluir imágenes grandes en el cuerpo de la solicitud. Para obtener mejores resultados, coloque el contenido de la imagen antes del texto en el mensaje, que coincide con el orden recomendado por Google DeepMind para las entradas multimodales de Gemma 4.

Transmisión de respuestas

Para casos de uso de chat y agentes en los que desea mostrar tokens al usuario a medida que se generan, establezca stream=True. La respuesta se convierte en un iterador de eventos delta incrementales:

stream = client.chat.completions.create( model="google.gemma-4-31b", mensajes=[ {"role": "user", "content": "Escribe un breve poema sobre sistemas distribuidos."} ], stream=True, ) para fragmentos en flujo: delta = chunk.choices[0].delta.content si delta: print(delta, end="", Flush=True) print()

La transmisión utiliza el mismo permiso bedrock-mantle:CreateInference que una llamada que no es de transmisión; la política de IAM que se mostró anteriormente ya lo cubre.

Llamada de herramientas

Gemma 4 admite llamadas de funciones nativas para flujos de trabajo agentes. El siguiente ejemplo muestra un ciclo completo de llamada de herramientas: definir una herramienta, recibir una llamada de herramienta del modelo, ejecutar la función y devolver el resultado.

importar json de openai importar cliente OpenAI = OpenAI( api_key="", base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1", ) herramientas = [ { "type": "function", "function": { "name": "get_weather", "description": "Obtener el clima actual para una ubicación determinada", "parameters": { "type": "object", "properties": { "ubicación": { "type": "string", "description": "Ciudad y país (por ejemplo, Seattle, EE. UU.)" }, "unit": { "type": "string", "enum": ["celsius", "fahrenheit"], "description": "Unidad de temperatura" } }, "required": ["ubicación"] } } } ] # Paso 1: Enviar la solicitud del usuario con mensajes de definiciones de herramientas = [ {"role": "user", "content": "¿Cómo está el clima en Seattle?"} ] respuesta = client.chat.completions.create( model="google.gemma-4-31b", mensajes=messages, herramientas=herramientas, tool_choice="auto", ) asistente_message = respuesta.choices[0].message # Paso 2: Verifique si el modelo quiere llamar a una herramienta si asistente_message.tool_calls: mensajes.append(assistant_message) para tool_call en asistente_message.tool_calls: function_name = tool_call.function.name arguments = json.loads(tool_call.function.arguments) # Paso 3: Valide el nombre de la función y ejecútelo (su implementación) si function_name == "get_weather": ubicación = argumentos.get("ubicación", "Desconocido") unidad = argumentos.get("unidad", "fahrenheit") resultado = { "ubicación": ubicación, "temperatura": 18 if unidad == "celsius" else 64, "unidad": unidad, "condición": "Parcialmente nublado", "humedad": 72, } else: resultado = {"error": f"Función desconocida: {nombre_función}"} # Paso 4: Devolver el resultado de la función al modelo message.append({ "role": "tool", "tool_call_id": tool_call.id, "content": json.dumps(result), }) # Paso 5: Obtener la respuesta final incorporando los resultados de la herramienta final_response = client.chat.completions.create( model="google.gemma-4-31b", mensajes=messages, tools=tools, ) imprimir(respuesta_final.opciones[0].message.content) más: imprimir (assistant_message.content)

API de respuestas

Además de las finalizaciones de chat, el punto final Bedrock-Mantle admite la API de respuestas OpenAI, que utiliza un único campo de entrada en lugar de una lista de mensajes y devuelve un texto de salida de nivel superior para la respuesta generada. Esta es una buena opción para la generación de un solo turno y para aplicaciones ya creadas en la interfaz de Respuestas:

respuesta = client.responses.create( model="google.gemma-4-31b", input="Explicar los beneficios de las arquitecturas de combinación de expertos para la inferencia de producción.", max_output_tokens=512, ) print(response.output_text)

La API de respuestas utiliza la misma clave de API de Amazon Bedrock y la misma URL base que los ejemplos de Finalizaciones de chat; sólo difieren el método y la forma de respuesta. Utilice Finalizaciones de chat cuando necesite un historial de mensajes de varios turnos o bucles de llamada de herramientas del lado del cliente, y la API de Respuestas para una generación optimizada de un solo turno o cuando desee el razonamiento del modelo (que se explica a continuación).

Habilitar el modo de razonamiento

Gemma 4 puede producir un proceso de pensamiento explícito antes de su respuesta final, lo cual es útil para tareas complejas de varios pasos a costa de una mayor latencia y uso de tokens. En el punto final de Bedrock-Mantle, esto se habilita a través de la API de respuestas configurando el parámetro de razonamiento. El modelo devuelve el proceso de pensamiento como un elemento de razonamiento separado en el resultado, junto con la respuesta final en texto_salida:

respuesta = client.responses.create( model="google.gemma-4-31b", input="Si un tren sale a las 3pm a 60 km/h y otro sale una hora más tarde a 90 km/h de la misma estación, ¿cuándo lo alcanza el segundo?", razonamiento={"effort": "high"}, ) # Respuesta final. print(response.output_text) # El proceso de pensamiento se devuelve como un elemento de salida separado de tipo "razonamiento". para elemento en respuesta.salida: si elemento.tipo == "razonamiento": para bloque en elemento.contenido: imprimir (bloque.texto)

El valor del esfuerzo (bajo, medio o alto) controla cuánto razona el modelo antes de responder. Para conversaciones de varios turnos, pase solo las respuestas finales como historial; excluya los elementos de razonamiento anteriores de la entrada en el siguiente turno.

Para Gemma 4 E2B, recomendamos configurar Reasoning_effort en alto. La variante más pequeña tiende a razonar extensamente de forma predeterminada, y un alto esfuerzo de razonamiento mantiene ese pensamiento en el canal de razonamiento dedicado, lo que mejora la calidad del resultado y evita que el texto de razonamiento se filtre en la respuesta final.

En el punto final lecho rocoso-manto, el muestreo se controla mediante la temperatura y top_p. Para Gemma 4, recomendamos temperatura = 1,0 y top_p = 0,95, que funcionan bien tanto para el modo de razonamiento como para el de no razonamiento.

Limpiar

La inferencia bajo demanda solo genera costos cuando se invoca, por lo que no hay infraestructura que derribar. Para evitar cargos no deseados:

Si generó claves API de Amazon Bedrock a corto plazo para realizar pruebas, las claves caducan automáticamente (máximo 12 horas). Para revocar antes, elimine la clave API en la consola. Eliminar una clave API revoca inmediatamente el acceso a todas las aplicaciones que usan esa clave, así que asegúrese de que ninguna aplicación activa dependa de ella antes de eliminarla. Si optó por el nivel Prioridad para las pruebas, vuelva al Estándar para el tráfico no sensible a la latencia eliminando el parámetro service_tier de sus invocaciones. Para obtener detalles de precios por nivel y modelo, consulte Precios de Amazon Bedrock.

Niveles de servicio

Amazon Bedrock ofrece varios niveles de servicio para satisfacer diferentes requisitos de carga de trabajo:

Nivel Óptimo para características Prioridad Flujos de trabajo de misión crítica orientados al cliente que necesitan los tiempos de respuesta más rápidos Latencia de tokens de salida por segundo (OTPS) hasta un 25 % mejor en comparación con el estándar. Priorizado por delante de las solicitudes Estándar y Flex. Premium sobre el precio estándar bajo demanda. Sin reserva ni compromiso por adelantado. Tareas estándar de IA cotidianas, como generación de contenido, análisis de texto y procesamiento de documentos de rutina. Rendimiento consistente a precios estándar bajo demanda. Nivel predeterminado cuando no se especifica ningún nivel. Sin compromiso. Cargas de trabajo flexibles que pueden tolerar tiempos de procesamiento más prolongados, como evaluaciones de modelos, resúmenes de contenido y flujos de trabajo agentes. Precios con descuento en relación con el estándar. Mayor latencia, especialmente durante picos de tráfico, porque las solicitudes Flex se procesan después del estándar. Sin compromiso.

Para conocer la disponibilidad de niveles más reciente por modelo, consulte el catálogo de modelos de Amazon Bedrock.

Escalar la inferencia bajo demanda

Cuando invoca los modelos Gemma 4 en Amazon Bedrock, las solicitudes utilizan la inferencia bajo demanda (nivel estándar) de forma predeterminada, donde paga por token sin reservar capacidad. El rendimiento bajo demanda se comparte y asigna por región de AWS, por lo que durante períodos de alta demanda regional una solicitud puede quedar en cola o limitarse brevemente. Diseñar para esto es importante para aplicaciones que necesitan escalar de manera confiable en producción.

En el punto final del manto de roca, no hay cuota de solicitudes por minuto (RPM). La inferencia se rige por cuotas basadas en tokens por modelo y por región: límites separados de tokens de entrada por minuto y tokens de salida por minuto. Gemma 4 y otros modelos abiertos actualmente no tienen cuotas de tokens por cuenta publicadas en la consola de Cuotas de servicio. Su rendimiento se rige por la capacidad del servicio interno, por lo tanto, utilice la lógica de reintento con retroceso exponencial para manejar la limitación transitoria. Los tokens de entrada almacenados en caché leídos mediante el almacenamiento en caché de avisos no cuentan para la cuota de tokens de entrada. Para obtener más información, consulte Cuotas para el punto final del lecho rocoso-manto.

Amazon Bedrock muestra dos códigos de error HTTP que indican que no se puede atender una solicitud:

Error Qué significa Qué hacer HTTP 429 Se ha excedido una cuota de token por minuto para el modelo. Reduzca la tasa de envío y vuelva a intentarlo con un retroceso exponencial; Solicite un aumento de cuota a través de AWS Support si alcanza constantemente el límite. HTTP 503 La capacidad regional para el modelo está bajo presión. Vuelva a intentarlo con retroceso exponencial para respuestas ocasionales; reducir la tasa de presentación de los sostenidos.

La distinción entre estas dos respuestas es importante a la hora de solucionar problemas del tráfico de producción. Un 429 indica que se ha excedido una cuota de token por minuto y la mejor manera de solucionarlo es reducir la tasa de envío o solicitar un aumento de la cuota a través de AWS Support. Un 503 indica que la capacidad regional para el modelo está bajo presión. Seguir las instrucciones de la siguiente sección para aumentar gradualmente permite que las aplicaciones continúen funcionando según la inferencia bajo demanda sin interrupciones.

Manejar respuestas 503 únicas

Algunas solicitudes de inferencia bajo demanda pueden recibir respuestas 503 ocasionales cuando el modelo tiene una gran demanda. La forma recomendada de manejarlos es un retroceso exponencial con fluctuación y un recuento de reintentos limitado. El SDK de OpenAI admite esto a través de su configuración max_retries incorporada, que reintenta solicitudes fallidas con un retroceso exponencial. El siguiente ejemplo configura el cliente utilizado con el punto final bedrock-mantle:

from openai import OpenAI # Reintentar fallas transitorias con retroceso exponencial. cliente = OpenAI( api_key="", base_url="https://bedrock-mantle.us-east-1.api.aws/openai/v1", max_retries=6,)

Retroceder y reintentar es la forma recomendada de manejar estas respuestas transitorias en el punto final del manto de roca.

Si se mantienen las respuestas 503, los reintentos por sí solos no resolverán el problema porque la tasa de solicitudes efectivas excede la capacidad disponible para el modelo. En ese caso, considere enrutar el tráfico sensible a la latencia al nivel Prioritario, que recibe procesamiento preferencial antes que las solicitudes Estándar y Flex durante períodos de alta demanda.

Manejar rampas de tráfico empinadas

Al utilizar la inferencia bajo demanda de nivel Estándar, el tráfico entrante de su aplicación debe alinearse con la forma en que escala la capacidad regional del modelo. Es más probable que los saltos repentinos y grandes en la tasa de solicitudes desencadenen 503 que los aumentos graduales que el sistema pueda acomodar. Siempre que aumente la tasa de solicitudes en comparación con los modelos Gemma 4, amplíela en incrementos medidos en lugar de pasar directamente a un nuevo volumen objetivo. El procedimiento de rampa recomendado es el siguiente:

Comience con su tasa de solicitudes objetivo. Si recibe 503 respuestas, reduzca la tasa en un 50 % y continúe reduciéndola hasta que las solicitudes tengan éxito de manera constante. Mantenga ese estado estable durante 15 minutos. Aumente la velocidad en un 50% y manténgala así durante otros 15 minutos. Repita hasta alcanzar su volumen objetivo.

Como ejemplo resuelto: si su objetivo es 2000 RPM y encuentra 503, reduzca a 1000 RPM y luego a 500 si los errores persisten. Una vez que 500 RPM se mantengan estables durante 15 minutos, escale a 750, luego a 1125, y así sucesivamente. Saltarse la espera de 15 minutos convierte cada paso en una nueva prueba de carga.

Elija el nivel de Prioridad para cargas de trabajo sensibles a la latencia

Más allá del uso reactivo durante los 503 sostenidos, el nivel de Prioridad puede ser una palanca útil para reducir las ocurrencias de 503 mientras se continúa usando la inferencia bajo demanda. Priority ofrece tokens de salida por segundo hasta un 25 % mejores en comparación con Standard, y no existe ninguna reserva ni compromiso por adelantado. Las aplicaciones optan por establecer el parámetro service_tier como prioridad en cada invocación, y los niveles se pueden combinar dentro de la misma aplicación. Las indicaciones de cara al cliente, los agentes en tiempo real y otras interacciones del usuario donde el tiempo de respuesta afecta directamente la experiencia son buenos candidatos para Prioridad. Para trabajos en segundo plano y por lotes, Standard o Flex suele ser la opción correcta y evita pagar la prima de Prioridad en solicitudes que no se beneficiarían de ella.

Más prácticas recomendadas para la escala de producción

Algunas prácticas ayudan a mantener las cargas de trabajo de inferencia funcionando sin problemas a escala:

Distribuya grandes cargas de trabajo en varios minutos, en lugar de dispararlas en ráfagas breves, para reducir la presión sobre la capacidad regional. Al migrar el tráfico de producción a una nueva versión del modelo Gemma 4, utilice indicadores de funciones para aumentar el porcentaje de tráfico gradualmente en lugar de cortarlo todo de una vez. Enrute el trabajo asincrónico (evaluaciones de modelos, resúmenes de contenido, reabastecimientos de agentes) al nivel Flex para mejorar la relación precio-rendimiento. Para cargas de trabajo sin requisitos de residencia de datos, distribúyalas en varias regiones para mejorar la resiliencia durante los picos de demanda regional. Para las cargas de trabajo que se espera que crezcan, planifique un espacio libre de dos a tres veces el pico esperado como amortiguador para los aumentos repentinos de tráfico.

Para obtener orientación completa, consulte Mejores prácticas de escalamiento y rendimiento en la Guía del usuario de Amazon Bedrock.

Reduzca la latencia con el almacenamiento en caché de mensajes implícitos

Los modelos Gemma 4 en Amazon Bedrock admiten el almacenamiento en caché de avisos implícitos, que se habilita automáticamente. Las solicitudes consecutivas que comparten un prefijo de aviso común pueden generar un acierto en la caché, lo que permite al modelo reutilizar el estado interno almacenado en la caché en lugar de volver a calcularlo. Los aciertos de caché reducen la latencia de inferencia en los tokens coincidentes, sin necesidad de cambios de código ni marcadores de caché.

El almacenamiento en caché de avisos implícitos está disponible en todos los niveles de servicio bajo demanda (Estándar, Prioridad y Flex), por lo que las aplicaciones pueden aprovecharlo independientemente de cómo se enruta su tráfico. Los aciertos de caché no siempre están presentes en todas las solicitudes, pero son comunes en cargas de trabajo con prefijos estables, como agentes de múltiples turnos, generación de recuperación aumentada y análisis de contexto prolongado, donde las indicaciones del sistema, las definiciones de herramientas o los documentos de origen se reutilizan en todas las solicitudes. Si coloca contenido estático al principio del mensaje y contenido dinámico al final, las aplicaciones pueden aprovechar el almacenamiento en caché cuando esto ocurre.

Precios y disponibilidad

En el lanzamiento, los modelos Gemma 4 están disponibles en cuatro regiones de AWS: EE.UU. Este (Norte de Virginia), EE.UU. Este (Ohio), EE.UU. Oeste (Oregón) y Europa (Frankfurt). Para obtener la lista más reciente, consulte el catálogo de modelos de Amazon Bedrock.

El precio es por token y varía según el modelo y el nivel de servicio. Para conocer las tarifas actuales, consulte los precios de Amazon Bedrock.

Conclusión

En esta publicación, exploramos la familia Gemma 4 en Amazon Bedrock: modelos abiertos de Google DeepMind que cubren arquitecturas densas y mixtas de expertos, con razonamiento integrado, llamada de funciones nativas y entrada multimodal en texto e imágenes. Recorrimos el punto final de Bedrock-Mantle y la arquitectura de seguridad que se ejecuta debajo de él (aislamiento de la cuenta de implementación del modelo sin acceso de operador) y mostramos cómo comenzar a usar el SDK de OpenAI Python contra Bedrock-Mantle. Cubrimos los niveles de servicio (Estándar, Prioridad y Flex), el modelo de rendimiento compartido para la inferencia bajo demanda y cómo manejar las respuestas 503 y aumentar el tráfico en producción.

Para empezar:

Abra la consola de Amazon Bedrock y pruebe Gemma 4 en el área de chat/texto. Ejecute el ejemplo de Python de Bedrock-Mantle en esta publicación con sus propios datos. Evalúe Gemma 4 31B, 26B-A4B y E2B en sus cargas de trabajo para elegir la variante que se ajuste a su perfil de costos y latencia. Para la implementación de producción, revise las mejores prácticas de escalamiento y rendimiento y considere el nivel de Prioridad para el tráfico sensible a la latencia.

Para obtener más información, consulte los siguientes recursos:

Sobre los autores

Aris Tsakpinis

Aris es un arquitecto senior de soluciones especializado en IA generativa que se centra en modelos de peso abierto en Amazon Bedrock y el ecosistema más amplio de código abierto de IA generativa. Paralelamente a su función profesional, está cursando un doctorado en Ingeniería de Aprendizaje Automático en la Universidad de Ratisbona, donde su investigación se centra en el procesamiento aplicado del lenguaje natural en ámbitos científicos.

Alex Thewsey

Alex Thewsey

Alex es arquitecto de soluciones especializado en IA generativa en AWS, con sede en Singapur. Alex ayuda a clientes de todo el sudeste asiático a diseñar e implementar soluciones con ML e IA generativa. También le gusta el karting, trabajar con proyectos de código abierto y tratar de mantenerse al día con las nuevas investigaciones de ML.

Saurabh Trikande

Saurabh Trikande

Saurabh es gerente senior de productos de Amazon Bedrock y Amazon SageMaker Inference. Le apasiona trabajar con clientes y socios, motivado por el objetivo de democratizar la IA. Se centra en los desafíos principales relacionados con la implementación de aplicaciones complejas de IA, la inferencia con modelos multiinquilino, la optimización de costos y hacer más accesible la implementación de modelos generativos de IA. En su tiempo libre, Saurabh disfruta hacer senderismo, aprender sobre tecnologías innovadoras, seguir TechCrunch y pasar tiempo con su familia.

Pradyun Ramadorai

Pradyun Ramadorai

Pradyun es ingeniero principal en Amazon Bedrock. Se centra en los desafíos principales relacionados con las aplicaciones de IA generativa, la inferencia LLM escalable y las optimizaciones.

Zohreh Norouzi

Zohreh Norouzi

Zohreh es arquitecto de soluciones de seguridad en Amazon Web Services. Ayuda a los clientes a tomar buenas decisiones de seguridad y acelerar su viaje a la nube de AWS. Ha participado activamente en iniciativas de seguridad de IA generativa en APJ, utilizando su experiencia para ayudar a los clientes a crear soluciones seguras de IA generativa a escala.