Presentamos GLM 5.3 en Amazon Bedrock

Las cargas de trabajo de codificación y agentes exigen más que nunca a los modelos de IA: refactorizar un repositorio que abarca cientos de archivos, mantener un flujo de trabajo de agentes de varias horas sin perder el contexto y razonar problemas de sistemas complejos con el uso de herramientas en cada paso. Históricamente, satisfacer esas demandas con modelos abiertos ha significado aprovisionar y operar su propia infraestructura de inferencia.

GLM 5.3 de Z.ai (Zhipu AI) ya está disponible en Amazon Bedrock. GLM 5.3, publicado en Hugging Face Hub, es un modelo de combinación de expertos con parámetros 753B optimizado para codificación y tareas agentes de largo horizonte. En particular, Z.ai informó que el modelo muestra capacidades notables de seguridad cibernética. En Amazon Bedrock, ahora puede usarlo a través de API totalmente administradas con inferencia entre regiones, almacenamiento en caché de avisos y niveles de servicio. No gestionas ninguna infraestructura. El acceso a GLM 5.3 en Bedrock está disponible para clientes empresariales elegibles.

En esta publicación, le mostramos cómo invocar GLM 5.3 en Amazon Bedrock utilizando las API compatibles con OpenAI y reducir el costo y la latencia con el almacenamiento en caché rápido. Luego ponemos el modelo a trabajar en un flujo de trabajo agente realista: ejecutando una prueba de seguridad autorizada de su propia aplicación con Strix, un agente de pruebas de penetración de IA de código abierto.

Novedades respecto al GLM 5

GLM 5 llegó a Amazon Bedrock a principios de este año. GLM 5.3 se basa en el mismo linaje, con una serie de ventajas importantes:

Codificación más sólida: Z.ai afirma tener un rendimiento competitivo en una variedad de puntos de referencia de codificación, incluidos DeepSWE, Terminal Bench 3.0 y FrontierSWE. También informan una mejora del 50 % con respecto a GLM 5.2 en su propio punto de referencia de codificación interno. No se informaron comparaciones directas con GLM 5, porque la magnitud de las mejoras llevó a actualizar las pruebas de referencia desde el anuncio de GLM 5.1. Capacidades emergentes de seguridad cibernética: se destaca el rendimiento de referencia informado en tareas de seguridad, lo que hace que el modelo sea una opción natural para los flujos de trabajo de seguridad defensiva. Por ejemplo, Z.ai obtuvo una puntuación líder de 84,5 en el punto de referencia CyberGym en el momento del lanzamiento. Integración más amplia de Amazon Bedrock: perfiles de inferencia entre regiones, almacenamiento en caché de mensajes implícitos y explícitos y paridad de funciones mejorada de las API de respuestas y finalización de chat compatibles con OpenAI junto con Invoke y Converse.

Capacidades clave

Codificación de frontera y desempeño agente. GLM 5.3 está diseñado para ingeniería de sistemas complejos y tareas de agencia de largo plazo. Estos incluyen razonamiento de varios pasos, flujos de trabajo mejorados con herramientas y contexto sostenido en grandes bases de código. Acceso API flexible. Puede invocar GLM 5.3 a través de las API de respuestas y finalización de chat compatibles con OpenAI, o las API de Amazon Bedrock Invoke y Converse. Almacenamiento en caché rápido. GLM 5.3 admite el almacenamiento en caché de mensajes implícitos (automáticos) de forma predeterminada y controles de caché explícitos (recomendados) en las API de Respuestas y Finalizaciones de chat. Para cargas de trabajo agentes que reenvían grandes mensajes del sistema o contexto del repositorio en cada turno, el almacenamiento en caché reduce tanto la latencia como el costo de entrada. Inferencia entre regiones. GLM 5.3 está disponible a través de los perfiles de inferencia entre regiones de EE. UU. (us.zai.glm-5.3) y de inferencia global entre regiones (global.zai.glm-5.3). Usted envía solicitudes a la región de AWS “de origen” de su elección y Amazon Bedrock enruta de forma segura cada solicitud para su procesamiento. Consulte la Guía del usuario de Amazon Bedrock para obtener más detalles. Niveles de servicio. Elija Flex para optimizar el costo de cargas de trabajo menos urgentes, Priority para priorizar solicitudes de latencia crítica a cambio de un precio más alto o Standard para obtener el equilibrio predeterminado entre precio y velocidad.

Requisitos previos

Para los siguientes ejemplos de uso, necesita:

Una cuenta de AWS con acceso a Amazon Bedrock. Permisos de AWS Identity and Access Management (IAM) para llamar al modelo base y al perfil de inferencia de destino: bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream y bedrock:CallWithBearerToken. (Para las demostraciones basadas en código) Python 3.10 o posterior. (Solo para la demostración de prueba de seguridad opcional) instale Docker y Strix con Bedrock Extra.

Pruebe GLM 5.3 en la consola de Amazon Bedrock

Puede comenzar a enviar mensajes a GLM 5.3 en la Consola de administración de AWS, sin necesidad de escribir código ni instalar herramientas de desarrollo. Para comenzar, navegue hasta Amazon Bedrock y luego elija Prueba > Patio de juegos en el menú de la barra lateral izquierda.

Desde esta interfaz de juegos, puede seleccionar GLM 5.3 de la lista de modelos y enviar sus primeras indicaciones a través de la interfaz de usuario del chat, como se muestra en la siguiente captura de pantalla:

Figura 1: Chat con GLM 5.3 en la consola de Amazon Bedrock

Comience con la API de Respuestas

Mediante programación, puede llamar al modelo a través del punto final de tiempo de ejecución de Bedrock. Esto admite las API de respuestas y finalización de chat compatibles con OpenAI, y las API de Amazon Bedrock Invoke y Converse para GLM 5.3. Para aplicaciones nuevas, se recomiendan las API compatibles con OpenAI, ya que admiten un conjunto más completo de funciones.

Amazon Bedrock admite la generación de claves API para integraciones compatibles con OpenAI que las requieran. Sin embargo, recomendamos encarecidamente preferir credenciales de corta duración a claves API de larga duración siempre que sea posible.

En el siguiente ejemplo, llamaremos a la API de respuestas desde Python utilizando el SDK de Python de OpenAI y la biblioteca aws-bedrock-token-generator para generar tokens a corto plazo a partir de sus credenciales estándar de AWS Command Line Interface (AWS CLI).

Instale los paquetes necesarios.

instalación de pip -U openai aws-bedrock-token-generator

Guarde el siguiente código como bedrock-request.py.

from aws_bedrock_token_generator import provide_token from openai import OpenAI region = “us-west-2″ # Su cliente de la región de AWS de origen = OpenAI( api_key=provide_token(region=region), base_url=f”https://bedrock-runtime. {region}.amazonaws.com/openai/v1″, ) resp = client.responses.create( input=”Refactorice esta función de Python para que sea iterativa en lugar de recursivo: …”, model=”global.zai.glm-5.3″, ) print(resp.output_text)

Ejecute el script, que mostrará el resultado del modelo.

Python bedrock-request.py

Optimice la inferencia con almacenamiento en caché de mensajes explícitos

Los flujos de trabajo de codificación y conocimiento de larga duración a menudo reenvían un contexto estable en múltiples turnos de conversación, como indicaciones del sistema, definiciones de herramientas o archivos de repositorio.

GLM 5.3 en Amazon Bedrock admite el almacenamiento en caché de avisos implícitos de forma predeterminada, lo que ayuda a reducir la latencia de respuesta y los costos de token de entrada para llamadas repetidas que comparten el mismo prefijo de aviso inicial.

Con el modo de almacenamiento en caché de avisos explícitos, usted identifica específicamente los prefijos de avisos reutilizables, lo que puede mejorar aún más la tasa de aciertos de caché (y, por lo tanto, la latencia y el ahorro de costos) en comparación con el almacenamiento en caché implícito.

Para utilizar el almacenamiento en caché de mensajes explícitos con GLM 5.3, como se muestra en el siguiente ejemplo:

Seleccione el modo de almacenamiento en caché explícito a través de Prompt_cache_options en su solicitud. Agregue uno o más marcadores Prompt_cache_breakpoint en los bloques de contenido de entrada para indicar el final (incluido) de los prefijos de aviso reutilizables. Cada punto de interrupción debe contener al menos 1024 tokens para ser elegible para el almacenamiento en caché.

resp = client.responses.create( model=”global.zai.glm-5.3″, # Habilitar el modo de almacenamiento en caché explícito: extra_body={“prompt_cache_options”: {“mode”: “explicit”}}, input=[
{
“type”: “message”,
“role”: “system”,
“content”: [
{
“type”: “input_text”,
“text”: SYSTEM_PROMPT,
# A long, static system prompt is a great target for caching:
“prompt_cache_breakpoint”: {“mode”: “explicit”},
},
]
}, { “tipo”: “mensaje”, “rol”: “usuario”, “contenido”: [
{
“type”: “input_text”,
“text”: USER_INPUT,
# Multiple breakpoints can also be defined, for layered cache:
“prompt_cache_breakpoint”: {“mode”: “explicit”},
},
]}, ], ) if resp.usage.input_tokens_details.cached_tokens: print(“¡Presione caché!”)

Para obtener más información, consulte la sección de almacenamiento en caché de mensajes de la Guía del usuario de Amazon Bedrock.

Ejemplo de carga de trabajo agente: pruebas de seguridad autorizadas con Strix

Una carga de trabajo que se beneficia directamente de los puntos fuertes de GLM 5.3 son las pruebas de seguridad automatizadas de sus propias aplicaciones. Strix es un agente de pruebas de penetración de IA de código abierto que ejecuta su código de forma dinámica, encuentra vulnerabilidades y las valida con pruebas de prueba de concepto. Al momento de escribir este artículo, la documentación de Strix utiliza GLM 5.3 como modelo predeterminado. Puede configurar Strix para usar GLM 5.3 en Amazon Bedrock en lugar de un proveedor de inferencia de terceros, de modo que la inferencia de modelos se ejecute bajo los controles de su cuenta de AWS.

Pruebe únicamente aplicaciones de su propiedad o que tenga permiso explícito por escrito para probarlas. Las pruebas de seguridad no autorizadas de sistemas que no le pertenecen son ilegales en la mayoría de las jurisdicciones y violan la Política de uso aceptable de AWS. En este tutorial, el objetivo es OWASP Juice Shop, una aplicación de muestra deliberadamente vulnerable que se ejecuta localmente en su máquina.

Si desea realizar pruebas de seguridad continuas y totalmente administradas más allá de ejecutar agentes de código abierto usted mismo, AWS Continuum proporciona pruebas de penetración bajo demanda y otros análisis de seguridad como un servicio administrado. Los dos enfoques son complementarios: los agentes de código abierto como Strix le brindan pruebas impulsadas por los desarrolladores, integradas y profundamente personalizables contra compilaciones locales, mientras que AWS Continuum ejecuta evaluaciones administradas a escala.

Para ejecutar una prueba de seguridad autorizada

Inicie la aplicación de destino de ejemplo Juice Shop localmente.

docker run –rm -p 3000:3000 bkimminich/juice-shop

Configure Strix para usar GLM 5.3 en Amazon Bedrock. Strix utiliza LiteLLM internamente, por lo que (como se describe en su documentación para Amazon Bedrock) sus credenciales de AWS CLI se recogerán automáticamente. Esto significa que no se requiere ninguna clave API, pero es posible que desee configurar variables de entorno como AWS_PROFILE y AWS_REGION para configurar su conexión. Al momento de escribir este artículo, LiteLLM aún no resuelve bedrock/global.zai.glm-5.3. Hasta que esto se solucione, puede especificar explícitamente la ruta de la API de Converse y el nombre de recurso de Amazon (ARN) del perfil de inferencia como se muestra en el siguiente fragmento:

# Complete los marcadores de posición REGION y ACCOUNT_ID a continuación antes de ejecutar. export STRIX_LLM=”bedrock/converse/arn:aws:bedrock:{AWS_REGION}:{AWS_ACCOUNT_ID}:inference-profile/global.zai.glm-5.3″

Ejecute Strix contra el objetivo local.

cadena –objetivo http://localhost:3000

Espere a que se complete el agente raíz Strix y luego revise los resultados.

Strix organiza un equipo de subagentes para mapear la superficie de la amenaza, explorar una variedad de categorías de vulnerabilidad potenciales e intentar validar cada hallazgo con una prueba de concepto funcional. Esto ayuda a minimizar el tiempo dedicado a clasificar los falsos positivos. Una ejecución exitosa generará un informe que incluirá la gravedad, la evidencia y una guía de solución para cada hallazgo.

El siguiente vídeo muestra el recorrido de principio a fin para configurar y ejecutar Strix en la aplicación de ejemplo y explorar los resultados:

Figura 2: Ejecución de una prueba de seguridad de ejemplo con GLM 5.3 y Strix

Limpiar

Detenga el contenedor Juice Shop con Ctrl+C en la terminal donde se está ejecutando, o ejecute docker ps para encontrar el ID del contenedor y deténgalo con docker stop. La inferencia de Amazon Bedrock es de pago por token sin recursos persistentes, por lo que no hay más cargos una vez completadas sus solicitudes. Si generó una clave API de Amazon Bedrock para este tutorial y ya no la necesita, elimínela en la consola de Amazon Bedrock.

Disponibilidad

Pruebe GLM 5.3 en la consola de Amazon Bedrock, utilícelo a través de asistentes de codificación como OpenCode, como se muestra en nuestra publicación reciente con Kimi K3, o conecte sus aplicaciones personalizadas a través de las API compatibles.

¿Está interesado en saber cómo Amazon Bedrock puede ayudar a su equipo? Conéctese con nosotros para iniciar la conversación.

Sobre los autores

Alex Thewsey

Alex Thewsey

Alex es arquitecto de soluciones especializado en inteligencia artificial en AWS, con sede en Singapur. Se centra en cómo las tecnologías de código abierto y los modelos de peso abierto pueden ayudar a los clientes de todo el mundo a crear soluciones de IA innovadoras y abordar los desafíos de la gobernanza de la IA.