Presentamos el almacenamiento en caché de mensajes explícitos para los modelos OpenAI GPT-5.6 en Amazon Bedrock

Esta publicación está coescrita con Chris Dickens de OpenAI.

OpenAI GPT-5.6 Sol, Terra y Luna ahora están disponibles de forma general en Amazon Bedrock. Con GPT-5.6 en Amazon Bedrock, obtiene la última generación de modelos de frontera OpenAI con precios de pago por token, controles de gobernanza y seguridad de AWS y un uso que cuenta para sus compromisos existentes de AWS. La familia cubre tres niveles de capacidad: GPT-5.6 Sol para el trabajo de codificación agente y razonamiento más complejo, GPT-5.6 Terra para cargas de trabajo de producción diarias equilibradas y GPT-5.6 Luna para tareas rápidas y de gran volumen, como clasificación y resumen.

Además de los nuevos modelos, GPT-5.6 introduce el almacenamiento en caché de mensajes explícitos en Amazon Bedrock, una nueva capacidad que le brinda control preciso sobre qué partes de su mensaje se almacenan en caché y se reutilizan en todas las solicitudes. La entrada almacenada en caché se factura con un descuento del 90 por ciento (consulte la página de precios de Amazon Bedrock) y permanece disponible para su reutilización durante 30 minutos. Obtiene el máximo valor de esto en los flujos de trabajo agentes, donde las instrucciones del sistema, las definiciones de herramientas y los documentos de referencia se repiten en muchas llamadas.

En esta publicación, presentamos el almacenamiento en caché de mensajes explícitos para GPT-5.6 en Amazon Bedrock, una nueva capacidad que le brinda control sobre qué partes de su mensaje se almacenan en caché y se reutilizan en todas las solicitudes. Mostramos en qué se diferencia del almacenamiento en caché implícito y cuándo usar cada modo, cómo configurarlo y verificar que esté funcionando, y cómo se desempeña en un flujo de trabajo agente. También cubrimos cómo migrar cargas de trabajo de modelos GPT anteriores a GPT-5.6, ya sea que se ejecuten en Amazon Bedrock hoy o en otra plataforma.

Comience con GPT-5.6 en Amazon Bedrock

Los modelos GPT-5.6 se ofrecen a través de la API Responses compatible con OpenAI en el punto final de Amazon Bedrock bedrock-mantle.

Configurar el cliente

La forma recomendada de autenticarse es con tokens de portador a corto plazo generados a partir de sus credenciales de AWS. Instale el generador de tokens junto con el SDK de OpenAI:

pip install openai aws-bedrock-token-generator

Luego crea un cliente. El generador de tokens utiliza la cadena de credenciales estándar de AWS (roles de IAM, variables de entorno o su perfil CLI), por lo que su código permanece libre de secretos de larga duración:

from openai import OpenAI from aws_bedrock_token_generator import provide_token REGION = "us-east-2" client = OpenAI( base_url=f"https://bedrock-mantle.{REGION}.api.aws/openai/v1", api_key=provide_token(region=REGION), # token a corto plazo de sus credenciales de AWS)

Haz tu primera solicitud

Los modelos GPT-5.6 utilizan la API de respuestas. Una solicitud mínima se ve así:

respuesta = client.responses.create( model="openai.gpt-5.6-terra", instrucciones="Eres un asistente técnico conciso.", input="¿Qué es Amazon Bedrock?", max_output_tokens=500, ) print(response.output_text)

Los tres ID de modelo son openai.gpt-5.6-sol, openai.gpt-5.6-terra y openai.gpt-5.6-luna. GPT-5.6 Sol está disponible en el Este de EE. UU. (Norte de Virginia) y el Este de EE. UU. (Ohio). Terra y Luna también están disponibles en el oeste de EE. UU. (Oregón). Para conocer la disponibilidad de modelos por región, consulte Modelos admitidos por región de AWS en Amazon Bedrock (https://docs.aws.amazon.com/bedrock/latest/userguide/models-regions.html).

Controlar el esfuerzo de razonamiento

GPT-5.6 admite niveles de esfuerzo de razonamiento ninguno, bajo, medio, alto y xalto, con medio como valor predeterminado. Los niveles más altos asignan más razonamiento a problemas más difíciles y ninguno le brinda la ruta de latencia más baja para tareas sencillas:

respuesta = client.responses.create( model="openai.gpt-5.6-luna", input="Clasifique este ticket como error, solicitud de función o pregunta: 'La aplicación falla al iniciar sesión'", razonamiento={"effort": "none"}, )

Una guía práctica al actualizar desde GPT-5.5 o GPT-5.4: comience con el nivel de esfuerzo que usa hoy y luego pruebe un nivel más bajo. GPT-5.6 es más eficiente con los tokens y muchas cargas de trabajo mantienen la calidad con una configuración de menor esfuerzo. Los parámetros de muestreo (temperatura y top_p) se admiten cuando Reasoning.effort se establece en ninguno. En otros niveles de esfuerzo, el proceso de razonamiento del modelo controla la variación de la producción.

Transmitir respuestas

La transmisión funciona a través de la interfaz estándar del SDK y entrega resultados como eventos escritos:

con client.responses.stream( model="openai.gpt-5.6-terra", input="Escribe un haiku sobre sistemas distribuidos.", ) como flujo: para evento en flujo: if event.type == "response.output_text.delta": print(event.delta, end="", flush=True)

Llame a herramientas y obtenga resultados estructurados

La llamada a funciones y la salida estricta del esquema JSON funcionan como lo hacen con la API nativa de OpenAI. Las definiciones de herramientas utilizan el formato plano de la API de Respuestas:

respuesta = client.responses.create( model="openai.gpt-5.6-terra", input="¿Cuál es el clima en Seattle?", tools=[{ "type": "function", "name": "get_weather", "description": "Obtener el clima actual de una ciudad", "parameters": { "type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"], }, }], ) para el elemento en respuesta.salida: if item.type == "function_call": print(item.name, item.arguments) # get_weather {"city":"Seattle"}

Para una salida estructurada, pase un esquema JSON estricto y el modelo devolverá un JSON válido que se ajuste a él:

respuesta = client.responses.create( model="openai.gpt-5.6-luna", input="Extracto: 'Orden #1234 enviada a Berlín el 2 de mayo'", text={ "format": { "type": "json_schema", "name": "order", "strict": True, "schema": { "type": "object", "properties": { "order_id": {"type": "string"}, "destination": {"tipo": "cadena"}, }, "requerido": ["order_id", "destino"], "additionalProperties": False, }, } }, ) print(response.output_text) # {"destino":"Berlín","order_id":"1234"}

Utilice el almacenamiento en caché rápido para GPT-5.6 en Amazon Bedrock

Los modelos GPT-5.6 admiten el almacenamiento en caché rápido a través de la API de Responses, con dos modos: implícito, donde Amazon Bedrock coloca puntos de interrupción de caché automáticamente, y explícito, donde usted mismo marca el límite de caché para un control preciso. Esta sección cubre ambos, además de cómo verificar el comportamiento del almacenamiento en caché y elegir el modo correcto para su carga de trabajo.

El almacenamiento en caché de mensajes permite a Amazon Bedrock omitir el recálculo de partes del mensaje que se repiten en todas las solicitudes. En GPT-5.6, las lecturas de caché se facturan con un descuento del 90 por ciento en comparación con los tokens de entrada no almacenados en caché, y las escrituras de caché se facturan a 1,25 veces la tasa de entrada sin caché, por lo que la función está diseñada para patrones de escritura una vez y lectura múltiple. Debido a que una lectura ahorra mucho más de lo que agrega una escritura, una carga de trabajo reduce su costo de entrada neto una vez que las lecturas de caché representan aproximadamente el 20 por ciento de los tokens que fluyen a través de la caché. Implícito lo lleva hacia eso sin ningún trabajo de su parte, porque Amazon Bedrock coloca el punto de interrupción y lo ajusta por usted. En modo explícito, marcar el prefijo estable usted mismo generalmente aumenta aún más la tasa de aciertos, porque las solicitudes posteriores leen el prefijo mientras permanece en caché. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock.

Comience con el almacenamiento en caché de mensajes implícitos

En GPT-5.6, el almacenamiento en caché de mensajes está activado de forma predeterminada en modo implícito. Cuando envía una solicitud sin ningún parámetro de almacenamiento en caché, Amazon Bedrock coloca automáticamente un punto de interrupción de caché y busca un prefijo reutilizable. Se puede almacenar en caché y reutilizar un prefijo estable de al menos 1024 tokens sin necesidad de realizar cambios en el código.

# Almacenamiento en caché implícito: no se necesitan parámetros de almacenamiento en caché respuesta = client.responses.create( model="openai.gpt-5.6-terra", instrucciones=SYSTEM_INSTRUCTIONS, # prefijo estable, >= 1024 tokens input=user_question, ) detalles = respuesta.usage.input_tokens_details print(f"cached: {details.cached_tokens}, escrito: {detalles.cache_write_tokens}")

El almacenamiento en caché implícito significa que su código existente comienza a obtener lecturas de caché desde el primer día, sin necesidad de analizar su estructura de avisos. Debido a que Bedrock elige el punto de interrupción por usted, la primera solicitud escribe el prefijo en la memoria caché y las solicitudes posteriores lo vuelven a leer. Para cargas de trabajo donde el contenido después de su prefijo estable cambia en cada solicitud, como asistentes de chat y bucles de herramientas agentes, obtiene resultados más predecibles marcando el prefijo usted mismo con un punto de interrupción explícito. La siguiente sección describe este enfoque.

Configurar el almacenamiento en caché de mensajes explícitos

El modo explícito le brinda control directo sobre el límite de la caché. Usted marca el final de su prefijo reutilizable y los prefijos almacenados en caché permanecen disponibles para su reutilización durante al menos 30 minutos, tiempo suficiente para cubrir la ráfaga de llamadas que genera una sola ejecución de agente. Tres parámetros de solicitud controlan el almacenamiento en caché en GPT-5.6:

Prompt_cache_breakpoint: colocado en un bloque de contenido, marca el final exacto de un prefijo de mensaje reutilizable. Todo hasta el bloque marcado inclusive se almacena en caché, y todo lo que sigue puede cambiar libremente mientras el prefijo almacenado en caché sigue siendo válido. Cada prefijo almacenado en caché debe contener al menos 1024 tokens y puede configurar hasta 4 puntos de interrupción por solicitud en los bloques input_text, input_image y input_file. Prompt_cache_key: una ID estable que enruta solicitudes al mismo caché. Configúrelo de forma coherente en todas las solicitudes de una sesión o aplicación para que las solicitudes repetidas encuentren el prefijo almacenado en caché. Prompt_cache_options: controla el modo de almacenamiento en caché (implícito o explícito, cubierto en la siguiente sección) y el TTL.

Aquí hay un ejemplo completo: un asistente de soporte con una larga instrucción del sistema que es idéntica en cada llamada, seguida de una pregunta del usuario que cambia cada vez. El punto de interrupción va al final del contenido estático:

respuesta = client.responses.create( model="openai.gpt-5.6-terra", Prompt_cache_key="support-app:kb-v1", # misma clave en todas las solicitudes input=[ { "type": "message", "role": "developer", "content": [{ "type": "input_text", "text": SYSTEM_INSTRUCTIONS, # long, static: directrices, extractos de KB (>= 1024 tokens) "prompt_cache_breakpoint": {"mode": "explicit"}, }], }, { "type": "message", "role": "user", "content": [{ "type": "input_text", "text": user_question, # cambios en cada solicitud }], }, ], extra_body={"prompt_cache_options": {"mode": "explicit"}}, )

Verificar el comportamiento del almacenamiento en caché

Cada respuesta informa exactamente lo que hizo el caché, en el objeto use.input_tokens_details. Este es el lugar para verificar su configuración:

cached_tokens: tokens de entrada leídos desde la memoria caché, facturados con un descuento del 90 por ciento. cache_write_tokens: tokens de entrada escritos en caché, facturados a 1,25 veces la tarifa sin caché.

detalles = respuesta.usage.input_tokens_details print(f"en caché: {detalles.cached_tokens}, escrito: {detalles.cache_write_tokens}")

Nota: Los tokens servidos desde el caché dentro del período de 30 minutos no se incluyen en los cargos de llamadas posteriores. La siguiente explicación cubre esto en detalle.

input_tokens = cached_tokens + cache_write_tokens + resto no almacenado en caché

input_tokens es el recuento total de entradas para la solicitud. cached_tokens y cache_write_tokens informan qué parte de esa entrada proviene del caché, y el resto es el contenido nuevo que envía cada vez, como la pregunta del usuario después de su punto de interrupción. Debido a que los recuentos escritos y en caché son parte de input_tokens en lugar de agregarse encima de él, un token servido desde la caché se cuenta una vez y se factura una vez a la velocidad de lectura de la caché. Nunca se le cobrará dos veces por el mismo token. En el siguiente ejemplo, las solicitudes reutilizan el mismo prefijo del sistema de 3626 tokens en una Prompt_cache_key. La pregunta del usuario cambia cada vez, por lo que el resto de input_tokens no almacenados en caché cambia con ella:

Solicitar input_tokens cached_tokens cache_write_tokens Entrada nueva (no almacenada en caché) Primera (fría) 3682 0 3626 56 Segunda 3671 3626 0 45 Tercera 3662 3626 0 36

La primera solicitud escribe el prefijo de 3626 tokens en la caché. A partir de la segunda solicitud, ese prefijo se vuelve a leer con el descuento de lectura de caché, mientras que solo la entrada del nuevo usuario (aquí 45 y 36 tokens) se procesa a la tarifa estándar. cached_tokens se mantiene alto, cache_write_tokens cae a cero y input_tokens se mueve solo según el tamaño de la pregunta cambiante del usuario.

Estos dos campos llegan con cada respuesta. El flujo de trabajo de verificación más directo es registrarlos desde su aplicación junto con el ID de solicitud y Prompt_cache_key. Luego confirme el patrón de escritura una vez y lectura muchas en sus registros antes de que el tráfico de producción dependa de él. Para el monitoreo agregado, el punto de enlace de Bedrock-Mantle publica inferencias y métricas de tokens en Amazon CloudWatch en el espacio de nombres AWS/BedrockMantle (consulte Monitorear la inferencia de Bedrock-Mantle mediante métricas de CloudWatch). Esto rastrea el volumen general de tokens de entrada y salida por cuenta, proyecto y modelo. El desglose de la caché por solicitud proviene del objeto de uso en cada respuesta, lo que hace que el registro a nivel de aplicación de estos dos campos sea la base de la observabilidad del almacenamiento en caché.

Utilice el almacenamiento en caché en un bucle agente

Las cargas de trabajo agentes son donde brilla el almacenamiento en caché explícito. En un bucle de llamada de herramientas, el mensaje del sistema y las definiciones de las herramientas se repiten en cada turno mientras la conversación crece al final, una opción perfecta para un punto de interrupción después del contenido estático. Este ejemplo crea un asistente de respuesta a incidentes que verifica el estado del servicio y las implementaciones recientes:

import json SYSTEM_PROMPT = "…" # libro de ejecución largo e instrucciones (>= 1024 tokens) MAX_TURNS = 10 TOOLS = [ {"type": "function", "name": "get_service_health", "description": "Obtener estado de salud para un microservicio", "parameters": {"type": "object", "properties": {"service": {"type": "string"}}, "required": ["service"]}}, {"type": "function", "name": "get_recent_deploys", "description": "Listar implementaciones en las últimas N horas", "parameters": {"type": "object", "properties": {"hours": {"type": "integer"}}, "required": ["hours"]}}, ] conversación = [ {"type": "message", "role": "developer", "content": [{"type": "input_text", "text": SYSTEM_PROMPT, "prompt_cache_breakpoint": {"mode": "explicit"}}]}, {"type": "message", "role": "user", "content": [{"type": "input_text", "text": "¿Está el servicio de pago en buen estado? Si no, ¿hubo una implementación reciente?"}]}, ] para turn in range(MAX_TURNS): respuesta = client.responses.create( model="openai.gpt-5.6-sol", Prompt_cache_key="incident-agent:session-42", input=conversation, tools=TOOLS, extra_body={"prompt_cache_options": {"mode": "explicit", "ttl": "30m"}}, ) tool_calls = [o for o en respuesta.salida si o.type == "function_call"] si no es tool_calls: print(response.output_text) break for call in tool_calls: # ejecutar_tool es su implementación: llame al sistema real # y devuelva un resultado serializable en JSON resultado = ejecutar_herramienta(call.name, json.loads(call.arguments)) conversación.append({"type": "function_call", "call_id": call.call_id, "name": call.name, "arguments": call.arguments}) conversación.append({"type": "function_call_output", "call_id": call.call_id, "output": json.dumps(resultado)})

El modelo impulsa este ciclo: decide qué herramientas llamar y el ciclo finaliza cuando el modelo devuelve una respuesta final en lugar de otra llamada a la herramienta. Este bucle de herramientas es la forma mínima de un agente, el mismo bucle que los marcos de agentes administran por usted. El primer turno escribe el prefijo del indicador del sistema en la memoria caché. Cada turno posterior de la ejecución lee ese prefijo del caché mientras el modelo procesa las llamadas y los resultados de la herramienta recién agregada, y el TTL de 30 minutos cubre cómodamente sesiones de agente de varios minutos. El registro de los dos campos de uso por turno muestra claramente el patrón: una única escritura de caché en el turno inicial, seguida de lecturas de caché en cada turno posterior.

Elija entre almacenamiento en caché implícito y explícito

GPT-5.6 admite dos modos de almacenamiento en caché, controlados por Prompt_cache_options.mode:

Implícito (el valor predeterminado). Amazon Bedrock coloca automáticamente un punto de interrupción de la caché en el último mensaje e intenta maximizar la tasa de aciertos de la caché. Cualquier punto de interrupción explícito que agregue también se respetará. Este modo ofrece beneficios de almacenamiento en caché automáticamente con su formato de solicitud existente. Explícito. Configurar “prompt_cache_options”: {“mode”: “explicit”} le da a sus puntos de interrupción control total: solo los puntos de interrupción que usted coloca se usan para lecturas y escrituras de caché.

El modo explícito pone el límite de la caché bajo su control, y ese control es más importante cuando sus indicaciones combinan un prefijo estable con contenido que cambia en cada solicitud. En modo implícito, Bedrock coloca el punto de interrupción por usted y la cantidad de escrituras en caché antes de que comiencen las lecturas puede variar de una solicitud a otra. Con un punto de interrupción explícito colocado al final del contenido estático, el comportamiento es determinista: la primera solicitud escribe el prefijo una vez y cada solicitud siguiente lo lee del caché, porque el contenido cambiante se encuentra de forma segura después del punto de interrupción.

Su carga de trabajo Modo recomendado Solicita repetición exacta (análisis de documentos repetidos, puntuación por lotes con una solicitud fija) Implícito (predeterminado) funciona sin cambios de solicitud. Explícito da el mismo resultado con control determinista Prefijo estable más sufijo cambiante (asistentes de chat, RAG, bucles de herramientas agentes) Explícito, con un punto de interrupción después del contenido estático Múltiples secciones que cambian en diferentes frecuencias (herramientas, avisos del sistema, documentos largos, conversación) Explícito, con hasta 4 puntos de interrupción para control granular

Si no desea el almacenamiento en caché de avisos en GPT-5.6+, puede usar el modo de caché explícito sin proporcionar puntos de interrupción explícitos. Esto lo excluye del comportamiento de facturación de caché de avisos (y no incurre en cargos por escritura de caché), pero es posible que partes de los avisos aún se almacenen en caché en los sistemas Bedrock para brindarle una latencia más baja. Cualquiera que sea el modo que elija, siga monitoreando los dos campos de uso en producción. Un patrón de almacenamiento en caché saludable muestra lecturas de caché significativas después de cada escritura. Si ve una gran cantidad de escrituras en caché con pocas lecturas en modo implícito, considere cambiar al modo explícito agregando un punto de interrupción explícito al final de su contenido estático para que el prefijo almacenado en caché sea determinista. En modo explícito, mueva su punto de interrupción antes para que cubra solo el contenido que permanece constante entre llamadas. Confirme que Prompt_cache_key esté configurado de manera consistente en todas las solicitudes que deben compartir un caché.

Migrar a GPT-5.6 desde modelos GPT anteriores

La combinación de GPT-5.6 de mayor rendimiento, mejor eficiencia de token y almacenamiento en caché controlable lo convierte en un objetivo de actualización convincente. El esfuerzo de migración depende de dónde se ejecuta su carga de trabajo hoy. Cubrimos los tres puntos de partida comunes, desde el cambio más pequeño hasta el más grande.

Punto de partida 1: GPT-5.5 o GPT-5.4 en Amazon Bedrock

Si ya ejecuta modelos OpenAI en Amazon Bedrock, la actualización es un cambio de ID de modelo. La forma de solicitud del punto final, la autenticación y la API de respuestas permanecen idénticas:

respuesta = client.responses.create( model="openai.gpt-5.6-terra", # era: openai.gpt-5.5 instrucciones=SYSTEM_PROMPT, input=user_input, max_output_tokens=1000,)

Dos cosas para incluir en la actualización:

Adopte puntos de interrupción de caché explícitos. En GPT-5.5 y GPT-5.4, el almacenamiento en caché de avisos es automático: el sistema almacena en caché prefijos elegibles de 1024 tokens o más sin parámetros adicionales, y las escrituras en caché son gratuitas. GPT-5.6 pasa al modelo controlable descrito anteriormente, incluida la tasa de escritura de caché de 1,25 veces, que se aplica tanto a las escrituras implícitas como a las explícitas. Planifique los dos cambios juntos: cuando cambie la ID del modelo, coloque un punto de interrupción explícito después de su contenido estático al mismo tiempo. Esa única adición establece el patrón de escritura una vez y lectura muchas para mensajes cuyo final cambia en cada solicitud. También extiende la vida útil de la caché, porque los prefijos almacenados en caché GPT-5.6 permanecen disponibles durante al menos 30 minutos.

Revise su esfuerzo de razonamiento. GPT-5.6 agrega el nivel de esfuerzo xalto y ofrece más capacidad por token en todo el rango. Comience con su nivel de esfuerzo GPT-5.5 actual y pruebe un nivel más bajo. Muchas cargas de trabajo mantienen su nivel de calidad a un costo menor.

Punto de partida 2: API de respuestas en otra plataforma

Si su aplicación ya utiliza la API OpenAI Responses en otra plataforma, la migración a Amazon Bedrock requiere tres cambios: la URL base, la autenticación y el ID del modelo. Su código de manejo de solicitudes y respuestas sigue siendo el mismo:

de openai importar OpenAI de aws_bedrock_token_generator importar provide_token REGION = "us-east-2" client = OpenAI( base_url=f"https://bedrock-mantle.{REGION}.api.aws/openai/v1", # 1. endpoint api_key=provide_token(region=REGION), # 2. auth ) respuesta = client.responses.create( model="openai.gpt-5.6-terra", # 3. instrucciones de ID del modelo=SYSTEM_PROMPT, input=user_input,)

El cambio de autenticación también es una mejora de seguridad: aws-bedrock-token-generator deriva tokens a corto plazo de sus credenciales de AWS, por lo que su aplicación utiliza roles de IAM de un extremo a otro. Mantiene la misma identidad, política y modelo de auditoría (AWS CloudTrail) que el resto de sus cargas de trabajo de AWS. Para la producción, incluya la generación de tokens en una rutina de actualización, ya que, por diseño, los tokens tienen una vida corta. Debido a que esta migración generalmente también lo eleva una generación de modelo, agregue los dos cambios desde el punto inicial 1: coloque un punto de interrupción de caché explícito después de su contenido estático y pruebe un nivel de esfuerzo de razonamiento por debajo de su configuración actual.

Punto de partida 3: API de finalización de chat en otra plataforma

GPT-5.6 en Amazon Bedrock se ofrece a través de la API de respuestas, por lo que las cargas de trabajo escritas en las finalizaciones de chat trasladan su manejo de solicitudes y respuestas como parte de la migración. El mapeo es mecánico:

Mensajes API de respuestas de finalización de chat=[{role, content}] instrucciones="…" (sistema) más input="…" o lista de mensajes max_completion_tokens max_output_tokens respuesta.choices[0].message.content respuesta.output_text tools=[{"type": "function", "function": {…}}] tools=[{"type": "function", "name": …, …}] opciones (planas)[0].message.tool_calls[i].id salida[i].call_id {"role": "tool", "tool_call_id": …} {"type": "function_call_output", "call_id": …} respuesta.usage.prompt_tokens/completation_tokens respuesta.usage.input_tokens/output_tokens stream=Verdadero con fragmentos delta.content stream=Verdadero con eventos escritos (respuesta.output_text.delta)

Antes y después, uno al lado del otro:

# Antes: Finalizaciones de chat en otra plataforma respuesta = client.chat.completions.create( model="gpt-5.5", mensajes=[ {"role": "system", "content": "Eres un asistente conciso."}, {"role": "user", "content": "¿Qué es Amazon Bedrock?"}, ], max_completion_tokens=200, ) print(response.choices[0].message.content) # Después: API de respuestas en Amazon Bedrock respuesta = client.responses.create( model="openai.gpt-5.6-terra", instrucciones="Eres un asistente conciso.", input="¿Qué es Amazon Bedrock?", max_output_tokens=200, ) print(response.output_text)

La API de Responses también ofrece capacidades adicionales, incluido el estado de conversación administrado por el servidor, eventos de transmisión escritos y el almacenamiento en caché de mensajes explícitos que se tratan en esta publicación, por lo que el puerto es una inversión que rinde frutos más allá de la migración en sí.

Validar y desplegar

Cualquiera que sea su punto de partida, trate la migración como un proyecto de ingeniería estructurado:

Primero el inventario. Catalogue los modelos, las API (respuestas o finalizaciones de chat), las herramientas, el uso de streaming y la gestión de estado en la que se basa su aplicación. Esto determina qué punto de partida anterior se aplica y abarca el trabajo. Crea un conjunto de mensajes dorados. Recopile indicaciones representativas y comportamientos esperados del tráfico de producción y reprodúzcalos en GPT-5.6 en Amazon Bedrock junto con su configuración actual. Evalúe la tasa de éxito, la calidad de la salida, el consumo de tokens y la latencia en las tareas importantes para su aplicación. Las herramientas de evaluación de Amazon Bedrock o su evaluación existente aprovechan ambos trabajos. Establezca su línea base de almacenamiento en caché. Como parte de la misma repetición, registre cached_tokens y cache_write_tokens y confirme que la ubicación de su punto de interrupción produce el patrón de escritura una vez y lectura muchas antes de que el tráfico de producción dependa de ello. Aumente gradualmente. Enrute un pequeño porcentaje del tráfico al nuevo modelo, compare los KPI con su línea de base y amplíelo a medida que crece la confianza, manteniendo la configuración anterior disponible para una reversión instantánea hasta que se complete la migración.

Conclusión

GPT-5.6 Sol, Terra y Luna traen los modelos de frontera más nuevos de OpenAI a Amazon Bedrock. Con el almacenamiento en caché de avisos explícitos, tiene una herramienta de precisión para las cargas de trabajo que dominan el gasto en modelos de lenguaje grande (LLM) modernos: agentes y cargas de trabajo de IA que reenvían las mismas instrucciones, herramientas y referencias en cada llamada. Necesita un punto de interrupción después de su contenido estático, una clave de caché consistente y dos campos de uso para monitorear. Una vez implementados, puede convertir ese contexto repetido de entrada de precio completo en lecturas de caché con descuento. La misma compatibilidad con OpenAI SDK que hace que el almacenamiento en caché sea sencillo de adoptar también hace que la migración en sí sea un cambio pequeño y bien definido desde donde se ejecute su carga de trabajo hoy.

Para obtener más información, consulte el anuncio de lanzamiento de GPT-5.6 y la documentación de almacenamiento en caché de mensajes de Amazon Bedrock para obtener detalles completos sobre los parámetros y modelos admitidos. Para obtener detalles sobre precios, consulte la página de precios de Amazon Bedrock. Para monitorear sus cargas de trabajo en producción, consulte Monitorear la inferencia del manto de roca mediante métricas de CloudWatch. Pruebe GPT-5.6 con sus propias indicaciones en la consola de Amazon Bedrock y comparta sus comentarios en AWS re:Post para Amazon Bedrock o a través de sus contactos habituales de AWS Support.

Sobre los autores

Melanie Li

Melanie Li, PhD, es arquitecta sénior de soluciones especializada en IA generativa en AWS con sede en Sydney, Australia, donde se centra en trabajar con los clientes para crear soluciones utilizando herramientas de IA/ML de última generación. Ha participado activamente en múltiples iniciativas de IA generativa en APJ, aprovechando el poder de los LLM. Antes de unirse a AWS, el Dr. Li ocupó puestos de ciencia de datos en las industrias financiera y minorista.

Joe Magerramov en la cabeza

Joe Magerrámov

Joe es vicepresidente e ingeniero distinguido en AWS. Joe ha estado en Amazon desde 2005 y en AWS desde 2014. En AWS, Joe centra su atención en las redes EC2, VPC y ELB. Antes de AWS, Joe trabajó en los servicios responsables de los sistemas de mercado, cumplimiento y pagos de Amazon.com. En su tiempo libre, Joe disfruta aprendiendo más sobre física y cosmología.

Chris Dickens

Chris Dickens

Chris es miembro del personal de producto de OpenAI y se centra en las API de OpenAI. Su trabajo incluye la colaboración con AWS en Amazon Bedrock para hacer que los modelos de frontera de OpenAI sean ampliamente accesibles para los desarrolladores.

Saurabh Trikande

Saurabh Trikande

Saurabh Trikande es gerente senior de productos de Amazon Bedrock y Amazon SageMaker Inference. Le apasiona trabajar con clientes y socios, motivado por el objetivo de democratizar la IA. Se centra en los desafíos principales relacionados con la implementación de aplicaciones complejas de IA, la inferencia con modelos multiinquilino, la optimización de costos y hacer más accesible la implementación de modelos generativos de IA. En su tiempo libre, Saurabh disfruta hacer senderismo, aprender sobre tecnologías innovadoras, seguir TechCrunch y pasar tiempo con su familia.