Las soluciones multiagente, en las que redes de agentes colaboran, se coordinan y razonan juntos, están cambiando la forma en que abordamos los desafíos del mundo real. Las empresas gestionan entornos con múltiples fuentes de datos, objetivos cambiantes y diversas limitaciones. Aquí es donde brillan las arquitecturas multiagente. Al empoderar a múltiples agentes, cada uno de los cuales tiene herramientas, memoria o perspectivas especializadas para interactuar y razonar como colectivo, las organizaciones desbloquean nuevas y poderosas capacidades:
Escalabilidad: los marcos multiagente manejan tareas de creciente complejidad, distribuyendo la carga de trabajo de manera inteligente y adaptándose a la escala en tiempo real. Resiliencia: cuando los agentes trabajan juntos, el fallo de uno puede ser compensado o mitigado por otros, creando sistemas robustos y tolerantes a fallos. Especialización: los agentes individuales se destacan en dominios específicos (como finanzas, transformación de datos y soporte al usuario) pero pueden cooperar sin problemas para resolver problemas interdisciplinarios. Resolución dinámica de problemas: los sistemas multiagente pueden reconfigurarse, pivotar y responder rápidamente al cambio, lo cual es esencial en entornos comerciales, de seguridad y de operaciones volátiles.
Los lanzamientos recientes en marcos de IA agentes, como Strands Agents, facilitan que los desarrolladores participen en la creación e implementación de soluciones multiagente basadas en modelos. Puede definir indicaciones e integrar conjuntos de herramientas, lo que permite que modelos de lenguaje sólidos razonen, planifiquen e invoquen herramientas de forma autónoma en lugar de depender de flujos de trabajo frágiles y hechos a mano.
En producción, servicios como Amazon Bedrock AgentCore admiten una implementación segura y escalable con características como memoria persistente, integración de identidades y observabilidad de nivel empresarial. Este cambio hacia soluciones de IA colaborativas y multiagente está revolucionando las arquitecturas de software al hacerlas más autónomas, resilientes y adaptables. Desde la resolución de problemas en tiempo real en la infraestructura de la nube hasta la automatización entre equipos en servicios financieros y asistentes basados en chat que coordinan procesos comerciales complejos de varios pasos, las organizaciones que adoptan soluciones multiagente se están posicionando para una mayor agilidad e innovación. Ahora, con marcos abiertos como Strands, cualquiera puede empezar a construir sistemas inteligentes que piensen, interactúen y evolucionen juntos.
En esta publicación, exploramos cómo crear un flujo de trabajo de procesamiento de video de múltiples agentes utilizando Strands Agents, los modelos Llama 4 de Meta y Amazon Bedrock para analizar y comprender automáticamente el contenido de video a través de agentes de IA especializados que trabajan en coordinación. Para mostrar la solución, utilizaremos Amazon SageMaker AI para guiarle a través del código.
Meta's Llama 4: desbloqueando el valor de más de 1 millón de ventanas contextuales
Llama 4 es la última familia de modelos de lenguaje grande (LLM) de Meta que se destaca por sus capacidades de ventana de contexto e inteligencia multimodal. Ambos modelos utilizan una arquitectura de combinación de expertos (MoE) para lograr eficiencia, están diseñados para entradas multimodales y están optimizados para impulsar sistemas agentes y flujos de trabajo complejos. La variante insignia, Llama 4 Scout de Meta, admite una ventana de contexto de 10 millones de tokens (una primicia en la industria) que permite al modelo procesar y razonar grandes cantidades de datos en un solo mensaje.
Esto admite aplicaciones como resumir bibliotecas enteras de libros, analizar bases de código masivas, realizar investigaciones holísticas en miles de documentos y mantener un contexto de conversación profundo y persistente a lo largo de interacciones prolongadas. La variante Llama 4 Maverick también ofrece una ventana de 1 millón de tokens, lo que la hace adecuada para tareas exigentes de lenguaje, visión y documentos cruzados. Estas ventanas de contexto ultralargas abren nuevas posibilidades para resúmenes avanzados, retención de memoria y flujos de trabajo complejos de varios pasos, posicionando a Llama 4 de Meta como una solución versátil para aplicaciones de IA de nivel empresarial y de investigación.
Nombre del modelo Ventana contextual Capacidades clave y casos de uso Meta's Llama 4 Scout 10 millones de tokens (hasta 3,5 millones usando Amazon Bedrock) Procesamiento de documentos ultralargo, ingestión de todo el libro o base de código, resumen a gran escala, amplia memoria de diálogo, investigación avanzada Meta's Llama 4 Maverick 1M tokens Tareas multimodales de contexto grande, comprensión avanzada de documentos e imágenes, análisis de código, preguntas y respuestas integrales, resumen sólido
Descripción general de la solución
Esta publicación demuestra cómo crear un flujo de trabajo de procesamiento de video de múltiples agentes utilizando el SDK de Strands Agents, Llama 4 de Meta con sus capacidades multimodales y ventana de contexto, y la infraestructura escalable de Amazon Bedrock. Aunque esta publicación se centra principalmente en la creación de agentes especializados para crear esta solución de análisis de video, las prácticas de creación de un flujo de trabajo de múltiples agentes se pueden utilizar para crear su propia solución automatizada y adaptable a nivel empresarial.
Para escalar, este enfoque se extiende naturalmente para manejar cargas de trabajo más grandes y diversas, como el procesamiento de transmisiones de video desde millones de dispositivos conectados en ciudades inteligentes, la automatización industrial para el mantenimiento predictivo a través del análisis continuo de datos de sensores y videos, sistemas de vigilancia en tiempo real en múltiples ubicaciones o compañías de medios que administran vastas bibliotecas para indexación y recuperación de contenido. El uso de la integración integrada de Strands Agents con los servicios de Amazon Web Services (AWS) y la infraestructura de inteligencia artificial administrada de Amazon Bedrock significa que sus flujos de trabajo de múltiples agentes pueden escalar elásticamente, distribuir tareas de manera eficiente y mantener una alta disponibilidad y tolerancia a fallas. Puede crear flujos de trabajo complejos de varios pasos a través de fuentes de datos y casos de uso heterogéneos, desde análisis de video en vivo hasta experiencias multimedia personalizadas, mientras mantiene la agilidad para adaptarse y expandirse a medida que evolucionan las necesidades comerciales.
Introducción a los flujos de trabajo agentes utilizando Strands Agents
Esta publicación muestra una solución de procesamiento de video que implementa un flujo de trabajo de agentes utilizando seis agentes especializados. Cada agente desempeña una función específica y pasa su resultado al siguiente agente para completar tareas de varios pasos en el proceso. Esto se lleva a cabo mediante el mismo análisis que la arquitectura de investigación profunda, en la que hay un agente orquestador que coordina el proceso de los otros agentes que trabajan juntos en conjunto. Este concepto en Strands Agents se llama Agentes como herramientas.
Este patrón arquitectónico en los sistemas de IA permite que los agentes de IA especializados se envuelvan como funciones (herramientas) invocables que pueden ser utilizadas por otros agentes. Este flujo de trabajo agente tiene los siguientes agentes especializados:
Llama4_coordinator_agent: tiene acceso a los otros agentes e inicia el proceso desde el agente de extracción de cuadros hasta la generación de resumen s3_frame_extraction_agent: utiliza la biblioteca OpenCV para extraer cuadros significativos de videos, manejando la complejidad de las operaciones de archivos de video s3_visual_analysis_agent: tiene las herramientas necesarias que procesan los cuadros analizando cada imagen y almacenándola como un archivo JSON en el depósito proporcionado por Amazon Simple Storage Service (Amazon S3) retrieve_json_agent: Recupera el análisis de los fotogramas en forma de archivo JSON c_temporal_analysis_agent – Agente de IA que se especializa en secuencias temporales en fotogramas de video analizando imágenes cronológicamente. resumen_generación_agent – Se especializa en crear un resumen del análisis temporal de las imágenes
Modularizando la solución de análisis de vídeo con Agentes como Herramientas
El proceso comienza con el agente orquestador, implementado utilizando Meta's Llama 4, que coordina la comunicación y la delegación de tareas entre agentes especializados. Este agente central inicia y monitorea cada paso del proceso de procesamiento de video. Al utilizar el patrón Agentes como herramientas en Strands Agents, cada agente especializado se envuelve como una función (herramienta) invocable, lo que permite una comunicación perfecta entre agentes y una orquestación modular. Este patrón de delegación jerárquica permite al agente coordinador invocar dinámicamente agentes de dominios específicos, lo que refleja cómo funcionan los equipos humanos colaborativos.
Personalización: el indicador del sistema de cada agente se puede ajustar de forma independiente para lograr un rendimiento óptimo en su tarea especializada. Separación de preocupaciones: los agentes se centran en lo que mejor saben hacer, lo que hace que el sistema sea más sencillo de desarrollar y mantener. Flexibilidad del flujo de trabajo: el agente coordinador puede organizar componentes en diferentes secuencias para diversos casos de uso. Escalabilidad: los componentes se pueden optimizar individualmente en función de sus requisitos de rendimiento específicos. Extensibilidad: se pueden agregar nuevas capacidades mediante la introducción de nuevos agentes especializados sin alterar los existentes.
Al convertir a los agentes en herramientas, creamos bloques de construcción que se pueden combinar para resolver tareas complejas de comprensión de videos, demostrando cómo se pueden usar Strands Agents para respaldar sistemas de múltiples agentes con razonamiento especializado basado en LLM. Examinemos el agente_coordinador:
Llamar a coordinador_agent activa el flujo de trabajo del agente para llamar a s3_frame_extraction_agent. Este agente especializado tiene las herramientas necesarias para extraer fotogramas clave del vídeo de entrada utilizando OpenCV, cargar los fotogramas en Amazon S3 e identificar la ruta de la carpeta para pasarla al agente run_visual_analysis. El siguiente diagrama muestra este flujo.
Después de que los fotogramas se almacenen en Amazon S3, visual_analysis_agent tendrá acceso a herramientas que enumeran los fotogramas de la carpeta S3, usará Meta's Llama en Amazon Bedrock para procesar las imágenes y cargará el análisis como un archivo JSON en Amazon S3.
El siguiente código lo guiará a través de las diferentes partes clave de los diferentes agentes. El siguiente ejemplo muestra visual_analysis_agent:
Luego de cargar el JSON en Amazon S3, hay un agente especializado que recupera el archivo JSON de Amazon S3 y analiza el texto:
Esta salida luego se enviará a
el temporal_analysis_agent para obtener conocimiento temporal de las secuencias en los cuadros de video y proporcionar una descripción detallada del contenido visual.
Una vez generado el resultado del análisis temporal, se iniciará el resumen_generación_agente para proporcionar el resumen final.
Requisitos previos y pasos de configuración
Para ejecutar la solución en la computadora portátil o en la interfaz de usuario de Gradio, necesita lo siguiente:
Una cuenta de AWS con acceso a Amazon Bedrock.
Para copiar el proyecto,
Clona el repositorio github Meta-LLama-on-AWS:
En tu terminal, instala las dependencias correctas:
Implementar una aplicación de procesamiento de video en Gradio
Para implementar la aplicación de procesamiento de video en Gradio, siga estas instrucciones de inicio de la aplicación:
Para iniciar la terminal Python, abra su interfaz de línea de comandos Python3. Para instalar dependencias, ejecute los comandos pip install para las bibliotecas requeridas (consulte la sección de instalación de la biblioteca anterior). Para ejecutar la aplicación, ejecute el comando python3 gradio_app.py. Para acceder a la interfaz, elija el enlace alojado generado que se muestra en la terminal. Para iniciar el procesamiento de video, cargue su archivo de video a través de la interfaz y luego elija Ejecutar.
El asistente de análisis de video Llama de Meta proporciona el siguiente resultado para el video buglifeflik.mp4 proporcionado en el repositorio de GitHub:
La siguiente captura de pantalla muestra la interfaz de usuario de Gradio con esta salida.
Ejecutando en el cuaderno Jupyter
Después de importar las bibliotecas necesarias, debe cargar manualmente su video en su depósito S3:
Después de cargar el video, puede iniciar el flujo de trabajo del agente creando una instancia de un nuevo agente con un historial de conversaciones nuevo:
Limpieza
Para evitar incurrir en cargos futuros innecesarios, limpie los recursos que creó como parte de esta solución: Para eliminar los archivos de Amazon S3:
Abra la Consola de administración de AWS Navegue hasta Amazon S3 Busque y seleccione su depósito de Amazon SageMaker Seleccione los archivos de video que cargó Elija Eliminar y confirme
Para detener y eliminar el cuaderno de SageMaker:
Vaya a Amazon SageMaker AI en la consola de administración de AWS Elija instancias de Notebook Seleccione su notebook Elija Detener si se está ejecutando Después de que se haya detenido, elija Eliminar
Conclusión
Esta publicación destaca cómo la combinación del SDK de Strands Agents con los modelos Llama 4 de Meta y la infraestructura de Amazon Bedrock permite crear flujos de trabajo de procesamiento de video avanzados con múltiples agentes. Al utilizar agentes altamente especializados que se comunican y colaboran a través del patrón Agentes como herramientas, los desarrolladores pueden modularizar tareas complejas como la extracción de cuadros, el análisis visual, el razonamiento temporal y el resumen. Esta separación de preocupaciones mejora la capacidad de mantenimiento, la personalización y la escalabilidad, al tiempo que permite una integración perfecta entre los servicios de AWS. Alentamos a los desarrolladores a explorar y ampliar esta arquitectura agregando nuevos agentes especializados y adaptando los flujos de trabajo a diversos casos de uso, desde ciudades inteligentes y automatización industrial hasta gestión de contenido multimedia. La combinación de Strands Agents, Meta's Llama 4 y Amazon Bedrock sienta una base sólida para crear soluciones de IA autónomas y resilientes que aborden la complejidad de los entornos empresariales modernos.
Para comenzar, visite el repositorio oficial de GitHub para el proyecto de agentes Meta-Llama-on-AWS para obtener ejemplos de código e instrucciones de implementación. Para obtener más información sobre la creación con Strands Agents, explore la documentación de Strands Agents, que ofrece un enfoque basado en el código para integrar agentes modulares de IA. Para un contexto más amplio sobre la orquestación y arquitecturas de IA de múltiples agentes, las publicaciones del blog de AWS sobre interoperabilidad de agentes y marcos de agentes autónomos brindan una valiosa orientación para dar forma al futuro de los sistemas inteligentes.
Sobre los autores
Sebastián Bustillo es arquitecto de soluciones empresariales en Amazon Web Services (AWS), trabaja con aerolíneas y es miembro activo de la comunidad de campo técnico de AI/ML. En AWS, ayuda a los clientes a desbloquear valor empresarial a través de la IA. Fuera del trabajo, le gusta pasar tiempo con su familia y explorar el aire libre. También le apasiona preparar cafés especiales.