Esta publicación está coescrita con Hammad Mian y Joonas Kukkonen de Bark.com.
Al ampliar la creación de contenido de vídeo, muchas empresas enfrentan el desafío de mantener la calidad y al mismo tiempo reducir el tiempo de producción. Esta publicación demuestra cómo Bark.com y AWS colaboraron para resolver este problema, mostrándole un enfoque replicable para la generación de contenido impulsada por IA. Bark.com utilizó Amazon SageMaker y Amazon Bedrock para transformar su canal de contenido de marketing de semanas a horas.
Bark conecta a miles de personas cada semana con servicios profesionales, desde jardinería hasta atención domiciliaria, en múltiples categorías. Cuando el equipo de marketing de Bark identificó una oportunidad para expandirse a la publicidad en redes sociales a mitad del embudo, se enfrentaron a un problema de escala: las campañas sociales efectivas requieren grandes volúmenes de contenido creativo personalizado para pruebas A/B rápidas, pero su flujo de trabajo de producción manual tomaba semanas por campaña y no podía soportar múltiples variaciones de segmentos de clientes.
Si enfrenta desafíos similares de escalamiento de contenido, este patrón de arquitectura puede ser un punto de partida útil. En colaboración con el Centro de innovación de IA generativa de AWS, Bark desarrolló una solución de generación de contenido impulsada por IA que demostró una reducción sustancial en el tiempo de producción en pruebas experimentales y al mismo tiempo mejoró los puntajes de calidad del contenido. La colaboración tenía cuatro objetivos:
Tiempo de producción: reducir de semanas a horas Escala de personalización: admitir múltiples microsegmentos de clientes por campaña Consistencia de marca: mantener la identidad visual y de voz en todo el contenido generado Estándares de calidad: igualar anuncios producidos profesionalmente
En esta publicación, lo guiamos a través de la arquitectura técnica que creamos, las decisiones de diseño clave que contribuyeron al éxito y los resultados mensurables logrados, brindándole un plan para implementar soluciones similares.
Descripción general de la solución
Bark colaboró con el Centro de innovación en IA generativa de AWS para desarrollar una solución que pudiera abordar estos desafíos de escalamiento de contenido. El equipo diseñó un sistema utilizando servicios de AWS y modelos de IA personalizados. El siguiente diagrama ilustra la arquitectura de la solución.
La arquitectura de la solución consta de las siguientes capas integradas:
Capa de datos y almacenamiento: Amazon Simple Storage Service (Amazon S3) almacena activos que incluyen datos de entrenamiento, segmentos de video generados, imágenes de referencia y resultados finales. Los artefactos del modelo y los contenedores de inferencia personalizados se almacenan en Amazon Elastic Container Registry (Amazon ECR). Capa de procesamiento: AWS Lambda organiza la canalización de varias etapas, con AWS Step Functions administrando el estado del flujo de trabajo a lo largo del proceso de generación de siete pasos. Amazon Bedrock con Claude Sonnet 3.7 de Anthropic maneja tareas de generación de texto, incluida la segmentación de clientes, la generación de historias y la evaluación de calidad. Capa de cómputo de GPU: para servir Wan 2.1 Text2Video-14B de manera confiable, ejecutamos un contenedor de inferencia de múltiples GPU que fragmenta el modelo en ocho GPU en una única instancia de SageMaker p4de.24xlarge usando paralelismo tensorial. TorchServe encabeza el punto final para el manejo de solicitudes y torchrun inicia un proceso de trabajo por GPU. Usamos fragmentación de datos paralelos completamente fragmentados (FSDP), una técnica para dividir los componentes del modelo entre GPU, para que el codificador de texto y el transformador de difusión permanezcan dentro de los límites de memoria de la GPU sin descargar pesos a la CPU. Debido a que la difusión de video es de larga duración, el punto final se ajusta con un tiempo de espera de inferencia extendido y una ventana de verificación del estado de inicio del contenedor más larga para adaptarse al tiempo de carga del modelo y ayudar a evitar reinicios prematuros. Los contenedores de Amazon Elastic Container Service (Amazon ECS) en instancias g5.2xlarge habilitadas para GPU manejan la síntesis de voz para la generación de voz del narrador, escalando a cero durante los períodos de inactividad. Capa de interfaz de usuario: una interfaz de React con autenticación de Amazon Cognito proporciona una interfaz de estudio de video donde los equipos de marketing pueden revisar, editar y aprobar el contenido generado mediante comandos de lenguaje natural.
Canal de ideas creativas
Ahora que comprende la arquitectura general, examinemos cómo puede implementar el proceso de ideación creativa en su propio entorno. El proceso transforma los datos de los cuestionarios de los clientes en guiones gráficos listos para producción a través de tres etapas.
Etapa 1: Generación de segmentos de clientes
El proceso comienza analizando los datos del cuestionario de los clientes de Bark utilizando Amazon Bedrock con Claude Sonnet 3.7 de Anthropic. El modelo de lenguaje grande (LLM) procesa las respuestas de las encuestas para identificar distintas personas de los clientes con atributos estructurados que incluyen datos demográficos, motivaciones, puntos débiles y factores de toma de decisiones. Por ejemplo, en la categoría de atención domiciliaria, el sistema identificó segmentos como:
El cuidador familiar abrumado: adultos entre 40 y 50 años que equilibran las responsabilidades laborales con el cuidado de padres ancianos, priorizando la confiabilidad y la confianza. La persona mayor centrada en la independencia: personas mayores que buscan mantener la autonomía y al mismo tiempo reconocen la necesidad de asistencia ocasional.
Cada perfil de segmento se revisa en la interfaz de usuario a través de un proceso humano y sirve como entrada para la ideación creativa posterior, creando anuncios que resuenan con las características identificadas de la audiencia.
Etapa 2: Generación de briefs creativos
Dada la categoría empresarial y el segmento objetivo, el sistema genera entre 4 y 6 conceptos creativos con distintos grados de abstracción, lo que fomenta enfoques tanto literales como metafóricos. Configuramos el modelo con muestreo de alta temperatura (0,8–1) para fomentar el pensamiento divergente. El modelo emplea razonamiento en cadena de pensamiento, evaluando explícitamente la relevancia del concepto, el potencial de participación y el valor del entretenimiento antes de generar resúmenes. Esto produce diversos enfoques narrativos para el mismo objetivo comercial, como formatos testimoniales sencillos o historias metafóricas emocionalmente resonantes.
Etapa 3: refinamiento del guión gráfico
La etapa final transforma los resúmenes creativos genéricos en guiones gráficos de segmentos específicos. Un mecanismo de muestreo de características estocástico, que determina aleatoriamente qué atributos resaltar, identifica qué atributos del segmento de clientes se deben enfatizar, manteniendo la diversidad y al mismo tiempo abordando motivaciones y puntos débiles específicos. El sistema realiza una comparación explícita entre breves y segmentos mediante un razonamiento motivado antes de generar el guión gráfico final con especificaciones audiovisuales completas, incluidas descripciones de escenas, direcciones de cámara, texto de narración y tiempos. La revisión humana en esta etapa confirma la alineación de la marca antes de que comience la producción.
Mantener la coherencia visual entre escenas.
Un anuncio de 30 segundos contiene de 4 a 6 escenas distintas, que es mejor generarlas individualmente. Sin una orquestación cuidadosa, los modelos de IA exhiben una deriva semántica: los personajes cambian de apariencia, los fondos cambian inesperadamente y los elementos de la marca se vuelven inconsistentes. Nuestra solución implementa un marco de coherencia de dos niveles.
Consistencia semántica
Puede transformar resúmenes creativos en sugerencias en video a través de un proceso de tres etapas:
Extracción de elementos: un LLM analiza el guión gráfico para identificar elementos de decoración atómicos (actores, accesorios, objetos y ubicaciones) y marca aquellos que requieren coherencia en todas las escenas. Generación de planos: para cada elemento recurrente, el sistema genera planos de especificaciones detallados, estableciendo representaciones visuales canónicas. Transformación rápida: las descripciones de escenas de alto nivel se transforman en indicaciones detalladas para la generación de videos, incorporando tanto el resumen creativo original (para adherencia narrativa) como especificaciones de decoración estandarizadas (para consistencia visual).
Consistencia visual
Aunque la coherencia semántica a través de indicaciones detalladas reduce significativamente la deriva, los modelos de generación de video aún muestran latitud interpretativa incluso bajo especificaciones de indicaciones idénticas. Para abordar esta limitación, implementamos un canal de extracción y propagación de imágenes de referencia, como se ilustra en el siguiente diagrama.
El oleoducto consta de las siguientes etapas:
Identificación óptima de fotogramas: Amazon Nova Premier analiza las escenas generadas para identificar fotogramas donde los elementos de destino aparecen con mayor claridad. Segmentación de elementos: el modelo Segment Anything de código abierto, implementado en Amazon ECS, aísla los elementos de destino de los fondos. Propagación de referencia: las imágenes de referencia extraídas se envían a llamadas de generación de video posteriores utilizando las capacidades de referencia a video de Wan 2.2.
Este enfoque de doble restricción (que combina la especificación semántica a través de indicaciones detalladas con la especificación visual a través de imágenes de referencia) crea un marco de coherencia sólido que validamos mediante estudios de ablación sistemáticos.
El canal de generación de videos
El canal organiza cinco modalidades (texto, imagen, video, audio y gráficos superpuestos) con una selección estratégica de modelos basada en los requisitos de la escena:
Síntesis de referencia a vídeo: las escenas que requieren continuidad visual utilizan Wan 2.1 VACE-14B con imágenes de referencia extraídas. Generación de texto a vídeo: las escenas que introducen nuevos elementos utilizan Wan 2.1 Text2Video-14B.
Una generación de secuencias de flujo de trabajo de Step Functions para verificar que las imágenes de referencia estén disponibles antes de que comiencen las escenas dependientes.
Síntesis de voz y gráficos.
La síntesis de voz utiliza el modelo de voz conversacional de Sesame AI Lab en instancias ECS habilitadas para GPU (g5.2xlarge). La clonación de voz requiere una muestra de referencia de 10 segundos del narrador de la marca Bark; El modelo extrae incrustaciones de altavoces que pueden usarse para acondicionar la generación posterior. Amazon ECS escala a cero durante los períodos de inactividad, lo que alivia los costos fuera de las ventanas de generación activa. Además, las superposiciones de texto y los gráficos de llamado a la acción utilizan sistemas de plantillas que respaldan la coherencia tipográfica con las pautas de la marca Bark. Estos elementos se componen durante el montaje final.
Bucle de evaluación de calidad
Un ciclo de evaluación de LLM como juez en Lambda evalúa cada escena en tres dimensiones:
Cumplimiento narrativo – Precisión de la descripción del guión gráfico Calidad visual – Ausencia de artefactos e inconsistencias Cumplimiento de la marca – Alineación con las pautas de la marca
Las escenas que caen por debajo de los umbrales de calidad configurables activan la regeneración automática al tiempo que preservan los elementos de referencia visual. Este refinamiento iterativo continúa hasta que las escenas cumplen con los estándares de calidad o se solicita revisión humana.
Enviar mensajes a páginas de destino consistentes
Utilizando videos generados y el segmento de clientes como base, creamos un sistema agente para generar landing pages personalizadas. Utilizamos un agente de Strands para realizar las siguientes acciones:
Genere el código TypeScript para la página. Tome capturas de pantalla óptimas del video para incluirlas en la página (para que el usuario comprenda que está relacionado directamente con el anuncio de video que había visto). Modifique la redacción y el diseño para alinearlos con el segmento de clientes.
Resultados
Evaluamos el contenido generado por IA con la biblioteca de campañas existente de Bark. La siguiente tabla resume los resultados.
Dimensión de evaluación Anuncios generados por IA Biblioteca de campañas existente Estructura de la historia C Coherencia 6,9 ± 0,49 6,4 ± 0,74 Originalidad C Compromiso 6,5 ± 1,23 5,2 ± 1,22 Visual C Consistencia espacial 6,9 ± 0,74 6,6 ± 0,75
Puntuaciones en una escala de 10 puntos con intervalos de confianza del 95%
Los resultados demuestran que el contenido generado por IA logró puntuaciones más altas en coherencia narrativa, validando el enfoque de planificación jerárquica de la escena. La mejora del 25 % en las puntuaciones de originalidad sugiere que el proceso de ideas creativas equilibra con éxito la novedad con la viabilidad comercial. El sistema de propagación de imágenes de referencia proporcionó una coherencia de caracteres y entorno considerablemente mayor que la producción manual.
De un extremo a otro, la canalización genera un anuncio de 15 a 30 segundos en aproximadamente 12 a 15 minutos en instancias ml.p4d.24xlarge de SageMaker; esto incluye orquestación (extracción/segmentación de referencias), controles de calidad automatizados y bucles de regeneración, no solo una llamada de modelo única. La fragmentación de múltiples GPU (tensor paralelo de 8 vías) mantiene la generación por escena en el rango de segundos a unos pocos minutos al encajar completamente el modelo 14B en la memoria de la GPU y acelerar el cálculo de atención intensa/eliminación de ruido. Ejecutarlo detrás de un punto final en tiempo real de SageMaker mantiene el modelo activo entre solicitudes y ayuda a evitar la latencia de cargas repetidas del modelo, y los tiempos de espera de inferencia prolongados y las comprobaciones de estado de inicio reducen las fallas y los reintentos para llamadas de difusión de larga duración.
estudio de ablación
Para validar cada decisión arquitectónica, realizamos estudios de ablación sistemática. La siguiente tabla resume los resultados.
Configuración Historia Coherencia Compromiso Consistencia visual Sistema completo 6,9 6,5 6,9 Sin propagación de imágenes de referencia 7,5 4,8 6,7 Sin extracción de elementos narrativos 7,6 4,5 6,4 Sin planificación jerárquica de escenas 7,0 4,5 6,5
Los resultados revelan que eliminar la propagación de imágenes de referencia afecta significativamente las puntuaciones de participación (de 6,5 a 4,8), lo que indica que la representación consistente de los personajes respalda un desarrollo narrativo más sofisticado. La desactivación de la extracción de elementos narrativos provocó la degradación más grave de la participación, al tiempo que mejoró ligeramente las puntuaciones estructurales, lo que sugiere que el análisis narrativo estructurado respalda la toma de riesgos creativa y al mismo tiempo mantiene historias coherentes.
Qué significa esto para su implementación
Según nuestra experiencia, las siguientes son pautas prácticas para sus propios proyectos de generación de videos:
La intervención humana es esencial: aunque el sistema automatiza la mayor parte del tiempo de producción, la intervención humana en la aprobación del resumen creativo y la revisión final confirma la alineación de la marca. La calidad de la imagen de referencia importa más que la cantidad: nuestro sistema adaptativo de extracción de referencia identifica dinámicamente los fotogramas óptimos mediante una evaluación de criterios múltiples (claridad visual, iluminación, prominencia de elementos). Las imágenes de referencia deficientes propagan errores a lo largo de la secuencia de vídeo. LLM-as-a-juez admite una iteración rápida: la evaluación de video tradicional es costosa y lenta. El uso de Claude de Anthropic para evaluar el contenido generado según criterios estructurados respaldó la experimentación rápida con diferentes enfoques de generación. Diseño para desafíos de coherencia compuesta: se ha investigado profundamente la coherencia de un solo carácter; el problema más difícil es mantener la coherencia de elementos compuestos como habitaciones amuebladas donde deben coexistir múltiples atributos visuales. Planifique la arquitectura en torno a estos casos complejos.
limpiando
Si replica esta solución en su propio entorno, recuerde eliminar recursos cuando termine de experimentar para evitar costos continuos:
Elimine los puntos finales de SageMaker. Elimine los depósitos de S3 que contienen activos generados. Termine los servicios y las definiciones de tareas de Amazon ECS. Elimine las funciones Lambda y las máquinas de estado de Step Functions.
Conclusión
Esta colaboración establece un patrón replicable para la producción creativa asistida por IA utilizando los servicios de AWS. La idea arquitectónica central, que combina la coherencia semántica a través de una planificación jerárquica inmediata con la coherencia visual a través de la propagación de imágenes de referencia, aborda desafíos fundamentales en la generación de videos de múltiples escenas que se extienden más allá de la publicidad a varios dominios que requieren narrativas coherentes y extendidas. Para Bark, la solución, bajo evaluación comercial, tiene el potencial de respaldar una experimentación rápida con campañas personalizadas en las redes sociales, respaldando su expansión a los canales de marketing de mitad del embudo.
Para comenzar a crear una solución similar, considere los siguientes pasos:
Reconocimiento
Un agradecimiento especial a Giuseppe Mascellero y Nikolas Zavitsanos por su contribución.