Experimente con la generación de imágenes nativas Flash de Gemini 2.0

En diciembre presentamos por primera vez la salida de imágenes nativa en Gemini 2.0 Flash a evaluadores confiables. Hoy, lo ponemos a disposición de los desarrolladores para que lo experimenten en todas las regiones actualmente compatibles con Google AI Studio. Puede probar esta nueva capacidad utilizando una versión experimental de Gemini 2.0 Flash (gemini-2.0-flash-exp) en Google AI Studio y mediante la API de Gemini.

Gemini 2.0 Flash combina entrada multimodal, razonamiento mejorado y comprensión del lenguaje natural para crear imágenes.

Aquí hay algunos ejemplos de dónde brillan los resultados multimodales de 2.0 Flash:

1. Texto e imágenes juntos

Utilice Gemini 2.0 Flash para contar una historia y la ilustrará con imágenes, manteniendo los personajes y los escenarios consistentes en todo momento. Dale tu opinión y el modelo volverá a contar la historia o cambiará el estilo de sus dibujos.

Lo sentimos, tu navegador no admite la reproducción de este vídeo.

Generación de historias e ilustraciones en Google AI Studio

2. Edición de imágenes conversacional

Gemini 2.0 Flash le ayuda a editar imágenes a través de muchos giros de un diálogo en lenguaje natural, ideal para iterar hacia una imagen perfecta o para explorar diferentes ideas juntos.

Lo sentimos, tu navegador no admite la reproducción de este vídeo.

Edición de imágenes de conversaciones en varios turnos manteniendo el contexto durante toda la conversación en Google AI Studio

3. Comprensión del mundo

A diferencia de muchos otros modelos de generación de imágenes, Gemini 2.0 Flash aprovecha el conocimiento mundial y el razonamiento mejorado para crear la imagen correcta. Esto lo hace perfecto para crear imágenes detalladas que sean realistas, como ilustrar una receta. Si bien se esfuerza por lograr la precisión, como todos los modelos lingüísticos, su conocimiento es amplio y general, no absoluto ni completo.

Lo sentimos, tu navegador no admite la reproducción de este vídeo.

Salida de texto e imagen entrelazada para una receta en Google AI Studio

4. Representación de texto

La mayoría de los modelos de generación de imágenes tienen dificultades para representar con precisión largas secuencias de texto, lo que a menudo da como resultado caracteres ilegibles o mal formateados, o errores ortográficos. Los puntos de referencia internos muestran que Flash 2.0 tiene una representación más sólida en comparación con los modelos competitivos líderes y es excelente para crear anuncios, publicaciones en redes sociales o incluso invitaciones.

Lo sentimos, tu navegador no admite la reproducción de este vídeo.

Salidas de imágenes con representación de texto largo en Google AI Studio

Empieza a crear imágenes con Gemini hoy

Comience con Gemini 2.0 Flash a través de la API de Gemini. Lea más sobre la generación de imágenes en nuestros documentos.

de google import genai de google.genai tipos de importación cliente = genai.Client(api_key=”GEMINI_API_KEY”) respuesta = client.models.generate_content( model=”gemini-2.0-flash-exp”, contenidos=( “Genera una historia sobre una linda tortuga bebé en un estilo de arte digital en 3D. ” “Para cada escena, genera una imagen.” ), config=types.GenerateContentConfig( Response_modalities=[“Text”, “Image”]), )

Pitón

Ya sea que esté creando agentes de IA, desarrollando aplicaciones con bellas imágenes como historias interactivas ilustradas o generando ideas visuales en una conversación, Gemini 2.0 Flash le permite agregar generación de texto e imágenes con un solo modelo. Estamos ansiosos por ver qué crean los desarrolladores con salida de imágenes nativas y sus comentarios nos ayudarán a finalizar pronto una versión lista para producción.