Genera y edita imágenes a partir de descripciones de texto en segundos con los modelos de generación de imágenes Imagen yGemini 3 Pro Image de Gemini con las APIs disponibles en los lenguajes de programación Python, Java y Go.
Los clientes nuevos obtienen hasta $300 en créditos gratuitos para generar imágenes y mucho más en Gemini Enterprise Agent Platform.
Descripción general
La IA de texto a imagen es un tipo de Inteligencia Artificial que puede generar y editar imágenes a partir de descripciones de texto. Esta tecnología tiene el potencial de transformar la forma en que interactuamos con el contenido visual y lo creamos. Las herramientas y los recursos de conversión de texto a IA de Google Cloud, incluidos modelos de IA entrenados previamente como Imagen, Gemini 3 Pro Image y Veo (disponibles en Agent Platform) están diseñados para ayudar a los desarrolladores a implementar sin problemas la generación de texto a imagen en sus aplicaciones.
La IA de texto a imagen se puede usar en el desarrollo de aplicaciones para generar maquetas, prototipos, ilustraciones, datos de prueba, contenido educativo y visualizaciones para la depuración. Agent Platform y la API de Cloud Vision de Google Cloud brindan a los desarrolladores acceso a un paquete de capacidades de procesamiento de imágenes, incluidas la detección de texto y de objetos, y la clasificación de imágenes.Document AI se puede usar para extraer texto de documentos escaneados con el objetivo de generar imágenes de descripciones de texto.
Puedes acceder a estos modelos de IA de texto a imagen a través de Agent Platform en Google Cloud o Google AI Studio.Para usar los modelos, proporciona una instrucción de texto, selecciona parámetros (algunos modelos te permiten seleccionar parámetros que controlan el estilo, la creatividad y la precisión de la imagen generada) y, por último, genera la imagen.
Cómo funciona
La IA de texto a imagen usa el procesamiento de lenguaje natural (PLN) para convertir la descripción de texto a un formato legible por máquina. Una vez convertido en un formato legible por máquina, el modelo de aprendizaje automático se entrena con un enorme conjunto de datos de imágenes y texto, aprende a identificar patrones y a usarlos para generar o editar imágenes.
Aprende a usar la función de generación de texto a imagen de Imagen en Agent Platform y a exportar una versión reescalada de una imagen generada. En esta guía de inicio rápido, se muestra cómo usar la generación de imágenes de Imagen en la consola de Google Cloud.
Aprende a usar la función de generación de texto a imagen de Imagen en Agent Platform y a exportar una versión reescalada de una imagen generada. En esta guía de inicio rápido, se muestra cómo usar la generación de imágenes de Imagen en la consola de Google Cloud.
Con Gemini, puedes combinar diferentes imágenes en una nueva imagen perfecta. Usa varias imágenes de referencia para crear una sola imagen unificada. También puedes editar imágenes con instrucciones sencillas en lenguaje natural. Puedes hacer cambios con una simple conversación, desde quitar a una persona de una foto grupal hasta corregir un pequeño detalle como una mancha.
Además, Imagen en Agent Platform te permite editar imágenes existentes o generadas por Imagen. Puedes especificar una parte de la imagen para modificar, además de una descripción de texto de las actualizaciones (edición basada en máscaras).
Con Gemini, puedes combinar diferentes imágenes en una nueva imagen perfecta. Usa varias imágenes de referencia para crear una sola imagen unificada. También puedes editar imágenes con instrucciones sencillas en lenguaje natural. Puedes hacer cambios con una simple conversación, desde quitar a una persona de una foto grupal hasta corregir un pequeño detalle como una mancha.
Además, Imagen en Agent Platform te permite editar imágenes existentes o generadas por Imagen. Puedes especificar una parte de la imagen para modificar, además de una descripción de texto de las actualizaciones (edición basada en máscaras).
Genera descripciones relevantes para imágenes, incluidos metadatos detallados, subtítulos automáticos y descripciones rápidas de productos y recursos visuales.
Genera descripciones relevantes para imágenes, incluidos metadatos detallados, subtítulos automáticos y descripciones rápidas de productos y recursos visuales.