IA de texto a imagen

Crea y edita imágenes a partir de texto sin escribir ni una sola línea de código

Genera y edita imágenes a partir de descripciones de texto en segundos con los modelos de generación de imágenes Imagen yGemini 3 Pro Image de Gemini con las APIs disponibles en los lenguajes de programación Python, Java y Go. 

Los clientes nuevos obtienen hasta $300 en créditos gratuitos para generar imágenes y mucho más en Gemini Enterprise Agent Platform.

Descripción general

¿Qué es la IA de texto a imagen?

La IA de texto a imagen es un tipo de Inteligencia Artificial que puede generar y editar imágenes a partir de descripciones de texto. Esta tecnología tiene el potencial de transformar la forma en que interactuamos con el contenido visual y lo creamos. Las herramientas y los recursos de conversión de texto a IA de Google Cloud, incluidos modelos de IA entrenados previamente como Imagen, Gemini 3 Pro Image y Veo (disponibles en Agent Platform) están diseñados para ayudar a los desarrolladores a implementar sin problemas la generación de texto a imagen en sus aplicaciones.

¿Cómo se usa el texto a imagen en el desarrollo de aplicaciones?

La IA de texto a imagen se puede usar en el desarrollo de aplicaciones para generar maquetas, prototipos, ilustraciones, datos de prueba, contenido educativo y visualizaciones para la depuración. Agent Platform y la API de Cloud Vision de Google Cloud brindan a los desarrolladores acceso a un paquete de capacidades de procesamiento de imágenes, incluidas la detección de texto y de objetos, y la clasificación de imágenes.Document AI se puede usar para extraer texto de documentos escaneados con el objetivo de generar imágenes de descripciones de texto.

¿Cómo puedo usar estos modelos de Google?

Puedes acceder a estos modelos de IA de texto a imagen a través de Agent Platform en Google Cloud o Google AI Studio.Para usar los modelos, proporciona una instrucción de texto, selecciona parámetros (algunos modelos te permiten seleccionar parámetros que controlan el estilo, la creatividad y la precisión de la imagen generada) y, por último, genera la imagen. 

Cómo funciona

La IA de texto a imagen usa el procesamiento de lenguaje natural (PLN) para convertir la descripción de texto a un formato legible por máquina. Una vez convertido en un formato legible por máquina, el modelo de aprendizaje automático se entrena con un enorme conjunto de datos de imágenes y texto, aprende a identificar patrones y a usarlos para generar o editar imágenes.

IU del producto de IA generativa
Del texto a la visión: Introducción a la generación de imágenes con IA
Usos comunes

Genera imágenes con IA

Genera imágenes con mensajes de texto

Aprende a usar la función de generación de texto a imagen de Imagen en Agent Platform y a exportar una versión reescalada de una imagen generada. En esta guía de inicio rápido, se muestra cómo usar la generación de imágenes de Imagen en la consola de Google Cloud.

imágenes creadas con Imagen
Genera imágenes con mensajes de texto

Aprende a usar la función de generación de texto a imagen de Imagen en Agent Platform y a exportar una versión reescalada de una imagen generada. En esta guía de inicio rápido, se muestra cómo usar la generación de imágenes de Imagen en la consola de Google Cloud.

imágenes creadas con Imagen

Edita imágenes con IA

Fusión de varias imágenes y edición conversacional

Con Gemini, puedes combinar diferentes imágenes en una nueva imagen perfecta. Usa varias imágenes de referencia para crear una sola imagen unificada. También puedes editar imágenes con instrucciones sencillas en lenguaje natural. Puedes hacer cambios con una simple conversación, desde quitar a una persona de una foto grupal hasta corregir un pequeño detalle como una mancha.

Además, Imagen en Agent Platform te permite editar imágenes existentes o generadas por Imagen. Puedes especificar una parte de la imagen para modificar, además de una descripción de texto de las actualizaciones (edición basada en máscaras).

Fusión de varias imágenes y edición conversacional

Con Gemini, puedes combinar diferentes imágenes en una nueva imagen perfecta. Usa varias imágenes de referencia para crear una sola imagen unificada. También puedes editar imágenes con instrucciones sencillas en lenguaje natural. Puedes hacer cambios con una simple conversación, desde quitar a una persona de una foto grupal hasta corregir un pequeño detalle como una mancha.

Además, Imagen en Agent Platform te permite editar imágenes existentes o generadas por Imagen. Puedes especificar una parte de la imagen para modificar, además de una descripción de texto de las actualizaciones (edición basada en máscaras).

Subtítulos visuales con IA

Obtén descripciones de imágenes con subtítulos visuales

Genera descripciones relevantes para imágenes, incluidos metadatos detallados, subtítulos automáticos y descripciones rápidas de productos y recursos visuales.

IU del producto para leyendas de imágenes
Obtén descripciones de imágenes con subtítulos visuales

Genera descripciones relevantes para imágenes, incluidos metadatos detallados, subtítulos automáticos y descripciones rápidas de productos y recursos visuales.

IU del producto para leyendas de imágenes

Comienza tu prueba de concepto

Los clientes nuevos obtienen hasta $300 en créditos gratuitos para generar imágenes y mucho más en Agent Platform.

¿Tienes un proyecto grande?

Descubre qué tipos de imágenes puedes crear

Aprende a generar imágenes con instrucciones de texto

Prueba Imagen en Colab

Google Cloud