Los datos sintéticos son información que se genera de forma artificial con algoritmos informáticos, en lugar de recopilarse de eventos del mundo real. Piensa en ellos como un simulador de vuelo para la Inteligencia Artificial (IA). Así como un piloto aprende a volar en una cabina simulada sin correr riesgos en un avión real, los modelos de IA pueden aprender a reconocer patrones con datos simulados sin arriesgar la privacidad del usuario.
La distinción clave es que los datos sintéticos imitan las propiedades estadísticas de los datos reales, como los promedios, las correlaciones y las distribuciones, pero no contienen información de identificación de personas reales. Parecen y actúan como si fueran reales, pero no hubo personas reales involucradas en la creación de un registro específico.
Generar datos sintéticos no se trata solo de copiar y pegar. Implica usar modelos avanzados de aprendizaje automático para comprender la "forma" de los datos reales y, luego, crear muestras nuevas y originales que se ajusten a esa forma.
No todos los datos sintéticos son iguales. Según tus necesidades de privacidad y exactitud, puedes elegir diferentes tipos.
Estos datos se generan completamente desde cero. No contienen datos originales de usuarios, lo que significa que no hay una asignación uno a uno entre un registro sintético y una persona real. Como no se relaciona con ninguna persona específica, ofrece el nivel más alto de protección de la privacidad. Sin embargo, requiere una validación rigurosa para garantizar que siga siendo lo suficientemente preciso como para ser útil en el entrenamiento de la IA.
A veces, necesitas conservar algunos datos reales para que tus conjuntos de datos sean útiles. Los datos parcialmente sintéticos implican tomar un conjunto de datos real y reemplazar solo las partes sensibles, como nombres, números de seguridad social o direcciones, por valores sintéticos. El resto de los datos sigue siendo distinto. Este enfoque equilibra la privacidad con una alta utilidad, pero conlleva un riesgo algo mayor de reidentificación en comparación con los datos completamente sintéticos.
Este enfoque combina registros reales y sintéticos para crear un "superconjunto" de datos. A menudo, se usa para enriquecer un conjunto de datos real más pequeño. Por ejemplo, si tienes muchos datos sobre transacciones bancarias frecuentes, pero muy pocos sobre fraudes, puedes generar registros de fraudes sintéticos para mezclarlos con los reales. Esto ayuda a "aumentar el muestreo" de eventos inusuales para que el modelo de IA tenga suficientes ejemplos de los que aprender.
Los datos reales son el estándar de precisión, pero pueden ser costosos de recopilar, a menudo están desordenados o incompletos, y se encuentran restringidos estrictamente por leyes de privacidad como el RGPD o la HIPAA. Además, la recopilación de datos del mundo real puede llevar meses o años.
Por otro lado, los datos sintéticos pueden ser menos costosos de escalar. Puedes generar millones de registros en horas. Están perfectamente etiquetado (porque la computadora los creó y esta sabe qué creó) y están centrados en cumplir con los requisitos de privacidad. Además, los datos sintéticos se pueden equilibrar para quitar los sesgos naturales que suelen encontrarse en las recopilaciones del mundo real.
Función | Datos reales | Datos sintéticos |
Costo | Más alto (recopilación y etiquetado) | Más bajo (solo potencia de procesamiento) |
Velocidad | Más lenta (meses o años) | Más rápida (horas/días) |
Privacidad | Más restringidos (riesgos de IIP) | Más seguros (sin IIP) |
Exactitud | Más alta (refleja la realidad) | Variable (depende de la calidad del modelo) |
Función
Datos reales
Datos sintéticos
Costo
Más alto (recopilación y etiquetado)
Más bajo (solo potencia de procesamiento)
Velocidad
Más lenta (meses o años)
Más rápida (horas/días)
Privacidad
Más restringidos (riesgos de IIP)
Más seguros (sin IIP)
Exactitud
Más alta (refleja la realidad)
Variable (depende de la calidad del modelo)
Los vehículos autónomos y la robótica dependen en gran medida de los datos sintéticos porque la recopilación de información del mundo real es lenta. Incluso después de registrar millones de kilómetros en la carretera, las pruebas físicas no pueden tener en cuenta todas las situaciones de accidentes posibles. Con la generación de entornos de conducción virtuales, los ingenieros pueden entrenar os autos en miles de millones de kilómetros de carreteras simuladas y probarlos en situaciones peligrosas, como niños que corren hacia la calle, sin ningún riesgo físico.
Los datos médicos son extremadamente privados y difíciles de compartir. Con los datos sintéticos, los investigadores crear registros de pacientes ficticios que imitan los patrones estadísticos de enfermedades reales. Esto permite que los hospitales compartan datos para la investigación del cáncer o estudios de enfermedades raras sin incumplir la HIPAA. En una encuesta de ManageEngine, se descubrió que el 81% de las organizaciones de atención médica usan datos sintéticos para innovar sin infringir las reglamentaciones de privacidad.
Detectar los fraudes es difícil porque suelen ocurrir con muy poca frecuencia. Esto puede dificultar que la IA aprenda cómo detectar fraudes. Los bancos pueden usar datos sintéticos para generar miles de patrones de transacciones fraudulentas. Este "sobremuestreo" ayuda a entrenar a la IA para detectar actividad sospechosa sin exponer los historiales financieros reales de los clientes.
Los desarrolladores necesitan grandes cantidades de datos para probar el rendimiento de las aplicaciones bajo presión. Esto se conoce como "administración de datos de pruebas". En vez de usar copias peligrosas de la base de datos de producción real, los equipos de DevOps pueden completar entornos de etapas de pruebas con millones de usuarios sintéticos. Esto les permite realizar pruebas de esfuerzo de las nuevas actualizaciones de apps de forma segura y garantizar que el sistema pueda manejar un tráfico alto.
Privacidad y cumplimiento
Los datos sintéticos reducen en gran medida el riesgo de exponer información de identificación personal (IIP). Debido a que los datos no se refieren a ninguna persona real, por lo general, quedan fuera del alcance de reglamentaciones estrictas como el RGPD y la CCPA. Esto permite que los equipos globales compartan conjuntos de datos con mayor facilidad a través de las fronteras sin tener que sortear obstáculos legales complejos.
Costo y velocidad
El uso de datos sintéticos puede acelerar significativamente el ciclo de vida de los datos a la IA. No necesitas contratar a personas para etiquetar imágenes de forma manual ni esperar a que se recopilen datos en el campo. Esta eficiencia puede reducir los costos y acelerar el desarrollo.
Mitigación de sesgos
Los datos del mundo real suelen reflejar los prejuicios que existen en él. Si entrenas una IA con datos históricos de contratación, es posible que aprenda a preferir un segmento demográfico sobre otro. Los datos sintéticos permiten a los desarrolladores corregir artificialmente estos desequilibrios. Puedes generar más datos para grupos subrepresentados (como garantizar que una IA reconozca todos los tonos de piel o géneros por igual) para crear modelos más justos y sólidos.
Prueba de casos extremos
Algunas situaciones son demasiado peligrosas o poco frecuentes para probarlas en la vida real. No puedes chocar mil autos reales solo para ver cómo funciona el sensor de la bolsa de aire. Los datos sintéticos te permiten crear estos "casos extremos" de forma segura. Puedes simular eventos poco comunes, como una tormenta de nieve en Phoenix o una falla específica del motor, para entrenar sistemas en situaciones que representan menos del 0.01% de los datos del mundo real, pero que son fundamentales para la seguridad.
Para los desarrolladores, la forma más rápida de generar un conjunto de datos sintéticos de pequeño a mediano (por ejemplo, para pruebas de unidades o demostraciones simples) no suele ser entrenar una GAN compleja, sino aprovechar las capacidades generativas de los modelos de lenguaje grandes (LLM). Estas capacidades ahora están unificadas en Gemini Enterprise Agent Platform (antes conocido como Vertex AI). Esta plataforma proporciona un entorno integral para crear, implementar y escalar modelos de aprendizaje automático, incluido el acceso a modelos potentes como Gemini.
En esta explicación, usaremos el SDK de Agent Platform (antes SDK de Vertex AI) para Python y Gemini para generar un conjunto de datos sintético de "transacciones de clientes" desde cero. Imagina que eres un desarrollador que crea un panel de tecnología financiera. Necesitas 50 filas de "datos de transacciones" para probar tu frontend.
Necesitas campos específicos: transaction_id, timestamp, amount, merchant_category y is_fraud.
Primero, asegúrate de tener el SDK de Agent Platform instalado en tu entorno de Python. Si bien la plataforma cambió de marca, el paquete de Python sigue siendo google-cloud-aiplatform.
Importa la biblioteca y, luego, inicialízala con los detalles de tu proyecto. Esta configuración es estándar para usar modelos de Gemini a través del SDK de Agent Platform en Gemini Enterprise Agent Platform.
La calidad de los datos sintéticos de un LLM depende en gran medida de tus instrucciones. Debes especificar el esquema, las restricciones (por ejemplo, no números negativos) y el formato de salida (CSV o JSON). Las instrucciones claras y específicas son clave para la ingeniería de instrucciones eficaz con los modelos de Gemini en Gemini Enterprise Agent Platform.
Envía la instrucción al modelo y carga la respuesta directamente en un DataFrame de Pandas. El método generate_content forma parte del SDK de Agent Platform.
A menudo, es más rápido utilizar un LLM de uso general como Gemini para datos tabulares sintéticos que entrenar un modelo estadístico personalizado (como un VAE) cuando solo necesitas datos "plausibles" para probar la funcionalidad del software.
* Nota para la escala empresarial: Si necesitas generar millones de filas que clonen estadísticamente un conjunto de datos privado masivo existente, es probable que pases de una instrucción simple de LLM a usar canalizaciones de Gemini Enterprise Agent Platform (antes Vertex AI Pipelines) integradas con socios especializados como Gretel.ai o MOSTLY AI, que están disponibles directamente en Google Cloud Marketplace. Estos flujos de trabajo avanzados se pueden organizar y administrar en Gemini Enterprise Agent Platform más amplia.
Google Cloud ofrece herramientas para ayudar a los desarrolladores a generar y administrar datos sintéticos de manera eficaz.


Solución
Comienza a desarrollar en Google Cloud con el crédito gratis de $300 y los más de 20 productos del nivel Siempre gratuito.