Replicar datos de MySQL en BigQuery

En este instructivo, se muestra cómo crear e implementar una canalización que replique de forma continua los datos modificados de una base de datos de MySQL en una tabla de BigQuery.

Objetivos

En este instructivo, harás lo siguiente:

  1. Implementa tu base de datos de MySQL en Compute Engine.
  2. Configura tu base de datos de MySQL para habilitar la replicación.
  3. Crear y ejecutar un trabajo de replicación de Cloud Data Fusion
  4. Consulte los resultados en BigQuery.

Costos

En este instructivo, se usan los siguientes componentes facturables de Google Cloud:

Para generar una estimación de costos en función del uso previsto, usa la calculadora de precios. Es posible que los usuarios nuevos de Google Cloud califiquen para obtener una prueba gratuita.

Cuando se ejecuta la replicación, se te cobra por el clúster de Dataproc y se generan costos de procesamiento para BigQuery. Para optimizar estos costos, te recomendamos que uses los precios de tasa fija de BigQuery.

Antes de comenzar

  1. Accede a tu cuenta de Google Cloud. Si eres nuevo en Google Cloud, crea una cuenta para evaluar el rendimiento de nuestros productos en situaciones reales. Los clientes nuevos también obtienen $300 en créditos gratuitos para ejecutar, probar y, además, implementar cargas de trabajo.
  2. En la página del selector de proyectos de Google Cloud Console, selecciona o crea un proyecto de Google Cloud.

    Ir al selector de proyectos

  3. Comprueba que la facturación esté habilitada en tu proyecto.

    Descubre cómo puedes habilitar la facturación

  4. Habilita las API de Cloud Data Fusion, BigQuery, and Cloud Storage.

    Habilita las API

  5. En la página del selector de proyectos de Google Cloud Console, selecciona o crea un proyecto de Google Cloud.

    Ir al selector de proyectos

  6. Comprueba que la facturación esté habilitada en tu proyecto.

    Descubre cómo puedes habilitar la facturación

  7. Habilita las API de Cloud Data Fusion, BigQuery, and Cloud Storage.

    Habilita las API

  8. Crea una instancia privada de Cloud Data Fusion en la versión 6.3.0 o superior. Cuando configures la instancia, ten en cuenta lo siguiente:

Si usas una instancia existente o si no ves la replicación en el menú de Cloud Data Fusion , consulta Actualiza para habilitar la replicación.

Instala MySQL en Compute Engine

  1. Descarga una imagen de Docker del servidor de MySQL.

  2. Sube tu imagen de Docker a Container Registry.

  3. Implementa la imagen de Docker en una instancia de VM nueva.

  4. En la página Discos de Compute Engine, cambia el tamaño del disco a 500 GB y, luego, reinicia la VM.

    Ir a la página Discos

  5. Crea un firewall para la instancia de VM.

  6. Instala la base de datos de muestra de Sakila.

Habilita la replicación en tu base de datos de MySQL

Para habilitar la replicación, configura la captura de datos modificados (CDC) en MySQL.

Crear y ejecutar un trabajo de replicación de Cloud Data Fusion

Sube el controlador de JDBC

  1. Descarga el controlador JDBC de MySQL (versión 8 o posterior) en tu máquina local.

  2. En la IU de Cloud Data Fusion, sube el controlador JDBC.

    Usa estos valores para configurar el controlador JDBC:

    • En el campo Nombre, ingresa mysql.
    • En el campo Versión, mantén la configuración predeterminada.
    • En el campo Class Name, ingresa com.mysql.jdbc.Driver.

Crea la canalización

  1. En la IU de Cloud Data Fusion, haz clic en el menú y navega a la página Replicación.

  2. En la página Crear trabajo de replicación nuevo, especifica un Nombre para el trabajo de replicación.

  3. Haga clic en Next.

  4. Configura la fuente:

    1. Selecciona MySQL como fuente.
    2. En Host, ingresa el nombre de host del servidor MySQL desde el que deseas leer.
    3. En Puerto, ingresa el puerto que deseas usar para conectarte al servidor MySQL: 3306.
    4. En Nombre del complemento JDBC, selecciona mysql (o el nombre que especificaste cuando configuraste el controlador JDBC).
    5. En Nombre de la base de datos, ingresa sakila.
    6. En la sección Credenciales, ingresa tu nombre de usuario y contraseña para acceder al servidor de MySQL.
  5. Haga clic en Next.

  6. Si la conexión se realiza de forma correcta, se mostrará una lista de tablas de base de datos de muestra de Sakila. En este instructivo, selecciona algunas tablas y eventos para replicar (incluidos los eventos Insertar, Actualizar y Borrar).

  7. Haga clic en Next.

  8. Configura el destino:

    1. Selecciona el destino de BigQuery.
    2. El ID del proyecto y la clave de la cuenta de servicio se detectan de forma automática. Mantén los valores predeterminados.
    3. En la sección Avanzado (Advanced), puedes configurar el nombre y la ubicación del bucket de etapa de pruebas, el intervalo de carga, el prefijo de la tabla de etapa de pruebas y el comportamiento cuando se descartan las tablas o bases de datos (opcional).
  9. Haga clic en Siguiente.

  10. Configura las propiedades avanzadas (opcional). En este instructivo, puedes usar la configuración predeterminada.

  11. Haga clic en Next.

  12. En la página Revisar evaluación, haz clic en Ver asignaciones junto a cualquiera de las tablas para obtener una evaluación de los problemas del esquema, las características faltantes o los problemas de conectividad que podrían ocurren durante la replicación. Si hay algún problema, debe resolverse antes de que puedas continuar. Para este instructivo, si alguna de las tablas tiene problemas, regresa al paso en el que seleccionaste las tablas y, en su lugar, selecciona una tabla o un evento (Insertaciones, Actualizaciones o eliminaciones) sin problemas.

  13. Haga clic en Atrás.

  14. Haga clic en Siguiente.

  15. Revisa los detalles del trabajo de replicación de resumen y, luego, haz clic en Implementar trabajo de replicación.

Comienza la canalización

En la página Detalles del trabajo de replicación, haz lo siguiente:

Haz clic en Iniciar.

El trabajo de replicación pasa del aprovisionamiento al inicio al estado en ejecución. En el estado de ejecución, el trabajo de replicación carga una instantánea inicial de los datos de la tabla que seleccionaste en BigQuery. El estado de la tabla aparece como instantánea. Después de cargar la instantánea inicial en BigQuery, los cambios realizados en la tabla se replican en BigQuery, y el estado de la tabla aparece como Replica.

Supervisa la canalización

Puedes iniciar y detener el trabajo de replicación, revisar su configuración y los registros, y supervisar tu trabajo de replicación.

Puedes supervisar las actividades de trabajo de replicación en la página Detalles del trabajo de replicación.

  1. En la página Replicación, haz clic en el Nombre del trabajo de replicación deseado.

  2. Haz clic en Monitoring.

Ver los resultados en BigQuery

El trabajo de replicación crea un conjunto de datos replicados y una tabla en BigQuery, con nombres heredados de la base de datos y los nombres de tabla correspondientes de MySQL.

  1. Abre BigQuery en Cloud Console.

  2. En el panel izquierdo, haga clic en el nombre de su proyecto para expandir una lista de conjuntos de datos.

  3. Selecciona el conjunto de datos sakila y, luego, selecciona una tabla.

Para obtener más información, consulta la documentación de BigQuery.

Limpia

Para evitar que se apliquen cargos a tu cuenta de Google Cloud por los recursos usados en este instructivo, borra el proyecto que contiene los recursos o conserva el proyecto y borra los recursos individuales.

Una vez que completaste el instructivo, limpia los recursos que creaste en Google Cloud para evitar que se te facture por ellos en el futuro. En las siguientes secciones, se describe cómo borrar o desactivar estos recursos.

Borra la instancia de Cloud Data Fusion

Sigue las instrucciones para borrar tu instancia de Cloud Data Fusion.

Borra el proyecto

La manera más fácil de eliminar la facturación es borrar el proyecto que creaste para el instructivo.

Para borrar el proyecto, sigue estos pasos:

  1. En Cloud Console, ve a la página Administrar recursos.

    Ir a Administrar recursos

  2. En la lista de proyectos, elige el proyecto que quieres borrar y haz clic en Borrar.
  3. En el diálogo, escribe el ID del proyecto y, luego, haz clic en Cerrar para borrar el proyecto.

¿Qué sigue?