SSD locales en Dataproc

Para complementar el disco de arranque, puedes adjuntar unidades de estado sólido locales (SSD locales) a los nodos principales, trabajadores principales y trabajadores secundarios en tu clúster. Cuando se proporcionan SSD locales al clúster, tanto los datos de HDFS como los temporales como las salidas aleatorias, usa los SSD locales en lugar del en un disco persistente estándar.

  • Los SSD locales pueden proporcionar tiempos de lectura y escritura más rápidos que los discos persistentes (consulta Rendimiento de SSD locales).
  • El tamaño de 375 GB de cada SSD local es fijo, pero puedes conectar varios SSD locales aumenta el almacenamiento SSD (consulta Acerca de los SSD locales).
  • Cada SSD local se activa en /mnt/<id> en los nodos del clúster de Dataproc.
  • Las SSD locales usan ext4 como el sistema de archivos predeterminado.

Usa SSD locales

Comando de gcloud

Usa el gcloud dataproc clusters create con el --num-master-local-ssds, --num-workers-local-ssds y Marcas de --num-secondary-worker-local-ssds para adjuntar elementos locales De SSD al trabajador principal, principal y secundario del clúster nodos.

Los SSD locales se pueden conectar a las VMs de Dataproc mediante una SCSI (Interfaz de sistema informático pequeño) o NVME (Memoria exprés no volátil) (consulta la sección rendimiento de SSD locales). La interfaz de SSD local de VM del clúster de Dataproc predeterminada es la interfaz SCSI. Usa el comando gcloud dataproc clusters create con las marcas --master-local-ssd-interface, --worker-local-ssd-interface y --secondary-worker-local-ssd-interface para especificar la interfaz de SSD local para los nodos trabajadores principales, primarios y secundarios.

Ejemplo:

gcloud dataproc clusters create cluster-name \
    --region=region \
    --num-master-local-ssds=1 \
    --num-worker-local-ssds=1 \
    --num-secondary-worker-local-ssds=1 \
    --master-local-ssd-interface=NVME \
    --worker-local-ssd-interface=NVME \
    --secondary-worker-local-ssd-interface=NVME \
    ... other args ...

API de REST

Establece el campo numLocalSsds en InstanceGroupConfig de masterConfig, workerConfig y secondaryWorkerConfig en una solicitud cluster.create a la API para conectar SSD locales a los nodos trabajadores (interrumpibles) principales, primarios y secundarios del clúster.

Las SSD locales se pueden conectar a las VMs de Dataproc mediante una interfaz SCSI (Small Computer System Interface) o NVMe (Non-Volatile Memory Express) (consulta rendimiento de SSD locales). La interfaz de SSD local de VM del clúster de Dataproc predeterminada es la interfaz SCSI. Establece el campo localSsdInterface en InstanceGroupConfig de masterConfig, workerConfig y secondaryWorkerConfig en una solicitud cluster.create a la API para especificar la interfaz "SCSI" o "NVME" para conectar SSD locales a los nodos trabajadores principales, primarios y secundarios del clúster.

Console

Crea un clúster y conecta los SSD locales a los nodos trabajadores principales, primarios y secundarios desde el panel Configurar nodos de la página Crear un clúster de Dataproc en la consola de Google Cloud.