Questa pagina è stata tradotta dall'API Cloud Translation.

Configurazione di Dataproc Hub

Dataproc Hub è un server JupyterHub personalizzato. Gli amministratori configurano e creano istanze Dataproc Hub che possono generare utenti singoli. Cluster Dataproc per ospitare ambienti di blocchi note Jupyter e JupyterLab (vedi Utilizzo di Dataproc Hub).

Avvia Notebooks per più utenti. Puoi creare un'istanza Vertex AI Workbench abilitata per Dataproc o installare il plug-in JupyterLab di Dataproc su una VM per fornire i notebook a più utenti.

Obiettivi

Definisci una configurazione del cluster Dataproc (o utilizza uno tra i file di configurazione predefiniti).
Imposta le variabili di ambiente dell'istanza Dataproc Hub.
Creare un'istanza Dataproc Hub.

Prima di iniziare

Se non l'hai ancora fatto, crea un progetto Google Cloud e un bucket Cloud Storage.

Configurazione del progetto
Creazione di un bucket Cloud Storage del progetto per conservare i dati usati in questo tutorial.
1. In the Google Cloud console, go to the Cloud Storage Buckets page.
  Go to Buckets page
2. Click Create bucket.
3. On the Create a bucket page, enter your bucket information. To go to the next step, click Continue.
  - For Name your bucket, enter a name that meets the bucket naming requirements.
  - For Choose where to store your data, do the following:
    - Select a Location type option.
    - Select a Location option.
  - For Choose a default storage class for your data, select a storage class.
  - For Choose how to control access to objects, select an Access control option.
  - For Advanced settings (optional), specify an encryption method, a retention policy, or bucket labels.
4. Click Create.

Definisci una configurazione del cluster

Un'istanza Dataproc Hub crea un cluster dai valori di configurazione contenuti in un file di configurazione del cluster YAML.

Configurazioni di cluster predefinite: Puoi utilizzare i seguenti file di configurazione predefiniti che si trovano in Cloud Storage:

Configurazione example-cluster: configura un componente Jupyter standard in un cluster con un master e due nodi worker
Configurazione example-single-node: configura un componente Jupyter un cluster con un nodo

Per visualizzare questi file di configurazione pubblici di Cloud Storage, esegui:

gcloud storage cat gs://dataproc-spawner-dist/example-configs/example-cluster.yaml
gcloud storage cat gs://dataproc-spawner-dist/example-configs/example-single-node.yaml

Crea un hub di guida rapida. Per creare un hub utilizzando le configurazioni dei cluster predefinite, vai a Creare un'istanza Dataproc Hub. La località di Cloud Storage le configurazioni cluster predefinite elencate sopra sono il valore predefinito Campo della variabile di ambiente DATAPROC_CONFIGS.

La configurazione del cluster può specificare qualsiasi funzionalità o componente disponibile ai cluster Dataproc (come tipo di macchina, inizializzazione azioni e componenti facoltativi). La versione dell'immagine del cluster deve essere 1.4.13 o versioni successive. Tentativo di generazione di un cluster con una versione dell'immagine precedente 1.4.13 causerà un errore e non riuscirà.

Esempio di file di configurazione del cluster YAML

clusterName: cluster-name
config:
  softwareConfig:
    imageVersion: 2.2-ubuntu22
    optionalComponents:
    - JUPYTER

Ogni configurazione deve essere salvata in Cloud Storage. Puoi creare e salvare più file di configurazione agli utenti una scelta quando utilizza Dataproc Hub per creare l'ambiente di blocco note del cluster Dataproc.

Esistono due modi per creare un file di configurazione del cluster YAML:

Creare un file di configurazione del cluster YAML dalla console
Esportare un file di configurazione del cluster YAML da un cluster esistente

crea il file di configurazione del cluster YAML dalla console

Apri la pagina Crea un cluster nella console Google Cloud, quindi seleziona e compila i campi per specificare il tipo di cluster che Dataproc Hub creerà per gli utenti.
Le impostazioni della regione e della zona verranno sostituite quando viene generato il cluster dell'utente: la regione del cluster generato sarà la regione in cui si trova Dataproc Hub e l'utente selezionerà una zona all'interno di questa regione.
1. Nella parte inferiore del riquadro a sinistra, seleziona "Equivalente REST".
2. Copia il blocco JSON generato, escludendo la riga di richiesta POST principale. quindi incolla il blocco JSON in un file JSON-to-YAML online convertitore (cerca online "Converti JSON in YAML").
  Alcuni convertitori da JSON a YAML generano una prima riga contenente "---". L'inclusione di questa riga nel file YAML è facoltativa.
3. Copia il file YAML convertito in un file cluster-config-filename.yaml locale.

Esporta un file di configurazione di cluster YAML da un cluster esistente

Crea un cluster corrispondente i tuoi requisiti.

Esporta la configurazione del cluster in un file cluster-config-filename.yaml locale.

gcloud dataproc clusters export cluster-name \
    --destination cluster-config-filename.yaml  \
    --region region

Salva il file di configurazione YAML in Cloud Storage

Copia il file di configurazione del cluster YAML locale nel tuo bucket Cloud Storage.

gcloud storage cp cluster-config-filename.yaml gs://bucket-name/

Impostare le variabili di ambiente dell'istanza Dataproc Hub

L'amministratore può impostare le variabili di ambiente hub elencate nella tabella seguente. per impostare gli attributi dei cluster Dataproc che verranno generate dagli utenti dell'hub.

Variabile	Descrizione	Esempio
NOTEBOOKS_LOCATION	Bucket o cartella bucket Cloud Storage contenente i notebook dell'utente. Il prefisso "gs://" è facoltativo. Predefinito: Bucket gestione temporanea Dataproc.	gs://`bucket-name`/
DATAPROC_CONFIGS	Elenco delimitato da virgole di stringhe dei percorsi Cloud Storage verso File di configurazione dei cluster YAML. "gs://" è facoltativo. Predefinita: `gs://dataproc-spawner-dist/example-configs/`. che contiene `example-cluster.yaml` e `example-single-node.yaml` predefiniti.	gs://`cluster-config-filename`.yaml
DATAPROC_LOCATIONS_LIST	I suffissi di zona nella regione in cui si trova l'istanza Dataproc Hub. Gli utenti possono selezionare una di queste zone come zona in cui verrà generato il loro cluster Dataproc. Predefinito: "b".	b,c,d
DATAPROC_DEFAULT_SUBNET	Subnet da cui l'istanza Dataproc Hub genererà Dataproc cluster. Predefinito:la subnet dell'istanza Dataproc Hub.	https://www.googleapis.com/compute/v1/projects/`project-id`/regions/`region`/subnetworks/`subnet-name`
DATAPROC_SERVICE_ACCOUNT	Account di servizio con cui verranno eseguite le VM Dataproc. Valore predefinito: se non impostato, viene utilizzato il service account Dataproc predefinito.	`service-account`@`project-id`.iam.gserviceaccount.com
SPAWNER_DEFAULT_URL	Specifica se visualizzare la UI Jupyter o JupyterLab sui cluster Dataproc generati per impostazione predefinita. Valore predefinito: "/lab".	"/" o "/lab", rispettivamente per Jupyter o JupyterLab.
DATAPROC_ALLOW_CUSTOM_CLUSTERS	Specifica se consentire agli utenti di personalizzare i cluster Dataproc. Predefinito:falso.	"true" o "false"
DATAPROC_MACHINE_TYPES_LIST	Elenco dei tipi di macchina tra cui gli utenti possono scegliere per i propri cluster Dataproc generati, se la personalizzazione del cluster (DATAPROC_ALLOW_CUSTOM_CLUSTERS) è abilitata. Valore predefinito: vuoto (sono consentiti tutti i tipi di macchine).	n1-standard-4,n1-standard-8,e2-standard-4,n1-highcpu-4
NOTEBOOKS_EXAMPLES_LOCATION	Percorso Cloud Storage del bucket o della cartella bucket dei notebook da scaricare nel cluster Dataproc generato all'avvio del cluster. Valore predefinito: vuoto.	gs://`bucket-name`/

Impostazione delle variabili di ambiente dell'hub

Esistono due modi per impostare le variabili di ambiente hub:

Impostare le variabili di ambiente dell'hub dalla console
Impostare le variabili di ambiente hub in un file di testo

Imposta le variabili di ambiente hub dalla console

Quando crei un'istanza di Dataproc Hub dalla scheda Notebook gestiti dall'utente nella pagina Dataproc→Workbench nella console Google Cloud, puoi fare clic sul pulsante Compila per aprire un modulo Compila Dataproc Hub che ti consente di impostare ogni variabile di ambiente.

Impostare le variabili di ambiente hub in un file di testo

Crea il file. Puoi utilizzare un editor di testo per impostare le variabili di ambiente dell'istanza Dataproc Hub in un file locale. In alternativa, puoi creare il file eseguendo il seguente comando dopo aver inserito i valori segnaposto e aver modificato o aggiunto le variabili e i relativi valori.
```
cat <<EOF > environment-variables-file
DATAPROC_CONFIGS=gs://bucket/cluster-config-filename.yaml
NOTEBOOKS_LOCATION=gs://bucket/notebooks
DATAPROC_LOCATIONS_LIST=b,c
EOF
```
Salva il file in Cloud Storage. Copia il file delle variabili di ambiente dell'istanza Dataproc Hub locale nel tuo bucket Cloud Storage.
```
gcloud storage cp environment-variable-filename gs://bucket-name/folder-name/
```

Impostare i ruoli IAM (Identity and Access Management)

Dataproc Hub include le seguenti identità con le seguenti funzionalità:

Amministratore: crea un'istanza Dataproc Hub
Utente di dati e ML: accede all'interfaccia utente di Dataproc Hub
Account di servizio Dataproc Hub: rappresenta Dataproc Hub
Account di servizio Dataproc: rappresenta il cluster Dataproc creato da Dataproc Hub.

Ogni identità richiede ruoli o autorizzazioni specifici per svolgere le attività associate. La tabella seguente riassume i ruoli e le autorizzazioni IAM richiesti da ogni identità.

Identità	Tipo	Ruolo o autorizzazione
Amministratore di Dataproc Hub	Account utente o di servizio	roles/notebooks.admin
Utente Dataproc Hub	Utente	notebooks.instances.use, dataproc.clusters.use
Dataproc Hub	Service account	roles/dataproc.hubAgent
Dataproc	Service account	roles/dataproc.worker

Crea un'istanza Dataproc Hub

Prima di iniziare: per creare un'istanza Dataproc Hub dalla console Google Cloud, l'account utente deve avere Autorizzazione compute.instances.create. Inoltre, l'account di servizio l'account di servizio predefinito all'account di servizio specificato dall'utente IAM e amministratore > Account di servizio (vedi Account di servizio VM Dataproc), deve avere iam.serviceAccounts.actAs autorizzazione.
Vai alla sezione Dataproc→Workbench nella console Google Cloud, poi seleziona Blocchi note gestiti dall'utente .
Se non è preselezionato come filtro, fai clic nella casella Filtro e seleziona **Ambiente: Dataproc Hub"".
Fai clic su Nuovo blocco note→Dataproc Hub.
Nella pagina Crea un notebook gestito dall'utente, fornisci le seguenti informazioni:
1. Nome del notebook: nome dell'istanza Dataproc Hub.
2. Regione: seleziona una regione. per l'istanza Dataproc Hub. Anche i cluster Dataproc generati da questa istanza Dataproc Hub verranno creati in questa regione.
  Per un rendimento ottimale, seleziona un'area geografica regione più vicina.
3. Zona: seleziona una zona all'interno della regione selezionata.
4. Ambiente:
  1. Environment: seleziona Dataproc Hub.
  2. Select a script to run after creation (facoltativo): puoi inserire o selezionare uno script o un eseguibile di azione di inizializzazione da eseguire sul cluster Dataproc generato.
  3. Populate Dataproc Hub (optional): fai clic su Compila per aprire un modulo di impostare ognuna delle variabili di ambiente dell'hub (vedi Impostare le variabili di ambiente dell'istanza Dataproc Hub per una descrizione di ciascuna variabile). Dataproc utilizza i valori predefiniti per le variabili di ambiente non impostate. In alternativa, puoi impostare coppie di metadati key:value per impostare le variabili di ambiente (vedi l'elemento successivo).
  4. Metadata:
    1. Se hai creato un file di testo contiene le impostazioni variabile di ambiente hub (vedi l'impostazione delle variabili di ambiente hub), fornisci il nome del file come key e gs://bucket-name/folder-name/environment-variable-filename Percorso Cloud Storage del file come value. Dataproc utilizza i valori predefiniti per tutti i casi variabili di ambiente.
5. Configurazione macchina:
  1. Machine Type: seleziona il tipo di macchina Compute Engine.
  2. Impostare altre opzioni di configurazione della macchina.
6. Altre opzioni:
  1. Puoi espandere e impostare o sostituire i valori predefiniti nelle sezioni Dischi, Networking, Autorizzazioni, Sicurezza e Upgrade dell'ambiente e integrità del sistema.
7. Fai clic su Crea per avviare l'istanza Dataproc Hub.
Il link Apri JupyterLab per l'istanza Dataproc Hub diventa attivo dopo la creazione dell'istanza. Gli utenti fanno clic su questo link per aprire la pagina del server JupyterHub per configurare e creare un cluster JupyterLab Dataproc (vedi Utilizzare Dataproc Hub).

Esegui la pulizia

Elimina l'istanza Dataproc Hub

Per eliminare l'istanza Dataproc Hub:

gcloud compute instances delete --project=${PROJECT} ${INSTANCE_NAME}

Elimina il bucket

Per eliminare il bucket Cloud Storage creato Prima di iniziare, inclusi i file di dati archiviati nel bucket:
```
gcloud storage rm gs://${BUCKET_NAME} --recursive
```

Passaggi successivi

Utilizzare Dataproc Hub