ShapeMask auf Cloud TPU trainieren (TF 2.x)

In diesem Dokument wird dargestellt, wie das ShapeMask-Modell mithilfe von Cloud TPU mit dem COCO-Dataset ausgeführt wird.

Bei der folgenden Anleitung wird davon ausgegangen, dass Sie bereits mit dem Ausführen eines Modells in Cloud TPU vertraut sind. Wenn Sie Cloud TPU noch nicht kennen, finden Sie in der Kurzanleitung eine grundlegende Einführung.

Wenn Sie auf einem TPU Pod-Slice trainieren möchten, lesen Sie Auf TPU Pods trainieren, um mehr über Parameteränderungen für Pod-Slices zu erfahren.

Lernziele

COCO-Dataset vorbereiten
Cloud Storage-Bucket zum Speichern der Dataset- und Modellausgabe erstellen
TPU-Ressourcen für Training und Evaluierung einrichten
Training und Bewertung auf einer einzelnen Cloud TPU oder einem Cloud TPU Pod ausführen

Kosten

In diesem Dokument verwenden Sie die folgenden kostenpflichtigen Komponenten von Google Cloud:

Compute Engine
Cloud TPU
Cloud Storage

Mit dem Preisrechner können Sie eine Kostenschätzung für Ihre voraussichtliche Nutzung vornehmen. Neuen Google Cloud-Nutzern steht möglicherweise eine kostenlose Testversion zur Verfügung.

Hinweise

Bevor Sie mit dieser Anleitung beginnen, prüfen Sie, ob Ihr Google Cloud-Projekt ordnungsgemäß eingerichtet ist.

Melden Sie sich bei Ihrem Google Cloud-Konto an. Wenn Sie mit Google Cloud noch nicht vertraut sind, erstellen Sie ein Konto, um die Leistungsfähigkeit unserer Produkte in der Praxis sehen und bewerten zu können. Neukunden erhalten außerdem ein Guthaben von 300 $, um Arbeitslasten auszuführen, zu testen und bereitzustellen.

In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

Go to project selector

Die Abrechnung für das Google Cloud-Projekt muss aktiviert sein.

In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

Go to project selector

Die Abrechnung für das Google Cloud-Projekt muss aktiviert sein.

In dieser Anleitung werden kostenpflichtige Komponenten der Google Cloud verwendet. Rufen Sie die Seite mit den Cloud TPU-Preisen auf, um Ihre Kosten abzuschätzen. Denken Sie daran, nicht mehr benötigte Ressourcen zu bereinigen, um unnötige Kosten zu vermeiden.

Cloud TPU-Training mit Einzelgerät

Dieser Abschnitt enthält Informationen zum Einrichten von Cloud Storage-, VM- und Cloud TPU-Ressourcen für das Training mit einem Einzelgerät.

Wenn Sie auf einem TPU Pod-Slice trainieren möchten, lesen Sie Auf TPU Pods trainieren, um mehr über die Änderungen nötig für Trainieren auf Pod-Slices zu erfahren.

Erstellen Sie in Cloud Shell eine Variable für die ID Ihres Projekts.
```
export PROJECT_ID=project-id
```
Konfigurieren Sie die Google Cloud CLI so, dass das Projekt verwendet wird, in dem Sie eine Cloud TPU erstellen möchten.
```
gcloud config set project ${PROJECT_ID}
```
Wenn Sie diesen Befehl zum ersten Mal in einer neuen Cloud Shell-VM ausführen, wird die Seite Authorize Cloud Shell angezeigt. Klicken Sie auf Authorize unten auf der Seite, damit gcloud GCP API-Aufrufe mit Ihren Anmeldedaten durchführen kann.

Erstellen Sie ein Dienstkonto für das Cloud TPU-Projekt.

gcloud beta services identity create --service tpu.googleapis.com --project $PROJECT_ID

Der Befehl gibt ein Cloud TPU-Dienstkonto im folgenden Format zurück:

service-PROJECT_NUMBER@cloud-tpu.iam.gserviceaccount.com

COCO-Dataset vorbereiten

In dieser Anleitung wird das COCO-Dataset verwendet. Das Dataset muss im TFRecord-Format in einem Cloud Storage-Bucket vorliegen, der für das Training verwendet werden soll.

Der Bucket-Speicherort muss sich in derselben Region wie die virtuelle Maschine (VM) und der TPU-Knoten befinden. VMs und TPU-Knoten befinden sich in bestimmten Zonen, die Untergruppen innerhalb einer Region sind.

Dieser Cloud Storage-Bucket speichert die Daten, die Sie zum Trainieren Ihres Modells verwenden, sowie die Trainingsergebnisse. Mit dem in dieser Anleitung verwendeten gcloud compute tpus execution-groups-Tool werden Standardberechtigungen für das Cloud TPU-Dienstkonto eingerichtet, das Sie im vorherigen Schritt eingerichtet haben. Wenn Sie detailliertere Berechtigungen benötigen, können Sie die Berechtigungen auf Zugriffsebene anpassen.

Wenn Sie das COCO-Dataset bereits in einem Cloud Storage-Bucket vorbereitet haben, der sich in der Zone befindet, die Sie zum Trainieren des Modells verwenden, können Sie die TPU-Ressourcen starten und die Cloud TPU für das Training vorbereiten. Führen Sie andernfalls folgende Schritte aus, um das Dataset vorzubereiten.

Konfigurieren Sie gcloud in Cloud Shell mit Ihrer Projekt-ID.

export PROJECT_ID=project-id
gcloud config set project ${PROJECT_ID}

Erstellen Sie in Ihrer Cloud Shell mit folgendem Befehl einen Cloud Storage-Bucket:

Hinweis: Ersetzen Sie im folgenden Befehl bucket-name durch den Namen, den Sie dem Bucket zuweisen möchten.
```
gsutil mb -p ${PROJECT_ID} -c standard -l europe-west4 gs://bucket-name
```
Starten Sie eine Compute Engine-VM-Instanz.

Diese VM-Instanz wird ausschließlich zum Herunterladen und Vorverarbeiten des COCO-Datasets verwendet. Geben Sie in instance-name einen Namen Ihrer Wahl ein.
```
$ gcloud compute tpus execution-groups create \
 --vm-only \
 --name=instance-name \
 --zone=europe-west4-a \
 --disk-size=300 \
 --machine-type=n1-standard-16 \
 --tf-version=2.12.0
```
Beschreibung der Befehls-Flags

vm-only

Erstellen Sie nur eine VM. Standardmäßig werden mit dem Befehl gcloud compute tpus execution-groups eine VM und eine Cloud TPU erstellt.

name

Der Name der zu erstellenden Cloud TPU.

zone

Die Zone, in der Sie Ihre Cloud TPU erstellen möchten.

disk-size

Die Größe der Festplatte in GB der mit dem Befehl gcloud compute tpus execution-groups erstellten VM.

machine-type

Der Maschinentyp der Compute Engine-VM, die erstellt werden soll.

tf-version

Die TensorFlow-Version gcloud compute tpus execution-groups wird auf der VM installiert.
Wenn Sie nicht automatisch bei der Compute Engine-Instanz angemeldet werden, melden Sie sich mit dem folgenden ssh-Befehl an. Wenn Sie bei der VM angemeldet sind, ändert sich die Shell-Eingabeaufforderung von username@projectname in username@vm-name:
```
  $ gcloud compute ssh instance-name --zone=europe-west4-a
  
```
Richten Sie zwei Variablen ein, eine für den zuvor erstellten Storage-Bucket und eine für das Verzeichnis, das die Trainingsdaten (DATA_DIR) im Storage-Bucket enthält.
```
(vm)$ export STORAGE_BUCKET=gs://bucket-name
```
```
(vm)$ export DATA_DIR=${STORAGE_BUCKET}/coco
```

Installieren Sie die Pakete, die für die Vorverarbeitung der Daten erforderlich sind.

(vm)$ sudo apt-get install -y python3-tk && \
  pip3 install --user Cython matplotlib opencv-python-headless pyyaml Pillow && \
  pip3 install --user "git+https://github.com/cocodataset/cocoapi#egg=pycocotools&subdirectory=PythonAPI"

Führen Sie das Skript download_and_preprocess_coco.sh aus, um das COCO-Dataset in einen Satz von TFRecords (*.tfrecord) zu konvertieren, der von der Trainingsanwendung erwartet wird.
```
(vm)$ git clone https://github.com/tensorflow/tpu.git
(vm)$ sudo bash tpu/tools/datasets/download_and_preprocess_coco.sh ./data/dir/coco
```
Dadurch werden die erforderlichen Bibliotheken installiert und das Skript für die Vorverarbeitung ausgeführt. Dann werden verschiedene *.tfrecord-Dateien in Ihr lokales Datenverzeichnis ausgegeben. Der COCO-Download und das Ausführen des Konvertierungsskripts dauern ungefähr eine Stunde.
Daten in den Cloud Storage-Bucket kopieren

Nachdem Sie die Daten in TFRecords konvertiert haben, kopieren Sie sie mit dem Befehl gsutil aus dem lokalen Speicher in den Cloud Storage-Bucket. Die Annotationsdateien müssen ebenfalls kopiert werden. Diese Dateien helfen dabei, die Leistung des Modells zu validieren.
```
(vm)$ gsutil -m cp ./data/dir/coco/*.tfrecord ${DATA_DIR}
(vm)$ gsutil cp ./data/dir/coco/raw-data/annotations/*.json ${DATA_DIR}
```
Bereinigen Sie die VM-Ressourcen.

Nachdem das COCO-Dataset in TFRecords konvertiert und in DATA_DIR in Ihrem Cloud Storage-Bucket kopiert wurde, können Sie die Compute Engine-Instanz löschen.

Trennen Sie die Verbindung zur Compute Engine-Instanz:
```
(vm)$ exit
```
Die Eingabeaufforderung sollte nun username@projectname lauten und angeben, dass Sie sich in Cloud Shell befinden.

Löschen Sie die Compute Engine-Instanz.

  $ gcloud compute instances delete instance-name
    --zone=europe-west4-a

TPU-Ressourcen starten und Modell trainieren

Verwenden Sie den Befehl gcloud, um die TPU-Ressourcen zu starten. Der verwendete Befehl hängt davon ab, ob Sie TPU-VMs oder TPU-Knoten verwenden. Weitere Informationen zu beiden VM-Architekturen finden Sie unter Systemarchitektur.
TPU-VM
```
$ gcloud compute tpus tpu-vm create shapemask-tutorial \
--zone=europe-west4-a \
--accelerator-type=v3-8 \
--version=tpu-vm-tf-2.16.1-pjrt
```
Beschreibung der Befehls-Flags

zone

Die Zone, in der Sie Ihre Cloud TPU erstellen möchten.

accelerator-type

Der Beschleunigertyp gibt die Version und Größe der Cloud TPU an, die Sie erstellen möchten. Weitere Informationen zu unterstützten Beschleunigertypen für die einzelnen TPU-Versionen finden Sie unter TPU-Versionen.

version

Die Cloud TPU-Softwareversion.
TPU-Knoten
```
$ gcloud compute tpus execution-groups create  \
 --zone=europe-west4-a \
 --name=shapemask-tutorial \
 --accelerator-type=v3-8 \
 --machine-type=n1-standard-8 \
 --disk-size=300 \
 --tf-version=2.12.0
```
Beschreibung der Befehls-Flags

zone

Die Zone, in der Sie Ihre Cloud TPU erstellen möchten.

name

Der TPU-Name. Ist standardmäßig Ihr Nutzername, wenn nichts anderes angegeben ist.

accelerator-type

Der Typ der zu erstellenden Cloud TPU.

machine-type

Der Maschinentyp der Compute Engine-VM, die erstellt werden soll.

disk-size

Die Größe des Stamm-Volumes Ihrer Compute Engine-VM (in GB).

tf-version

Die TensorFlow-Version gcloud wird auf der VM installiert.
Hinweis: Wenn Sie mehrere Projekte haben, müssen Sie die Projekt-ID mit dem Flag --project angeben.

Weitere Informationen zum Befehl gcloud finden Sie in der gcloud-Referenz.

Hinweis: Beim erstmaligen Ausführen von gcloud compute tpus für ein Projekt dauert es etwa 5 Minuten, bis alle Startprozesse wie die SSH-Schlüsselverbreitung und die API-Aktivierung abgeschlossen sind.
Wenn Sie nicht automatisch bei der Compute Engine-Instanz angemeldet werden, melden Sie sich mit dem folgenden ssh-Befehl an. Wenn Sie bei der VM angemeldet sind, ändert sich die Shell-Eingabeaufforderung von username@projectname in username@vm-name:
TPU-VM
```
gcloud compute tpus tpu-vm ssh shapemask-tutorial --zone=europe-west4-a
```
TPU-Knoten
```
gcloud compute ssh shapemask-tutorial --zone=europe-west4-a
```
Wichtiger Hinweis: Ab jetzt bedeutet das Präfix (vm)$, dass Sie den Befehl in der Compute Engine-VM-Instanz ausführen sollten.

Führen Sie im weiteren Verlauf dieser Anleitung jeden Befehl, der mit (vm)$ beginnt, in Ihrem VM-Sitzungsfenster aus.

Installieren Sie TensorFlow-Anforderungen.

TPU-VM

(vm)$ pip3 install -r /usr/share/tpu/models/official/requirements.txt

TPU-Knoten

(vm)$ pip3 install -r /usr/share/models/official/requirements.txt

Für das Trainingsskript ist ein zusätzliches Paket erforderlich. Installieren Sie es jetzt.

TPU-VM

(vm)$ pip3 install --user tensorflow-model-optimization>=0.1.3

TPU-Knoten

(vm)$ pip3 install --user tensorflow-model-optimization>=0.1.3

Legen Sie die Variable für den Storage-Bucket-Namen fest. Ersetzen Sie bucket-name durch den Namen Ihres Storage-Buckets.
```
(vm)$ export STORAGE_BUCKET=gs://bucket-name
```

Legen Sie die Cloud TPU-Namensvariable fest.

TPU-VM

(vm)$ export TPU_NAME=local

TPU-Knoten

(vm)$ export TPU_NAME=shapemask-tutorial

Legen Sie die Umgebungsvariable PYTHONPATH fest:

TPU-VM

(vm)$ export PYTHONPATH="/usr/share/tpu/models:${PYTHONPATH}"

TPU-Knoten

(vm)$ export PYTHONPATH="${PYTHONPATH}:/usr/share/models"

Wechseln Sie zum Verzeichnis, in dem sich das Modell befindet:

TPU-VM

(vm)$ cd /usr/share/tpu/models/official/legacy/detection

TPU-Knoten

(vm)$ cd /usr/share/models/official/legacy/detection

Fügen Sie einige erforderliche Umgebungsvariablen hinzu:

(vm)$ export RESNET_CHECKPOINT=gs://cloud-tpu-checkpoints/retinanet/resnet50-checkpoint-2018-02-07
(vm)$ export DATA_DIR=${STORAGE_BUCKET}/coco
(vm)$ export TRAIN_FILE_PATTERN=${DATA_DIR}/train-*
(vm)$ export EVAL_FILE_PATTERN=${DATA_DIR}/val-*
(vm)$ export VAL_JSON_FILE=${DATA_DIR}/instances_val2017.json
(vm)$ export SHAPE_PRIOR_PATH=gs://cloud-tpu-checkpoints/shapemask/kmeans_class_priors_91x20x32x32.npy
(vm)$ export MODEL_DIR=${STORAGE_BUCKET}/shapemask

Wenn Sie beim Erstellen Ihrer TPU den Parameter --version auf eine Version festlegen, die auf -pjrt endet, legen Sie die folgenden Umgebungsvariablen fest, um die PJRT-Laufzeit zu aktivieren:
```
  (vm)$ export NEXT_PLUGGABLE_DEVICE_USE_C_API=true
  (vm)$ export TF_PLUGGABLE_DEVICE_LIBRARY_PATH=/lib/libtpu.so
```

Trainieren Sie das ShapeMask-Modell:

Das folgende Skript führt ein Beispieltraining aus, das mit nur 100 Schritten trainiert wird und etwa 10 Minuten auf einer v3-8-TPU benötigt. Das Training zur Konvergenz dauert etwa 22.500 Schritte und ca. 6 Stunden auf einer v3-8-TPU.

(vm)$ python3 main.py \
  --strategy_type=tpu \
  --tpu=${TPU_NAME} \
  --model_dir=${MODEL_DIR} \
  --mode=train \
  --model=shapemask \
  --params_override="{train: {total_steps: 100, learning_rate: {init_learning_rate: 0.08, learning_rate_levels: [0.008, 0.0008], learning_rate_steps: [15000, 20000], }, checkpoint: { path: ${RESNET_CHECKPOINT},prefix: resnet50}, train_file_pattern: ${TRAIN_FILE_PATTERN}}, shapemask_head: {use_category_for_mask: true, shape_prior_path: ${SHAPE_PRIOR_PATH}}, shapemask_parser: {output_size: [640, 640]}}"

Beschreibung der Befehls-Flags

strategy_type: Wenn Sie das Shapemask-Modell auf einer TPU trainieren möchten, müssen Sie distribution_strategy auf tpu festlegen.
tpu: Der Name der Cloud TPU. Dies wird mit der Umgebungsvariable TPU_NAME festgelegt.
model_dir: Das Verzeichnis, in dem während des Modelltrainings Prüfpunkte und Zusammenfassungen gespeichert werden. Wenn der Ordner fehlt, wird er vom Programm erstellt. Wenn eine Cloud TPU verwendet wird, muss model_dir ein Cloud Storage-Pfad sein (gs://...). Sie können einen vorhandenen Ordner wiederverwenden, um aktuelle Prüfpunktdaten zu laden und zusätzliche Prüfpunkte zu speichern, sofern die vorherigen Prüfpunkte mit einer Cloud TPU derselben Größe und TensorFlow-Version erstellt wurden.
mode: Legen Sie dafür train fest, um das Modell zu trainieren, oder eval, um es zu bewerten.
params_override: Ein JSON-String, der Standardskriptparameter überschreibt. Weitere Informationen zu Skriptparametern finden Sie unter /usr/share/models/official/legacy/detection/main.py.

Wenn das Training abgeschlossen ist, wird eine Meldung wie diese angezeigt:

Train Step: 100/100  / loss = {'total_loss': 10.815635681152344,
'loss': 10.815635681152344, 'retinanet_cls_loss': 1.4915691614151,
'l2_regularization_loss': 4.483549118041992,
'retinanet_box_loss': 0.013074751943349838,
'shapemask_prior_loss': 0.17314358055591583,
'shapemask_coarse_mask_loss': 1.953366756439209,
'shapemask_fine_mask_loss': 2.216097831726074, 'model_loss': 6.332086086273193,
'learning_rate': 0.021359999} / training metric = {'total_loss': 10.815635681152344,
'loss': 10.815635681152344, 'retinanet_cls_loss': 1.4915691614151,
'l2_regularization_loss': 4.483549118041992,
'retinanet_box_loss': 0.013074751943349838,
'shapemask_prior_loss': 0.17314358055591583,
'shapemask_coarse_mask_loss': 1.953366756439209,
'shapemask_fine_mask_loss': 2.216097831726074,
'model_loss': 6.332086086273193, 'learning_rate': 0.021359999}

Führen Sie das Skript aus, um das ShapeMask-Modell zu bewerten. Dies dauert auf einer v3-8-TPU etwa zehn Minuten:

(vm)$ python3 main.py \
    --strategy_type=tpu \
    --tpu=${TPU_NAME} \
    --model_dir=${MODEL_DIR} \
    --checkpoint_path=${MODEL_DIR} \
    --mode=eval_once \
    --model=shapemask \
    --params_override="{eval: { val_json_file: ${VAL_JSON_FILE}, eval_file_pattern: ${EVAL_FILE_PATTERN}, eval_samples: 5000 }, shapemask_head: {use_category_for_mask: true, shape_prior_path: ${SHAPE_PRIOR_PATH}}, shapemask_parser: {output_size: [640, 640]}}"

Beschreibung der Befehls-Flags

strategy_type: Wenn Sie das Shapemask-Modell auf einer TPU trainieren möchten, müssen Sie distribution_strategy auf tpu setzen.
tpu: Der Name der Cloud TPU. Dieser wird mit der Umgebungsvariable TPU_NAME festgelegt.
model_dir: Das Verzeichnis, in dem während des Modelltrainings Prüfpunkte und Zusammenfassungen gespeichert werden. Wenn der Ordner fehlt, wird er vom Programm erstellt. Wenn eine Cloud TPU verwendet wird, muss model_dir ein Cloud Storage-Pfad sein (gs://...). Sie können einen vorhandenen Ordner wiederverwenden, um aktuelle Prüfpunktdaten zu laden und zusätzliche Prüfpunkte zu speichern, sofern die vorherigen Prüfpunkte mit einer Cloud TPU derselben Größe und TensorFlow-Version erstellt wurden.
mode: Legen Sie dafür train fest, um das Modell zu trainieren, oder eval, um es zu bewerten.
params_override: Ein JSON-String, der Standardskriptparameter überschreibt. Weitere Informationen zu Skriptparametern finden Sie unter /usr/share/models/official/legacy/detection/main.py.

Sobald die Beurteilung abgeschlossen ist, wird eine Meldung wie diese angezeigt:

DONE (t=5.47s).
 Average Precision  (AP) @[ IoU=0.50:0.95 | area=   all | maxDets=100 ] = 0.000
 Average Precision  (AP) @[ IoU=0.50      | area=   all | maxDets=100 ] = 0.000
 Average Precision  (AP) @[ IoU=0.75      | area=   all | maxDets=100 ] = 0.000
 Average Precision  (AP) @[ IoU=0.50:0.95 | area= small | maxDets=100 ] = 0.000
 Average Precision  (AP) @[ IoU=0.50:0.95 | area=medium | maxDets=100 ] = 0.000
 Average Precision  (AP) @[ IoU=0.50:0.95 | area= large | maxDets=100 ] = 0.000
 Average Recall     (AR) @[ IoU=0.50:0.95 | area=   all | maxDets=  1 ] = 0.000
 Average Recall     (AR) @[ IoU=0.50:0.95 | area=   all | maxDets= 10 ] = 0.000
 Average Recall     (AR) @[ IoU=0.50:0.95 | area=   all | maxDets=100 ] = 0.000
 Average Recall     (AR) @[ IoU=0.50:0.95 | area= small | maxDets=100 ] = 0.000
 Average Recall     (AR) @[ IoU=0.50:0.95 | area=medium | maxDets=100 ] = 0.000
 Average Recall     (AR) @[ IoU=0.50:0.95 | area= large | maxDets=100 ] = 0.000

Sie haben jetzt das Training und die Bewertung für ein Einzelgerät abgeschlossen. Führen Sie die folgenden Schritte aus, um die aktuellen Ressourcen des TPU-Einzelgeräts zu löschen.

Trennen Sie die Verbindung zur Compute Engine-Instanz:
```
(vm)$ exit
```
Die Eingabeaufforderung sollte nun username@projectname lauten und angeben, dass Sie sich in Cloud Shell befinden.
Löschen Sie die TPU-Ressource.
TPU-VM
```
$ gcloud compute tpus tpu-vm delete shapemask-tutorial \
--zone=europe-west4-a
```
Beschreibung der Befehls-Flags

zone

Die Zone, in der sich Ihre Cloud TPU befindet.
TPU-Knoten
```
$ gcloud compute tpus execution-groups delete shapemask-tutorial \
--tpu-only \
--zone=europe-west4-a
```
Beschreibung der Befehls-Flags

tpu-only

Löscht nur die Cloud TPU. Die VM bleibt verfügbar.

zone

Die Zone, in der die zu löschende TPU enthalten ist.
An dieser Stelle können Sie entweder diese Anleitung beenden und eine Bereinigung durchführen oder die Ausführung des Modells auf Cloud TPU Pods fortsetzen.

Modell mit Cloud TPU Pods skalieren

oder TPU-Knoten.

Wenn Sie das Modell auf Cloud TPU-Pods trainieren, sind möglicherweise einige Änderungen am Trainingsskript erforderlich. Weitere Informationen finden Sie unter Training auf TPU-Pods.

TPU-Pod-Training

Öffnen Sie ein Cloud Shell-Fenster.

Cloud Shell öffnen
Erstellen Sie eine Variable für Ihre Projekt-ID.
```
export PROJECT_ID=project-id
```
Konfigurieren Sie die Google Cloud CLI so, dass das Projekt verwendet wird, in dem Sie eine Cloud TPU erstellen möchten.
```
gcloud config set project ${PROJECT_ID}
```
Wenn Sie diesen Befehl zum ersten Mal in einer neuen Cloud Shell-VM ausführen, wird die Seite Authorize Cloud Shell angezeigt. Klicken Sie auf Authorize unten auf der Seite, damit gcloud GCP API-Aufrufe mit Ihren Anmeldedaten durchführen kann.
Erstellen Sie ein Dienstkonto für das Cloud TPU-Projekt.

Dienstkonten ermöglichen dem Cloud TPU-Dienst, auf andere Google Cloud Platform-Dienste zuzugreifen.
```
gcloud beta services identity create --service tpu.googleapis.com --project $PROJECT_ID
```
Der Befehl gibt ein Cloud TPU-Dienstkonto im folgenden Format zurück:
```
service-PROJECT_NUMBER@cloud-tpu.iam.gserviceaccount.com
```
Erstellen Sie mit dem folgenden Befehl einen Cloud Storage-Bucket oder verwenden Sie einen Bucket, den Sie zuvor für Ihr Projekt erstellt haben:

Wichtig: Richten Sie die Cloud TPU-Ressourcen und den Cloud Storage-Bucket in derselben Region/Zone ein, um Netzwerklatenz und Netzwerkkosten zu reduzieren. Cloud TPUs befinden sich in bestimmten Zonen, die Untergruppen innerhalb einer Region sind.
```
gsutil mb -p ${PROJECT_ID} -c standard -l europe-west4 gs://bucket-name
```
Wenn Sie das COCO-Dataset bereits vorbereitet und in den Storage-Bucket verschoben haben, können Sie es für das Pod-Training wiederverwenden. Wenn Sie das COCO-Dataset noch nicht vorbereitet haben, bereiten Sie es jetzt vor und kehren Sie dann hierher zurück, um das Pod-Training einzurichten.
Cloud TPU-Pod starten

In dieser Anleitung wird ein v3-32-Pod angegeben. Weitere Pod-Optionen finden Sie unter TPU-Versionen.
TPU-VM
Hinweis: Wenn derzeit nicht genügend Kapazität zum Erstellen des TPU-Pod verfügbar ist, können Sie Ihre Anfrage mithilfe von Ressourcen in der Warteschlange in die Warteschlange stellen. Mit Ressourcen in der Warteschlange können Sie Kapazität erhalten, sobald sie verfügbar ist. Verwenden Sie stattdessen den Befehl gcloud alpha compute tpus queued-resources create, um Ihre Cloud TPU-Ressourcen als Ressourcen in der Warteschlange anzufordern. Weitere Informationen finden Sie unter Ressourcen in der Warteschlange verwalten.
```
$ gcloud compute tpus tpu-vm create shapemask-tutorial \
--zone=europe-west4-a \
--accelerator-type=v3-32 \
--version=tpu-vm-tf-2.16.1-pod-pjrt
```
Beschreibung der Befehls-Flags

zone

Die Zone, in der Sie Ihre Cloud TPU erstellen möchten.

accelerator-type

Der Beschleunigertyp gibt die Version und Größe der Cloud TPU an, die Sie erstellen möchten. Weitere Informationen zu unterstützten Beschleunigertypen für die einzelnen TPU-Versionen finden Sie unter TPU-Versionen.

version

Die Cloud TPU-Softwareversion.

Hinweis: Beim erstmaligen Ausführen von gcloud für ein Projekt dauert es etwa 5 Minuten, bis alle Startprozesse wie die SSH-Schlüsselverbreitung und die API-Aktivierung abgeschlossen sind.
TPU-Knoten
```
$ gcloud compute tpus execution-groups create  \
 --zone=europe-west4-a \
 --name=shapemask-tutorial \
 --accelerator-type=v3-32 \
 --machine-type=n1-standard-8 \
 --disk-size=300 \
 --tf-version=2.12.0
```
Beschreibung der Befehls-Flags

zone

Die Zone, in der Sie Ihre Cloud TPU erstellen möchten.

name

Der TPU-Name. Ist standardmäßig Ihr Nutzername, wenn nichts anderes angegeben ist.

accelerator-type

Der Typ der zu erstellenden Cloud TPU.

machine-type

Der Maschinentyp der Compute Engine-VM, die erstellt werden soll.

disk-size

Die Größe des Stamm-Volumes Ihrer Compute Engine-VM (in GB).

tf-version

Die TensorFlow-Version gcloud wird auf der VM installiert.

Hinweis: Wenn Sie mehrere Projekte haben, müssen Sie die Projekt-ID mit dem Flag --project angeben.
Wenn Sie nicht automatisch bei der Compute Engine-Instanz angemeldet werden, melden Sie sich mit dem folgenden ssh-Befehl an. Wenn Sie bei der VM angemeldet sind, ändert sich die Shell-Eingabeaufforderung von username@projectname in username@vm-name:
TPU-VM
```
gcloud compute tpus tpu-vm ssh shapemask-tutorial --zone=europe-west4-a
```
TPU-Knoten
```
gcloud compute ssh shapemask-tutorial --zone=europe-west4-a
```
Wichtiger Hinweis: Ab jetzt bedeutet das Präfix (vm)$, dass Sie den Befehl in der Compute Engine-VM-Instanz ausführen sollten.

Führen Sie im weiteren Verlauf dieser Anleitung jeden Befehl, der mit (vm)$ beginnt, in Ihrem VM-Sitzungsfenster aus.

Installieren Sie TensorFlow-Anforderungen.

TPU-VM

(vm)$ pip3 install -r /usr/share/tpu/models/official/requirements.txt

TPU-Knoten

(vm)$ pip3 install -r /usr/share/models/official/requirements.txt

Für das Trainingsskript ist ein zusätzliches Paket erforderlich. Installieren Sie es jetzt.

TPU-VM

(vm)$ pip3 install --user tensorflow-model-optimization>=0.1.3

TPU-Knoten

(vm)$ pip3 install --user tensorflow-model-optimization>=0.1.3

Richten Sie die folgenden Umgebungsvariablen ein und ersetzen Sie bucket-name durch den Namen Ihres Cloud Storage-Buckets:
```
(vm)$ export STORAGE_BUCKET=gs://bucket-name
```
Die Trainingsanwendung erwartet, dass Ihre Trainingsdaten in Cloud Storage verfügbar sind. Die Trainingsanwendung verwendet auch Ihren Cloud Storage-Bucket, um während des Trainings Prüfpunkte zu speichern.

Aktualisieren Sie die erforderlichen Trainingsvariablen.

(vm)$ export MODEL_DIR=${STORAGE_BUCKET}/shapemask-pods
(vm)$ export DATA_DIR=${STORAGE_BUCKET}/coco
(vm)$ export RESNET_CHECKPOINT=gs://cloud-tpu-checkpoints/retinanet/resnet50-checkpoint-2018-02-07
(vm)$ export TRAIN_FILE_PATTERN=${DATA_DIR}/train-*
(vm)$ export EVAL_FILE_PATTERN=${DATA_DIR}/val-*
(vm)$ export VAL_JSON_FILE=${DATA_DIR}/instances_val2017.json
(vm)$ export SHAPE_PRIOR_PATH=gs://cloud-tpu-checkpoints/shapemask/kmeans_class_priors_91x20x32x32.npy

Legen Sie erforderliche Umgebungsvariablen fest:

TPU-VM

(vm)$ export PYTHONPATH="/usr/share/tpu/models:${PYTHONPATH}"
(vm)$ export TPU_LOAD_LIBRARY=0

TPU-Knoten

(vm)$ export PYTHONPATH="${PYTHONPATH}:/usr/share/models"

Wechseln Sie zum Verzeichnis, in dem sich das Modell befindet:

TPU-VM

(vm)$ cd /usr/share/tpu/models/official/legacy/detection

TPU-Knoten

(vm)$ cd /usr/share/models/official/legacy/detection

Starten Sie das Pod-Training.

Das Beispieltraining erfordert nur 20 Schritte und dauert etwa 10 Minuten auf einem v3-32-TPU-Knoten. Das Training zur Konvergenz erfordert etwa 11.250 Schritte und dauert etwa 2 Stunden auf einem v3-32-TPU-Pod.
```
(vm)$ python3 main.py \
 --strategy_type=tpu \
 --tpu=${TPU_NAME} \
 --model_dir=${MODEL_DIR} \
 --mode=train \
 --model=shapemask \
 --params_override="{train: { batch_size: 128, iterations_per_loop: 500, total_steps: 20, learning_rate: {'learning_rate_levels': [0.008, 0.0008], 'learning_rate_steps': [10000, 13000] }, checkpoint: { path: ${RESNET_CHECKPOINT}, prefix: resnet50/ }, train_file_pattern: ${TRAIN_FILE_PATTERN} }, eval: { val_json_file: ${VAL_JSON_FILE}, eval_file_pattern: ${EVAL_FILE_PATTERN}}, shapemask_head: {use_category_for_mask: true, shape_prior_path: ${SHAPE_PRIOR_PATH}} }"
```
Beschreibung der Befehls-Flags

strategy_type

Wenn Sie das Shapemask-Modell auf einer TPU trainieren möchten, müssen Sie distribution_strategy auf tpu setzen.

tpu

Der Name der Cloud TPU. Dieser wird mit der Umgebungsvariable TPU_NAME festgelegt.

model_dir

Das Verzeichnis, in dem während des Modelltrainings Prüfpunkte und Zusammenfassungen gespeichert werden. Wenn der Ordner fehlt, wird er vom Programm erstellt. Wenn eine Cloud TPU verwendet wird, muss model_dir ein Cloud Storage-Pfad sein (gs://...). Sie können einen vorhandenen Ordner wiederverwenden, um aktuelle Prüfpunktdaten zu laden und zusätzliche Prüfpunkte zu speichern, sofern die vorherigen Prüfpunkte mit einer Cloud TPU derselben Größe und TensorFlow-Version erstellt wurden.

mode

Legen Sie dafür train fest, um das Modell zu trainieren, oder eval, um es zu bewerten.

params_override

Ein JSON-String, der Standardskriptparameter überschreibt. Weitere Informationen zu Skriptparametern finden Sie unter /usr/share/models/official/legacy/detection/main.py.

Bereinigen

Damit Ihrem Google Cloud-Konto die in dieser Anleitung verwendeten Ressourcen nicht in Rechnung gestellt werden, löschen Sie entweder das Projekt, das die Ressourcen enthält, oder Sie behalten das Projekt und löschen die einzelnen Ressourcen.

Trennen Sie die Verbindung zur Compute Engine-Instanz, sofern noch nicht geschehen:
```
(vm)$ exit
```
Die Eingabeaufforderung sollte nun username@projectname lauten und angeben, dass Sie sich in Cloud Shell befinden.
Löschen Sie Ihre Cloud TPU- und Compute Engine-Ressourcen. Der Befehl zum Löschen Ihrer Ressourcen hängt davon ab, ob Sie TPU-VMs oder TPU-Knoten verwenden. Weitere Informationen finden Sie unter Systemarchitektur.
TPU-VM
```
$ gcloud compute tpus tpu-vm delete shapemask-tutorial \
--zone=europe-west4-a
```
TPU-Knoten
```
$ gcloud compute tpus execution-groups delete shapemask-tutorial \
--zone=europe-west4-a
```
Prüfen Sie, ob die Ressourcen gelöscht wurden. Führen Sie dazu gcloud compute tpus execution-groups list aus. Der Löschvorgang kann einige Minuten dauern. Die Ausgabe des folgenden Befehls sollte keine der in dieser Anleitung erstellten TPU-Ressourcen enthalten:
```
$ gcloud compute tpus execution-groups list --zone=europe-west4-a
```
Führen Sie gsutil wie angegeben aus und ersetzen Sie dabei bucket-name durch den Namen des Cloud Storage-Buckets, den Sie für diese Anleitung erstellt haben:

Achtung: Alle Trainingsdaten gehen beim Löschen des Buckets verloren. Führen Sie diesen Schritt daher nur aus, wenn Sie die Anleitung ausgeführt haben.
```
$ gsutil rm -r gs://bucket-name
```

Nächste Schritte

Mit verschiedenen Bildgrößen trainieren

Sie können auch ein neuronales Netzwerk wie ResNet-101 statt ResNet-50 ausprobieren. Ein größeres Eingabebild und ein leistungsfähigeres neuronales Netzwerk ergeben ein langsameres, aber präziseres Modell.

Andere Grundlage verwenden

Alternativ können Sie versuchen, ein ResNet-Modell im Voraus mit Ihrem eigenen Dataset zu trainieren und es als Grundlage für Ihr ShapeMask-Modell zu verwenden. Sie haben auch die Möglichkeit, ResNet durch ein alternatives neuronales Netzwerk zu ersetzen, was etwas arbeitsaufwändiger ist. Wenn Sie Ihre eigenen Objekterkennungsmodelle implementieren möchten, ist dieses Netzwerk möglicherweise eine gute Basis für weitere Experimente.