Bigtable to JSON テンプレート

Bigtable to JSON テンプレートは、Bigtable テーブルからデータを読み取り、Cloud Storage バケットに JSON 形式で書き込むパイプラインです。

パイプラインの要件

Bigtable テーブルが存在している必要があります。
パイプラインを実行する前に、出力用の Cloud Storage バケットが存在している必要があります。

テンプレートのパラメータ

必須パラメータ

bigtableProjectId: データの読み取り元である Bigtable インスタンスが含まれている Google Cloud プロジェクトの ID。
bigtableInstanceId: テーブルが含まれている Bigtable インスタンスの ID。
bigtableTableId: 読み取り元の Bigtable テーブルの ID。
outputDirectory: 出力 JSON ファイルが保存されている Cloud Storage パス。例: gs://your-bucket/your-path/

オプションパラメータ

filenamePrefix: JSON ファイル名の接頭辞。例: table1-。値が指定されていない場合、デフォルトは part です。
userOption: 値は FLATTEN または NONE です。FLATTEN は、行を単一レベルにフラット化します。NONE は、行全体を JSON 文字列として格納します。デフォルトは NONE です。
columnsAliases: Vertex AI Vector Search インデックスに必要な列のカンマ区切りリスト。Vertex AI Vector Search には列 id と embedding が必要です。fromfamily:fromcolumn;to という表記を使用できます。たとえば、列が rowkey と cf:my_embedding で、rowkey とエンベディング列の名前が異なる場合は、cf:my_embedding;embedding と rowkey;id を指定します。このオプションは、userOption の値が FLATTEN の場合にのみ使用します。
bigtableAppProfileId: エクスポートに使用する Bigtable アプリケーションプロファイルの ID。アプリプロファイルを指定しない場合は、インスタンスのデフォルトのアプリプロファイル（https://cloud.google.com/bigtable/docs/app-profiles#default-app-profile）が使用されます。

テンプレートを実行する

コンソール

Dataflow の [テンプレートからジョブを作成] ページに移動します。

[テンプレートからジョブを作成] に移動

[ジョブ名] フィールドに、固有のジョブ名を入力します。
（省略可）[リージョンエンドポイント] で、プルダウンメニューから値を選択します。デフォルトのリージョンは us-central1 です。
Dataflow ジョブを実行できるリージョンのリストについては、Dataflow のロケーションをご覧ください。
[Dataflow テンプレート] プルダウンメニューから、[ the Bigtable to JSON template] を選択します。
表示されたパラメータフィールドに、パラメータ値を入力します。
[ジョブを実行] をクリックします。

gcloud CLI

シェルまたはターミナルで、テンプレートを実行します。

gcloud dataflow jobs run JOB_NAME \
    --gcs-location=gs://dataflow-templates-REGION_NAME/VERSION/Cloud_Bigtable_to_GCS_Json \
    --project=PROJECT_ID \
    --region=REGION_NAME \
    --parameters \
       bigtableProjectId=BIGTABLE_PROJECT_ID,\
       bigtableInstanceId=BIGTABLE_INSTANCE_ID,\
       bigtableTableId=BIGTABLE_TABLE_ID,\
       filenamePrefix=FILENAME_PREFIX,\

次のように置き換えます。

JOB_NAME: 一意の任意のジョブ名
VERSION: 使用するテンプレートのバージョン
使用できる値は次のとおりです。
- latest: 最新バージョンのテンプレートを使用します。このテンプレートは、バケット内で日付のない親フォルダ（gs://dataflow-templates-REGION_NAME/latest/）にあります。
- バージョン名（例: 2023-09-12-00_RC00）。特定のバージョンのテンプレートを使用します。このテンプレートは、バケット内で対応する日付の親フォルダ（gs://dataflow-templates-REGION_NAME/）にあります。
注: 最新のテンプレートでは、互換性のない変更が行われている場合があります。こうした互換性のない変更が本番環境のワークフローに影響しないように、本番環境では最新の日付付き親フォルダに保存されているテンプレートを使用する必要があります。
REGION_NAME: Dataflow ジョブをデプロイするリージョン（例: us-central1）
BIGTABLE_PROJECT_ID: プロジェクト ID
BIGTABLE_INSTANCE_ID: インスタンス ID
BIGTABLE_TABLE_ID: テーブル ID
FILENAME_PREFIX: JSON ファイルの接頭辞

API

REST API を使用してテンプレートを実行するには、HTTP POST リクエストを送信します。API とその認証スコープの詳細については、projects.templates.launch をご覧ください。

POST https://dataflow.googleapis.com/v1b3/projects/PROJECT_ID/locations/LOCATION/templates:launch?gcsPath=gs://dataflow-templates-LOCATION/VERSION/Cloud_Bigtable_to_GCS_Json
{
   "jobName": "JOB_NAME",
   "parameters": {
     "bigtableProjectId": "BIGTABLE_PROJECT_ID",
     "bigtableInstanceId": "BIGTABLE_INSTANCE_ID",
     "bigtableTableId": "BIGTABLE_TABLE_ID",
     "filenamePrefix": "FILENAME_PREFIX",
   },
   "environment": { "maxWorkers": "10" }
}