このページは Cloud Translation API によって翻訳されました。

Google Distributed Cloud エアギャップアプライアンス 1.0.x の既知の問題

モニタリング

デバイスの再起動後に Grafana ダッシュボードにアクセスすると、健全なアップストリームエラーが発生する

バージョン: 1.0

症状: デバイスをシャットダウンした後、Grafana UI にアクセスできない。この問題は、Cortex Pod で CPU が過負荷になった場合に発生します。

回避策:

管理プレーンで mon-cortex のサブコンポーネントの調整を一時停止します。

export SUBCOMPONENT_NAME=mon-cortex
export SUBCOMPONENT_NAMESPACE=root

kubectl annotate subcomponent "${SUBCOMPONENT_NAME:?}" -n "${SUBCOMPONENT_NAMESPACE:?}" --kubeconfig=/root/release/root-admin/kube-admin-remote-kubeconfig lcm.private.gdc.goog/paused=true

コントロールプレーンでレプリカ数を 0 に減らして、既存の Cortex Pod を削除します。このアクションが必要なのは、Pod cortex-1 が不良状態の場合、その状態が継続し、再起動されないためです。Pod を再起動するには、レプリカ数を 0 に減らします。
```
kubectl scale statefulset cortex --replicas=0 -n mon-system --kubeconfig=/root/release/root-admin/root-admin-kubeconfig
```

cortex レプリカの数を 7 に増やします。

kubectl scale statefulset cortex --replicas=7 -n mon-system --kubeconfig=/root/release/root-admin/root-admin-kubeconfig

No healthy upstream error が消えます。

ストレージ

OTS VM が正常にシャットダウンされなかった後に自動的に再起動しない

バージョン: 1.0.x

現象: 電源喪失などの正常でないシャットダウンの後、再起動時に OTS VM が自動的に再起動しないことがあります。bm01 と bm02 の両方に移動し、VM の状態を確認します。

[root@aa-ah-bm01 ~]# virsh list --all
 Id   Name              State
----------------------------------
 -    aa-ah-stge01-01   shut off

lsblk を確認します。次のような場合:

nvme0n1                             259:0    0   3.5T  0 disk
└─md127                               9:127  0  10.5T  0 raid5
nvme3n1                             259:1    0   3.5T  0 disk
└─md127                               9:127  0  10.5T  0 raid5
nvme2n1                             259:2    0   3.5T  0 disk
└─md127                               9:127  0  10.5T  0 raid5
nvme1n1                             259:3    0   3.5T  0 disk
└─md127                               9:127  0  10.5T  0 raid5

次に、cat /proc/mdstat を実行します。raid5 アレイが active (auto-read-only) モードの場合、これはクリーンでないシャットダウンまたは停電が原因です。mdadm は、配列のスーパーブロックが書き込みが完了していないことを示しているか、配列が適切に停止されていないことを検出します。データの整合性を確保するため、アレイを resync=PENDING としてマークし、多くの場合 auto-read-only モードで起動します。

回避策:

RAID の再同期と復元を開始します。

sudo mdadm --readwrite /dev/NAME

NAME は、RAID デバイス名（md127 など）に置き換えます。raid5 アレイが active モードになっていることを確認します。

[root@aa-ah-bm01 ~]# cat /proc/mdstat
Personalities : [raid1] [raid6] [raid5] [raid4]
md126 : active raid1 nvme5n1[0] nvme4n1[1]
      937692352 blocks super 1.0 [2/2] [UU]
      bitmap: 7/7 pages [28KB], 65536KB chunk

md127 : active raid5 nvme3n1[2] nvme2n1[4] nvme1n1[1] nvme0n1[0]
      11251817472 blocks super 1.2 level 5, 512k chunk, algorithm 2 [4/4] [UUUU]
      bitmap: 0/28 pages [0KB], 65536KB chunk

unused devices: <none>

/etc/crypttab ファイルで LUKS 構成を確認します。この構成は次の例のようになります。

luksroot UUID=45297124-672d-4c03-9805-de94b545e959 none luks,discard
luksrd5 UUID=b10724fe-2b17-423c-8078-d62410738f8a /etc/luks/rd5.keyfile luks,discard
luksnvram UUID=12694ec9-1d1c-41a3-af2e-8f5bbc1ddca4 /etc/luks/md126p73.keyfile luks,discard

このファイルには、luksrd5 と luksnvram のキーファイルの場所が含まれています。

raid5 udev 名を取得します。
```
cd /dev/md
ls | grep rd5
```

nvram udev 名を取得します。

NVRAM=$(blkid -o device | while read -r device; do
  if blkid "$device" | grep -q 'PARTLABEL=".*OTS.*"'; then
    echo "$device"
    break
  fi
done)
echo $NVRAM

OTS で使用される luksrd5 と luksnvram という名前の LUKS デバイスを開きます。

cryptsetup luksOpen /dev/md/<raid5 udev name> luksrd5 --key-file <luksrd5 keyfile>
cryptsetup luksOpen /dev/<nvram udev name> luksnvram --key-file <luksnvram keyfile>

lsblk コマンドは、次の例のような結果を出力します。

[root@aa-ah-bm02 ~]# lsblk
NAME                                             MAJ:MIN RM   SIZE RO TYPE  MOUNTPOINT
nvme0n1                                          259:0    0   3.5T  0 disk
└─md127                                            9:127  0  10.5T  0 raid5
  └─luksrd5                                      253:9    0  10.5T  0 crypt
    ├─data_pool-aa--ah--stge01--1_sdotconfig.iso 253:10   0     4M  0 lvm
    ├─data_pool-aa--ah--stge01--1_coredisk       253:11   0   120G  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_1    253:12   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_2    253:13   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_root_1         253:14   0    68G  0 lvm
    └─data_pool-aa--ah--stge01--1_root_2         253:15   0    68G  0 lvm
nvme1n1                                          259:1    0   3.5T  0 disk
└─md127                                            9:127  0  10.5T  0 raid5
  └─luksrd5                                      253:9    0  10.5T  0 crypt
    ├─data_pool-aa--ah--stge01--1_sdotconfig.iso 253:10   0     4M  0 lvm
    ├─data_pool-aa--ah--stge01--1_coredisk       253:11   0   120G  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_1    253:12   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_2    253:13   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_root_1         253:14   0    68G  0 lvm
    └─data_pool-aa--ah--stge01--1_root_2         253:15   0    68G  0 lvm
nvme2n1                                          259:2    0   3.5T  0 disk
└─md127                                            9:127  0  10.5T  0 raid5
  └─luksrd5                                      253:9    0  10.5T  0 crypt
    ├─data_pool-aa--ah--stge01--1_sdotconfig.iso 253:10   0     4M  0 lvm
    ├─data_pool-aa--ah--stge01--1_coredisk       253:11   0   120G  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_1    253:12   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_2    253:13   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_root_1         253:14   0    68G  0 lvm
    └─data_pool-aa--ah--stge01--1_root_2         253:15   0    68G  0 lvm
nvme3n1                                          259:3    0   3.5T  0 disk
└─md127                                            9:127  0  10.5T  0 raid5
  └─luksrd5                                      253:9    0  10.5T  0 crypt
    ├─data_pool-aa--ah--stge01--1_sdotconfig.iso 253:10   0     4M  0 lvm
    ├─data_pool-aa--ah--stge01--1_coredisk       253:11   0   120G  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_1    253:12   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_data_pool_2    253:13   0   5.1T  0 lvm
    ├─data_pool-aa--ah--stge01--1_root_1         253:14   0    68G  0 lvm
    └─data_pool-aa--ah--stge01--1_root_2         253:15   0    68G  0 lvm
nvme4n1                                          259:4    0 894.3G  0 disk
└─md126                                            9:126  0 894.3G  0 raid1
  ├─md126p1                                      259:13   0    99M  0 md    /boot/efi
  ├─md126p2                                      259:14   0  1000M  0 md    /boot
  ├─md126p3                                      259:15   0     4M  0 md
  ├─md126p4                                      259:16   0     1M  0 md
  ├─md126p5                                      259:17   0 873.1G  0 md
  │ └─luksroot                                   253:0    0 873.1G  0 crypt
  │   ├─rocky-rl--root                           253:1    0 190.1G  0 lvm   /
  │   ├─rocky-rl--swap                           253:2    0     2G  0 lvm
  │   ├─rocky-rl--tmp                            253:3    0  17.5G  0 lvm   /tmp
  │   ├─rocky-rl--var                            253:4    0 523.9G  0 lvm   /var
  │   ├─rocky-rl--home                           253:5    0  17.5G  0 lvm   /home
  │   ├─rocky-rl--var_tmp                        253:6    0  17.5G  0 lvm   /var/tmp
  │   ├─rocky-rl--var_log                        253:7    0  87.3G  0 lvm   /var/log
  │   └─rocky-rl--var_log_audit                  253:8    0  17.5G  0 lvm   /var/log/audit
  ├─md126p6                                      259:18   0  64.2M  0 md
  └─md126p73                                     259:19   0    20G  0 md
    └─luksnvram                                  253:16   0    20G  0 crypt
nvme5n1                                          259:5    0 894.3G  0 disk
└─md126                                            9:126  0 894.3G  0 raid1
  ├─md126p1                                      259:13   0    99M  0 md    /boot/efi
  ├─md126p2                                      259:14   0  1000M  0 md    /boot
 ├─md126p3                                      259:15   0     4M  0 md
  ├─md126p4                                      259:16   0     1M  0 md
  ├─md126p5                                      259:17   0 873.1G  0 md
  │ └─luksroot                                   253:0    0 873.1G  0 crypt
  │   ├─rocky-rl--root                           253:1    0 190.1G  0 lvm   /
  │   ├─rocky-rl--swap                           253:2    0     2G  0 lvm
  │   ├─rocky-rl--tmp                            253:3    0  17.5G  0 lvm   /tmp
  │   ├─rocky-rl--var                            253:4    0 523.9G  0 lvm   /var
  │   ├─rocky-rl--home                           253:5    0  17.5G  0 lvm   /home
  │   ├─rocky-rl--var_tmp                        253:6    0  17.5G  0 lvm   /var/tmp
  │   ├─rocky-rl--var_log                        253:7    0  87.3G  0 lvm   /var/log
  │   └─rocky-rl--var_log_audit                  253:8    0  17.5G  0 lvm   /var/log/audit
  ├─md126p6                                      259:18   0  64.2M  0 md
  └─md126p73                                     259:19   0    20G  0 md
    └─luksnvram                                  253:16   0    20G  0 crypt

VM を起動します。

[root@aa-ah-bm01 ~]# virsh start aa-ah-stge01-01
Domain 'aa-ah-stge01-01' started

[root@aa-ah-bm01 ~]# virsh list --all
 Id   Name              State
---------------------------------
 1    aa-ah-stge01-01   running

bm01 と bm02 の両方で手順を繰り返します。数分待ってから、OTS クラスタにログインし、クラスタが正常であることを確認します。

aa-ah-stge01::> cluster show
Node                  Health  Eligibility
--------------------- ------- ------------
aa-ah-stge01-01       true    true
aa-ah-stge01-02       true    true
2 entries were displayed.

aa-ah-stge01::> storage failover show
                              Takeover
Node           Partner        Possible State Description
-------------- -------------- -------- -------------------------------------
aa-ah-stge01-01
               aa-ah-stge01-  true     Connected to aa-ah-stge01-02
               02
aa-ah-stge01-02
               aa-ah-stge01-  true     Connected to aa-ah-stge01-01
               01
2 entries were displayed.

Google Distributed Cloud エアギャップ アプライアンス 1.0.x の既知の問題

モニタリング

デバイスの再起動後に Grafana ダッシュボードにアクセスすると、健全なアップストリーム エラーが発生する

ストレージ

OTS VM が正常にシャットダウンされなかった後に自動的に再起動しない

Google Distributed Cloud エアギャップアプライアンス 1.0.x の既知の問題

デバイスの再起動後に Grafana ダッシュボードにアクセスすると、健全なアップストリームエラーが発生する