電気通信事業者の自律性の拡張: Distributed GraphFlow を使用したグラフ ニューラル ネットワークの活用
Brian Naughton
Senior Principal Architect, Telecommunications
Mathieu Guillame-Bert
Software Engineer
※この投稿は米国時間 2026 年 9 月 16 日に、Google Cloud blog に投稿されたものの抄訳です。
通信業界は現在、従来の人間による手動運用から、完全な自律型ネットワーク運用へのパラダイム シフトを経験しています。最新のネットワークは複雑性、異種性、大規模性を増しているため、運用の自動化を実現するには、手動で設定したルールによるルールベースの手法や従来型の機械学習(ML)手法だけでは不十分です。従来の ML は大量の構造化データから微妙なパターンを特定してきめ細かな予測を行うことができる一方、データとそれが示すシステムを理解して推論し、最終的に人間のオペレーターと同じような意思決定を行う能力はありません。
AI エージェントの成長とその推論能力は、この課題に対する有望な解決策となります。しかし、人間のオペレーターが大規模なネットワーク中に作成された数十億のデータポイントに分散した統計情報を直接取り込むことができないのと同様に、AI エージェントにもそのような規模のネットワークを運用する能力はありません。この課題に対処するために電気通信事業者が採用しているのがグラフ ニューラル ネットワーク(GNN)です。GNN は、大量の時間データやリレーショナル データをネイティブに処理するように設計された最新の ML です。電気通信事業者は、GNN を AI エージェントと統合することで、根本原因分析、キャパシティ プランニング、トラフィック予測、What-If 分析、リアルタイムの異常検出などの高度な診断を、これらの分析情報を解釈して正当なアクションを実行するために必要な推論能力と組み合わせて利用できます。この強力な組み合わせにより、ネットワークを TM Forum が定義するレベル 5 の自律性(システムが自律的に動作する状態)に安全に移行させることが可能になります。
この投稿では、Google Cloud の自律型ネットワーク運用フレームワークを強化する 3 つのコンポーネント(データ、ML、AI)を紹介します。




Google 自律型ネットワーク運用フレームワークのアーキテクチャ
基盤: Spanner Graph 上のデジタルツイン
Google Cloud の自律型ネットワーク運用フレームワークの中核となるのは、ネットワーク デジタルツインです。これは、稼働中の通信ネットワークをリアルタイムで継続的にミラーリングし、細部にわたって忠実に再現する仮想レプリカです。静的なモデルではなく、進化し続けるコンポーネントの状態と関係を経時的に捉える、動的な時系列ネットワーク グラフとして表現されます。このアーキテクチャ アプローチにより、オペレーターは過去に「戻って」過去のデータで ML モデルをトレーニングおよび評価できると同時に、レベル 5 の自律性を実現するために必要な基本的な運用知識を AI エージェントに提供できます。デジタルツインは、提案されたネットワーク変更の影響をこのデジタル環境内でシミュレートすることで、信頼性の重要なレイヤを確立し、AI エージェントが自信を持って将来の状態を設計し、ネットワークの問題を自動的に解決できるようにします。
Google Cloud の Spanner Graph はこのデジタルツインをホストするのに最適なサービスですが、その理由は以下のとおりです。
-
スケーラビリティと可用性: Spanner Graph は、最新のアプリケーションに妥協のない基盤を提供します。ネットワークの成長に合わせて事実上無制限にスケーリングでき、RPO と RTO はともに 0 であると同時に、99.999% の可用性を保証します。
-
マルチモデルのサポート: 単一のプラットフォームで複数のデータモデル(リレーショナル、グラフ、ベクトル、全文検索)をサポートしているため、グラフ走査と最近傍ベクトル検索を組み合わせるなど、複雑な構成の構築が可能です。
-
グローバルな整合性: Spanner は、グローバルに整合性のあるネットワーク ビューを提供し、システム開発を簡素化します。
次の図は、ルーター、インターフェース(物理ポート)、VPN(L3VPN サービス インスタンス)、フロー(アクティブなトラフィック セッション)の 4 種類のノードを含むネットワーク トポロジを示しています。これらは、ネットワーク スタック全体をキャプチャする有向エッジによって接続されます。接続の種類としては、ルーターとインターフェース間の物理的封じ込め、インターフェース間の物理リンク、OSPF/iBGP を介したルーター間のコントロール プレーン ピアリング、ルーターと VPN 間のサービス メンバーシップ、フローとインターフェース間およびフローと VPN 間のトラフィック アンカリングが挙げられます。


ネットワーク トポロジの概要
ML レイヤ: Distributed Graph Flow(DGF)
ネットワークの動作と反応を予測するために、デジタルツインは Distributed Graph Flow(DGF)を活用した ML レイヤを利用します。このレイヤは、Spanner Graph 内にホストされている膨大な量の過去の構造化データでトレーニングすることで、重要な予測的分析情報を引き出します。これにより、人間のオペレーターと AI エージェントは、事後的ではなく事前的にネットワークを管理できるようになります。
先日オープンソース化された DGF は、GNN モデリングのエンドツーエンドのライフサイクル全体を管理するために設計された Python ライブラリです。Google CoreML と Google Research によって開発されたこのライブラリにより、Google Cloud の企業クライアントは、Google が 10 年にわたり開発してきた社内ツールと専門知識を直接活用できるようになります。さまざまなエンジニアリング ニーズに対応するこのライブラリは、高度なチーム向けに高性能でコンポーズ可能な低レベル プリミティブを提供するほか、GNN の専門知識なしで迅速な開発を行うためのシンプルな API も提供しています。
たとえば、高レベル API を使用して GraphFlow で GNN モデルをトレーニングして評価する場合、次のように 5 行のコードを記述するだけで済みます。
(具体的な例については、入門チュートリアルをご覧ください)
DGF は、自律型ネットワーク運用要件に直接マッピングされる最上位概念を提供します。


ユースケース
DGF と GNN を活用する電気通信事業者は、複数の高度なユースケースを通じて、事後保守から予防保守へと移行できます。
-
異常検出: GNN は、過去のパターンと現在の状態をカプセル化したノードとエッジのエンベディングを生成します。異常なエンベディングは、サービスの低下につながる前に調査対象としてフラグが立てられます。
-
根本原因分析(RCA): DGF は、特定の郵便番号での「接続失敗」など、インシデントに関連するネットワーク インスタンスのみを含む特定のサブグラフを出力できます。グローバル ネットワーク全体をスキャンする必要性がなくなるため、トラブルシューティング エージェントは、分析を高速で実行できます。
-
予測メンテナンス: システムは、高速移動する機器の「ハンドオーバー障害」など、デバイスの障害やエッジの切断の可能性を予測し、プロアクティブなロード バランシングやルート変更を可能にします。さらに、エージェントを組み合わせることで、「人間関与型」や「人間参加型」を採用して修復アクションを自動化できます。
-
What-If 分析: GNN を使用すると、電気通信事業者はファイバーの切断、トラフィックの急増、デバイス構成の変更などのシナリオをシミュレートできます。GNN は、トポロジカルな依存関係をモデル化することで、こうした局所的な変化がネットワーク全体にどのように伝播するかを予測できるため、エンジニアはリスクのないデジタル環境で復元力をテストし、緩和戦略を評価できます。
シナリオ: GNN と DGF を使用した根本原因分析
デジタルツインを作成したら(サンプルコード)、以下の簡単な 5 ステップのプロセスで、GNN と DGF を使用した根本原因分析(RCA)検出を実装できます。
-
デジタルツインに接続する: DGF Spanner Graph コネクタ(dgf.io.read_spanner_graph)を使用して、Spanner Graph のデジタルツインから DGF 環境にネットワーク トポロジを直接読み込みます。
-
教師ありノード(またはエッジ)予測モデルをトレーニングする: トレーニング データと目的に応じて、教師ありノード予測モデルをトレーニングしてターゲット ノードの特徴を予測するか、エッジ予測モデルをトレーニングして根本原因エンティティ ノードと影響を受けるエンティティ ノード間のエッジを予測します。指定されたサンプルデータに対して、高レベルの
dgf.learning.train_node_modelAPI を使用して、教師ありノード予測モデルをトレーニングします。 -
ノード予測モデルを使用して根本原因ノードを予測する: ノード予測モデルを直接使用して、異常のあるノードへの影響スコアを予測できます。異常の影響を受けるエンティティ ノードのうち、予測される影響スコアが最も高いものが根本原因の最有力候補となります。
-
Gemini Enterprise Agent Platform(旧称 Vertex AI)にデプロイする: モデルをエクスポートして Gemini Enterprise エンドポイントにホストし、スケーラブルかつ低レイテンシの予測を可能にします。
-
リアルタイム推論: 異常の日付を入力として、推論エンドポイントに予測呼び出しを行います。エンドポイントは、予測された根本原因のエンティティ ノードを返します。
使ってみる
Distributed Graph Flow を使用した GNN のネットワーク運用への統合は、単なる技術的なアップグレードではなく、通信業界の重要な進化です。GNN を活用した自律型フレームワークに移行することで、電気通信事業者はサービス停止時間を大幅に短縮し、リアルタイムで容量を最適化できます。さらに、最終的には運用効率の向上を通じて優れたカスタマー エクスペリエンスを提供することにもつながります。
独自のインテリジェント ネットワーク アプリケーションの構築を始めるには、スケーラブルな GNN トレーニングと推論に不可欠なプリミティブを提供する Distributed GraphFlow(DGF)ライブラリをご覧ください。実践演習を行う場合は、コードサンプルの手順に沿って進めます。また、当社が最近受賞したビジネスアウェア GNN ヒーリング ネットワークに関するムーンショット プロジェクトもご覧ください。自己最適化自律ネットワークに対する Google のアプローチについては、こちらのホワイトペーパーをご確認ください。

