Cluster Director

Orchestration de l'IA pour les clusters Kubernetes et Slurm

Configurez, déployez et gérez facilement des clusters d'IA ou HPC. Bénéficiez des avantages de l'automatisation d'une infrastructure gérée, tout en gardant le contrôle.

Fonctionnalités

Un service d'infrastructure géré pour Slurm et Kubernetes

Vous pouvez accéder aux fonctionnalités de Cluster Director de deux manières :

  • Directement via le plan de contrôle, l'API ou la CLI pour les jobs utilisant Slurm ou des outils d'orchestration personnalisés. Cet environnement unifié s'intègre également à Google Kubernetes Engine (GKE), ce qui vous offre une interface unique et puissante pour créer et superviser les clusters Slurm et Kubernetes.
  • Dans GKE ou Compute Engine. Dans ces contextes, vous pouvez accéder aux fonctionnalités de Cluster Director tout en travaillant dans un environnement familier.

Planification simplifiée des jobs

Cluster Director fournit une planification des jobs tolérante aux pannes et hautement évolutive prête à l'emploi. Le nœud du contrôleur est géré automatiquement. Vous pouvez facilement configurer les nœuds de connexion de votre cluster, y compris le type de machine, l'image source et la taille du disque de démarrage.

Gestion intuitive des clusters

Le plan de contrôle vous permet de créer, de mettre à jour et de supprimer facilement votre cluster. Il simplifie également la mise en réseau en vous permettant de déployer des clusters sur un réseau VPC dédié nouveau ou existant. Pour le stockage, vous pouvez créer et associer une instance Filestore ou Google Cloud Managed Lustre, ou vous connecter à un bucket Cloud Storage existant.

Placement tenant compte de la topologie

Pour optimiser les performances, Cluster Director est étroitement intégré à la topologie du réseau de Google. Cela garantit que les VM d'un cluster sont placées à proximité physique les unes des autres, ce qui réduit la latence du réseau. C'est un point essentiel pour les charges de travail d'entraînement distribué hautement synchronisées.

Visibilité et insights complets

Le tableau de bord d'observabilité intégré de Cluster Director offre une vue claire de l'état, de l'utilisation et des performances de votre cluster. Vous pouvez ainsi comprendre rapidement le comportement de votre système et diagnostiquer les problèmes en un seul endroit. Le tableau de bord est conçu pour s'adapter facilement à des dizaines de milliers de VM.

Cycles d'entraînement sans interruption

Bénéficiez d'une fiabilité de base en demandant une fiche d'état, ainsi que de fonctionnalités supplémentaires telles que les points de contrôle à trois niveaux et les commandes de maintenance avancées pour optimiser l'efficacité de l'entraînement.

Fonctionnement

Les utilisateurs de l'infrastructure d'IA peuvent passer des semaines à configurer leur environnement avant de procéder au déploiement. Ce n'est pourtant pas une fatalité. Découvrez à quoi vous attendre en tant que nouvel utilisateur de Cluster Director, de la préparation de l'environnement au déploiement, en passant par la transformation des interruptions en événements gérés.

Qu'est-ce que Cluster Director ?
Qu'est-ce que Cluster Director ?
Utilisations courantes

Qualification et préparation avant le déploiement

Concevoir une base fiable et hautes performances

Avant de lancer un cluster, vous devez vous assurer que vos accélérateurs seront performants et fiables dès le départ. Cluster Director fournit un placement intelligent et tenant compte de la topologie pour vos TPU et GPU.

Chaque composant de calcul, de mise en réseau et de stockage est validé par un processus de qualification rigoureux en plusieurs étapes, consigné dans une fiche d'état détaillée qui fournit la preuve ultime de la qualité et de l'aptitude.

Cluster Director, jour 0
Concevoir une base fiable et hautes performances

Avant de lancer un cluster, vous devez vous assurer que vos accélérateurs seront performants et fiables dès le départ. Cluster Director fournit un placement intelligent et tenant compte de la topologie pour vos TPU et GPU.

Chaque composant de calcul, de mise en réseau et de stockage est validé par un processus de qualification rigoureux en plusieurs étapes, consigné dans une fiche d'état détaillée qui fournit la preuve ultime de la qualité et de l'aptitude.

Cluster Director, jour 0

Déployer un cluster

Déployez votre cluster en quelques minutes au lieu de plusieurs jours

Simplifiez la configuration d'un cluster GKE ou Slurm. Commencez par des architectures de référence validées, choisissez vos ressources d'accélération et de stockage, et laissez Cluster Director s'occuper du reste.

Déployez un environnement entièrement optimisé à n'importe quelle échelle grâce aux bonnes pratiques de Google en matière de performances et de topologie, et réduisez considérablement le délai de déploiement.

Déploiement sur Cluster Director
Déployez votre cluster en quelques minutes au lieu de plusieurs jours

Simplifiez la configuration d'un cluster GKE ou Slurm. Commencez par des architectures de référence validées, choisissez vos ressources d'accélération et de stockage, et laissez Cluster Director s'occuper du reste.

Déployez un environnement entièrement optimisé à n'importe quelle échelle grâce aux bonnes pratiques de Google en matière de performances et de topologie, et réduisez considérablement le délai de déploiement.

Déploiement sur Cluster Director

Gérer votre cluster

Gestion et observabilité des clusters

Faites le lien entre l'infrastructure brute et l'exécution d'un job avec une seule console pour votre cluster Slurm. Obtenez une vue topologique de l'état et de l'utilisation des clusters.

En cas de problème, utilisez l'observabilité centrée sur les jobs pour corréler instantanément les métriques sur l'ensemble de la pile avec un seul ID de job. Vous pouvez ainsi identifier rapidement la cause de tout ralentissement en quelques clics, au lieu de passer des heures à tâtonner.

Gestion et observabilité des clusters
Gestion et observabilité des clusters

Faites le lien entre l'infrastructure brute et l'exécution d'un job avec une seule console pour votre cluster Slurm. Obtenez une vue topologique de l'état et de l'utilisation des clusters.

En cas de problème, utilisez l'observabilité centrée sur les jobs pour corréler instantanément les métriques sur l'ensemble de la pile avec un seul ID de job. Vous pouvez ainsi identifier rapidement la cause de tout ralentissement en quelques clics, au lieu de passer des heures à tâtonner.

Gestion et observabilité des clusters

Détecter les problèmes liés au matériel

Capacités d'autoréparation

Cluster Director vous permet de détecter, de corriger et de résoudre de manière proactive les problèmes liés à l'infrastructure.

Par exemple, vous bénéficiez de vérifications d'état permanentes, de la détection des retardataires et d'un outil de prédiction de l'état basé sur l'IA pour identifier les problèmes de manière proactive.

Capacités d'autoréparation
Capacités d'autoréparation

Cluster Director vous permet de détecter, de corriger et de résoudre de manière proactive les problèmes liés à l'infrastructure.

Par exemple, vous bénéficiez de vérifications d'état permanentes, de la détection des retardataires et d'un outil de prédiction de l'état basé sur l'IA pour identifier les problèmes de manière proactive.

Capacités d'autoréparation

Tarification

Fonctionnement des tarifs de Cluster DirectorL'utilisation de Cluster Director n'entraîne pas de frais supplémentaires. Vous ne payez que les ressources Google Cloud sous-jacentes utilisées par vos clusters, telles que le calcul, le stockage et la mise en réseau.
ServicesDescriptionPrix (USD)

Démarrer sans frais

Les nouveaux utilisateurs bénéficient de 300 $ de crédits d'essai gratuit à utiliser sous 90 jours.

Sans frais

Le niveau gratuit de Compute Engine fournit une instance de VM e2-micro, jusqu'à 30 Go de stockage sur disque persistant standard et jusqu'à 1 Go de transferts de données sortants par mois.

Sans frais

Instances de VM, stockage et mise en réseau

Pour en savoir plus, consultez les tarifs de Compute Engine.

Payez uniquement pour les services que vous utilisez, sans frais initiaux ni de résiliation. Les tarifs varient en fonction du produit et de l'utilisation.

À partir de

0,01 $

(e2-micro, paiement à l'usage)

Fonctionnement des tarifs de Cluster Director

L'utilisation de Cluster Director n'entraîne pas de frais supplémentaires. Vous ne payez que les ressources Google Cloud sous-jacentes utilisées par vos clusters, telles que le calcul, le stockage et la mise en réseau.

Démarrer sans frais

Description

Les nouveaux utilisateurs bénéficient de 300 $ de crédits d'essai gratuit à utiliser sous 90 jours.

Prix (USD)

Sans frais

Le niveau gratuit de Compute Engine fournit une instance de VM e2-micro, jusqu'à 30 Go de stockage sur disque persistant standard et jusqu'à 1 Go de transferts de données sortants par mois.

Description

Sans frais

Instances de VM, stockage et mise en réseau

Description

Pour en savoir plus, consultez les tarifs de Compute Engine.

Payez uniquement pour les services que vous utilisez, sans frais initiaux ni de résiliation. Les tarifs varient en fonction du produit et de l'utilisation.

Prix (USD)

Starting at

0,01 $

(e2-micro, paiement à l'usage)

Simulateur de coût

Estimez vos frais mensuels, y compris les frais de gestion des clusters.

Besoin d'aide ?

Échangez avec nous en ligne, appelez-nous directement ou demandez à être rappelé.

Envie d'essayer ?

Inscrivez-vous à un essai sans frais et recevez 300 $ de crédits à utiliser sous 90 jours.

Vous avez un projet volumineux ?

Créer un cluster Slurm et s'y connecter dans Cluster Director à l'aide d'un modèle d'entraînement d'IA/de ML

Choisissez un parcours de formation, développez vos compétences et validez vos connaissances avec Google Cloud Skills Boost

Obtenir une assistance technique ou envoyer des commentaires sur le produit

  • Produits Google Cloud
  • Parcourez plus de 100 produits. Les nouveaux clients bénéficient de 300 $ de crédits gratuits pour exécuter, tester et déployer des charges de travail. Tous les clients peuvent utiliser plus de 25 produits gratuitement, dans les limites mensuelles spécifiées.
Google Cloud