Annonces concernant les puces personnalisées de Google : les TPU Ironwood et les nouvelles VM Axion.
Configurez, déployez et gérez facilement des clusters d'IA ou HPC. Bénéficiez des avantages de l'automatisation d'une infrastructure gérée, tout en gardant le contrôle.
Fonctionnalités
Vous pouvez accéder aux fonctionnalités de Cluster Director de deux manières :
Cluster Director fournit une planification des jobs tolérante aux pannes et hautement évolutive prête à l'emploi. Le nœud du contrôleur est géré automatiquement. Vous pouvez facilement configurer les nœuds de connexion de votre cluster, y compris le type de machine, l'image source et la taille du disque de démarrage.
Le plan de contrôle vous permet de créer, de mettre à jour et de supprimer facilement votre cluster. Il simplifie également la mise en réseau en vous permettant de déployer des clusters sur un réseau VPC dédié nouveau ou existant. Pour le stockage, vous pouvez créer et associer une instance Filestore ou Google Cloud Managed Lustre, ou vous connecter à un bucket Cloud Storage existant.
Pour optimiser les performances, Cluster Director est étroitement intégré à la topologie du réseau de Google. Cela garantit que les VM d'un cluster sont placées à proximité physique les unes des autres, ce qui réduit la latence du réseau. C'est un point essentiel pour les charges de travail d'entraînement distribué hautement synchronisées.
Le tableau de bord d'observabilité intégré de Cluster Director offre une vue claire de l'état, de l'utilisation et des performances de votre cluster. Vous pouvez ainsi comprendre rapidement le comportement de votre système et diagnostiquer les problèmes en un seul endroit. Le tableau de bord est conçu pour s'adapter facilement à des dizaines de milliers de VM.
Bénéficiez d'une fiabilité de base en demandant une fiche d'état, ainsi que de fonctionnalités supplémentaires telles que les points de contrôle à trois niveaux et les commandes de maintenance avancées pour optimiser l'efficacité de l'entraînement.
Fonctionnement
Les utilisateurs de l'infrastructure d'IA peuvent passer des semaines à configurer leur environnement avant de procéder au déploiement. Ce n'est pourtant pas une fatalité. Découvrez à quoi vous attendre en tant que nouvel utilisateur de Cluster Director, de la préparation de l'environnement au déploiement, en passant par la transformation des interruptions en événements gérés.
Avant de lancer un cluster, vous devez vous assurer que vos accélérateurs seront performants et fiables dès le départ. Cluster Director fournit un placement intelligent et tenant compte de la topologie pour vos TPU et GPU.
Chaque composant de calcul, de mise en réseau et de stockage est validé par un processus de qualification rigoureux en plusieurs étapes, consigné dans une fiche d'état détaillée qui fournit la preuve ultime de la qualité et de l'aptitude.
Avant de lancer un cluster, vous devez vous assurer que vos accélérateurs seront performants et fiables dès le départ. Cluster Director fournit un placement intelligent et tenant compte de la topologie pour vos TPU et GPU.
Chaque composant de calcul, de mise en réseau et de stockage est validé par un processus de qualification rigoureux en plusieurs étapes, consigné dans une fiche d'état détaillée qui fournit la preuve ultime de la qualité et de l'aptitude.
Simplifiez la configuration d'un cluster GKE ou Slurm. Commencez par des architectures de référence validées, choisissez vos ressources d'accélération et de stockage, et laissez Cluster Director s'occuper du reste.
Déployez un environnement entièrement optimisé à n'importe quelle échelle grâce aux bonnes pratiques de Google en matière de performances et de topologie, et réduisez considérablement le délai de déploiement.
Simplifiez la configuration d'un cluster GKE ou Slurm. Commencez par des architectures de référence validées, choisissez vos ressources d'accélération et de stockage, et laissez Cluster Director s'occuper du reste.
Déployez un environnement entièrement optimisé à n'importe quelle échelle grâce aux bonnes pratiques de Google en matière de performances et de topologie, et réduisez considérablement le délai de déploiement.
Faites le lien entre l'infrastructure brute et l'exécution d'un job avec une seule console pour votre cluster Slurm. Obtenez une vue topologique de l'état et de l'utilisation des clusters.
En cas de problème, utilisez l'observabilité centrée sur les jobs pour corréler instantanément les métriques sur l'ensemble de la pile avec un seul ID de job. Vous pouvez ainsi identifier rapidement la cause de tout ralentissement en quelques clics, au lieu de passer des heures à tâtonner.
Faites le lien entre l'infrastructure brute et l'exécution d'un job avec une seule console pour votre cluster Slurm. Obtenez une vue topologique de l'état et de l'utilisation des clusters.
En cas de problème, utilisez l'observabilité centrée sur les jobs pour corréler instantanément les métriques sur l'ensemble de la pile avec un seul ID de job. Vous pouvez ainsi identifier rapidement la cause de tout ralentissement en quelques clics, au lieu de passer des heures à tâtonner.
Cluster Director vous permet de détecter, de corriger et de résoudre de manière proactive les problèmes liés à l'infrastructure.
Par exemple, vous bénéficiez de vérifications d'état permanentes, de la détection des retardataires et d'un outil de prédiction de l'état basé sur l'IA pour identifier les problèmes de manière proactive.
Cluster Director vous permet de détecter, de corriger et de résoudre de manière proactive les problèmes liés à l'infrastructure.
Par exemple, vous bénéficiez de vérifications d'état permanentes, de la détection des retardataires et d'un outil de prédiction de l'état basé sur l'IA pour identifier les problèmes de manière proactive.
Tarification
| Fonctionnement des tarifs de Cluster Director | L'utilisation de Cluster Director n'entraîne pas de frais supplémentaires. Vous ne payez que les ressources Google Cloud sous-jacentes utilisées par vos clusters, telles que le calcul, le stockage et la mise en réseau. | |
|---|---|---|
| Services | Description | Prix (USD) |
Démarrer sans frais | Les nouveaux utilisateurs bénéficient de 300 $ de crédits d'essai gratuit à utiliser sous 90 jours. | Sans frais |
Le niveau gratuit de Compute Engine fournit une instance de VM e2-micro, jusqu'à 30 Go de stockage sur disque persistant standard et jusqu'à 1 Go de transferts de données sortants par mois. | Sans frais | |
Instances de VM, stockage et mise en réseau | Pour en savoir plus, consultez les tarifs de Compute Engine. Payez uniquement pour les services que vous utilisez, sans frais initiaux ni de résiliation. Les tarifs varient en fonction du produit et de l'utilisation. | À partir de 0,01 $ (e2-micro, paiement à l'usage) |
Fonctionnement des tarifs de Cluster Director
L'utilisation de Cluster Director n'entraîne pas de frais supplémentaires. Vous ne payez que les ressources Google Cloud sous-jacentes utilisées par vos clusters, telles que le calcul, le stockage et la mise en réseau.
Démarrer sans frais
Les nouveaux utilisateurs bénéficient de 300 $ de crédits d'essai gratuit à utiliser sous 90 jours.
Sans frais
Le niveau gratuit de Compute Engine fournit une instance de VM e2-micro, jusqu'à 30 Go de stockage sur disque persistant standard et jusqu'à 1 Go de transferts de données sortants par mois.
Sans frais
Instances de VM, stockage et mise en réseau
Pour en savoir plus, consultez les tarifs de Compute Engine.
Payez uniquement pour les services que vous utilisez, sans frais initiaux ni de résiliation. Les tarifs varient en fonction du produit et de l'utilisation.
Starting at
0,01 $
(e2-micro, paiement à l'usage)