Cluster Director

Organización de IA para clústeres de Kubernetes y Slurm

Configura, implementa y administra fácilmente clústeres de IA o HPC. Obtén los beneficios de la automatización de la infraestructura administrada sin limitar tu control.

Funciones

Un servicio de infraestructura administrado para Slurm y Kubernetes

Puedes acceder a las capacidades de Cluster Director de dos maneras:

  • Directamente a través del plano de control, la API o la CLI para trabajos que usan Slurm o los orquestadores personalizados. Este entorno unificado también se integra con Google Kubernetes Engine (GKE), lo que te brinda una interfaz única y potente para crear y supervisar clústeres de Slurm y Kubernetes.
  • En GKE o Compute Engine. En estos contextos, puedes acceder a las capacidades de Cluster Director mientras trabajas desde un entorno familiar.

Programación de trabajos simplificada

Cluster Director proporciona programación de trabajos tolerante a errores y altamente escalable de forma inmediata. El nodo del controlador se administra por ti. Puedes configurar fácilmente los nodos de acceso para tu clúster, incluidos el tipo de máquina, la imagen de origen y el tamaño del disco de arranque.

Administración intuitiva de clústeres

Usa el plano de control para crear, actualizar y borrar tu clúster con facilidad. También simplifica las redes, ya que te permite implementar clústeres en una red de VPC nueva y diseñada específicamente o en una existente. Para el almacenamiento, puedes crear y conectar una nueva instancia de Filestore o Google Cloud Managed Lustre, o conectarte a un bucket de Cloud Storage existente.

Colocación con reconocimiento de topología

Para maximizar el rendimiento, Cluster Director está profundamente integrado en la topología de red de Google. Esto garantiza que las VMs dentro de un clúster se coloquen en una proximidad física cercana, lo que reduce la latencia de red, algo fundamental para las cargas de trabajo de entrenamiento distribuido altamente sincronizadas.

Visibilidad y estadísticas integrales

El panel de observabilidad integrado de Cluster Director proporciona una vista clara del estado, la utilización y el rendimiento de tu clúster, por lo que puedes comprender rápidamente el comportamiento de tu sistema y diagnosticar problemas en un solo lugar. El panel está diseñado para escalar fácilmente a decenas de miles de VMs.

Ejecuciones de entrenamiento sin interrupciones

Obtén confiabilidad básica solicitando un informe de estado, además de funciones adicionales como el control de 3 niveles y controles de mantenimiento avanzados para ayudar a maximizar la eficiencia del entrenamiento.

Cómo funciona

Los usuarios de la infraestructura de IA pueden pasar semanas luchando con los parámetros de configuración antes de presionar “implementar”, pero no tiene que ser así. Descubre qué puedes esperar como usuario principiante de Cluster Director, desde la preparación de un entorno hasta la implementación y la conversión de interrupciones en eventos administrados.

¿Qué es Cluster Director?
¿Qué es Cluster Director?
Usos comunes

Calificación y preparación previas a la implementación

Diseña una base confiable y de alto rendimiento

Antes de iniciar un clúster, necesitas asegurarte de que tus aceleradores funcionen de manera eficiente y confiable desde el principio. Cluster Director proporciona una colocación inteligente y con reconocimiento de la topología para tus TPU y GPU.

Cada componente de procesamiento, redes y almacenamiento se valida a través de un proceso de calificación riguroso y de varias etapas, que se captura en una lista de componentes en buen estado detallada que proporciona la prueba definitiva de calidad y preparación.

Cluster Director Day 0
Diseña una base confiable y de alto rendimiento

Antes de iniciar un clúster, necesitas asegurarte de que tus aceleradores funcionen de manera eficiente y confiable desde el principio. Cluster Director proporciona una colocación inteligente y con reconocimiento de la topología para tus TPU y GPU.

Cada componente de procesamiento, redes y almacenamiento se valida a través de un proceso de calificación riguroso y de varias etapas, que se captura en una lista de componentes en buen estado detallada que proporciona la prueba definitiva de calidad y preparación.

Cluster Director Day 0

Implementa tu clúster

Implementa tu clúster en minutos, no en días

Elimina la complejidad de configurar un clúster de GKE o Slurm. Comienza con arquitecturas de referencia validadas, elige tus recursos de acelerador y almacenamiento, y deja que Cluster Director haga el resto.

Implementa un entorno totalmente optimizado a cualquier escala con las prácticas recomendadas de Google para el rendimiento y la topología integradas, lo que reduce drásticamente el tiempo de implementación.

Implementación en Cluster Director
Implementa tu clúster en minutos, no en días

Elimina la complejidad de configurar un clúster de GKE o Slurm. Comienza con arquitecturas de referencia validadas, elige tus recursos de acelerador y almacenamiento, y deja que Cluster Director haga el resto.

Implementa un entorno totalmente optimizado a cualquier escala con las prácticas recomendadas de Google para el rendimiento y la topología integradas, lo que reduce drásticamente el tiempo de implementación.

Implementación en Cluster Director

Administra tu clúster

Administración y observabilidad de clústeres

Cierra la brecha entre la infraestructura sin procesar y la ejecución de un trabajo con una sola consola para tu clúster de Slurm. Obtén una vista de topología del estado y la utilización del clúster.

Cuando surgen problemas, usa la observabilidad centrada en el trabajo para correlacionar instantáneamente las métricas en todo el full stack con un solo ID de trabajo, lo que convierte horas de conjeturas en unos pocos clics y permite identificar rápidamente la causa raíz de cualquier desaceleración.

Administración y observabilidad de clústeres
Administración y observabilidad de clústeres

Cierra la brecha entre la infraestructura sin procesar y la ejecución de un trabajo con una sola consola para tu clúster de Slurm. Obtén una vista de topología del estado y la utilización del clúster.

Cuando surgen problemas, usa la observabilidad centrada en el trabajo para correlacionar instantáneamente las métricas en todo el full stack con un solo ID de trabajo, lo que convierte horas de conjeturas en unos pocos clics y permite identificar rápidamente la causa raíz de cualquier desaceleración.

Administración y observabilidad de clústeres

Detectar problemas de hardware

Capacidades de autorreparación

Puedes usar Cluster Director para detectar, corregir y recuperarte de problemas de infraestructura de forma proactiva.

Por ejemplo, obtienes verificaciones de estado siempre activas, detección de rezagados y un predictor de estado basado en IA para identificar problemas de forma proactiva.

Capacidades de autorreparación
Capacidades de autorreparación

Puedes usar Cluster Director para detectar, corregir y recuperarte de problemas de infraestructura de forma proactiva.

Por ejemplo, obtienes verificaciones de estado siempre activas, detección de rezagados y un predictor de estado basado en IA para identificar problemas de forma proactiva.

Capacidades de autorreparación

Precios

Cómo funcionan los precios de Cluster DirectorNo se aplican cargos adicionales por usar Cluster Director. Solo pagas por los recursos subyacentes de Google Cloud que usan tus clústeres, como procesamiento, almacenamiento y redes.
ServiciosDescripciónPrecio (USD)

Iniciar prueba gratuita

Los usuarios nuevos obtienen $300 en créditos de prueba gratuita que pueden usar en un plazo de 90 días.

Gratis

El nivel gratuito de Compute Engine te brinda una instancia de VM e2-micro, hasta 30 GB de almacenamiento de disco persistente estándar y hasta 1 GB de transferencias de datos salientes por mes.

Gratis

Instancias de VM, almacenamiento y redes

Revisa nuestros precios de Compute Engine para obtener más información.

Solo pagas por los servicios que usas. Sin tarifas por adelantado. Sin tarifas de rescisión. Los precios varían según el producto y el uso.

A partir de

$0.01

(e2-micro, pago por uso)

Cómo funcionan los precios de Cluster Director

No se aplican cargos adicionales por usar Cluster Director. Solo pagas por los recursos subyacentes de Google Cloud que usan tus clústeres, como procesamiento, almacenamiento y redes.

Iniciar prueba gratuita

Descripción

Los usuarios nuevos obtienen $300 en créditos de prueba gratuita que pueden usar en un plazo de 90 días.

Precio (USD)

Gratis

El nivel gratuito de Compute Engine te brinda una instancia de VM e2-micro, hasta 30 GB de almacenamiento de disco persistente estándar y hasta 1 GB de transferencias de datos salientes por mes.

Descripción

Gratis

Instancias de VM, almacenamiento y redes

Descripción

Revisa nuestros precios de Compute Engine para obtener más información.

Solo pagas por los servicios que usas. Sin tarifas por adelantado. Sin tarifas de rescisión. Los precios varían según el producto y el uso.

Precio (USD)

Starting at

$0.01

(e2-micro, pago por uso)

Calculadora de precios

Estima tus cargos mensuales, incluidas las tarifas por administración de clústeres.

¿Necesitas ayuda?

Chatea con nosotros en línea, llámanos directamente o solicita que te devuelvan la llamada.

¿Estás listo para probarlo?

Regístrate para obtener una prueba gratuita y recibe $300 en créditos para usar en un plazo de 90 días.

¿Tienes un proyecto grande?

Crea un clúster de Slurm en Cluster Director y conéctate a él con una plantilla de entrenamiento de IA/AA

Elige una ruta de aprendizaje, desarrolla tus habilidades y valida tus conocimientos con Google Cloud Skills Boost.

Obtén asistencia técnica o proporciona comentarios sobre el producto

Google Cloud