Aller au contenu principal

Ray sur AI Runtime

info

Aperçu

Cette fonctionnalité est en Aperçu public.

remarque

Cette page traite de Ray sur AI Runtime. Si vous utilisez Ray sur un compute classique Databricks avec Databricks Runtime ML, consultez Ray on Databricks.

Ray est un framework open source permettant de mettre à l'échelle les charges de travail Python. Vous pouvez créer des clusters Ray et exécuter des applications Ray sur AI Runtime, en utilisant un compute GPU serverless qui gère automatiquement le provisionnement de l'infrastructure.

Utiliser Ray dans des Notebooks

Lorsque votre notebook est connecté au compute GPU AI Runtime, utilisez ray_init() du package serverless_gpu pour start Ray sur le compute associé :

Python
from serverless_gpu import ray_init

ray_init()

ray_init() configure le tableau de bord Ray pour un accès via le proxy du driver Databricks et affiche l'URL du tableau de bord dans la sortie du notebook. Utilisez le tableau de bord pour inspecter les jobs, les tâches et l'utilisation des ressources Ray pendant l'exécution de votre code.

remarque

ray_init() nécessite la version 5 ou ultérieure de l'environnement. Databricks AI v6 inclut Ray. Si vous utilisez Standard v6, installez Ray avant d'appeler ray_init().

Exemples de Notebook

Exemple

Description

Ray Core hello world

Soumettez des tâches GPU asynchrones sur le compute attaché, inspectez la planification dans le tableau de bord Ray et récupérez les résultats.

Inférence par batch Qwen2.5-32B avec Ray Data et vLLM

Exécutez une inférence par batch multilingue avec huit réplicas vLLM persistants sur 8 GPU H100 et enregistrez les résultats au format Parquet dans Unity Catalog.

Exemple

Description

Ray Core hello world

Soumettez des tâches GPU asynchrones sur le compute attaché, inspectez la planification dans le tableau de bord Ray et récupérez les résultats.

Inférence par batch Qwen2.5-32B avec Ray Data et vLLM

Exécutez une inférence par batch multilingue avec huit réplicas vLLM persistants sur 8 GPU H100 et enregistrez les résultats au format Parquet dans Unity Catalog.

Utiliser Ray avec la CLI du Runtime IA

Le CLI AI Runtime prend en charge Ray dans des configurations à nœud unique et à nœuds multiples. Incluez un script de bootstrap sous le command de la charge de travail, qui start le cluster Ray et coordonne les nœuds head et Worker lors du lancement de la charge de travail. Les exemples Ray hello world illustrent ce modèle.

Le Runtime IA prend en charge les bibliothèques principales de Ray, notamment Ray Core, Ray Data, Ray Train et Ray Tune. Avec l'environnement Standard, ajoutez ray ou l'extra pertinent (ray[data], ray[train] ou ray[tune]) aux dépendances de votre charge de travail. L'environnement Databricks AI inclut Ray.

Exemples de CLI

Exemple

Description

Exemples Ray hello world

Exemples minimaux à nœud unique et à nœuds multiples pour Ray Core, Ray Train, Ray Data et Ray Tune, incluant le modèle de bootstrap de cluster.

Entraînement distribué avec Ray Train

Ajustez un grand modèle de langage sur plusieurs nœuds à l’aide de Ray Train et PyTorch.

Inférence par batch avec Ray Data et vLLM

Exécutez une inférence batch à grande échelle en utilisant Ray Data pour le chargement de données distribué et vLLM pour une mise à disposition efficace des modèles.

Recherche d'hyperparamètres avec Ray Tune

Rechercher des hyperparamètres d’affinement LoRA pour Qwen2.5 avec Ray Tune, en exécutant un essai par GPU et en arrêtant prématurément les essais peu performants avec le planificateur ASHA.

Exemple

Description

Exemples Ray hello world

Exemples minimaux à nœud unique et à nœuds multiples pour Ray Core, Ray Train, Ray Data et Ray Tune, incluant le modèle de bootstrap de cluster.

Entraînement distribué avec Ray Train

Ajustez un grand modèle de langage sur plusieurs nœuds à l’aide de Ray Train et PyTorch.

Inférence par batch avec Ray Data et vLLM

Exécutez une inférence batch à grande échelle en utilisant Ray Data pour le chargement de données distribué et vLLM pour une mise à disposition efficace des modèles.

Recherche d'hyperparamètres avec Ray Tune

Rechercher des hyperparamètres d’affinement LoRA pour Qwen2.5 avec Ray Tune, en exécutant un essai par GPU et en arrêtant prématurément les essais peu performants avec le planificateur ASHA.