Aller au contenu principal

Se connecter à Runtime depuis un notebook

info

Aperçu

Cette fonctionnalité est en aperçu public.

La connexion d’un notebook à Runtime est le principal moyen d’exécuter des charges de travail d’entraînement et d’affinement. Vous développez de manière interactive sur un GPU, puis planifiez le même notebook en tant que job récurrent lorsqu’il est prêt pour la production.

astuce

Principaux points à retenir

  • Connectez un notebook à Serverless GPU pour développer de manière interactive sur un GPU, sans configuration de cluster.
  • Planifiez le même notebook en tant que Job récurrent à partir de l’interface utilisateur du notebook, de l’API Jobs ou de Declarative Automation Bundles.
  • Pour l’entraînement multi-GPU à partir d’un notebook, consultez Entraînement distribué dans les notebooks.
astuce

Autres moyens de connexion

Cette page traite des notebooks. Pour accéder à AI Runtime d'une autre manière, consultez Se connecter à partir d'un IDE via un tunnel SSH, soumettez des jobs depuis votre ordinateur portable avec Utiliser la CLI Databricks avec AI Runtime, ou exécutez Ray. Pour industrialiser du code d'entraînement (et non un notebook) avec Declarative Automation Bundles, consultez Industrialiser des charges de travail d'entraînement.

Se connecter à un notebook​

C'est la principale façon d'utiliser l'AI Runtime. Pour connecter votre Notebook et configurer l'environnement :

  1. Depuis un Notebook, cliquez sur le menu déroulant du compute en haut et sélectionnez **Serverless GPU**.

    Menu déroulant du compute du notebook avec Serverless GPU sélectionné comme compute pour un notebook AI Runtime.

  2. Cliquez sur l'Icône de l'environnement. pour ouvrir le panneau latéral Environnement .

  3. Sélectionnez un accélérateur dans le champ Accelerator . Pour les charges de travail d’entraînement distribué, sélectionnez 8xH100 ou 8xB300 . Consultez Hardware options pour obtenir des conseils sur le choix d’un accélérateur.

  4. Sélectionnez Standard v6 pour l'environnement Standard, ou AI v6 pour l'environnement AI, dans le champ Base environment .

  5. Cliquez sur Appliquer , puis Confirmer que vous souhaitez appliquer le Runtime IA à votre environnement de notebook.

    Le panneau latéral de l’environnement affichant les champs Accélérateur et Socle d’environnement pour un notebook AI Runtime.

remarque

La connexion à votre compute se termine automatiquement après 60 minutes d'inactivité.

astuce

Pour les opérations qui ne nécessitent pas de GPU (par exemple, le clonage d'un repository Git, la conversion de formats de données ou l'analyse exploratoire de données), attachez votre Notebook à un cluster CPU afin de préserver les ressources GPU.

Planifier un notebook​

Vous pouvez planifier des notebooks qui utilisent AI Runtime en tant que jobs récurrents, soit à partir de l’interface utilisateur du notebook, soit par programmation. Consultez Créer et gérer des jobs de notebook planifiés pour plus de détails.

info

Bêta

L’exécution d’un job de notebook planifié qui utilise un environnement de base du workspace, y compris l’ environnement Databricks AI, est en version Beta. Un administrateur de workspace doit activer l’aperçu de la fonctionnalité Serverless workspace base environment support in Jobs . Consultez Gérer les aperçus Databricks.

Pour planifier à partir du notebook que vous souhaitez exécuter :

  1. Sélectionnez le bouton **Planifier** en haut à droite.
  2. Sélectionnez Ajouter un planning .
  3. Renseignez le formulaire Nouvelle planification avec le Job name , la Planification et le compute .
  4. Sélectionnez Créer .

Formulaire New schedule indiquant les champs Job name, Schedule et Compute pour un job de notebook planifié.

Vous pouvez également créer et planifier des jobs à partir de l’interface utilisateur Jobs et pipelines . Consultez Créer un nouveau job pour des instructions détaillées.

remarque

L'ajout de dépendances à l'aide du panneau Environnements n'est pas pris en charge pour les Jobs planifiés de l'AI Runtime. Les dépendances doivent être installées par programme dans votre Notebook (par exemple, %pip install). La récupération automatique n'est pas prise en charge. Si votre job échoue en raison de packages incompatibles, vous devez corriger manuellement et le relancer.

Pour les charges de travail qui peuvent dépasser la durée d'exécution maximale de 7 jours, implémentez un point de contrôle manuel pour permettre la reprise. Nous recommandons d'utiliser les volumes Unity Catalog via UCVolumeWriter et UCVolumeReader à partir de serverless_gpu.data. Voir Point de contrôle de modèle.

Planifiez avec l’API Jobs et Declarative Automation Bundles​

Vous pouvez créer et gérer par programmation des jobs de notebook AI Runtime à l’aide de l’API Databricks Jobs ou de Declarative Automation Bundles. Configurez le type de compute sur GPU serverless dans votre définition de job ou de bundle pour automatiser les pipelines de déploiement.

Pour exécuter votre propre commande d’entraînement sur un répertoire de code au lieu d’un Notebook, et pour créer des Job multi-tâches ainsi que des pipelines planifiés, consultez Mettre en production les charges de travail d’entraînement.

L’exemple suivant illustre une configuration Declarative Automation Bundles pour un job de notebook AI Runtime planifié utilisant l’ environnement Standard:

YAML
resources:
jobs:
sample_job:
name: sample_job_h100

trigger:
periodic:
interval: 1
unit: DAYS

parameters:
- name: catalog
default: ${var.catalog}
- name: schema
default: ${var.schema}

environments:
- environment_key: default
spec:
environment_version: '6'

tasks:
- task_key: notebook_task
notebook_task:
notebook_path: /Workspace/Users/your_email/your_notebook
environment_key: default
compute:
hardware_accelerator: GPU_8xH100

Pour utiliser l'environnement Databricks AI au lieu de l'environnement Standard, définissez base_environment sur l'identifiant de l'environnement AI (par exemple, databricks_ai_v6 pour AI v6) dans l'environnement spec et référencez-le à partir de environment_key de la tâche :

info

Bêta

La sélection d’un environnement Databricks AI comme environnement de base du workspace dans un job est en version Beta. Un administrateur de workspace doit activer l’aperçu de la fonctionnalité Serverless workspace base environment support in Jobs . Consultez Gérer les aperçus Databricks.

YAML
resources:
jobs:
sample_job:
name: sample_job_aiv6_h100

trigger:
periodic:
interval: 1
unit: DAYS

parameters:
- name: catalog
default: ${var.catalog}
- name: schema
default: ${var.schema}

environments:
- environment_key: aiv6
spec:
base_environment: databricks_ai_v6

tasks:
- task_key: notebook_task
notebook_task:
notebook_path: /Workspace/Users/your_email/your_notebook
environment_key: aiv6
compute:
hardware_accelerator: GPU_8xH100