Aller au contenu principal

Tâche Notebook pour les Jobs

Utilisez la tâche de Notebook pour déployer des Notebooks Databricks.

Exigences

  • Votre Notebook doit se trouver à un emplacement accessible à l'utilisateur qui configure le Job.

Configurer une tâche de Notebook

remarque

L'interface utilisateur des Jobs affiche les options de manière dynamique en fonction d'autres paramètres configurés.

Pour commencer le flux de configuration d'une tâche Notebook :

  1. Accédez à l'onglet tab dans l'interface utilisateur des Jobs.
  2. Cliquez sur Icône Plus. Ajouter une tâche .
  3. Saisissez un nom dans le champ Nom de la tâche .
  4. Dans le menu déroulant Type , sélectionnez Notebook.

Configurez la source

Dans le menu déroulant Source , sélectionnez un emplacement pour le notebook en utilisant l'une des options suivantes.

Workspace

Utilisez Workspace pour configurer un Notebook stocké dans le Workspace en suivant les étapes suivantes :

  1. Cliquez sur le champ Chemin . La boîte de dialogue Sélectionner un Notebook apparaît.
  2. Accédez au notebook, cliquez pour sélectionner le fichier et cliquez sur Confirmer .
remarque

Vous pouvez utiliser cette option pour configurer une tâche pour un Notebook stocké dans un dossier Git Databricks. Databricks recommande d'utiliser l'option fournisseur Git et un repository Git distant pour le versioning des assets planifiés avec des Jobs.

Fournisseur Git

Utilisez Git provider pour configurer un Notebook dans un repository Git distant.

Les options affichées par l’interface utilisateur dépendent du fait que vous ayez déjà configuré ou non un fournisseur Git ailleurs. Un seul repository Git distant peut être utilisé pour toutes les tâches d’un job. Consultez Utiliser Git avec Lakeflow Jobs.

important

Les Notebooks créés par Lakeflow Jobs qui s'exécutent à partir de repositories Git distants sont éphémères et ne peuvent pas être utilisés pour suivre les exécutions MLflow, les expérimentations ou les modèles. Lors de la création d'un Notebook à partir d'un Job, utilisez une Experimentation MLflow du Workspace (au lieu d'une Experimentation MLflow du Notebook) et appelez mlflow.set_experiment("/path/to/experiment") dans le Notebook du Workspace avant d'exécuter tout code de suivi MLflow. Pour plus de détails, voir Éviter la perte de données dans les expérimentations MLflow.

Le champ Chemin apparaît après que vous avez configuré une référence Git.

Entrez le chemin d’accès relatif de votre notebook, tel que etl/bronze/ingest.py.

important

Lorsque vous entrez le chemin relatif, ne commencez pas par / ou ./. Par exemple, si le chemin absolu du Notebook auquel vous souhaitez accéder est /etl/bronze/ingest.py, saisissez etl/bronze/ingest.py dans le champ Chemin .

Configurez le compute et les bibliothèques dépendantes

remarque

Vous pouvez sélectionner un SQL Warehouse comme compute pour une tâche de Notebook uniquement lorsque le Notebook est entièrement écrit en SQL et que SQL est défini comme sa default language. Si le Notebook utilise une autre langue par default ou mélange les langues, sélectionnez un cluster ou un autre compute pris en charge à la place.

  1. Utilisez Compute pour sélectionner ou configurer un cluster qui prend en charge la logique de votre Notebook.
  2. Si vous utilisez le compute Serverless, installez les bibliothèques directement dans le Notebook, en utilisant le volet Environnement ou en utilisant %pip install. Consultez Configurer l'environnement Serverless.
  3. Pour toutes les autres configurations de compute, cliquez sur Icône Plus. Ajouter sous Bibliothèques dépendantes . La boîte de dialogue Ajouter une bibliothèque dépendante apparaît.
    • Vous pouvez sélectionner une bibliothèque existante ou upload une nouvelle bibliothèque.
    • Vous pouvez uniquement utiliser les bibliothèques stockées dans un emplacement pris en charge par vos configurations de compute. Consultez la prise en charge des bibliothèques Python.
    • Chaque source de bibliothèque a un flux différent pour sélectionner ou upload une bibliothèque. Consultez Installer des bibliothèques.

Finaliser la configuration du job

  1. (Facultatif) Configurez les **parameters** comme paires clé-valeur accessibles dans le Notebook dbutils.widgets à l'aide de. Consultez configurer les paramètres de tâche.
  2. (Facultatif) Pour configurer les nouvelles tentatives, les threshold de durée d'exécution ou de backlog de streaming, ou les notifications, consultez Paramètres de tâches avancés.
  3. Cliquez sur Enregistrer la tâche .

Pour modifier, cloner, désactiver ou supprimer cette tâche, consultez Configurer et modifier les tâches dans Lakeflow Jobs.

Préparation visuelle des données

La **préparation visuelle des données** dans le menu déroulant **Type** de tâche crée une tâche de notebook pour un fichier de préparation visuelle des données. Vous créez ces fichiers sur un canevas visuel dans Lakeflow Designer, qui enregistre chacun d'eux en tant que notebook nommé <name>.designer.ipynb. Pour en exécuter un en tant que Job, ajoutez une tâche de notebook et sélectionnez son fichier .designer.ipynb comme source. See Lakeflow Designer.

Limitations

Le résultat total des cellules du Notebook (le résultat combiné de toutes les cellules du Notebook) est soumis à une limite de taille de 30 Mo. De plus, la sortie de chaque cellule est soumise à une limite de taille de 8 Mo. Si le résultat total d'une cellule dépasse 30 Mo ou si le résultat d'une cellule individuelle dépasse 8 Mo, l'exécution est annulée et marquée comme échouée.

Si vous avez besoin d'aide pour trouver des cellules proches ou au-delà de la limite, exécutez le Notebook sur un cluster à usages multiples et utilisez cette technique de sauvegarde automatique du Notebook.