Aller au contenu principal

Exécutez un fichier sur un cluster ou un fichier ou Notebook en tant que Job dans Databricks à l'aide de l'extension Databricks pour Visual Studio Code

L'extension Databricks pour Visual Studio Code vous permet d'exécuter votre code Python sur un cluster ou votre code ou notebook Python, R, Scala ou SQL en tant que Job dans Databricks.

Ces informations supposent que vous avez déjà installé et configuré l'extension Databricks pour Visual Studio Code. Voir Installer l'extension Databricks pour Visual Studio Code.

Exécuter un fichier Python sur un cluster

remarque

Cette fonctionnalité n'est pas disponible lors de l'utilisation de compute serverless.

Pour exécuter un fichier Python sur un cluster Databricks à l'aide de l'extension Databricks pour Visual Studio Code, avec l'extension et votre projet ouverts :

  1. Ouvrez le fichier Python que vous souhaitez exécuter sur le cluster.
  2. Effectuez l'une des actions suivantes :
    • Dans la barre de titre de l'éditeur de fichiers, cliquez sur l'icône Exécuter sur Databricks , puis cliquez sur Upload et Exécuter le fichier .

      upload et exécuter le fichier à partir de l'icône.

    • Dans la vue Explorateur ( Affichage > Explorateur ), cliquez avec le bouton droit sur le fichier, puis sélectionnez Exécuter sur Databricks > upload et exécuter le fichier dans le menu contextuel.

      Upload et exécution du fichier depuis le menu contextuel.

Le fichier s'exécute sur le cluster, et la sortie est disponible dans la console de débogage ( Afficher > Console de débogage ).

Exécutez un fichier Python en tant que Job

Pour exécuter un fichier Python en tant que Job Databricks à l'aide de l'extension Databricks pour Visual Studio Code, avec l'extension et votre projet ouverts :

  1. Ouvrez le fichier Python que vous souhaitez exécuter en tant que job.
  2. Effectuez l'une des actions suivantes :
    • Dans la barre de titre de l'éditeur de fichiers, cliquez sur l'icône Exécuter sur Databricks , puis sur Exécuter le fichier en tant que workflow .

      Exécuter le fichier en tant que workflow à partir de l'icône.

    • Dans l’affichage **Explorer** (**Vue > Explorer**), cliquez avec le bouton droit de la souris sur le fichier, puis sélectionnez **Exécuter sur Databricks** > **Exécuter le fichier en tant que workflow** dans le menu contextuel.

      Exécuter le fichier comme workflow à partir du menu contextuel

Un nouvel onglet d'éditeur apparaît, intitulé Exécution de Job Databricks . Le fichier s'exécute comme un job dans le workspace, et toute sortie est imprimée dans la zone Sortie du nouvel tab d'éditeur.

Pour afficher les informations sur l'exécution du Job, cliquez sur le Link ID d'exécution de la tâche dans le nouvel onglet d'éditeur Databricks Job Run. Votre workspace s'ouvre et les détails de l'exécution du job s'affichent dans le workspace.

Exécuter un notebook Python, R, Scala ou SQL en tant que job

Pour exécuter un notebook en tant que Job Databricks à l'aide de l'extension Databricks pour Visual Studio Code, avec l'extension et votre projet ouverts :

  1. Ouvrez le notebook que vous souhaitez exécuter en tant que job.
astuce

Pour transformer un fichier Python, R, Scala ou SQL en un Notebook Databricks, ajoutez le commentaire # Databricks notebook source au début du fichier et ajoutez le commentaire # COMMAND ---------- devant chaque cellule. Pour plus d'information, consultez Convertir un fichier en Notebook.

Un fichier de code Python formaté comme un Databricks Notebook1

  1. Effectuez l'une des actions suivantes :

    • Dans la barre de titre de l'éditeur de fichiers du Notebook, cliquez sur l'icône Exécuter sur Databricks , puis cliquez sur Exécuter le fichier en tant que workflow .
remarque

Si Exécuter sur Databricks en tant que Workflow n'est pas disponible, consultez Créer une configuration d'exécution personnalisée.

  • Dans la vue Explorateur ( Affichage > Explorateur ), faites un clic droit sur le fichier du notebook, puis sélectionnez Exécuter sur Databricks > Exécuter le fichier en tant que workflow dans le menu contextuel.

Un nouvel onglet d'éditeur apparaît, intitulé Exécution de Job Databricks . Le notebook s'exécute en tant que Job dans le Workspace. Le notebook et ses résultats sont affichés dans la zone Sortie du nouvel tab de l'éditeur.

Pour afficher des informations sur l'exécution du job, cliquez sur le Link ID d'exécution de la tâche dans l'onglet de l'éditeur Databricks Job Run. Votre workspace s'ouvre et les détails de l'exécution du job s'affichent dans le workspace.

Créer une configuration d'exécution personnalisée

Une configuration d'exécution personnalisée pour l'extension Databricks de Visual Studio Code vous permet de transmettre des arguments personnalisés à un Job ou à un Notebook, ou de créer différents paramètres d'exécution pour différents fichiers. Pour plus d'informations, consultez Configurations de lancement dans la documentation de Visual Studio Code.

Pour créer une configuration d'exécution personnalisée, cliquez sur Exécuter > Ajouter une configuration dans le menu principal de Visual Studio Code. Sélectionnez ensuite Databricks pour une configuration d'exécution basée sur un cluster ou Databricks: Workflow pour une configuration d'exécution basée sur un Job.

Par exemple, la configuration d’exécution personnalisée suivante modifie la commande de lancement **Exécuter le fichier en tant que workflow** pour transmettre --prod l’argument au Job :

JSON
{
"version": "0.2.0",
"configurations": [
{
"type": "databricks-workflow",
"request": "launch",
"name": "Run on Databricks as Workflow",
"program": "${file}",
"parameters": {},
"args": ["--prod"]
}
]
}
astuce

Ajoutez "databricks": true à votre configuration "type": "python" si vous souhaitez utiliser la configuration Python et tirer parti de l'authentification Databricks Connect qui fait partie de la configuration de l'extension.