Didacticiel : Exécuter Python sur un cluster et en tant que Job à l'aide de l'extension Databricks pour Visual Studio Code
Ce tutoriel vous guide à travers la configuration de l'extension Databricks pour Visual Studio Code, puis l'exécution de Python sur un cluster Databricks et en tant que Job Databricks dans votre workspace distant. Voir l'extension Databricks pour Visual Studio Code.
Exigences
Ce didacticiel nécessite que :
- Vous avez installé l'extension Databricks pour Visual Studio Code. Voir Installer l'extension Databricks pour Visual Studio Code.
- Vous avez un cluster Databricks distant à utiliser. Veuillez noter le nom du cluster. Pour afficher vos clusters disponibles, dans la barre latérale de votre Workspace Databricks, cliquez sur **Compute**. See compute.
Étape 1 : Créer un nouveau projet Databricks
Dans cette étape, vous créez un nouveau projet Databricks et configurez la connexion avec votre Workspace Databricks distant.
- Lancez Visual Studio Code, puis cliquez sur Fichier > Ouvrir le dossier et ouvrez un dossier vide sur votre machine de développement locale.
- Dans la barre latérale, cliquez sur l'icône du logo Databricks . Ceci ouvre l'extension Databricks.
- Dans l'affichage Configuration , cliquez sur Créer une configuration .
- La Palette de commandes pour configurer votre Workspace Databricks s'ouvre. Pour l' Hôte Databricks , saisissez ou sélectionnez l'URL d'instance de votre workspace, par exemple
https://dbc-a1b2345c-d6e7.cloud.databricks.com. - Sélectionnez un profil d'authentification pour le projet. Consultez Configuration de l'autorisation pour l'extension Databricks pour Visual Studio Code.
Étape 2 : Ajoutez les informations de cluster à l'extension Databricks et start le cluster
-
La vue Configuration étant déjà ouverte, cliquez sur Sélectionner un cluster ou sur l’icône d’engrenage ( Configurer un cluster ).

-
Dans la palette de commandes , sélectionnez le nom du cluster que vous avez créé précédemment.
-
Cliquez sur l'icône de lecture ( Start Cluster ) s'il n'est pas déjà démarré.
Étape 3 : Créer et exécuter du code Python
-
Créer un fichier de code Python local : dans la barre latérale, cliquez sur l'icône du dossier ( Explorateur ).
-
Dans le menu principal, cliquez sur Fichier > Nouveau fichier et choisissez un fichier Python. Nommez le fichier demo.py et enregistrez-le à la racine du projet.
-
Ajoutez le code suivant au fichier, puis enregistrez-le. Ce code crée et affiche le contenu d'un DataFrame PySpark de base :
Pythonfrom pyspark.sql import SparkSession
from pyspark.sql.types import *
spark = SparkSession.builder.getOrCreate()
schema = StructType([
StructField('CustomerID', IntegerType(), False),
StructField('FirstName', StringType(), False),
StructField('LastName', StringType(), False)
])
data = [
[ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ],
[ 1001, 'Joost', 'van Brunswijk' ],
[ 1002, 'Stan', 'Bokenkamp' ]
]
customers = spark.createDataFrame(data, schema)
customers.show()Output# +----------+---------+-------------------+
# |CustomerID|FirstName| LastName|
# +----------+---------+-------------------+
# | 1000| Mathijs|Oosterhout-Rijntjes|
# | 1001| Joost| van Brunswijk|
# | 1002| Stan| Bokenkamp|
# +----------+---------+-------------------+ -
Cliquez sur l'icône Exécuter sur Databricks à côté de la liste des tabs de l'éditeur, puis cliquez sur upload et Exécuter le Fichier . La sortie apparaît dans la vue Console de débogage .

Vous pouvez également, dans la vue Explorateur , faire un clic droit sur le fichier
demo.py, puis cliquer sur Exécuter sur Databricks > Upload et exécuter le fichier .
Étape 4 : exécutez le code en tant que Job
Pour exécuter demo.py en tant que Job, cliquez sur l'icône **Exécuter sur Databricks** à côté de la liste des tabs de l'éditeur, puis cliquez sur **Exécuter le fichier en tant que Workflow**. La sortie apparaît dans un tab d'éditeur distinct à côté de l'éditeur de fichiers demo.py.
![]()
Sinon, faites un clic droit sur le fichier demo.py dans le panneau Explorateur , puis sélectionnez Exécuter sur Databricks > Exécuter le fichier en tant que Workflow .

Étapes suivantes
Maintenant que vous avez utilisé avec succès l'extension Databricks pour Visual Studio Code afin d'upload un fichier Python local et de l'exécuter à distance, vous pouvez également :
- Explorez les Ressources et les variables des Declarative Automation Bundles à l'aide de l'interface utilisateur de l'extension. Consultez les fonctionnalités de l'extension Declarative Automation Bundles.
- Exécutez ou déboguez du code Python avec Databricks Connect. Consultez Déboguer du code à l'aide de Databricks Connect pour l'extension Databricks pour Visual Studio Code.
- Exécutez un fichier ou un notebook en tant que Databricks Job. Consultez Exécutez un fichier sur un cluster ou un fichier ou un notebook en tant que Job dans Databricks à l'aide de l'extension Databricks pour Visual Studio Code.
- Exécutez les tests avec
pytest. Voir Exécuter des tests Python à l'aide de l'extension Databricks pour Visual Studio Code.