Tutoriel : exécuter du code Python sur un cluster et en tant que job à l'aide de l'extension IDE Databricks
Ce tutoriel vous guide dans la configuration de l'extension IDE Databricks, puis dans l'exécution de Python sur un cluster Databricks et en tant que Job Databricks dans votre workspace distant. Voir Extension IDE Databricks.
Exigences
Ce didacticiel nécessite que :
- Vous avez installé l'extension IDE Databricks. Consultez Installer l'extension IDE Databricks.
- Vous avez un cluster Databricks distant à utiliser. Veuillez noter le nom du cluster. Pour afficher vos clusters disponibles, dans la barre latérale de votre Workspace Databricks, cliquez sur **Compute**. See compute.
Étape 1 : Créer un nouveau projet Databricks
Dans cette étape, vous créez un nouveau projet Databricks et configurez la connexion avec votre Workspace Databricks distant.
- Lancez Visual Studio Code, puis cliquez sur Fichier > Ouvrir le dossier et ouvrez un dossier vide sur votre machine de développement locale.
- Dans la barre latérale, cliquez sur l'icône du logo Databricks . Ceci ouvre l'extension Databricks.
- Dans l'affichage Configuration , cliquez sur Créer une configuration .
- La Palette de commandes pour configurer votre Workspace Databricks s'ouvre. Pour l' Hôte Databricks , saisissez ou sélectionnez l'URL d'instance de votre workspace, par exemple
https://dbc-a1b2345c-d6e7.cloud.databricks.com. - Sélectionnez un profil d’authentification pour le projet. Consultez Configurer l'autorisation pour l'extension IDE Databricks.
Étape 2 : Ajoutez les informations de cluster à l'extension Databricks et start le cluster
-
La vue Configuration étant déjà ouverte, cliquez sur Sélectionner un cluster ou sur l’icône d’engrenage ( Configurer un cluster ).

-
Dans la palette de commandes , sélectionnez le nom du cluster que vous avez créé précédemment.
-
Cliquez sur l'icône de lecture ( Start Cluster ) s'il n'est pas déjà démarré.
Étape 3 : Créer et exécuter du code Python
-
Créer un fichier de code Python local : dans la barre latérale, cliquez sur l'icône du dossier ( Explorateur ).
-
Dans le menu principal, cliquez sur Fichier > Nouveau fichier et choisissez un fichier Python. Nommez le fichier demo.py et enregistrez-le à la racine du projet.
-
Ajoutez le code suivant au fichier, puis enregistrez-le. Ce code crée et affiche le contenu d'un DataFrame PySpark de base :
Pythonfrom pyspark.sql import SparkSession
from pyspark.sql.types import *
spark = SparkSession.builder.getOrCreate()
schema = StructType([
StructField('CustomerID', IntegerType(), False),
StructField('FirstName', StringType(), False),
StructField('LastName', StringType(), False)
])
data = [
[ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ],
[ 1001, 'Joost', 'van Brunswijk' ],
[ 1002, 'Stan', 'Bokenkamp' ]
]
customers = spark.createDataFrame(data, schema)
customers.show()Output# +----------+---------+-------------------+
# |CustomerID|FirstName| LastName|
# +----------+---------+-------------------+
# | 1000| Mathijs|Oosterhout-Rijntjes|
# | 1001| Joost| van Brunswijk|
# | 1002| Stan| Bokenkamp|
# +----------+---------+-------------------+ -
Cliquez sur l'icône Exécuter sur Databricks à côté de la liste des tabs de l'éditeur, puis cliquez sur upload et Exécuter le Fichier . La sortie apparaît dans la vue Console de débogage .

Vous pouvez également, dans la vue Explorateur , faire un clic droit sur le fichier
demo.py, puis cliquer sur Exécuter sur Databricks > Upload et exécuter le fichier .
Étape 4 : exécutez le code en tant que Job
Pour exécuter demo.py en tant que Job, cliquez sur l'icône **Exécuter sur Databricks** à côté de la liste des tabs de l'éditeur, puis cliquez sur **Exécuter le fichier en tant que Workflow**. La sortie apparaît dans un tab d'éditeur distinct à côté de l'éditeur de fichiers demo.py.
![]()
Sinon, faites un clic droit sur le fichier demo.py dans le panneau Explorateur , puis sélectionnez Exécuter sur Databricks > Exécuter le fichier en tant que Workflow .

Étapes suivantes
Maintenant que vous avez utilisé avec succès l'extension IDE Databricks pour upload un fichier Python local et l'exécuter à distance, vous pouvez également :
- Explorez les ressources et les variables des Declarative Automation Bundles à l’aide de l’interface utilisateur de l’extension. Découvrez les fonctionnalités de Bundle et d’explorer.
- Exécutez ou déboguez du code Python avec Databricks Connect. Voir Déboguer du code à l'aide de Databricks Connect pour l'extension IDE Databricks.
- Exécutez un fichier ou un notebook en tant que job Databricks. Consultez Exécuter un fichier sur un cluster ou un fichier ou notebook en tant que job dans Databricks à l'aide de l'extension IDE Databricks.
- Exécuter les tests avec
pytest. Consultez Exécuter des tests Python à l'aide de l'extension IDE Databricks.