Tutoriel : Exécuter du code depuis PyCharm sur Classic Compute
Cet article s'applique à Databricks Connect pour Databricks Runtime 13,3 LTS et versions ultérieures.
Databricks Connect vous permet de connecter des IDEs populaires tels que PyCharm, des serveurs de Notebook et d'autres applications personnalisées au compute Databricks. See Databricks Connect.
Cet article démontre comment get start rapidement avec Databricks Connect pour Python en utilisant PyCharm. Vous allez créer un projet dans PyCharm, installer Databricks Connect pour Databricks Runtime 13,3 LTS et versions ultérieures, et exécuter un code simple sur des compute classiques dans votre workspace Databricks à partir de PyCharm.
Exigences
Pour suivre ce didacticiel, vous devez satisfaire aux exigences suivantes :
- Votre Workspace, environnement local et compute répondent aux exigences de Databricks Connect pour Python. Consultez les exigences d'utilisation de Databricks Connect.
- Vous avez PyCharm installé. Ce tutoriel a été testé avec PyCharm Community Edition 2023.3.5. Si vous utilisez une version ou une édition différente de PyCharm, les instructions suivantes peuvent varier.
- Si vous utilisez un compute classique, vous aurez besoin de l'ID du cluster. Pour obtenir votre ID de cluster, dans votre Workspace, cliquez sur Compute dans la barre latérale, puis sur le nom de votre cluster. Dans la barre d'adresse de votre navigateur web, copiez la chaîne de caractères entre
clustersetconfigurationdans l'URL.
Étape 1 : Configurer l'authentification Databricks
Ce tutoriel utilise l'authentification Databricks OAuth utilisateur à machine (U2M) et un profil de configuration Databricks pour s'authentifier auprès de votre Workspace Databricks. Pour utiliser un type d’authentification différent, consultez Configurer les propriétés de connexion.
La configuration de l'authentification OAuth U2M nécessite le CLI Databricks. Pour plus d'informations sur l'installation de la CLI Databricks, consultez Installer ou mettre à jour la CLI Databricks.
Lancer l'authentification OAuth U2M, comme suit :
-
Utilisez la CLI Databricks pour initier la gestion locale des jetons OAuth en exécutant la commande suivante pour chaque workspace cible.
Dans la commande suivante, remplacez
<workspace-url>par l'URL de votre instance de workspace Databricks, parhttps://dbc-a1b2345c-d6e7.cloud.databricks.comexemple.Bashdatabricks auth login --configure-cluster --host <workspace-url>
Pour utiliser le compute Serverless avec Databricks Connect, consultez Configurer une connexion au compute Serverless.
-
La CLI Databricks vous invite à enregistrer les informations que vous avez saisies en tant que profil de configuration Databricks. Appuyez sur
Enterpour accepter le nom de profil suggéré, ou entrez le nom d’un profil nouveau ou existant. Tout profil existant portant le même nom est écrasé avec les informations que vous avez saisies. Vous pouvez utiliser des profils pour basculer rapidement votre contexte d'authentification entre plusieurs Workspaces.Pour obtenir une liste de tous les profils existants, dans un terminal ou une invite de commande distinct, utilisez la CLI Databricks pour exécuter la commande
databricks auth profiles. Pour consulter les paramètres existants d’un profil spécifique, exécutez la commandedatabricks auth env --profile <profile-name>. -
Dans votre navigateur web, suivez les instructions à l'écran pour vous connecter à votre Databricks Workspace.
-
Dans la liste des clusters disponibles qui apparaît dans votre terminal ou votre invite de commande, utilisez les touches de direction haut et bas pour sélectionner le cluster Databricks cible dans votre Workspace, puis appuyez sur
Enter. Vous pouvez également taper n'importe quelle partie du nom d'affichage du cluster pour filtrer la liste des clusters disponibles. -
Pour afficher la valeur actuelle du token OAuth d'un profil et le timestamp d'expiration à venir du token, exécutez l'une des commandes suivantes :
databricks auth token --host <workspace-url>databricks auth token -p <profile-name>databricks auth token --host <workspace-url> -p <profile-name>
Si vous avez plusieurs profils avec la même valeur
--host, vous devrez peut-être spécifier les options--hostet-pensemble pour aider le CLI Databricks à trouver les informations de jeton OAuth correspondantes correctes.
Étape 2 : Créez le projet
- Start PyCharm.
- Dans le menu principal, cliquez sur Fichier > Nouveau projet .
- Dans la boîte de dialogue Nouveau projet , cliquez sur Pure Python .
- Pour Emplacement , cliquez sur l'icône de dossier et suivez les instructions à l'écran pour spécifier le chemin vers votre nouveau projet Python.
- Laissez Créer un script de bienvenue main.py sélectionné.
- Pour Type d'interpréteur , cliquez sur Project venv .
- Développez Version Python , et utilisez l'icône de dossier ou la liste déroulante pour spécifier le chemin d'accès à l'interpréteur Python à partir des exigences précédentes.
- Cliquez sur Créer .

Étape 3 : Ajoutez le package Databricks Connect
- Dans le menu principal de PyCharm, cliquez sur Affichage > Fenêtres d'outils > Packages Python .
- Dans la zone de recherche, entrez
databricks-connect. - Dans la liste des **PyPI repository**, cliquez sur **databricks-connect**.
- Dans la liste déroulante dernière du volet de résultats, sélectionnez la version qui correspond à la version de Databricks Runtime de votre cluster. Par exemple, si votre cluster a Databricks Runtime 14.3 installé, sélectionnez 14.3.1 .
- Cliquez sur **Installer le package**.
- Une fois le package installé, vous pouvez fermer la fenêtre Python Packages .

Étape 4 : Ajouter du code
-
Dans la fenêtre d'outil Projet , cliquez avec le bouton droit de la souris sur le dossier racine du projet, puis cliquez sur Nouveau > Fichier Python .
-
Saisissez
main.pyet double-cliquez sur Fichier Python . -
Entrez le code suivant dans le fichier, puis enregistrez le fichier, en fonction du nom de votre profil de configuration.
Si votre profil de configuration de l'étape 1 est nommé
DEFAULT, saisissez le code suivant dans le fichier, puis enregistrez le fichier :Pythonfrom databricks.connect import DatabricksSession
spark = DatabricksSession.builder.getOrCreate()
df = spark.read.table("samples.nyctaxi.trips")
df.show(5)Si votre profil de configuration de l'Étape 1 n'est pas nommé
DEFAULT, saisissez plutôt le code suivant dans le fichier. Remplacez l'espace réservé<profile-name>par le nom de votre profil de configuration de l'étape 1, puis enregistrez le fichier :Pythonfrom databricks.connect import DatabricksSession
spark = DatabricksSession.builder.profile("<profile-name>").getOrCreate()
df = spark.read.table("samples.nyctaxi.trips")
df.show(5)
Étape 5 : Exécutez le code
- Start le cluster cible dans votre workspace Databricks distant.
- Après le cluster a start, dans le menu principal, cliquez sur Exécuter > Exécuter « main » .
- Dans la fenêtre d'outil Exécuter ( Affichage > Fenêtres d'outil > Exécuter ), dans le volet principal du tab Exécuter, les 5 premières lignes du
samples.nyctaxi.tripsapparaissent.
Étape 6 : Déboguer le code
- Tant que le cluster est toujours en cours d'exécution, dans le code précédent, cliquez sur la gouttière à côté de
df.show(5)pour définir un point d'arrêt. - Dans le menu principal, cliquez sur Exécuter > Déboguer « main ».
- Dans la fenêtre d'outil Débogage ( Affichage > Tool Windows > Debug ), dans le volet Variables de l'onglet Debugger , développez les nœuds de variable df et spark pour parcourir les informations sur les variables
dfetsparkdu code. - Dans la barre latérale de la fenêtre d’outil Debug , cliquez sur l’icône de flèche verte ( Reprendre le programme ).
- Dans le volet **Console** de l'onglet **tab**, les 5 premières lignes du
samples.nyctaxi.tripsapparaissent.
