Aller au contenu principal

Configurer votre projet Databricks

L’extension IDE Databricks offre une vue Configuration au sein de l’extension qui vous permet de configurer et de mettre à jour facilement les paramètres de votre projet Databricks. Ces fonctionnalités incluent les paramètres de dossier local, l’installation d’outils d’IA, un sélecteur de déploiement de workspace cible, une configuration facile de l’authentification et du compute, la synchronisation des dossiers de workspace et des étapes simples pour activer l’environnement virtuel Python nécessaire au debugging.

La vue Configuration au sein de l'extension IDE Databricks est disponible une fois que vous avez créé ou migré un projet vers un projet Databricks. Voir Créer un nouveau projet Databricks.

remarque

Les versions précédentes de l'extension IDE Databricks définissaient les paramètres de configuration dans un fichier JSON de projet et les variables d'environnement étaient définies dans le terminal. Dans la version de publication, la configuration du projet et de l'environnement se trouve dans les fichiers databricks.yml et databricks.env.

Si votre projet est un Databricks Asset Bundle, l’interface utilisateur de l’extension Databricks fournit également un Bundle Resource Explorer et une Bundle Variables View pour gérer vos ressources et variables de bundle. Voir les fonctionnalités de bundle et d’explorateur.

Définir le dossier local

Pour sélectionner un dossier local différent pour votre projet Databricks, cliquez sur l’icône d’engrenage associée à l’entrée Local Folder dans la vue Configuration .

Installer et utiliser des outils d’IA

info

Bêta

Cette fonctionnalité est en version Bêta.

La section AI tools de la vue Configuration vous permet d'installer des outils d'IA afin que vos agents de codage fonctionnent efficacement avec Databricks. L'extension vérifie si les outils d'IA sont installés au niveau global ou au niveau du projet, y compris les installations que vous avez effectuées via la CLI Databricks, et met à jour le statut affiché. Pour plus d'informations sur les outils d'IA, consultez Agent skills for AI coding assistants et groupe de commandesaitools.

Pour installer des outils d’IA :

  1. Dans la vue Configuration de l'extension, cliquez sur Installer les outils d'IA .
  2. Suivez les instructions pour sélectionner un scope et des outils afin de terminer l’installation.

Lorsque les outils d'IA sont installés, une icône de robot vert apparaît à côté de Outils d'IA . Les outils d'IA se mettent automatiquement à jour vers la dernière version.

Outils d'extension IA Databricks

Pour désinstaller les outils d'IA, faites un clic droit sur Outils d'IA et sélectionnez Désinstaller les outils d'IA .

Modifier le workspace de déploiement cible

Pour sélectionner ou modifier la cible de déploiement de votre projet Databricks (par exemple, pour passer d'une cible dev à une cible prod) :

  1. Dans la vue Configuration de l'extension Databricks, cliquez sur l'icône d'engrenage ( Select a Databricks Asset Bundle target ) associée à Target .

    Sélectionnez une cible de bundle

  2. Dans la Palette de commandes , sélectionnez la cible de déploiement souhaitée.

Une fois qu'une cible est configurée, le Hôte et le Mode de déploiement sont affichés. Pour obtenir des informations sur les modes de déploiement des Declarative Automation Bundles, consultez Modes de déploiement des Declarative Automation Bundles.

L'hôte du Workspace peut être modifié en changeant le paramètre cible workspace dans le fichier de configuration databricks.yml associé au projet. Voir les cibles.

remarque

Les fonctionnalités suivantes de l’extension IDE Databricks ne sont disponibles que lorsque le mode de déploiement cible est le développement :

  • Utilisez le cluster de développement joint pour les jobs de bundle.
  • Synchroniser les fichiers du dossier Workspace
  • Sélectionnez un cluster de développement interactif

Configurez le profil Databricks pour le projet

Lorsque vous créez un projet Databricks ou convertissez un projet en projet Databricks, vous configurez un profil qui inclut les paramètres d'authentification utilisés pour vous connecter à Databricks. Si vous souhaitez modifier le profil d'authentification utilisé, cliquez sur l'icône en forme d'engrenage associée à **AuthType** dans la vue **Configuration**.

Pour plus d’informations sur l’authentification de l’extension IDE Databricks, consultez Configurer l’autorisation pour l’extension IDE Databricks.

Sélectionnez le compute pour l'exécution du code et des jobs

En utilisant l'extension IDE Databricks, vous pouvez sélectionner serverless, sélectionner un cluster Databricks existant ou créer un nouveau cluster Databricks pour exécuter votre code et vos jobs. Une fois connecté au compute, l'ID du cluster, la version de Databricks Runtime, le créateur, l'état et le mode d'accès sont affichés. Vous pouvez également start et arrêter un cluster, et naviguer directement vers la page des détails du cluster.

astuce

Si vous ne voulez pas attendre que le cluster de jobs **start**, cochez Remplacer le cluster de jobs dans le bundle juste en dessous de la sélection du cluster pour utiliser le cluster sélectionné pour exécuter les jobs de bundle en mode développement. Ceci n'est pas disponible si vous utilisez le compute serverless.

Utiliser Serverless

Le compute Serverless est géré par Databricks. Lorsque vous exécutez des charges de travail sur le compute Serverless, Databricks alloue et gère automatiquement les ressources de compute nécessaires.

  1. Dans la vue Configuration , cliquez sur Select compute ou sur l’icône en forme d’engrenage ( Configure compute ).

    Configurer le compute

  2. Dans la Palette de commandes , sélectionnez Serverless .

    Sélection de compute serverless

Utiliser un cluster existant

Si vous disposez d'un cluster Databricks existant que vous souhaitez utiliser :

  1. Dans la vue Configuration , cliquez sur Select compute ou sur l’icône en forme d’engrenage ( Configure compute ).

  2. Dans la palette de commandes , sélectionnez le cluster que vous souhaitez utiliser.

Créer un nouveau cluster

Si vous n'avez pas de cluster Databricks existant, ou si vous souhaitez en créer un nouveau :

  1. Dans la vue Configuration , cliquez sur Select compute ou sur l’icône en forme d’engrenage ( Configure compute ).

  2. Dans la Palette de commandes , cliquez sur Créer un nouveau cluster .

  3. Lorsque vous êtes invité à ouvrir le site web externe (votre Workspace Databricks), cliquez sur Ouvrir .

  4. Si vous y êtes invité, connectez-vous à votre Databricks Workspace.

  5. Suivez les instructions pour créer un cluster.

remarque

Databricks vous recommande de créer un cluster de Calcul personnel. Cela vous permet de start immédiatement des charges de travail, minimisant ainsi les frais généraux de gestion du compute.

  1. Une fois que le cluster est créé et en cours d'exécution, revenez à Visual Studio Code.

  2. Dans la vue Configuration , à côté du cluster, cliquez sur l'icône en forme d'engrenage ( Configuration compute ).

    Configurer le cluster icône 3

    Dans la palette de commandes , cliquez sur le cluster que vous souhaitez utiliser.

Synchronisez votre dossier Workspace avec Databricks

Vous pouvez synchroniser le dossier de workspace Databricks distant associé à votre projet Databricks en cliquant sur l'icône de synchronisation ( Start synchronization ) associée à Remote Folder dans la vue Configuration de l'extension Databricks.

remarque

L'extension IDE Databricks fonctionne uniquement avec les répertoires de workspace qu'elle crée. Vous ne pouvez pas utiliser un Workspace existant dans votre projet à moins qu'il n'ait été créé par l'extension.

Pour naviguer vers la vue Workspace dans Databricks, cliquez sur l'icône de Link externe ( Ouvrir le Link en externe ) associée au Dossier distant .

L'extension détermine le dossier Databricks Workspace à utiliser en fonction du paramètre file_path dans le mappage workspace de la configuration du bundle associé au projet. See Workspace.

remarque

L’extension IDE Databricks effectue uniquement une synchronisation automatique unidirectionnelle des modifications de fichiers depuis votre projet Visual Studio Code local vers le dossier d’espace de travail associé dans votre workspace Databricks distant. Les fichiers de ce répertoire de workspace distant sont destinés à être temporaires. N'initiez pas de modifications sur ces fichiers depuis votre workspace distant, car ces modifications ne seront pas synchronisées avec votre projet local.

Pour plus de détails sur l’utilisation de la fonctionnalité de synchronisation de répertoire de workspace pour les versions antérieures de l’extension IDE Databricks, voir Sélectionner un répertoire de workspace pour l’extension IDE Databricks.

start un tunnel SSH

info

Bêta

Cette fonctionnalité est en version Bêta.

Vous pouvez start un tunnel SSH depuis l'extension IDE Databricks pour ouvrir une session de développement à distance sur le compute Databricks. Cela vous permet d'éditer des fichiers et d'exécuter du code directement sur le compute distant depuis Visual Studio Code.

  1. Pour start un tunnel SSH, cliquez sur le bouton Start SSH Tunnel dans la vue SSH tunnel de l’extension.

  2. Ensuite, sélectionnez le compute classic ou serverless auquel vous connecter :

    • Cluster : le sélecteur de cluster affiche uniquement les clusters qui utilisent le mode d’accès dédié (mono-utilisateur). Si vous avez déjà sélectionné un cluster mono-utilisateur dans votre session locale Visual Studio Code, ce cluster est présélectionné pour la connexion SSH.
    • Serverless : si vous ne sélectionnez pas de clusters, le tunnel se connecte par default au compute serverless.

Lorsque vous démarrez un tunnel, une nouvelle instance de Visual Studio Code s'ouvre dans le même IDE que celui que vous utilisez actuellement. La session distante ouvre votre dossier personnel (users/username@databricks.com) par default et affiche automatiquement le fichier spécifique que vous étiez en train de modifier. L'authentification est préconfigurée ; vous n'avez donc pas besoin de vous reconnecter pour vous connecter à la session distante.

Configurez votre environnement Python et Databricks Connect

La section Environnement Python de la vue Configuration permet de configurer facilement votre environnement de développement virtuel Python et d'installer Databricks Connect pour exécuter et déboguer le code et les cellules de notebook. Les environnements virtuels Python garantissent que votre projet utilise des versions compatibles de Python et de packages Python (dans ce cas, le package Databricks Connect).

Pour configurer l' environnement virtuel Python de votre projet, dans la vue Configuration de l'extension :

  1. Cliquez sur l'élément rouge Activer l'environnement virtuel sous Environnement Python .
  2. Dans la **palette de commandes**, sélectionnez Venv ou Conda.
  3. Sélectionnez les dépendances que vous souhaitez installer, le cas échéant.

Pour changer d'environnements, cliquez sur l'icône d'engrenage ( Changer l'environnement virtuel ) associée à Environnement actif .

Pour plus d'informations sur l'installation de Databricks Connect, qui permet d'exécuter et de procéder au debugging de code et de Notebooks dans Visual Studio Code, consultez Debug code using Databricks Connect for the Databricks IDE extension.