Présentation des objets Workspace
Cet article fournit une introduction générale aux objets Workspace de Databricks. Vous pouvez créer, afficher et organiser les objets du Workspace dans le navigateur de Workspace pour toutes les personas.
Remarque sur la dénomination des assets de Workspace.
Le nom complet d'un asset de Workspace se compose de son nom de base et de son extension de fichier . Par exemple, l'extension de fichier d'un Notebook peut être .py, .sql, .scala, .r et .ipynb en fonction de la langue et du format du Notebook.
Lorsque vous créez un asset Notebook, son nom de base et son nom complet (le nom de base concaténé avec l'extension de fichier) doivent être uniques dans n'importe quel dossier de Workspace. Lorsque vous nommez un actif, Databricks vérifie s'il répond à ce critère en y ajoutant l'extension de fichier. Si le nom complet correspond à un fichier existant dans le dossier, ce nom n'est pas autorisé et vous devez choisir un nouveau nom de Notebook. Par exemple, si vous essayez de créer un Notebook Python (au format source Python) nommé test dans le même dossier qu'un fichier Python nommé test.py, cela ne sera pas autorisé.
clusters
Les clusters Databricks offrent une plateforme unifiée pour divers cas d'utilisation, tels que l'exécution de pipelines ETL de production, l'analytique en streaming, l'analytique ad hoc et le Machine Learning. Un cluster est un type de ressource de compute Databricks. D'autres types de ressources de compute comprennent les SQL Warehouses Databricks.
Pour des informations détaillées sur la gestion et l'utilisation des clusters, consultez Compute.
Notebook
Un notebook est une interface web vers des documents contenant une série de cellules exécutables (commandes) qui opèrent sur des fichiers et des tables, des visualisations et du texte narratif. Les commandes peuvent être exécutées en séquence, en se référant à la sortie d'une ou de plusieurs commandes exécutées précédemment.
Les Notebooks sont un mécanisme pour l'exécution de code dans Databricks. L'autre mécanisme est les jobs.
Pour plus d'informations détaillées sur la gestion et l'utilisation des notebooks, consultez les notebooks Databricks.
Jobs
Les tâches sont un mécanisme pour exécuter du code dans Databricks. L'autre mécanisme est les notebooks.
Pour des informations détaillées sur la gestion et l'utilisation des jobs, consultez les Lakeflow Jobs.
Bibliothèques
Une bibliothèque rend le code tiers ou développé localement disponible pour les Notebooks et les Jobs s'exécutant sur vos clusters.
Pour des informations détaillées sur la gestion et l'utilisation des bibliothèques, consultez Installer les bibliothèques.
Données
Vous pouvez importer des données dans un système de fichiers distribué monté dans un Workspace Databricks et y travailler dans des Notebooks et des clusters Databricks. Vous pouvez également utiliser une grande variété de sources de données Apache Spark pour accéder aux données.
Pour des informations détaillées sur le chargement des données, consultez Connecteurs standards dans Lakeflow Connect.
Fichiers
Aperçu
Cette fonctionnalité est en aperçu public.
Dans Databricks Runtime 11.3 LTS et versions ultérieures, vous pouvez créer et utiliser des fichiers arbitraires dans le Workspace Databricks. Les fichiers peuvent être de tout type. Voici les types de fichiers courants :
.pyFichiers utilisés dans les modules personnalisés..mdfichiers, tels queREADME.md..csvou d'autres petits fichiers de données..txtfichiers.- Fichiers de logs.
Pour des informations détaillées sur l'utilisation des fichiers, consultez Travailler avec les fichiers sur Databricks. Pour plus d'informations sur la façon d'utiliser des fichiers pour modulariser votre code lorsque vous développez avec des notebooks Databricks, consultez Partager du code entre les notebooks Databricks
Dossiers Git
Les dossiers Git sont des dossiers Databricks dont le contenu est cogéré en les synchronisant avec un repository Git distant. À l'aide des dossiers Git Databricks, vous pouvez développer des Notebooks dans Databricks et utiliser un repository Git distant pour la collaboration et le contrôle de version.
Pour plus d'informations détaillées sur l'utilisation des dépôts, consultez les dossiers Git Databricks.
Modèles
Model fait référence à un modèle enregistré dans le MLflow Model Registry. Le Model Registry est un magasin de modèles centralisé qui vous permet de gérer le cycle de vie complet des modèles MLflow. Il fournit le lignage chronologique des modèles, le versioning des modèles, les transitions d'étape, ainsi que les annotations et les descriptions des modèles et de leurs versions.
Pour des informations détaillées sur la gestion et l'utilisation des modèles, consultez Gérer le cycle de vie des modèles dans Unity Catalog.
Experimentation
Une Experimentation MLflow est l’unité principale d’organisation et de contrôle d’accès pour les exécutions MLflow, y compris les traces d’agents, les évaluations d’applications LLM et les exécutions d’entraînement de modèles ML. Toutes les exécutions MLflow appartiennent à une expérience. Chaque Experiment vous permet de visualiser, de rechercher et de comparer les exécutions, ainsi que de download et d’exécuter des artefacts ou des métadonnées pour l'analyse dans d’autres outils.
Pour des informations détaillées sur la gestion et l'utilisation des expériences, consultez Organiser les exécutions d'entraînement avec les expériences MLflow.
query
Les requêtes sont des instructions SQL qui vous permettent d'interagir avec vos données. Pour plus d'informations, consultez Accéder et gérer les requêtes enregistrées.
Tableaux de bord
Les tableaux de bord sont des présentations de visualisations de query et de commentaires. Consultez Tableaux de bord.
Alertes
Les alertes sont des notifications indiquant qu'un champ renvoyé par une requête a atteint un threshold. Pour plus d'informations, consultez les alertes Databricks SQL.
Références aux objets Workspace
Historiquement, les utilisateurs devaient inclure le préfixe de chemin /Workspace pour certaines APIs Databricks (%sh), mais pas pour d'autres (%run, entrées d'API REST).
Les utilisateurs peuvent utiliser les chemins de workspace avec le préfixe /Workspace partout. Les anciennes références aux chemins sans le préfixe /Workspace sont redirigées et continuent de fonctionner. Nous recommandons que tous les chemins de workspace portent le préfixe /Workspace pour les différencier des chemins de Volume et de DBFS.
La condition préalable pour un comportement cohérent du préfixe de chemin /Workspace est la suivante : Il ne peut y avoir de dossier /Workspace au niveau racine du workspace. Si vous avez un dossier /Workspace au niveau racine et que vous souhaitez activer cette amélioration de l'expérience utilisateur, supprimez ou renommez le dossier /Workspace que vous avez créé et contactez votre équipe de compte Databricks.
Partager l'URL d'un fichier, d'un dossier ou d'un notebook
Dans votre workspace Databricks, les URL vers les fichiers de workspace, les notebooks et les dossiers sont dans les formats :
URL de fichier du Workspace
https://<databricks-instance>/?o=<16-digit-workspace-ID>#files/<16-digit-object-ID>
URL de Notebook
https://<databricks-instance>/?o=<16-digit-workspace-ID>#notebook/<16-digit-object-ID>/command/<16-digit-command-ID>
URL des dossiers (Workspace et Git)
https://<databricks-instance>/browse/folders/<16-digit-ID>?o=<16-digit-workspace-ID>
Ces liens peuvent se rompre si un dossier, un fichier ou un notebook du chemin actuel est mis à jour avec une commande d'extraction Git, ou est supprimé et recréé avec le même nom. Cependant, vous pouvez créer un Link basé sur le chemin d'accès à l'espace de Workspace à partager avec d'autres utilisateurs Databricks ayant les niveaux d'accès appropriés en le transformant en un Link de ce format :
https://<databricks-instance>/?o=<16-digit-workspace-ID>#workspace/<full-workspace-path-to-file-or-folder>
Le Link vers les dossiers, Notebooks et fichiers peuvent être partagés en remplaçant tout dans l'URL après ?o=<16-digit-workspace-ID> par le chemin d'accès au fichier, dossier ou Notebook à partir de la racine du Workspace. Si vous partagez une URL vers un dossier, supprimez également /browse/folders/<16-digit-ID> de l'URL d'origine.
Pour obtenir le chemin du fichier, ouvrez le menu contextuel en cliquant avec le bouton droit sur le dossier, le Notebook ou le fichier de votre Workspace que vous souhaitez partager et sélectionnez **Copier l'URL/le chemin** > **Chemin complet**. Ajoutez #workspace au chemin du fichier que vous venez de copier, et ajoutez la chaîne résultante après le ?o=<16-digit-workspace-ID> afin qu'elle corresponde au format d'URL ci-dessus.

Exemple de formulation d'URL #1 : URL de dossier
Pour partager l'URL du dossier Workspace https://<databricks-instance>/browse/folders/1111111111111111?o=2222222222222222, supprimez la sous-chaîne browse/folders/1111111111111111 de l'URL. Ajoutez #workspace suivi du chemin d'accès au dossier ou à l'objet Workspace que vous souhaitez partager.
Dans ce cas, le chemin du Workspace correspond à un dossier, /Workspace/Users/user@example.com/team-git/notebooks. Après avoir copié le chemin complet depuis votre Workspace, vous pouvez maintenant construire le Link partageable :
https://<databricks-instance>/?o=2222222222222222#workspace/Workspace/Users/user@example.com/team-git/notebooks
Exemple de formulation d'URL 2 : URL de notebook
Pour partager l'URL du Notebook https://<databricks-instance>/?o=1111111111111111#notebook/2222222222222222/command/3333333333333333, retirez #notebook/2222222222222222/command/3333333333333333. Ajoutez #workspace suivi du chemin d'accès au dossier ou à l'objet Workspace.
Dans ce cas, le chemin du Workspace pointe vers un Notebook, /Workspace/Users/user@example.com/team-git/notebooks/v1.0/test-notebook. Après avoir copié le chemin complet depuis votre Workspace, vous pouvez maintenant construire le Link partageable :
https://<databricks-instance>/?o=1111111111111111#workspace/Workspace/Users/user@example.com/team-git/notebooks/v1.0/test-notebook
Vous disposez désormais d'une URL stable pour un fichier, un dossier ou un chemin de Notebook à partager ! Pour plus d'informations sur les URL et les identifiants, consultez Obtenir les identifiants des objets du Workspace.