Composants Databricks
Cet article présente les composants fondamentaux que vous devez comprendre pour utiliser Databricks efficacement.
Comptes et Workspace
Dans Databricks, un *workspace* est un déploiement Databricks dans le cloud qui fonctionne comme un environnement permettant à votre équipe d'accéder aux assets Databricks. Votre organisation peut choisir d'avoir plusieurs workspaces ou un seul, en fonction de ses besoins.
Un compte Databricks représente une entité unique qui peut inclure plusieurs espaces de travail. Les comptes activés pour Unity Catalog peuvent être utilisés pour gérer les utilisateurs et leur accès aux données de manière centralisée dans tous les espaces de travail du compte. La facturation et le support sont également gérés au niveau du compte.
Facturation : unités Databricks (DBU)
Databricks facture en fonction des unités Databricks (DBU), qui sont des unités de capacité de traitement par heure basées sur le type d'instance de VM.
Consultez l'estimateur des Tarifs Databricks sur AWS.
Authentification et autorisation
Cette section décrit les concepts que vous devez connaître lorsque vous gérez les identités Databricks et leur accès aux assets Databricks.
Utilisateur
Un individu unique qui a accès au système. Les identités des utilisateurs sont représentées par des adresses e-mail. Consultez Gérer les utilisateurs.
Service Principal
Une identité de service à utiliser avec les Job, les outils automatisés et les systèmes tels que les scripts, les applications et les plateformes CI/CD. Les Service Principal sont représentés par un ID d'application. See Service Principal.
Groupe
Une collection d'identités. Les groupes simplifient la gestion des identités, facilitant l'attribution de l'accès aux workspaces, aux données et à d'autres objets sécurisables. Toutes les identités Databricks peuvent être attribuées en tant que membres de groupes. Voir Groupes.
Liste de contrôle d'accès (ACL)
Liste des autorisations attachées au Workspace, au cluster, au Job, à la table ou à l'Experimentation. Une ACL spécifie les utilisateurs ou les processus système autorisés à accéder aux objets, ainsi que les opérations autorisées sur les assets. Chaque entrée dans une ACL typique spécifie un sujet et une opération. Voir les listes de contrôle d'accès.
Jeton d'accès personnel (PAT)
Un jeton d'accès personnel est une chaîne utilisée pour authentifier les appels d'API REST, les connexions de partenaires technologiques et d'autres outils. Consultez S'authentifier avec des jetons d'accès personnels Databricks (hérité).
Interfaces Databricks
Cette section décrit les interfaces permettant d'accéder à vos ressources dans Databricks.
Interface utilisateur
L'interface utilisateur de Databricks est une interface graphique permettant d'interagir avec des fonctionnalités, telles que les dossiers de Workspace et les objets qu'ils contiennent, les objets de données et les ressources de calcul.
Genie One
Genie One est une interface Databricks simplifiée conçue pour les utilisateurs métier. Il offre un point d'entrée unique pour visualiser les tableaux de bord AI/BI, poser des questions sur les données et utiliser les Databricks Apps, sans naviguer dans les concepts techniques du Workspace. Consultez Utiliser Genie One.
API REST
L'API REST de Databricks fournit des endpoints pour modifier ou demander des informations sur les objets de compte et de workspace Databricks. Consultez la référence du compte et la référence du Workspace.
API REST SQL
L'API REST SQL vous permet d'automatiser les tâches sur les objets SQL. Consultez l'API SQL.
CLI
La CLI de Databricks est hébergée sur GitHub. La CLI est basée sur l'API REST Databricks.
gestion de données
Cette section décrit les outils et les objets logiques utilisés pour organiser et gouverner les données sur Databricks. Voir les objets de base de données dans Databricks.
Unity Catalog
Unity Catalog est une solution de gouvernance unifiée pour les données et les assets d'IA sur Databricks qui fournit des capacités centralisées de contrôle d'accès, d'audit, de lignage et de découverte des données à travers les Workspaces Databricks. Voir Qu'est-ce que Unity Catalog ?
Catalogue
Les catalogues sont le conteneur de niveau supérieur pour organiser et isoler les données sur Databricks. Vous pouvez partager des catalogues entre les Workspaces au sein de la même région et du même compte. Consultez Que sont les catalogues dans Databricks ?
Schéma
Les schémas, également appelés bases de données, sont contenus dans des catalogues et offrent un niveau d'organisation plus granulaire. Ils contiennent des objets de base de données et des assets d'IA, tels que des volumes, des tables, des fonctions et des modèles. Consultez Que sont les schémas dans Databricks ?.
Table
Les tables organisent et régissent l'accès aux données structurées. Vous interrogez les tables avec Apache Spark SQL et les APIs Apache Spark. Voir les tables Databricks.
Afficher
Une vue est un objet en lecture seule dérivé d'une ou plusieurs tables et vues. Les vues enregistrent les queries définies par rapport aux tables. Consultez Qu’est-ce qu’une vue ?.
Volume
Les volumes représentent un volume logique de stockage dans un emplacement de stockage d'objets cloud et organisent et gouvernent l'accès aux données non tabulaires. Databricks recommande d'utiliser des volumes pour gérer tous les accès aux données non tabulaires sur le stockage d'objets cloud. Consultez Que sont les volumes Unity Catalog ?.
Tables Delta
Par default, toutes les tables créées dans Databricks sont des tables Delta. Les tables Delta sont basées sur le projet open source Delta Lake, un framework pour le stockage de tables ACID hautes performances sur des magasins d'objets cloud. Une table Delta stocke les données sous forme de répertoire de fichiers sur le stockage d'objets cloud et enregistre les métadonnées de la table dans le metastore au sein d'un catalogue et d'un schéma.
Métastore
Unity Catalog fournit un métastore au niveau du compte qui enregistre les métadonnées sur les données, l'IA et les autorisations concernant les catalogues, les schémas et les tables. Voir Metastore.
Databricks fournit un Hive metastore hérité pour les clients qui n'ont pas adopté Unity Catalog. Voir Contrôle d’accès aux tables du Hive metastore (hérité).
Explorateur de catalogue
Catalog Explorer vous permet d'explorer et de gérer les données et les assets d'IA, y compris les schémas (bases de données), les tables, les modèles, les volumes (données non tabulaires), les fonctions et les modèles ML enregistrés. Vous pouvez l'utiliser pour trouver des objets de données et des propriétaires, comprendre les relations de données entre les tables et gérer les autorisations et le partage. Consultez Qu'est-ce que Catalog Explorer ?.
Racine DBFS
Le stockage et l'accès aux données à l'aide de la racine DBFS ou des montages DBFS sont un modèle obsolète et ne sont pas recommandés par Databricks. Au lieu de cela, Databricks recommande d'utiliser Unity Catalog pour gérer l'accès à toutes les données. Consultez Qu'est-ce que Unity Catalog ?.
La racine DBFS est un emplacement de stockage disponible par default pour tous les utilisateurs. Voir Qu'est-ce que DBFS ?.
Gestion du calcul
Cette section décrit les concepts que vous devez connaître pour exécuter des calculs dans Databricks.
clusters
Un ensemble de ressources de calcul et de configurations sur lesquelles vous exécutez des notebooks et des Jobs. Il existe deux types de clusters : multifonctions et Job. See compute.
- Vous créez un cluster polyvalent à l'aide de l'interface utilisateur, de la CLI ou de l'API REST. Vous pouvez arrêter et redémarrer manuellement un cluster multifonction. Plusieurs utilisateurs peuvent partager ces clusters pour effectuer des analyses interactives collaboratives.
- Le planificateur de jobs Databricks crée un cluster Jobs lorsque vous exécutez un Job sur un nouveau cluster Jobs et met fin au cluster lorsque le Job est terminé. Vous ne pouvez pas redémarrer un cluster Job.
Pool
Un ensemble d'instances inactives et prêtes à l'emploi qui réduisent les temps de start des clusters et de mise à l'échelle automatique. Lorsqu'il est attaché à un Pool, un clusters alloue ses nœuds Driver et Worker à partir du Pool. Voir la référence de configuration du Pool.
Si le Pool ne dispose pas de ressources inactives suffisantes pour répondre à la demande du cluster, le Pool s'étend en allouant de nouvelles instances du fournisseur d'instances. Lorsqu'un cluster attaché est terminé, les instances qu'il a utilisées sont retournées au pool et peuvent être réutilisées par un cluster différent.
Databricks Runtime
L'ensemble des composants principaux qui s'exécutent sur les clusters gérés par Databricks. See compute. Databricks dispose des runtimes suivants :
- Databricks Runtime inclut Apache Spark, mais ajoute également un certain nombre de composants et de mises à jour qui améliorent considérablement la convivialité, les performances et la sécurité de l'Analytique Big Data.
- Databricks Runtime for Machine Learning est basé sur Databricks Runtime et fournit une infrastructure de machine learning préconfigurée qui est intégrée à toutes les capacités du Workspace Databricks. Il contient plusieurs bibliothèques populaires, notamment TensorFlow, Keras, PyTorch et XGBoost.
UI Jobs et pipelines
L'interface utilisateur du workspace Jobs & Pipelines donne accès aux interfaces utilisateur Jobs, Lakeflow Pipelines et Lakeflow Connect, qui sont des outils vous permettant d'orchestrer et de planifier des workflows.
Jobs
Un mécanisme non interactif pour orchestrer et planifier des Notebooks, des bibliothèques et d'autres tâches. See Lakeflow Jobs
pipeline
LakeFlow Pipelines sont basés sur les Apache Spark™ Declarative Pipelines (SDP), un cadre déclaratif pour la création de pipelines de traitement de données fiables, maintenables et testables. See Spark Declarative Pipelines.
Workload
Workload est la quantité de capacité de traitement nécessaire pour effectuer une tâche ou un groupe de tâches. Databricks identifie deux types de charges de travail : data engineering (Job) et analytique des données (générique).
- Ingénierie des données Une charge de travail (automatisée) s'exécute sur un cluster de jobs que le planificateur de jobs Databricks crée pour chaque charge de travail.
- Analyse des données Une charge de travail (interactive) s'exécute sur un cluster polyvalent . Les charges de travail interactives exécutent généralement des commandes au sein d'un Notebook Databricks. Cependant, l'exécution d'un Job sur un cluster polyvalent existant est également considérée comme une charge de travail interactive.
Contexte d'exécution
L'état pour un environnement de boucle read–eval–print (REPL) pour chaque langage de programmation pris en charge. Les langages pris en charge sont Python, R, Scala et SQL.
Data Engineering
Les outils de data engineering favorisent la collaboration entre les data scientists, les data engineers, les data analysts et les ingénieurs en machine learning.
Workspace
Un Workspace est un environnement permettant d'accéder à l'ensemble de vos assets Databricks. Un Workspace organise les objets (Notebooks, bibliothèques, tableaux de bord et expérimentations) en dossiers et donne accès aux objets de données et aux ressources informatiques.
Notebook
Une interface web pour créer des workflows Data Science et Machine Learning qui peuvent contenir des commandes exécutables, des visualisations et du texte narratif. Consultez les notebooks Databricks.
Bibliothèque
Un package de code disponible pour le Notebook ou le Job s'exécutant sur votre cluster. Les Databricks Runtime incluent de nombreuses bibliothèques, et vous pouvez également upload les vôtres. Voir Installer les bibliothèques.
dossier Git (anciennement Repos)
Un dossier dont le contenu est co-versionné en le synchronisant avec un repository Git distant. Dossiers Git Databricks s'intègrent à Git pour fournir le contrôle de source et de version pour vos projets.
IA et machine learning
Databricks fournit un environnement intégré de bout en bout avec des services gérés pour développer et déployer des applications d'IA et de Machine Learning.
Runtime de machine learning
Pour vous aider à développer des modèles de ML et d'IA, Databricks fournit un Databricks Runtime for Machine Learning, qui automatise la création de compute avec une infrastructure de Machine Learning et d'apprentissage profond préconfigurée incluant les bibliothèques de ML et de DL les plus courantes. Il dispose également d'une prise en charge du GPU intégrée et préconfigurée, y compris les Drivers et les bibliothèques de support. Recherchez des informations sur les dernières versions de Databricks Runtime à partir des notes de version et de la compatibilité de Databricks Runtime.
Experimentation
Une collection d'exécutions MLflow pour développer des agents, des applications LLM et des modèles ML. Consultez Organiser les exécutions de formation avec les expérimentations MLflow.
Fonctionnalités
Les fonctionnalités sont un composant important des modèles ML. Un magasin de fonctionnalités permet le partage et la découverte des fonctionnalités au sein de votre organisation et garantit également que le même code de calcul de fonctionnalités est utilisé pour l'entraînement et l'inférence du modèle. Consultez Magasin de fonctionnalités Databricks.
Modèles d'IA générative
Databricks prend en charge l’exploration, le développement et le déploiement de modèles d’IA générative, notamment :
-
AI playground, un environnement de type chat dans le workspace où vous pouvez tester, solliciter et comparer des LLM. Consultez Discuter avec des LLM et prototyper des applications d'IA générative à l'aide d'AI Playground.
-
Un ensemble intégré de modèles de fondation préconfigurés que vous pouvez query :
- Voir APIs de modèle de fondation à paiement par jeton.
- Consultez [Recommandé] Déployer des modèles de fondation à partir d'Unity Catalog pour les modèles de fondation que vous pouvez servir en un seul clic.
-
Les LLM hébergés par des tiers, appelés modèles externes. Ces modèles sont destinés à être utilisés tels quels.
-
Capacités de personnalisation d'un modèle de fondation pour optimiser ses performances pour votre application spécifique (souvent appelé affinement). Consulter affinement du modèle de fondation (obsolète).
Registre des modèles
Databricks propose une version hébergée de MLflow Model Registry dans Unity Catalog. Les modèles enregistrés dans Unity Catalog héritent du contrôle d'accès centralisé, de la traçabilité, de la découverte et de l'accès entre les Workspace. Consultez Gérer le cycle de vie du modèle dans Unity Catalog.
Mise à disposition de modèles
Model Serving offre une interface unifiée pour déployer, gouverner et interroger les modèles d'IA. Chaque modèle que vous servez est disponible en tant qu'API REST que vous pouvez intégrer dans votre application web ou cliente. Avec Model Serving, vous pouvez déployer vos propres modèles, des modèles de fondation ou des modèles tiers hébergés en dehors de Databricks. Voir Déployer des modèles avec Model Serving.
entreposage des données
L'entreposage des données fait référence à la collecte et au stockage de données provenant de plusieurs sources afin qu'elles puissent être rapidement consultées pour obtenir des insights commerciaux et des rapports. Databricks SQL est la collection de services qui apportent des capacités et des performances d'entreposage des données à vos data lakes existants. Voir l’ architecture d’entreposage des données.
query
Une requête est une instruction SQL valide qui vous permet d’interagir avec vos données. Vous pouvez créer des requêtes à l'aide de l'éditeur SQL intégré à la plateforme, ou vous connecter à l'aide d'un connecteur SQL, d'un driver ou d'une API. Consultez Accédez et gérez les requêtes enregistrées pour en savoir plus sur la façon de travailler avec les requêtes.
SQL Warehouse
Une ressource de calcul sur laquelle vous exécutez des requêtes SQL. Il existe trois types de SQL Warehouses : Classic, Pro et Serverless. Databricks recommande d'utiliser des warehouses serverless là où ils sont disponibles. Consultez les SQL Warehouse types pour comparer les fonctionnalités disponibles pour chaque warehouse type.
Historique des query
Une liste des queries exécutées et de leurs caractéristiques de performance. L'historique des query vous permet de surveiller les performances des query, vous aidant à identifier les goulots d'étranglement et à optimiser les durées d'exécution des query. Consultez l'Historique des query.
Visualisation
Une présentation graphique du résultat de l’exécution d’une query. Consultez Visualisations dans les Notebooks et l'éditeur SQL de Databricks.
Tableau de bord
Une présentation des visualisations de données et des commentaires. Vous pouvez utiliser des tableaux de bord pour envoyer automatiquement des rapports à toute personne de votre compte Databricks. Utilisez le Genie Code pour vous aider à créer des visualisations basées sur des invites en langage naturel. Consultez les tableaux de bord. Vous pouvez également créer un tableau de bord à partir d'un notebook. Consultez les tableaux de bord dans les notebooks Databricks.