Aller au contenu principal

Architecture de haut niveau

Cet article fournit un aperçu de haut niveau de l'architecture Databricks, y compris son architecture d'entreprise, en combinaison avec AWS.

Objets Databricks

Un compte Databricks est la construction de niveau supérieur que vous utilisez pour gérer Databricks au sein de votre organisation. Au niveau du compte, vous gérez :

  • Identité et accès : utilisateurs, groupes, Service Principal, provisionnement SCIM et configuration SSO.

  • Gestion des Workspaces : Création, mise à jour et suppression de Workspaces dans plusieurs régions.

  • Gestion des metastores Unity Catalog : Créer et attacher un metastore aux workspaces.

  • Gestion de l'utilisation : facturation, conformité et politiques.

Un compte peut contenir plusieurs workspaces et métastores Unity Catalog.

  • Les **Espaces de travail** sont l'environnement de collaboration où les utilisateurs exécutent des charges de travail compute, telles que : l'ingestion, l'exploration interactive, les tâches Job planifiées et la formation au ML.

  • Les métastores Unity Catalog sont le système de gouvernance central pour les assets de données tels que les tables et les modèles ML. Vous organisez les données dans un métastore sous un espace de noms à trois niveaux :

<catalog-name>.<schema-name>.<object-name>

Les métastores sont associés aux espaces de travail. Vous pouvez Linker un métastore unique à plusieurs Databricks Workspaces dans la même région, offrant à chaque Workspace la même vue des données. Les contrôles d'accès aux données peuvent être gérés dans tous les espaces de travail liés.

Diagramme : hiérarchie d&#39;objets Databricks

Architecture de l'Workspace

Databricks opère à partir d’un plan de contrôle et d’un plan de compute.

  • Le plan de contrôle comprend les services back-end que Databricks gère dans votre compte Databricks. Le plan de contrôle est situé dans le compte Databricks, pas dans votre compte cloud. L'application web se trouve dans le plan de contrôle.

  • Le plan de compute est l'endroit où vos données sont traitées. Il existe deux types de plans de compute selon le compute que vous utilisez.

    • Pour le compute serverless, les ressources de compute serverless s’exécutent dans un plan de compute serverless dans votre compte Databricks.
    • Pour le compute Databricks classique, les ressources de compute se trouvent dans votre compte AWS, dans ce que l'on appelle le plan de compute classique . Ceci fait référence au réseau de votre compte AWS et à ses ressources.

    Pour en savoir plus sur le compute classique et le compute serverless, consultez Compute.

Architecture du workspace classique

Les workspaces Databricks classiques ont un compartiment de stockage associé connu sous le nom de **compartiment de stockage du workspace**. Le compartiment de stockage du workspace se trouve dans votre compte AWS.

Le diagramme suivant décrit l'architecture générale de Databricks pour les Workspace classiques.

Diagramme : architecture Databricks pour AWS

Architecture de workspace Serverless

Le stockage du Workspace dans les Workspaces Serverless est stocké dans le stockage default du Workspace. Vous pouvez également vous connecter à votre compte de stockage cloud pour accéder à vos données. Le diagramme suivant décrit l’architecture générale des workspaces serverless.

Diagramme : architecture du Workspace Serverless Databricks

Plan de compute Serverless

Dans le plan de calcul serverless, les ressources de compute Databricks s'exécutent dans une couche de calcul au sein de votre compte Databricks. Databricks crée un plan de compute serverless dans la même région AWS que le plan de compute classique de votre Workspace. Vous sélectionnez cette région lors de la création d'un Workspace.

Afin de protéger les données client au sein du plan de compute serverless, le compute serverless s'exécute à l'intérieur d'un périmètre réseau pour le Workspace, avec diverses couches de sécurité pour isoler les différents Workspaces de clients Databricks et des contrôles réseau supplémentaires entre les clusters d'un même client.

Pour en savoir plus sur la mise en réseau dans le plan compute Serverless, consultez Réseau de plan compute serverless.

Plan de compute classique

Dans le plan de compute classique, les Ressources de compute Databricks s’exécutent dans votre compte AWS. De nouvelles Ressources de compute sont créées au sein du réseau virtuel de chaque Workspace dans le compte AWS du client.

Un plan de compute classique possède une isolation naturelle, car il s'exécute dans le propre compte AWS de chaque client. Pour en savoir plus sur la mise en réseau dans le plan de compute classique, consultez Mise en réseau du plan de compute classique.

Pour le support régional, consultez les clouds et régions Databricks.

Stockage du Workspace

Le stockage du Workspace est géré différemment selon le type de votre Workspace. Pour plus d'informations sur les types de Workspace, consultez Créer un Workspace.

Le stockage Workspace contient deux catégories de données : données du système de fichiers Workspace et données système Workspace. Les deux sont distincts de vos propres objets de données (tels que les tables et volumes Unity Catalog).

Données du système de fichiers Workspace

Le système de fichiers du workspace stocke les assets que les utilisateurs créent et gèrent via l'interface utilisateur Databricks. Sont concernés :

  • Notebooks
  • Requêtes SQL et tableaux de bord
  • Alertes
  • Repos (dossiers attachés aux repositories Git)
  • Bibliothèques (.whl, .jar)
  • Fichiers Python, fichiers de configuration YAML et autres petits fichiers

Pour plus d'informations sur les fichiers du Workspace, consultez Que sont les fichiers du Workspace ?. Pour obtenir une liste complète des assets du Workspace, consultez Introduction aux objets du Workspace.

Données système de Workspace

Chaque Databricks workspace stocke également des données système générées en interne par les fonctionnalités Databricks. Ces données sont trop volumineuses pour être stockées en mémoire ou dans des bases de données, ou doivent persister au-delà de la durée de vie d'une seule ressource de compute. Exemples de données système du Workspace :

  • Résultats de query SQL et résultats de query mis en cache
  • Résultats d'exécution du Job
  • Révisions du Notebook
  • Plans de requête SQL utilisés pour l'observabilité
  • Logs des clusters

Pour plus de détails sur la façon dont le stockage du Workspace est configuré pour chaque type de Workspace, consultez les sections ci-dessous.

Workspaces Serverless

Les Workspaces Serverless utilisent le stockage default, qui est un emplacement de stockage entièrement managé pour les données système internes du Workspace et les assets de données Unity Catalog. Les workspaces Serverless permettent également de se connecter à vos emplacements de stockage cloud pour vos propres catalogues, tables et autres assets de données. Consultez Stockage par default dans Databricks.

Classic Workspace

important

Ne supprimez pas ou ne modifiez pas le stockage du Workspace dans votre compte cloud. Un workspace Databricks dépend de ses bases de données du plan de contrôle et de son stockage de workspace pour un fonctionnement correct. Si le stockage du workspace est supprimé, le workspace ne peut pas être récupéré.

Dans les Workspace classiques, les données système du Workspace sont distinctes de Qu’est-ce que DBFS ?. Bien que les deux puissent résider dans le même compartiment de stockage cloud dans les Workspace classiques, ils servent à des fins différentes. La racine DBFS est un système de fichiers accessible aux utilisateurs, tandis que les données système du workspace sont utilisées en interne par les fonctionnalités Databricks.

Les Workspace classiques vous demandent de fournir un compartiment S3 et un préfixe à utiliser comme compartiment de stockage du Workspace. Ce compartiment S3 contiendra :

  • Données système du Workspace: données internes générées par les fonctionnalités Databricks
  • Catalogue du workspace Unity Catalog : Si votre workspace a été activé automatiquement pour Unity Catalog, le bucket de stockage du workspace contient le catalogue de workspace par default. Tous les utilisateurs de votre workspace peuvent créer des assets dans le schéma par default de ce catalogue. Consultez Se familiariser avec Unity Catalog.
  • DBFS (hérité) : La racine DBFS et les montages DBFS sont hérités et peuvent être désactivés dans votre Workspace. DBFS (Databricks File System) est un système de fichiers distribué dans les environnements Databricks, accessible sous l'espace de noms dbfs:/. La racine DBFS et les montages DBFS se trouvent tous deux dans l'espace de noms dbfs:/. Le stockage et l'accès aux données à l'aide de la racine DBFS ou des montages DBFS est un modèle obsolète et n'est pas recommandé par Databricks. Pour plus d'information, consultez Qu'est-ce que DBFS ?.