Aller au contenu principal

Qu'est-ce que le protocole OpenSharing Databricks-to-Databricks ?

Cette page donne un aperçu de la façon d'utiliser Databricks-to-Databricks OpenSharing pour partager des données en toute sécurité avec n'importe quel utilisateur Databricks, quel que soit le compte ou l'hôte cloud, tant que cet utilisateur a accès à un Workspace activé pour Unity Catalog.

Qui devrait utiliser Databricks-to-Databricks OpenSharing ?

Il existe trois façons de partager des données à l'aide d'OpenSharing.

  1. Le protocole de partage Databricks-to-Databricks , traité dans cet article, vous permet de partager des données de votre Workspace compatible Unity Catalog avec des utilisateurs qui ont également accès à un Workspace Databricks compatible Unity Catalog.

    Cette approche utilise le serveur OpenSharing intégré à Databricks et prend en charge le partage de notebooks, la gouvernance des données Unity Catalog, l'audit et le suivi de l'utilisation pour les fournisseurs et les destinataires. L'intégration avec Unity Catalog simplifie la configuration et la gouvernance pour les fournisseurs et les destinataires et améliore les performances.

  2. Le protocole de partage Databricks-to-Open vous permet de partager les données que vous gérez dans un Workspace Databricks compatible avec Unity Catalog avec les utilisateurs sur n'importe quelle plateforme informatique.

    Consultez Qu'est-ce que le protocole de partage Databricks-à-Ouvert ?.

  3. Une implémentation gérée par le client du serveur OpenSharing open source vous permet de partager de n’importe quelle plateforme à n’importe quelle plateforme, que ce soit Databricks ou non.

    Voir le projet open source.

Pour une introduction à OpenSharing et plus d'informations sur ces trois approches, consultez Qu'est-ce qu'OpenSharing ?.

Flux de travail Databricks-to-Databricks OpenSharing

Cette section fournit une présentation générale du workflow de partage Databricks-to-Databricks, avec des liens vers une documentation détaillée pour chaque étape.

Dans le modèle OpenSharing Databricks-to-Databricks :

  1. Un destinataire de données donne à un fournisseur de données l’ identifiant de partage unique pour le métastore Databricks Unity Catalog qui est rattaché au Workspace Databricks que le destinataire (qui représente un utilisateur ou un groupe d’utilisateurs) utilisera pour accéder aux données que le fournisseur de données partage.

    Pour plus de détails, consultez Étape 1 : demander l'identifiant de partage du destinataire.

  2. Le fournisseur de données crée un partage dans le metastore Unity Catalog du fournisseur. Cet objet nommé contient une collection de tables, de vues, de volumes et de Notebooks enregistrés dans le metastore.

    Pour plus de détails, consultez Créer des partages pour OpenSharing.

  3. Le fournisseur de données crée un objet destinataire dans le métastore Unity Catalog du fournisseur. Cet objet nommé représente l'utilisateur ou le groupe d'utilisateurs qui accéderont aux données incluses dans le partage, ainsi que l'identifiant de partage du métastore Unity Catalog qui est associé au workspace que l'utilisateur ou le groupe d'utilisateurs utilisera pour accéder au partage. L'identifiant de partage est l'identifiant clé qui permet la connexion sécurisée.

    Pour plus de détails, voir Étape 2 : Créer le destinataire.

  4. Le fournisseur de données accorde au destinataire l’accès au partage.

    Pour plus de détails, consultez Gérer l'accès aux partages de données OpenSharing (pour les fournisseurs).

  5. Le partage devient disponible dans le workspace Databricks du destinataire, et les destinataires peuvent y accéder à l'aide de l'Explorateur de catalogues, de la CLI Databricks, ou des commandes SQL dans un Notebook Databricks ou l'éditeur de query Databricks SQL.

    Pour accéder aux tables, vues, volumes et Notebooks dans un partage, un administrateur de métastore ou un utilisateur privilégié doit créer un catalogue à partir du partage. Alors cet utilisateur ou un autre utilisateur à qui les privilèges appropriés sont accordés peut donner à d'autres utilisateurs l'accès au catalogue et aux objets du catalogue. L'octroi d'autorisations sur les catalogues partagés et les data assets fonctionne comme pour tout autre asset enregistré dans Unity Catalog, à la différence importante que les utilisateurs ne peuvent se voir accorder qu'un accès en lecture aux objets des catalogues créés à partir des partages OpenSharing.

    Les notebooks partagés résident au niveau du catalogue, et tout utilisateur disposant du privilège USE CATALOG sur le catalogue peut y accéder.

    Pour plus de détails, consultez Lire les données partagées à l'aide de Databricks-to-Databricks OpenSharing (pour les destinataires).

Améliorer les performances de lecture des tables avec le partage d'historique

Les partages de tables Databricks-to-Databricks peuvent améliorer les performances en activant le partage d'historique. Le partage de l'historique améliore les performances en tirant parti des identifiants de sécurité temporaires de votre stockage cloud, restreints au répertoire racine de la table Delta partagée du fournisseur, ce qui se traduit par des performances comparables à l'accès direct aux tables sources.

  • Pour les nouveaux partages de tables, spécifiez WITH HISTORY lors de la création du partage de table. Consultez Ajouter des tables à un partage. Lorsque vous partagez une table à l'aide de compute sur Databricks Runtime 16.2 et versions ultérieures, WITH HISTORY est le default.
  • Pour les partages de table existants, vous devez modifier le partage pour partager l'historique de la table. Consultez Mettre à jour les partages. Lorsque vous partagez une table en utilisant le compute sur Databricks Runtime 16.2 et versions ultérieures, WITH HISTORY est le default.

Lorsque vous partagez un schéma entier, toutes les tables du schéma sont partagées avec l'historique par default.

remarque

Les tables avec partitionnement activé ne bénéficient pas des avantages de performance du partage de l'historique. Consultez Spécifier les partitions de table à partager

Pour connaître les exigences d'éligibilité des jetons cloud et les considérations relatives à la confidentialité des données, consultez la page sur l'éligibilité des jetons cloud.

Matrice de prise en charge Databricks-to-Databricks OpenSharing pour les environnements cloud

Databricks-to-Databricks OpenSharing prend en charge le partage au sein du même type d'environnement. Les clouds commerciaux incluent des workspaces avec des contrôles de conformité activés, tels que FedRAMP Moderate. Le partage avec les environnements Azure Government n'est pas pris en charge.

info

Aperçu

Le partage entre les domaines réglementaires est en Aperçu public.

Dans cette matrice, chaque ligne représente l'environnement du fournisseur (le métastore partageant les données), et chaque colonne représente l'environnement du destinataire (le métastore recevant les données partagées).

Fournisseur

Destinataire : Clouds commerciaux

Destinataire : AWS GovCloud

Destinataire : AWS GovCloud DoD

Destinataire : Azure Chine

Clouds commerciaux

AWS GovCloud

AWS GovCloud DoD

Azure China

Fournisseur

Destinataire : Clouds commerciaux

Destinataire : AWS GovCloud

Destinataire : AWS GovCloud DoD

Destinataire : Azure Chine

Clouds commerciaux

AWS GovCloud

AWS GovCloud DoD

Azure China

Limitations

Les limitations suivantes s'appliquent au partage inter-domaines réglementaires :

  • Les jetons cloud sont utilisés, à moins qu'un partage n'entre ou ne sorte d'AWS GovCloud ou d'AWS GovCloud DoD. Dans les cas suivants, des tables sont partagées à l'aide d'URL pré-signées à la place :

    • Un cloud commercial partage avec ou reçoit des partages d'AWS GovCloud ou d'AWS GovCloud DoD.
    • AWS GovCloud et AWS GovCloud DoD partagent des informations.
  • Les Workspace commerciaux GCP ne peuvent pas partager avec ou recevoir de partages d'AWS GovCloud DoD.