Aller au contenu principal

Découverte des données et collaboration dans le lakehouse

Databricks permet une collaboration sécurisée et gouvernée entre les charges de travail de données, d'analytique et d'IA sur le Lakehouse. En utilisant Unity Catalog et des protocoles ouverts comme OpenSharing, les équipes peuvent découvrir, partager et analyser des données à grande échelle tout en maintenant la gouvernance, l'auditabilité et la confidentialité entre les cas d'utilisation et les collaborateurs.

Gérer les autorisations à l'échelle

Unity Catalog offre aux administrateurs un emplacement unifié pour attribuer des autorisations pour les catalogues, les bases de données, les tables et les vues à des groupes d'utilisateurs. Les privilèges et les metastores sont partagés entre les Workspace, ce qui permet aux administrateurs de définir des autorisations sécurisées une seule fois pour les groupes synchronisés à partir des fournisseurs d'identité et de savoir que les utilisateurs finaux n'ont accès qu'aux données appropriées dans n'importe quel Workspace Databricks auquel ils accèdent.

Unity Catalog permet également aux administrateurs de définir des identifiants de stockage, une méthode sécurisée pour stocker et partager les autorisations sur l'infrastructure de stockage cloud. Vous pouvez accorder des privilèges sur ces sécurisables pour permettre aux utilisateurs de l'organisation de définir des emplacements externes par rapport aux emplacements de stockage d'objets cloud, ce qui permet aux data engineers de s'auto-approvisionner pour de nouvelles charges de travail sans avoir besoin de fournir des autorisations élevées dans les consoles de compte cloud.

Découvrez les données sur Databricks

Les utilisateurs peuvent parcourir les objets de données disponibles dans Unity Catalog à l'aide de l'Explorateur de catalogues. Catalog Explorer utilise les privilèges configurés par les administrateurs Unity Catalog pour s'assurer que les utilisateurs ne peuvent voir que les catalogues, bases de données, tables et vues pour lesquels ils ont les autorisations de query. Une fois que les utilisateurs trouvent un dataset intéressant, ils peuvent examiner les noms et les types de champs, lire les commentaires sur les tables et les champs individuels, et prévisualiser un échantillon des données. Les utilisateurs peuvent également consulter l'historique complet de la table pour comprendre quand et comment les données ont changé, et la fonctionnalité de traçabilité permet aux utilisateurs de suivre comment certains datasets sont dérivés de Jobs en amont et utilisés dans des Jobs en aval.

Les identifiants de stockage et les emplacements externes sont également affichés dans l'Explorateur de catalogues, permettant à chaque utilisateur de voir les privilèges dont vous avez besoin pour lire et écrire des données sur l'ensemble des emplacements et ressources disponibles.

Accélérer le temps de mise en production avec le lakehouse

Databricks prend en charge les workloads en SQL, Python, Scala et R, permettant aux utilisateurs ayant des ensembles de compétences et des parcours techniques diversifiés d’utiliser leurs connaissances pour en tirer des insights analytiques. Vous pouvez utiliser toutes les langues prises en charge par Databricks pour définir des jobs de production, et les notebooks peuvent utiliser une combinaison de langues. Cela signifie que vous pouvez promouvoir les queries rédigées par des analystes SQL pour l’ETL du dernier kilomètre dans le code de data engineering de production avec presque aucun effort. Les queries et les workloads définis par les personas au sein de l’organisation utilisent les mêmes datasets, il n’est donc pas nécessaire de concilier les noms de champs ou de s’assurer que les tableaux de bord sont à jour avant de partager le code et les résultats avec d’autres équipes. Vous pouvez partager en toute sécurité du code, des Notebooks, des requêtes et des tableaux de bord, le tout propulsé par la même infrastructure cloud évolutive et défini à partir des mêmes sources de données sélectionnées.