Aller au contenu principal

Note de publication de Unity Catalog GA

important

Cette documentation a été retirée et pourrait ne pas être mise à jour. Les produits, services ou technologies mentionnés dans ce contenu ne sont plus pris en charge. Consultez Qu'est-ce que Unity Catalog ?.

25 août 2022

Unity Catalog est maintenant généralement disponible sur Databricks.

Cet article décrit Unity Catalog à la date de sa publication en disponibilité générale (GA). Il se concentre principalement sur les fonctionnalités et les mises à jour ajoutées à Unity Catalog depuis l'aperçu public. Pour des informations à jour sur Unity Catalog, consultez Qu'est-ce que Unity Catalog ? Pour les notes de version qui décrivent les mises à jour de Unity Catalog depuis la disponibilité générale, consultez les notes de version de la plateforme Databricks et les notes de version et compatibilité de Databricks Runtime.

Limites du metastore et quotas de Ressources

Au 25 août 2022

  • Votre compte Databricks ne peut avoir qu'un seul métastore par région.
  • Un metastore peut avoir jusqu'à 1000 catalogues.
  • Un catalogue peut contenir jusqu'à 10 000 schémas.
  • Un schéma peut contenir jusqu'à 10 000 tables.

Pour connaître les quotas Unity Catalog actuels, consultez Limites des ressources.

Formats de stockage pris en charge à GA

Au 25 août 2022 :

  • Toutes les tables gérées de Unity Catalog stockent des données avec Delta Lake
  • Les tables externes Unity Catalog et les emplacements externes prennent en charge Delta Lake, JSON, CSV, Avro, Parquet, ORC et les données textuelles.

Pour les formats de table pris en charge par Unity Catalog actuels, consultez les tables gérées et externes.

Gérer les ressources Unity Catalog à partir de la console du compte

Utilisez l'interface utilisateur de la console de compte Databricks pour :

  • Gérer le cycle de vie du métastore (créer, mettre à jour, supprimer et afficher les métastores gérés par Unity Catalog)
  • Attribuer et supprimer des metastores pour les workspaces

Types de clusters pris en charge et versions de Databricks Runtime

Unity Catalog nécessite des clusters qui exécutent Databricks Runtime 11.1 ou une version ultérieure. Unity Catalog est pris en charge par default sur toutes les versions de compute SQL Warehouse.

Les versions antérieures de Databricks Runtime prenaient en charge les versions préliminaires d'Unity Catalog. Les clusters exécutés sur des versions antérieures de Databricks Runtime ne prennent pas en charge toutes les fonctionnalités GA d'Unity Catalog.

Unity Catalog nécessite l'un des modes d'accès suivants lorsque vous créez un nouveau cluster :

  • Partagé

    • Langues : SQL ou Python
    • Un cluster sécurisé qui peut être partagé par plusieurs utilisateurs. Les utilisateurs du cluster sont entièrement isolés afin qu'ils ne puissent pas voir les données et les identifiants les uns des autres.
  • Utilisateur unique

    • Langages : SQL, Scala, Python, R
    • Un cluster sécurisé qui peut être utilisé exclusivement par un utilisateur unique spécifié.

Pour plus d’informations sur les modes d’accès au cluster, consultez Access modes.

Pour obtenir des informations sur les fonctionnalités mises à jour de Unity Catalog dans les versions ultérieures de Databricks Runtime, consultez les notes de publication pour ces versions.

Tables système

information_schema est entièrement pris en charge pour les ressources de données de Unity Catalog. Chaque métastore comprend un catalogue appelé system qui comprend un information_schema étendu au métastore. Consulter Schéma d'information. Vous pouvez utiliser information_schema pour répondre à des questions telles que les suivantes :

« Comptez le nombre de tables par catalogue »

SQL
SELECT table_catalog, count(table_name)
FROM system.information_schema.tables
GROUP BY 1
ORDER by 2 DESC

« Montrez-moi toutes les tables qui ont été modifiées au cours des dernières 24 heures »

SQL
SELECT table_name, table_owner, created_by, last_altered, last_altered_by, table_catalog
FROM system.information_schema.tables
WHERE datediff(now(), last_altered) < 1

Prise en charge de Structured Streaming

Les charges de travail Structured Streaming sont désormais prises en charge avec Unity Catalog. Pour plus de détails et les limitations, consultez Qu'est-ce que Unity Catalog ?.

Fonctions SQL

Les fonctions SQL définies par l'utilisateur sont désormais entièrement prises en charge sur Unity Catalog. Pour plus d'informations sur la création et l'utilisation des UDF SQL, consultez CREATE FUNCTION (SQL, Python, Scala et Java).

Syntaxe SQL pour les emplacements externes dans Unity Catalog

Les commandes de définition de données et de langage de définition de données standard sont désormais prises en charge dans Spark SQL pour les emplacements externes, notamment les suivants :

SQL
CREATE | DROP | ALTER | DESCRIBE | SHOW EXTERNAL LOCATION

Vous pouvez également gérer et consulter les autorisations avec GRANT, REVOKE et SHOW pour les emplacements externes avec SQL. Consultez Emplacements externes.

Exemple de syntaxe :

SQL
CREATE EXTERNAL LOCATION <your-location-name>
URL `<your-location-path>'
WITH (CREDENTIAL <your-credential-name>);

GRANT READ FILES, WRITE FILES, CREATE EXTERNAL TABLE ON EXTERNAL LOCATION `<your-location-name>`
TO `finance`;

Limites de Unity Catalog au GA

Au 25 août 2022, Unity Catalog présentait les limitations suivantes. Pour les limites actuelles, voir Qu'est-ce que Unity Catalog ?.

  • Scala, R et les charges de travail utilisant le Runtime Machine Learning sont prises en charge uniquement sur les clusters utilisant le mode d'accès utilisateur unique. Les charges de travail dans ces langages ne prennent pas en charge l'utilisation de vues dynamiques pour la sécurité au niveau des lignes ou des colonnes.

  • Les clones superficiels ne sont pas pris en charge lors de l’utilisation d’Unity Catalog comme source ou cible du clone.

  • Le compartimentage n'est pas pris en charge pour les tables Unity Catalog. Si vous exécutez des commandes qui tentent de créer une table compartimentée dans Unity Catalog, cela lancera une exception.

  • L'écriture sur le même chemin ou sur la même table Delta Lake à partir de Workspaces dans plusieurs régions peut entraîner des performances peu fiables si certains clusters accèdent à Unity Catalog et d'autres non.

  • Le mode de remplacement pour les opérations d'écriture DataFrame dans Unity Catalog est pris en charge uniquement pour les tables Delta, et non pour d'autres formats de fichiers. L'utilisateur doit disposer du privilège CREATE sur le schéma parent et doit être le propriétaire de l'objet existant.

  • Le streaming présente actuellement les limitations suivantes :

    • Ce n'est pas pris en charge dans les clusters utilisant le mode d'accès partagé. Pour les charges de travail en streaming, vous devez utiliser le mode d’accès utilisateur unique.
    • La création de points de contrôle asynchrones n'est pas encore prise en charge.
    • Sur Databricks Runtime version 11.2 et inférieure, les queries de streaming qui durent plus de 30 jours sur des clusters à usage général ou des clusters de Job généreront une exception. Pour les queries de streaming de longue durée, configurez des nouvelles tentatives automatiques de Job ou utilisez Databricks Runtime 11.3 et supérieur.
  • Le référencement des tables Unity Catalog à partir des Spark Declarative Pipelines sur Lakeflow n'est actuellement pas pris en charge.

  • Les groupes créés précédemment dans un Workspace ne peuvent pas être utilisés dans les instructions GRANT de Unity Catalog. C'est pour garantir une vue cohérente des groupes qui peuvent s'étendre sur plusieurs Workspace. Pour utiliser les groupes dans les instructions GRANT, créez vos groupes dans la console du compte et mettez à jour toute automatisation pour la gestion des principaux ou des groupes (tels que les connecteurs SCIM, Okta et Microsoft Entra ID, et Terraform) afin de référencer les Endpoints du compte au lieu des Endpoints de l'Workspace.

  • Unity Catalog requiert la version E2 de la plateforme Databricks. Tous les nouveaux comptes Databricks et la plupart des comptes existants sont sur E2.

Régions de disponibilité du Unity Catalog lors de la disponibilité générale

Au 25 août 2022, Unity Catalog était disponible dans les régions suivantes. Pour la liste des régions actuellement prises en charge, consultez Régions et clouds Databricks.

  • us-east-1
  • us-east-2
  • us-west-2
  • ap-northeast-1
  • ap-northeast-2
  • ap-south-1
  • ap-southeast-1
  • ap-southeast-2
  • ca-central-1
  • eu-central-1
  • eu-west-1
  • eu-west-2