Aller au contenu principal

Exigences pour les pipelines autonomes

La création et l'actualisation de vues matérialisées autonomes et de tables de streaming nécessitent un Workspace compatible serverless et Unity Catalog, ainsi qu'un SQL Warehouse ou un Notebook sur compute serverless général.

Vous pouvez créer et refresh des vues matérialisées autonomes et des tables de streaming à l'aide d'un SQL Warehouse. Pour soumettre les instructions CREATE et REFRESH, utilisez l'éditeur SQL de l'interface utilisateur de Databricks, le Databricks SQL CLI, ou l'API Databricks SQL.

Vous pouvez également créer et refresh des vues matérialisées et des tables de streaming autonomes à partir d’un Notebook exécuté sur un compute général Serverless (Bêta, disponibilité régionale limitée). See Notebook.

Exigences générales

Les exigences suivantes s’appliquent à tous les pipelines autonomes.

Vous devez avoir :

Autorisations de créer ou de refresh

Le propriétaire (l'utilisateur qui crée la table) doit disposer des autorisations suivantes :

  • SELECT privilège sur les tables de base.
  • USE CATALOG et USE SCHEMA privilèges sur le catalogue et le schéma contenant les tables sources.
  • USE CATALOG et USE SCHEMA privilèges sur le catalogue et le schéma cibles.
  • CREATE MATERIALIZED VIEW privilège sur le schéma contenant la vue matérialisée.
  • CREATE TABLE privilège sur le schéma contenant la table de streaming. Les pipelines utilisant le mode de publication hérité nécessitent également le privilège CREATE TABLE pour les vues matérialisées.

Pour refresh une vue matérialisée ou une table de streaming autonome :

  • Vous devez être dans le Workspace qui l'a créé.
  • Vous devez disposer du privilège REFRESH sur la table. Les propriétaires disposent implicitement de ce privilège.

Exigences de la table source

Pour le refresh incrémentiel des vues matérialisées à partir des tables Delta, les tables source doivent avoir le suivi des lignes activé.

SQL Warehouse

Pour créer ou refresh des vues matérialisées autonomes et des tables de streaming à l'aide d'un SQL Warehouse, vous devez disposer d'un SQL Warehouse Pro ou Serverless compatible Unity Catalog.

Notebook

Vous pouvez créer et refresh des vues matérialisées autonomes et des tables de streaming à partir d'un Notebook avec un compute serverless général.

Compute général serverless

info

Bêta

La création et l'actualisation de vues matérialisées autonomes et de tables de streaming à partir d'un Notebook sur un compute général Serverless est en version Beta. Cette fonctionnalité est disponible dans certaines régions uniquement. Voir Disponibilité régionale.

Vous pouvez créer et refresh des vues matérialisées et des tables de streaming autonomes à partir d'un Notebook attaché à un compute général Serverless. Cette option est utile lorsque vous souhaitez définir et exécuter des vues matérialisées ou des tables de streaming parallèlement à d'autres workflows basés sur des notebooks sans provisionner un SQL Warehouse.

Pour créer et refresh des vues matérialisées autonomes et des tables de streaming avec Python dans un Notebook, consultez Utiliser Python avec des pipelines autonomes.

Exigences générales de compute serverless

  • Un notebook attaché à un compute général serverless.
  • Databricks Runtime 18,1 ou une version ultérieure. Les Notebooks interactifs répondent automatiquement à cette exigence ; les Jobs épinglés à une version plus ancienne ne le font pas.
  • Votre workspace doit se trouver dans une région prise en charge.

Limitations

  • Seul le propriétaire de la table peut refresh la table. Pour permettre à un autre utilisateur de refresh, modifiez le propriétaire. Consultez Modifier le propriétaire d'une table de streaming et Modifier le propriétaire d'une vue matérialisée.
  • Les actualisations asynchrones ne sont pas prises en charge. Utilisez un refresh synchrone à la place.
  • Le canal de distribution de l'aperçu n'est pas pris en charge. Les tables créées sur le compute serverless général utilisent le Canal de distribution current.
  • Une table ne peut être actualisée qu'à l'aide du type de compute avec lequel elle a été créée. Une table créée sur un SQL Warehouse doit être actualisée sur un SQL Warehouse, et une table créée sur un compute général serverless doit être actualisée sur un compute général serverless. Pour vérifier le type de compute, affichez la table dans l’Explorateur de catalogues.
  • L'attribution et le contrôle des coûts ne sont pas disponibles. Utilisez un SQL Warehouse si vous avez besoin d'une attribution des coûts par table.
  • La mise à l'échelle automatique verticale en cas d'erreurs de mémoire insuffisante n'est pas disponible.
  • Les nouvelles tentatives de mise à niveau de schéma ne sont pas disponibles.
  • La sélection du mode de performance sur refresh n'est pas disponible. Voir Sélectionner un mode de performance pour les scheduled refresh.
remarque

spark.sql est pris en charge lors de l'exécution d'un refresh dans un Notebook sur un compute général serverless.

Exigences de la query

Pour query une vue matérialisée autonome ou une table de streaming, vous devez être le propriétaire, ou vous devez avoir SELECT sur la table ainsi que USE CATALOG et USE SCHEMA sur ses parents.

Vous devez utiliser l'une des ressources de compute suivantes :

  • SQL Warehouse
  • LakeFlow Pipelines interfaces
  • Compute en mode d'accès standard (anciennement mode d'accès partagé)
  • Compute en mode d'accès dédié (anciennement mode d'accès utilisateur unique) sur Databricks Runtime 15.4 ou une version ultérieure, si le workspace est activé pour le compute serverless. Consultez Contrôle d'accès granulaire sur le compute dédié. Si vous êtes le propriétaire, vous pouvez utiliser le compute en mode d'accès dédié exécutant Databricks Runtime 14.3 ou une version ultérieure.

Pour les tables de streaming sur Databricks Runtime 15.3 et versions antérieures, vous pouvez utiliser le compute dédié pour query une table de streaming uniquement si vous en êtes propriétaire. Databricks Runtime 15.4 LTS et versions ultérieures prennent en charge les requêtes sur les tables générées par le pipeline sur compute dédié, même si vous n’en êtes pas le propriétaire. Des frais peuvent vous être facturés pour les ressources de compute Serverless lorsque vous utilisez un compute dédié pour exécuter des Opérations de filtrage des données. Voir Contrôle d’accès granulaire sur compute dédié.

Disponibilité régionale

Les tables créées et actualisées à l'aide d'un Databricks SQL warehouse sont disponibles dans toutes les régions qui prennent en charge les Databricks SQL warehouses serverless.

La création et l'actualisation de vues matérialisées autonomes et de tables de streaming sur des ressources de compute générales Serverless ne sont disponibles que dans certaines régions.

Pour la liste des régions prises en charge pour les deux options de compute, consultez la disponibilité Serverless.