Limitations du pipeline
Voici les limites des LakeFlow Pipelines qu'il est important de connaître lors du développement de vos pipelines :
-
Un workspace Databricks est limité à 1 000 mises à jour de pipeline simultanées. Le nombre de jeux de données qu'un seul pipeline peut contenir est déterminé par la configuration du pipeline et la complexité de la charge de travail.
-
La configuration d'un pipeline inclut des références aux fichiers et dossiers source.
-
Si la configuration ne référence que des notebooks ou des fichiers individuels, la limite par pipeline est de 100 fichiers source.
-
Si la configuration inclut des dossiers, vous pouvez inclure jusqu'à 50 entrées sources composées de fichiers ou de dossiers.
Référencer un dossier fait référence indirectement aux fichiers de ce dossier. Dans ce cas, la limite sur le nombre de fichiers référencés (directement ou indirectement) est de 1 000.
Si vous avez besoin de plus de 100 fichiers source, organisez-les en dossiers. Pour savoir comment utiliser les dossiers pour contenir les fichiers source, consultez Explorateur d’assets de pipeline dans l’éditeur de LakeFlow Pipelines.
-
-
Les datasets de pipeline peuvent être définis une seule fois. Pour cette raison, ils ne peuvent être la cible que d'une seule opération dans tous les pipelines. L'exception concerne les tables de streaming avec traitement de flux d'ajout, ce qui vous permet d'écrire dans la table de streaming à partir de plusieurs sources de streaming. Voir default flows et flux d'ajout.
-
Les colonnes d'identité présentent les limitations suivantes. Pour en savoir plus sur les colonnes d'identité dans les tables Delta, consultez Colonnes d'identité.
- Les colonnes d’identité ne sont pas prises en charge avec les tables cibles du traitement AUTO CDC.
- Les colonnes d'identité pourraient être recalculées lors des mises à jour des vues matérialisées. Pour cette raison, Databricks recommande d'utiliser des colonnes d'identité dans les pipelines uniquement avec les tables de streaming.
-
Par défaut, les vues matérialisées et les tables de streaming sont accessibles uniquement par les clients et applications Databricks. Pour les rendre accessibles aux systèmes externes, consultez Accéder aux vues matérialisées et aux tables de streaming à l'aide de systèmes externes.
-
Il existe des limitations pour le compute Databricks nécessaire pour exécuter et interroger les pipelines Unity Catalog. Consultez les exigences pour les pipelines qui publient dans Unity Catalog.
-
Les query de time travel de Delta Lake sont prises en charge uniquement avec les tables de streaming, et ne sont pas prises en charge avec les vues matérialisées. Consultez Travailler avec l'historique des tables.
-
La fonction
pivot()n'est pas prise en charge. L'pivotopération dans Spark nécessite le chargement anticipé des données d'entrée pour calculer le schéma de sortie. Cette fonctionnalité n'est pas prise en charge dans les pipelines.
Pour les quotas de ressources LakeFlow Pipelines, consultez les limites de ressources.