Aller au contenu principal

Ingérer des données à partir du stockage d'objets cloud

Cet article liste les façons dont vous pouvez configurer l'ingestion incrémentielle depuis le stockage objet cloud.

Interface utilisateur d'ajout de données

Pour apprendre à utiliser l'interface utilisateur d'ajout de données pour créer une table gérée à partir de données dans un stockage d'objets cloud, consultez Charger des données à l'aide d'un emplacement externe Unity Catalog.

Notebook ou éditeur SQL

Cette section décrit les options de configuration de l'ingestion incrémentielle à partir du stockage d'objets cloud à l'aide d'un Notebook ou de l'éditeur Databricks SQL.

Auto Loader

Auto Loader traite progressivement et efficacement les nouveaux fichiers de données au fur et à mesure qu’ils arrivent dans le stockage cloud, sans configuration supplémentaire. Auto Loader fournit une source Structured Streaming appelée cloudFiles. Étant donné un chemin de répertoire d’entrée sur le stockage de fichiers cloud, la source cloudFiles traite automatiquement les nouveaux fichiers à mesure qu’ils arrivent, avec la possibilité de traiter également les fichiers existants dans ce répertoire.

COPY INTO

Avec COPY INTO, les utilisateurs SQL peuvent ingérer des données de manière idempotente et incémentielle à partir du stockage objet cloud dans des tables Delta. Vous pouvez utiliser COPY INTO dans Databricks SQL, les Notebooks et les Lakeflow Jobs.

Quand utiliser COPY INTO et quand utiliser Auto Loader

Voici quelques éléments à prendre en compte pour choisir entre Auto Loader et COPY INTO:

  • Si vous devez importer des milliers de fichiers au fil du temps, vous pouvez utiliser COPY INTO. Si vous vous attendez à des millions de fichiers ou plus au fil du temps, utilisez Auto Loader. Auto Loader nécessite moins d'Opérations totales pour découvrir les fichiers par rapport à COPY INTO et peut diviser le traitement en plusieurs batches, ce qui signifie qu'Auto Loader est moins coûteux et plus efficace à l'échelle.

  • Si votre schéma de données doit évoluer fréquemment, Auto Loader fournit de meilleurs types de données primitifs autour de l'inférence et de l'évolution du schéma. Voir configurer l'inférence et l'évolution du schéma dans Auto Loader pour plus de détails.

  • Le chargement d'un sous-ensemble de fichiers réimportés peut être un peu plus facile à gérer avec COPY INTO. Avec Auto Loader, il est plus difficile de retraiter un sous-ensemble de fichiers sélectionné. Toutefois, vous pouvez utiliser COPY INTO pour recharger le sous-ensemble de fichiers pendant qu'un Auto Loader Stream s'exécute simultanément.

  • Pour une expérience d'ingestion de fichiers encore plus évolutive et robuste, Auto Loader permet aux utilisateurs SQL de tirer parti des tables en streaming. Consultez Utiliser des tables de streaming autonomes.

Pour un bref aperçu et une démonstration d'Auto Loader et de COPY INTO, regardez la vidéo YouTube suivante (2 minutes).

Automatisez l'ETL avec les Lakeflow pipelines et Auto Loader

Vous pouvez simplifier le déploiement d'une infrastructure d'ingestion incrémentielle et évolutive avec Auto Loader et LakeFlow Pipelines. Les Lakeflow pipelines n'utilisent pas l'exécution interactive standard que l'on trouve dans les Notebooks ; au lieu de cela, ils mettent l'accent sur le déploiement d'une infrastructure prête pour la production.

Outils d'ingestion tiers

Databricks valide les intégrations de partenaires technologiques qui vous permettent d'ingérer des données de diverses sources, y compris le stockage objet cloud. Ces intégrations permettent une ingestion de données low-code et évolutive à partir de diverses sources dans Databricks. See partenaire technologique. Certains partenaires technologiques sont présentés dans Qu’est-ce que Databricks Partner Connect ?, qui fournit une interface utilisateur simplifiant la connexion d’outils tiers à vos données lakehouse.