Data engineering avec Databricks
Databricks offre Lakeflow, une solution de data engineering de bout en bout qui permet aux data engineers, aux développeurs de logiciels, aux développeurs SQL, aux analystes et aux data scientists de fournir des données de haute qualité pour l'analytique en aval, l'IA et les applications opérationnelles. Lakeflow est une solution unifiée pour l'ingestion, la transformation et l'orchestration de vos données, et inclut Lakeflow Connect, Lakeflow Pipelines, Lakeflow Designer et Lakeflow Jobs.
Lakeflow Connect
Lakeflow Connect simplifie l'ingestion de données grâce à des connecteurs vers des applications d'entreprise populaires, des bases de données, le stockage cloud, des bus de messages et des fichiers locaux. See Lakeflow Connect.
-
- Connecteurs gérés
- Les connecteurs managés fournissent une interface utilisateur simple et un service d'ingestion basé sur la configuration avec des frais opérationnels minimes, sans nécessiter l'utilisation des APIs de pipeline et de l'infrastructure sous-jacentes.
-
- Connecteurs standard
- Les connecteurs standard offrent la possibilité d'accéder aux données à partir d'un plus large éventail de sources de données à l'intérieur de vos pipelines ou d'autres queries.
LakeFlow Pipelines
Les Lakeflow Pipelines réduisent la complexité de la création et de la gestion de pipelines de données batch et de streaming efficaces. Construits sur Apache Spark™ Declarative Pipelines (SDP), le cadre déclaratif pour les pipelines batch et de streaming en SQL et Python, les Lakeflow Pipelines s'exécutent sur le Databricks Runtime optimisé pour les performances et restent interopérables avec celui-ci. Un pipeline orchestre automatiquement l'exécution des flux, des récepteurs, des tables de streaming et des vues matérialisées. See LakeFlow Pipelines.
-
- Flux
- Les flux traitent les données dans des pipelines. L'API de flux utilise la même API DataFrame qu'Apache Spark et Structured Streaming. Un flux peut écrire dans des tables et des récepteurs de streaming, tel qu'un Kafka topic, en utilisant la sémantique de streaming, ou il peut écrire dans une vue matérialisée en utilisant la sémantique de batch.
-
- Tables de streaming
- Une table de streaming est une table Delta avec un support supplémentaire pour le traitement des données en streaming ou incrémentiel. Il agit comme cible pour un ou plusieurs flux dans des pipelines.
-
- Vues matérialisées
- Une vue matérialisée est une vue avec des résultats mis en cache pour un accès plus rapide. Une vue matérialisée sert de cible pour les pipelines.
-
- Puits
- Les pipelines prennent en charge les dépôts de données externes comme cibles. Ces puits peuvent inclure des services de streaming d'événements, comme Apache Kafka ou Azure Event Hub, des tables externes gérées par Unity Catalog, ou des puits personnalisés définis en Python.
Lakeflow Designer
Lakeflow Designer est un outil visuel de préparation de données dans Databricks. Créez et explorez des workflows de transformations à l'aide d'un canevas glisser-déposer ou d'invites en langage naturel. Tous les workflows de concepteur sont basés sur du code prêt pour la production, régi par Unity Catalog. See Lakeflow Designer.
-
- Préparation des données visuelles
- Créez des workflows de transformation de données à l'aide d'un espace de dessin par glisser-déposer.
-
- Ingérer des données
- Importez toutes les données accessibles via Databricks dans une préparation visuelle des données dans Lakeflow Designer.
-
- Opérateurs intégrés
- Utilisez les opérateurs intégrés pour le filtrage, l'agrégation, la jointure et le remodelage des données.
-
- Mises à jour en utilisant le langage naturel
- Générez ou mettez à jour des transformations à l'aide d'invites en langage naturel dans Genie Code.
Lakeflow Jobs
Lakeflow Jobs offre une orchestration fiable et un monitoring de production pour toute charge de travail de données et d'IA. Un job peut consister en une ou plusieurs tâches qui exécutent des notebooks, des pipelines, des connecteurs gérés, des requêtes SQL, l'entraînement de modèles de Machine Learning, ainsi que le déploiement et l'inférence de modèles. Les tâches prennent également en charge une logique de flux de contrôle personnalisée, comme le branchement avec des instructions if/else et la boucle avec des instructions for each. See Lakeflow Jobs.
-
- Jobs
- Les Jobs sont la principale ressource pour l'orchestration. Ils représentent un processus que vous souhaitez effectuer sur une base planifiée.
-
- Tâches
- Une unité de travail spécifique au sein d'un Job. Il existe une variété de types de tâches qui vous offrent un éventail d'options pouvant être exécutées au sein d'un job.
-
- Flux de contrôle dans les jobs
- Les tâches de flux de contrôle vous permettent de contrôler si d'autres tâches doivent être exécutées, ou l'ordre des tâches à exécuter.
Databricks Runtime pour Apache Spark
Le Databricks Runtime est un environnement de compute fiable et optimisé pour les performances, permettant d'exécuter des charges de travail Spark, y compris en batch et en streaming. Le Databricks Runtime fournit Photon, un moteur de query vectorisé natif Databricks à haute performance, et diverses optimisations d'infrastructure comme l'autoscaling. Vous pouvez exécuter vos charges de travail Spark et Structured Streaming sur le Databricks Runtime en créant vos programmes Spark sous forme de Notebooks, de JARs ou de Python wheels. Voir Databricks Runtime pour Apache Spark.
-
- Apache Spark sur Databricks
- Spark est au cœur de la Databricks Data Intelligence Platform.
-
- streaming structuré
- Structured Streaming est le moteur de traitement Spark en quasi temps réel pour les données de streaming.
Qu'est-il arrivé à Delta Live Tables (DLT) ?
Si vous connaissez les Delta Live Tables (DLT), consultez Qu'est-il arrivé aux Delta Live Tables (DLT) ?.
Ressources supplémentaires
- Les concepts de Data Engineering décrivent les concepts de Data Engineering dans Databricks.
- Delta Lake est la couche de stockage optimisée qui constitue le fondement des tables d'un lakehouse dans Databricks.
- Bonnes pratiques en matière de Data Engineering vous informe sur les bonnes pratiques en Data Engineering dans Databricks.
- Les Notebooks Databricks sont un outil populaire pour la collaboration et le développement.
- Databricks SQL décrit l'utilisation de queries SQL et d'outils BI dans Databricks.
- Le Machine Learning sur Databricks décrit l'architecture des Solutions Machine Learning.