Migrez les applications de données vers Databricks
Cet article fournit une introduction à la migration des applications de données existantes vers Databricks. Databricks propose une approche unifiée qui vous permet de travailler avec des données provenant de nombreux systèmes sources sur une seule plateforme.
Pour un aperçu des capacités de la plateforme, consultez Qu'est-ce que Databricks ?.
Migrez les Jobs ETL vers Databricks
Vous pouvez migrer les jobs Apache Spark utilisés pour extraire, transformer et charger des données d'implémentations on-premise ou cloud natives vers Databricks en quelques étapes. Consultez Adaptez votre code Apache Spark existant pour Databricks.
Databricks étend les fonctionnalités de Spark SQL avec des intégrations open source préconfigurées, des intégrations de Partenaires et des offres de produits d'entreprise. Si vos charges de travail ETL sont rédigées en SQL ou Hive, vous pouvez migrer vers Databricks avec une refactorisation minimale. En savoir plus sur les offres Databricks SQL :
- Entreposage des données sur Databricks
- Spark Declarative Pipelines
- Qu’est-ce que Databricks Partner Connect ?
Pour obtenir des instructions spécifiques sur la migration de divers systèmes sources vers Databricks, consultez Migrer des pipelines ETL vers Databricks.
Remplacez votre data warehouse d'entreprise par un lakehouse
Databricks offre une valeur et des performances optimales lorsque les charges de travail s'alignent autour des données stockées dans le lakehouse. De nombreuses piles de données d'entreprise incluent à la fois un data lake et un data warehouse d'entreprise, et les organisations créent des workflows ETL complexes pour tenter de maintenir ces systèmes et ces données synchronisés. Le lakehouse vous permet d'utiliser les mêmes données, stockées dans le data lake, pour les requêtes et les systèmes qui s'appuient généralement sur un data warehouse distinct. Pour en savoir plus sur le lakehouse, consultez Qu'est-ce qu'un data lakehouse ?. Pour en savoir plus sur l'entreposage des données sur Databricks, voir Architecture d'entreposage des données.
La migration d'un data warehouse d'entreprise vers le lakehouse implique généralement une réduction de la complexité de votre architecture et de vos workflows de données, mais il existe certaines mises en garde et meilleures pratiques à garder à l'esprit lors de l'exécution de ce travail. Voir Migrer votre data warehouse vers le lakehouse Databricks.
Pour convertir le code SQL hérité de dialectes tels que T-SQL, Snowflake et Oracle en ANSI SQL dans le cadre de cette migration, utilisez Lakebridge Agentic Converter. Consultez Convertir le code SQL avec Lakebridge Agentic Converter.
Unifiez vos charges de travail de ML, de Data Science et d'analytique
Puisque le lakehouse offre un accès optimisé aux fichiers de données basés sur le cloud via des requêtes de table ou des chemins de fichiers, vous pouvez faire du ML, de la data science et de l'analytique sur une seule copie de vos données. Databricks facilite le déplacement des charges de travail depuis les outils open source et propriétaires, et maintient à jour de nombreuses bibliothèques open source utilisées par les analystes et les data scientists.
Les charges de travail Pandas dans les Notebook Jupyter peuvent être synchronisées et exécutées à l'aide des dossiers Git Databricks. Databricks prend en charge nativement Pandas dans toutes les versions de Databricks Runtime, et configure de nombreuses bibliothèques de ML et de deep learning populaires dans Databricks Runtime for Machine Learning. Si vous synchronisez vos charges de travail locales à l'aide de Git et des fichiers du workspace dans les dossiers Git, vous pouvez utiliser les mêmes chemins relatifs pour les données et les bibliothèques personnalisées présentes dans votre environnement local.
Par default, Databricks maintient .ipynb extensions pour les Notebooks Jupyter synchronisés avec les dossiers Git Databricks, mais convertit automatiquement les Notebooks Jupyter en Notebooks Databricks lorsqu'ils sont importés avec l'interface utilisateur. Les notebooks Databricks sont enregistrés avec une extension .py, et peuvent donc coexister avec les notebooks Jupyter dans un repository Git.