Qu'est-ce que Databricks ?
Databricks est une plateforme d'analytique unifiée et ouverte pour créer, déployer, partager et maintenir des solutions de données, d'analytique et d'IA de qualité professionnelle à grande échelle. La Databricks Data Intelligence Platform s'intègre au stockage cloud et à la sécurité dans votre compte cloud, et gère et déploie l'infrastructure cloud pour vous.

Databricks utilise l'IA générative avec le data lakehouse pour comprendre la sémantique unique de vos données. Ensuite, il optimise automatiquement les performances et gère l'infrastructure pour répondre aux besoins de votre entreprise.
Le traitement du langage naturel apprend le langage de votre entreprise, de sorte que vous pouvez rechercher et découvrir des données en posant une question dans vos propres mots. L'assistance en langage naturel vous aide à écrire du code, à résoudre les erreurs et à trouver des réponses dans la documentation.
Intégration open source gérée
Databricks s'engage envers la communauté open source et gère les mises à jour des intégrations open source avec les versions de Databricks Runtime. Les technologies suivantes sont des projets open source créés à l'origine par des employés de Databricks :
Cas d'utilisation courants
Les cas d'utilisation suivants mettent en évidence certaines des façons dont les clients utilisent Databricks pour accomplir des tâches essentielles au traitement, au stockage et à l'analyse des données qui animent les fonctions et les décisions commerciales critiques.
Créer un data lakehouse d'entreprise
Le data lakehouse combine les data warehouses d’entreprise et les data lakes pour accélérer, simplifier et unifier les Solutions de données d’entreprise. Les data engineers, les data scientists, les analystes et les systèmes de production peuvent tous utiliser le data lakehouse comme source unique de vérité, offrant un accès à des données cohérentes et réduisant les complexités liées à la construction, la maintenance et la synchronisation de nombreux systèmes de données distribués. Consultez Qu'est-ce qu'un data lakehouse ?.
ETL et Data Engineering
Que vous génériez des tableaux de bord ou que vous alimentiez des applications d'intelligence artificielle, la Data Engineering fournit l'épine dorsale des entreprises data-centric en s'assurant que les données sont disponibles, propres et stockées dans des modèles de données pour une découverte et une utilisation efficaces. Databricks combine la puissance d'Apache Spark avec Delta et des outils personnalisés pour offrir une expérience ETL inégalée. Utilisez SQL, Python et Scala pour composer une logique ETL et orchestrer le déploiement de jobs planifiés en quelques clics.
Les LakeFlow Pipelines simplifient davantage l'ETL en gérant intelligemment les dépendances entre les datasets et en déployant et mettant à l'échelle automatiquement l'infrastructure de production pour assurer une livraison rapide et précise des données selon vos spécifications.
Databricks fournit des outils pour l'ingestion de données, y compris Auto Loader, un outil efficace et évolutif pour le chargement incrémentiel et idempotent de données depuis le stockage d'objets cloud et les data lakes vers le data lakehouse.
Machine Learning, IA et Data Science
Le machine learning de Databricks étend les fonctionnalités principales de la plateforme avec une suite d'outils adaptés aux besoins des data scientists et des ingénieurs ML, notamment MLflow et Databricks Runtime for Machine Learning.
Grands modèles de langage et IA générative
Databricks Runtime for Machine Learning inclut des bibliothèques comme Hugging Face Transformers qui vous permettent d'intégrer des modèles pré-entraînés existants ou d'autres bibliothèques open source à votre workflow. L’intégration de MLflow à Databricks facilite l’utilisation du service de suivi MLflow avec des pipelines de transformateurs, des modèles et des composants de traitement. Intégrez des modèles OpenAI ou des solutions de partenaires comme John Snow Labs à vos workflows Databricks.
Avec Databricks, personnalisez un LLM sur vos données pour votre tâche spécifique. Avec le soutien d’outils open source, tels que Hugging Face et DeepSpeed, vous pouvez utiliser efficacement un LLM de base et start l’entraînement avec vos propres données pour une plus grande précision pour votre domaine et votre charge de travail.
En outre, Databricks fournit des fonctions d'IA que les data analysts SQL peuvent utiliser pour accéder aux LLM, y compris ceux d'OpenAI, directement au sein de leurs pipelines de données et workflows. Consultez Enrichir des données à l'aide des AI Functions.
Entreposage des données, analytique et BI
Databricks combine des interfaces utilisateur conviviales avec des ressources de compute rentables et un stockage évolutif à l'infini et abordable pour fournir une plateforme puissante pour l'exécution de requêtes analytiques. Les administrateurs configurent des clusters de compute évolutifs en tant que SQL Warehouse, afin que les utilisateurs finaux puissent exécuter des query sans gérer les complexités du travail dans le cloud. Les utilisateurs SQL peuvent interroger les données du lakehouse à l'aide de l'éditeur de requêtes SQL ou dans des Notebooks. Les Notebooks prennent en charge Python, R et Scala en plus de SQL, et permettent aux utilisateurs d'intégrer des visualisations à côté de liens, d'images et de commentaires rédigés en Markdown.
Pour fournir des insights cohérents, définissez une couche sémantique partagée avec la sémantique d'Unity Catalog. Vous définissez les KPI métier une seule fois comme des vues Indicateur et les interrogez sur n'importe quelle dimension, offrant à la fois aux personnes et aux outils d'IA une source unique et gouvernée pour vos métriques. Au-dessus de cette couche, vous pouvez créer des tableaux de bord AI/BI, qui offrent une création assistée par l'IA, une bibliothèque de visualisation améliorée et une expérience de configuration simplifiée. Les utilisateurs métier peuvent également explorer les données en langage naturel avec des agents Genie, qui utilisent une IA générative adaptée à la terminologie et aux données de votre organisation.
Gouvernance des données et partage sécurisé des données
Unity Catalog fournit un modèle de gouvernance des données unifié pour le data lakehouse. Les administrateurs cloud configurent et intègrent des autorisations de contrôle d'accès globales pour Unity Catalog, puis les administrateurs Databricks peuvent gérer les autorisations pour les équipes et les individus. Les privilèges sont gérés avec des listes de contrôle d'accès (ACL) via des interfaces utilisateur conviviales ou la syntaxe SQL, facilitant ainsi l'accès sécurisé aux données pour les administrateurs de base de données sans avoir à monter en charge sur la gestion des accès d'identité (IAM) cloud natif et la mise en réseau.
Unity Catalog simplifie l'exécution d'analytique sécurisée dans le cloud et offre une répartition des responsabilités qui contribue à limiter la reconversion ou le perfectionnement nécessaires aussi bien pour les administrateurs que pour les utilisateurs finaux de la plateforme. Voir Qu'est-ce que Unity Catalog ?
Le lakehouse rend le Data Sharing au sein de votre organisation aussi simple que d'accorder l'accès en query à une table ou une vue. Pour le partage en dehors de votre environnement sécurisé, Unity Catalog propose une version gérée d'OpenSharing.
DevOps, CI/CD et orchestration des tâches
Les cycles de vie de développement pour les pipelines ETL, les modèles de ML et les tableaux de bord analytiques présentent chacun leurs propres défis uniques. Databricks permet à tous vos utilisateurs de tirer parti d'une seule source de données, ce qui réduit les efforts en double et les rapports désynchronisés. En fournissant en outre une suite d'outils communs pour le versionnement, l'automatisation, la planification, le déploiement de code et de ressources de production, vous pouvez simplifier vos frais généraux de monitoring, d'orchestration et d'Opérations.
Les tâches planifient les Notebooks Databricks, les queries SQL et d'autres codes arbitraires. Declarative Automation Bundles vous permettent de définir, déployer et exécuter des ressources Databricks, telles que des jobs et des pipelines, par programmation. Les dossiers Git vous permettent de synchroniser des projets Databricks avec un certain nombre de fournisseurs Git populaires.
Pour les bonnes pratiques et les recommandations en matière de CI/CD, consultez les workflows CI/CD sur Databricks et les bonnes pratiques des développeurs sur Databricks. Pour un aperçu complet des outils pour les développeurs, veuillez consulter Développer sur Databricks.
Analytique en temps réel et en streaming
Databricks tire parti d'Apache Spark Structured Streaming pour gérer les données en streaming et les modifications de données incrémentielles. Structured Streaming s'intègre étroitement à Delta Lake, et ces technologies constituent les fondations à la fois pour les Lakeflow pipelines et Auto Loader. Consultez les concepts de Structured Streaming.
Traitement transactionnel en ligne
Lakebase est une base de données de traitement transactionnel en ligne (OLTP) entièrement intégrée à la Databricks Data Intelligence Platform. Cette base de données Postgres entièrement managée vous permet de créer et de gérer des bases de données OLTP stockées dans le stockage géré par Databricks. Voir Lakebase Postgres.