Fonctionnalités Databricks de Data Science et de ML
Databricks dispose d'une plateforme unifiée pour l'ensemble du cycle de vie de la Data Science (DS) et du Machine Learning (ML), de l'ingestion des données brutes à l'ingénierie des caractéristiques, à l'entraînement de modèles, au déploiement et au monitoring de la production. Databricks s'intègre aux frameworks ML open source populaires, en ajoutant une gouvernance, une observabilité et des outils opérationnels de niveau entreprise, collectivement connus sous le nom de MLOps.
Cette page répertorie les principales capacités DS et ML, organisées par étape de workflow.
Analyse exploratoire des données
Databricks simplifie l'analyse exploratoire des données (EDA) en fournissant des outils interactifs, collaboratifs et assistés par l'IA pour les data scientists. Les data scientists peuvent explorer les données à l'aide de discussions en langage naturel, d'interfaces utilisateur ou de code, et ils peuvent collaborer à l'aide de la co-édition en temps réel et du partage de code basé sur Git. Genie Code peut effectuer une EDA entièrement automatisée ou agir comme un assistant interactif.
Catégorie | Fonctionnalités |
|---|---|
Interface utilisateur |
|
Collaboration |
|
Assistants IA |
|
Préparer et servir les fonctionnalités
Databricks simplifie les données pour le ML en unifiant la gouvernance des charges de travail de données et de ML. Avec toutes les données gérées sous Unity Catalog avec des contrôles d'accès précis, vous pouvez ajuster les limites de Data Engineering et de ML pour qu'elles correspondent à votre organisation. Les données peuvent être préparées pour le ML à l'aide de n'importe quel outil de data engineering tel que LakeFlow Pipelines. Les fonctionnalités sont gérées dans un Magasin de fonctionnalités pour le service en batch et en temps réel, avec une source de vérité unique et régie pour les fonctionnalités.
Genie Code accélère la découverte et la préparation des données en parcourant Unity Catalog pour découvrir les tables pertinentes, en suggérant des transformations de fonctionnalités et en générant du code pour les pipelines d'ingestion et de fonctionnalités.
Type de fonctionnalité | Fonctionnalités |
|---|---|
Fonctionnalités de batch |
|
Fonctionnalités en temps réel |
|
Données non structurées | Recherche IA permet de diffuser des données non structurées et d'exécuter une recherche sémantique. |
Entraîner des modèles ML
Databricks dispose d'outils flexibles pour la formation de modèles de ML et de deep learning. Les environnements préconfigurés et personnalisables vous permettent d'utiliser des bibliothèques ML personnalisées, et les ressources de compute Serverless accélérées par CPU et GPU permettent une mise à l'échelle horizontale et verticale à la demande. Genie Code offre un AutoML intelligent, traitant les requêtes en langage naturel et construisant des workflows complets multi-notebook pour la caractérisation, la formation, le réglage, l'évaluation et le déploiement.
Catégorie | Fonctionnalités |
|---|---|
Types de ML | Databricks prend en charge tous les types de ML, notamment :
Pour l'IA générative, voir Fonctionnalités d'IA générative de Databricks. |
Calculer |
|
Environnements et bibliothèques |
|
Assistants de codage IA |
|
Suivre et gérer les expérimentations
MLflow géré par Databricks fournit les bases pour un développement ML reproductible et auditable. Ses intégrations avec Unity Catalog et Git fournissent le suivi et la traçabilité des données et des assets de code. Chaque version de modèle dans le registre renvoie à l'exécution d'entraînement, au dataset, à l'environnement et au commit Git qui l'ont produite, fournissant une piste d'audit complète pour tout modèle déployé.
Catégorie | Fonctionnalités |
|---|---|
Suivi des tests | Le suivi MLflow enregistre les paramètres, les métriques et les artefacts pour chaque exécution d’entraînement. Comparez les exécutions dans l’interface utilisateur MLflow pour identifier la configuration la plus performante. |
Registre des modèles | Les modèles dans Unity Catalog fournit un registre de modèles MLflow intégré à Unity Catalog. Les artefacts de modèle versionnés sont régis par des alias de cycle de vie ( |
Reproductibilité | Les Notebooks et le code peuvent être versionnés à l'aide des dossiers Git de Databricks et intégrés à n'importe quel fournisseur Git. |
Déployer et servir des modèles
Databricks prend en charge l'inférence par batch et le service en temps réel. L’inférence par batch applique efficacement les modèles à de grands datasets, tandis que le service en temps réel fournit les modèles sous forme d’endpoints API à faible latence. Genie Code peut à la fois générer du code pour le déploiement de modèles et diagnostiquer les problèmes et les performances des endpoints de service de modèles.
Modèle de service | Fonctionnalités |
|---|---|
Inférence par batch |
|
Diffusion en temps réel | Model Serving fournit des Endpoint REST gérés à faible latence et haute disponibilité avec une mise à l'échelle automatique Serverless. Ceci prend en charge le service CPU et GPU pour n'importe quel framework ML, et vous pouvez utiliser Genie pour évaluer et dépanner les Endpoint de service. |
Inférence native SQL |
|
Évaluer et superviser
Databricks offre une évaluation flexible pour la formation et un monitoring continu pour la production. Les logs de service en temps réel vers les tables d'inférence gérées dans Unity Catalog, et le monitoring de la qualité des données assurent un monitoring avec des métriques personnalisées, des tableaux de bord et des alertes.
Catégorie | Fonctionnalités |
|---|---|
Évaluation |
|
Enregistrement des prédictions | Les tables d'inférence enregistrent les requêtes et les réponses de service, permettant le monitoring, l'analytique et la construction d'ensembles d'entraînement. |
Monitoring et alertes |
|
MLOps et gouvernance
Databricks fournit une suite complète d'outils pour les opérations ML (MLOps) et la gouvernance. Les MLOps Stacks fournissent des Template pour permettre une promotion automatisée et reproductible du développement à la production à l'aide d'Infrastructure-as-Code. Les données, fonctionnalités, modèles et Endpoints sont entièrement régis par Unity Catalog et AI Gateway.
Catégorie | Fonctionnalités |
|---|---|
CI/CD pour le ML | MLOps Stacks, basé sur les Declarative Automation Bundles, fournit une gestion et un déploiement basés sur le code de l'infrastructure et des workflows ML. Ceci inclut des Template CI/CD pour l'automatisation de la formation, de l'évaluation et du déploiement. |
Orchestration des workflows | Lakeflow Jobs orchestre les workflows ML multi-étapes en tant que pipelines planifiés ou déclenchés. |
Gouvernance des assets de données et de modèles | Unity Catalog fournit une gouvernance unifiée pour les données, les fonctionnalités et les modèles enregistrés. Les contrôles d'accès précis, le suivi de la lignée et les logs d'audit s'appliquent à tous les actifs. |
Gouvernance des Endpoint de modèle | AI Gateway assure une gouvernance et un monitoring centralisés pour les Endpoint de modèle, y compris les limites de débit, le suivi de l'utilisation et la journalisation de la charge utile. |
Support Open source
Databricks prend entièrement en charge l'écosystème ML open source.
Vous pouvez utiliser n'importe quel framework ML open source sur Databricks : scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray, et d'autres. MLflow ou vos outils personnalisés peuvent stocker les artefacts de modèle dans des formats ouverts qui peuvent être exportés et exécutés en dehors de Databricks.
MLflow est open source, créé par Databricks et utilisé par plus de 10 000 organisations. Vos données de suivi d'expérimentation, vos artefacts de modèle et vos définitions de pipeline sont stockés dans des formats ouverts.
La gouvernance des données et de l'IA repose sur les APIs Unity Catalog open source, et le stockage des données est basé sur le format ouvert Delta Lake. Vos données de fonctionnalités et vos datasets d'entraînement restent dans des fichiers ouverts et portables.