Aller au contenu principal

Fonctionnalités Databricks de Data Science et de ML

Databricks dispose d'une plateforme unifiée pour l'ensemble du cycle de vie de la Data Science (DS) et du Machine Learning (ML), de l'ingestion des données brutes à l'ingénierie des caractéristiques, à l'entraînement de modèles, au déploiement et au monitoring de la production. Databricks s'intègre aux frameworks ML open source populaires, en ajoutant une gouvernance, une observabilité et des outils opérationnels de niveau entreprise, collectivement connus sous le nom de MLOps.

Cette page répertorie les principales capacités DS et ML, organisées par étape de workflow.

Analyse exploratoire des données

Databricks simplifie l'analyse exploratoire des données (EDA) en fournissant des outils interactifs, collaboratifs et assistés par l'IA pour les data scientists. Les data scientists peuvent explorer les données à l'aide de discussions en langage naturel, d'interfaces utilisateur ou de code, et ils peuvent collaborer à l'aide de la co-édition en temps réel et du partage de code basé sur Git. Genie Code peut effectuer une EDA entièrement automatisée ou agir comme un assistant interactif.

Catégorie

Fonctionnalités

Interface utilisateur

  • Les notebooks fournissent des espaces collaboratifs pour l’exploration, la visualisation et la documentation pour l’EDA.
  • Les tableaux de bord fournissent une EDA basée sur le SQL et la visualisation.
  • Genie Chat dispose d'une interface en langage naturel pour poser des questions sur les données.

Collaboration

Assistants IA

Catégorie

Fonctionnalités

Interface utilisateur

  • Les notebooks fournissent des espaces collaboratifs pour l’exploration, la visualisation et la documentation pour l’EDA.
  • Les tableaux de bord fournissent une EDA basée sur le SQL et la visualisation.
  • Genie Chat dispose d'une interface en langage naturel pour poser des questions sur les données.

Collaboration

Assistants IA

Préparer et servir les fonctionnalités

Databricks simplifie les données pour le ML en unifiant la gouvernance des charges de travail de données et de ML. Avec toutes les données gérées sous Unity Catalog avec des contrôles d'accès précis, vous pouvez ajuster les limites de Data Engineering et de ML pour qu'elles correspondent à votre organisation. Les données peuvent être préparées pour le ML à l'aide de n'importe quel outil de data engineering tel que LakeFlow Pipelines. Les fonctionnalités sont gérées dans un Magasin de fonctionnalités pour le service en batch et en temps réel, avec une source de vérité unique et régie pour les fonctionnalités.

Genie Code accélère la découverte et la préparation des données en parcourant Unity Catalog pour découvrir les tables pertinentes, en suggérant des transformations de fonctionnalités et en générant du code pour les pipelines d'ingestion et de fonctionnalités.

Type de fonctionnalité

Fonctionnalités

Fonctionnalités de batch

  • Les tables de fonctionnalités dans Unity Catalog stockent les fonctionnalités de batch précalculées avec lignage et gouvernance automatiques. Les équipes découvrent et réutilisent les fonctionnalités existantes plutôt que de reconstruire les pipelines à partir de zéro.
  • Feature Views fournissent une nouvelle API pour définir des fonctionnalités qui peuvent ensuite être utilisées pour le calcul de fonctionnalités en batch ou en temps réel.

Fonctionnalités en temps réel

  • Pour les fonctionnalités précalculées, les magasins de fonctionnalités en ligne servent des tables de fonctionnalités pour des cas d'utilisation de service de modèle en temps réel.
  • Lorsque les entrées de featurisation ne sont disponibles qu'au moment du service, le Feature Serving dispose d'un calcul de fonctionnalités à la demande pour compléter les tables de fonctionnalités. Les fonctionnalités sont définies en tant que fonctions, plutôt que précalculées.
  • Feature Views fournissent une nouvelle API pour définir des fonctionnalités qui peuvent ensuite être utilisées pour le calcul de fonctionnalités en batch ou en temps réel.

Données non structurées

Recherche IA permet de diffuser des données non structurées et d'exécuter une recherche sémantique.

Type de fonctionnalité

Fonctionnalités

Fonctionnalités de batch

  • Les tables de fonctionnalités dans Unity Catalog stockent les fonctionnalités de batch précalculées avec lignage et gouvernance automatiques. Les équipes découvrent et réutilisent les fonctionnalités existantes plutôt que de reconstruire les pipelines à partir de zéro.
  • Feature Views fournissent une nouvelle API pour définir des fonctionnalités qui peuvent ensuite être utilisées pour le calcul de fonctionnalités en batch ou en temps réel.

Fonctionnalités en temps réel

  • Pour les fonctionnalités précalculées, les magasins de fonctionnalités en ligne servent des tables de fonctionnalités pour des cas d'utilisation de service de modèle en temps réel.
  • Lorsque les entrées de featurisation ne sont disponibles qu'au moment du service, le Feature Serving dispose d'un calcul de fonctionnalités à la demande pour compléter les tables de fonctionnalités. Les fonctionnalités sont définies en tant que fonctions, plutôt que précalculées.
  • Feature Views fournissent une nouvelle API pour définir des fonctionnalités qui peuvent ensuite être utilisées pour le calcul de fonctionnalités en batch ou en temps réel.

Données non structurées

Recherche IA permet de diffuser des données non structurées et d'exécuter une recherche sémantique.

Entraîner des modèles ML

Databricks dispose d'outils flexibles pour la formation de modèles de ML et de deep learning. Les environnements préconfigurés et personnalisables vous permettent d'utiliser des bibliothèques ML personnalisées, et les ressources de compute Serverless accélérées par CPU et GPU permettent une mise à l'échelle horizontale et verticale à la demande. Genie Code offre un AutoML intelligent, traitant les requêtes en langage naturel et construisant des workflows complets multi-notebook pour la caractérisation, la formation, le réglage, l'évaluation et le déploiement.

Catégorie

Fonctionnalités

Types de ML

Databricks prend en charge tous les types de ML, notamment :

  • ML classique : apprentissage supervisé et non supervisé avec scikit-learn, XGBoost, LightGBM, Apache Spark MLlib et d'autres frameworks de ML
  • Apprentissage profond : entraînement de réseaux de neurones avec PyTorch, TensorFlow et Hugging Face Transformers, y compris l'entraînement distribué sur plusieurs GPU
  • Réglage des hyperparamètres : recherche automatisée dans les espaces d'algorithmes et d'hyperparamètres à l'aide d'outils tels que Optuna et Ray

Pour l'IA générative, voir Fonctionnalités d'IA générative de Databricks.

Calculer

  • Le compute Serverless démarre instantanément pour les Notebooks interactifs et les workflows planifiés, avec une mise à l'échelle automatique et sans gestion de cluster. Il prend en charge les clusters accélérés par CPU et GPU.
  • Classic compute offre une gestion des machines uniques et des clusters, pour les charges de travail CPU et GPU.

Environnements et bibliothèques

  • Les environnements de compute Serverless fournissent des environnements de base qui peuvent être entièrement personnalisés pour le ML. Pour le compute GPU serverless, l'AI Runtime fournit des environnements préconfigurés pour l'entraînement et l'inférence basés sur le GPU.
  • Pour le compute classique, le Databricks Runtime for Machine Learning fournit des environnements de cluster préconfigurés avec les principales bibliothèques ML préinstallées et testées ensemble, pour les clusters accélérés par CPU et GPU.

Assistants de codage IA

Catégorie

Fonctionnalités

Types de ML

Databricks prend en charge tous les types de ML, notamment :

  • ML classique : apprentissage supervisé et non supervisé avec scikit-learn, XGBoost, LightGBM, Apache Spark MLlib et d'autres frameworks de ML
  • Apprentissage profond : entraînement de réseaux de neurones avec PyTorch, TensorFlow et Hugging Face Transformers, y compris l'entraînement distribué sur plusieurs GPU
  • Réglage des hyperparamètres : recherche automatisée dans les espaces d'algorithmes et d'hyperparamètres à l'aide d'outils tels que Optuna et Ray

Pour l'IA générative, voir Fonctionnalités d'IA générative de Databricks.

Calculer

  • Le compute Serverless démarre instantanément pour les Notebooks interactifs et les workflows planifiés, avec une mise à l'échelle automatique et sans gestion de cluster. Il prend en charge les clusters accélérés par CPU et GPU.
  • Classic compute offre une gestion des machines uniques et des clusters, pour les charges de travail CPU et GPU.

Environnements et bibliothèques

  • Les environnements de compute Serverless fournissent des environnements de base qui peuvent être entièrement personnalisés pour le ML. Pour le compute GPU serverless, l'AI Runtime fournit des environnements préconfigurés pour l'entraînement et l'inférence basés sur le GPU.
  • Pour le compute classique, le Databricks Runtime for Machine Learning fournit des environnements de cluster préconfigurés avec les principales bibliothèques ML préinstallées et testées ensemble, pour les clusters accélérés par CPU et GPU.

Assistants de codage IA

Suivre et gérer les expérimentations

MLflow géré par Databricks fournit les bases pour un développement ML reproductible et auditable. Ses intégrations avec Unity Catalog et Git fournissent le suivi et la traçabilité des données et des assets de code. Chaque version de modèle dans le registre renvoie à l'exécution d'entraînement, au dataset, à l'environnement et au commit Git qui l'ont produite, fournissant une piste d'audit complète pour tout modèle déployé.

Catégorie

Fonctionnalités

Suivi des tests

Le suivi MLflow enregistre les paramètres, les métriques et les artefacts pour chaque exécution d’entraînement. Comparez les exécutions dans l’interface utilisateur MLflow pour identifier la configuration la plus performante.

Registre des modèles

Les modèles dans Unity Catalog fournit un registre de modèles MLflow intégré à Unity Catalog. Les artefacts de modèle versionnés sont régis par des alias de cycle de vie (Staging, Production), le contrôle d'accès, la traçabilité et le partage entre les workspaces.

Reproductibilité

Les Notebooks et le code peuvent être versionnés à l'aide des dossiers Git de Databricks et intégrés à n'importe quel fournisseur Git.

Catégorie

Fonctionnalités

Suivi des tests

Le suivi MLflow enregistre les paramètres, les métriques et les artefacts pour chaque exécution d’entraînement. Comparez les exécutions dans l’interface utilisateur MLflow pour identifier la configuration la plus performante.

Registre des modèles

Les modèles dans Unity Catalog fournit un registre de modèles MLflow intégré à Unity Catalog. Les artefacts de modèle versionnés sont régis par des alias de cycle de vie (Staging, Production), le contrôle d'accès, la traçabilité et le partage entre les workspaces.

Reproductibilité

Les Notebooks et le code peuvent être versionnés à l'aide des dossiers Git de Databricks et intégrés à n'importe quel fournisseur Git.

Déployer et servir des modèles

Databricks prend en charge l'inférence par batch et le service en temps réel. L’inférence par batch applique efficacement les modèles à de grands datasets, tandis que le service en temps réel fournit les modèles sous forme d’endpoints API à faible latence. Genie Code peut à la fois générer du code pour le déploiement de modèles et diagnostiquer les problèmes et les performances des endpoints de service de modèles.

Modèle de service

Fonctionnalités

Inférence par batch

  • ai_query fournit une inférence par batch efficace pour les modèles personnalisés déployés en tant qu'endpoints Model Serving.
  • Vous pouvez également utiliser un code personnalisé avec les UDF Apache Spark (exemple) ou mlflow.pyfunc pour l'inférence par batch.

Diffusion en temps réel

Model Serving fournit des Endpoint REST gérés à faible latence et haute disponibilité avec une mise à l'échelle automatique Serverless. Ceci prend en charge le service CPU et GPU pour n'importe quel framework ML, et vous pouvez utiliser Genie pour évaluer et dépanner les Endpoint de service.

Inférence native SQL

  • Les fonctions d'IA fournissent des prédictions ML accessibles via SQL pour la prévision, la détection d'anomalies et l'analyse des drivers, sans qu'il soit nécessaire d'utiliser Python ou de déployer un modèle.
  • Pour les modèles personnalisés, la fonction d'IA ai_query fournit une inférence par batch efficace, prise en charge par les Endpoint de Model Serving.

Modèle de service

Fonctionnalités

Inférence par batch

  • ai_query fournit une inférence par batch efficace pour les modèles personnalisés déployés en tant qu'endpoints Model Serving.
  • Vous pouvez également utiliser un code personnalisé avec les UDF Apache Spark (exemple) ou mlflow.pyfunc pour l'inférence par batch.

Diffusion en temps réel

Model Serving fournit des Endpoint REST gérés à faible latence et haute disponibilité avec une mise à l'échelle automatique Serverless. Ceci prend en charge le service CPU et GPU pour n'importe quel framework ML, et vous pouvez utiliser Genie pour évaluer et dépanner les Endpoint de service.

Inférence native SQL

  • Les fonctions d'IA fournissent des prédictions ML accessibles via SQL pour la prévision, la détection d'anomalies et l'analyse des drivers, sans qu'il soit nécessaire d'utiliser Python ou de déployer un modèle.
  • Pour les modèles personnalisés, la fonction d'IA ai_query fournit une inférence par batch efficace, prise en charge par les Endpoint de Model Serving.

Évaluer et superviser

Databricks offre une évaluation flexible pour la formation et un monitoring continu pour la production. Les logs de service en temps réel vers les tables d'inférence gérées dans Unity Catalog, et le monitoring de la qualité des données assurent un monitoring avec des métriques personnalisées, des tableaux de bord et des alertes.

Catégorie

Fonctionnalités

Évaluation

  • L'évaluation MLflow ML peut être utilisée pour définir les métriques à Log dans MLflow, ou le suivi MLflow peut Log les métriques calculées à l'aide de votre cadre personnalisé.
  • Genie Code peut aider à sélectionner les métriques d'évaluation et à écrire le code d'évaluation.

Enregistrement des prédictions

Les tables d'inférence enregistrent les requêtes et les réponses de service, permettant le monitoring, l'analytique et la construction d'ensembles d'entraînement.

Monitoring et alertes

Catégorie

Fonctionnalités

Évaluation

  • L'évaluation MLflow ML peut être utilisée pour définir les métriques à Log dans MLflow, ou le suivi MLflow peut Log les métriques calculées à l'aide de votre cadre personnalisé.
  • Genie Code peut aider à sélectionner les métriques d'évaluation et à écrire le code d'évaluation.

Enregistrement des prédictions

Les tables d'inférence enregistrent les requêtes et les réponses de service, permettant le monitoring, l'analytique et la construction d'ensembles d'entraînement.

Monitoring et alertes

MLOps et gouvernance

Databricks fournit une suite complète d'outils pour les opérations ML (MLOps) et la gouvernance. Les MLOps Stacks fournissent des Template pour permettre une promotion automatisée et reproductible du développement à la production à l'aide d'Infrastructure-as-Code. Les données, fonctionnalités, modèles et Endpoints sont entièrement régis par Unity Catalog et AI Gateway.

Catégorie

Fonctionnalités

CI/CD pour le ML

MLOps Stacks, basé sur les Declarative Automation Bundles, fournit une gestion et un déploiement basés sur le code de l'infrastructure et des workflows ML. Ceci inclut des Template CI/CD pour l'automatisation de la formation, de l'évaluation et du déploiement.

Orchestration des workflows

Lakeflow Jobs orchestre les workflows ML multi-étapes en tant que pipelines planifiés ou déclenchés.

Gouvernance des assets de données et de modèles

Unity Catalog fournit une gouvernance unifiée pour les données, les fonctionnalités et les modèles enregistrés. Les contrôles d'accès précis, le suivi de la lignée et les logs d'audit s'appliquent à tous les actifs.

Gouvernance des Endpoint de modèle

AI Gateway assure une gouvernance et un monitoring centralisés pour les Endpoint de modèle, y compris les limites de débit, le suivi de l'utilisation et la journalisation de la charge utile.

Catégorie

Fonctionnalités

CI/CD pour le ML

MLOps Stacks, basé sur les Declarative Automation Bundles, fournit une gestion et un déploiement basés sur le code de l'infrastructure et des workflows ML. Ceci inclut des Template CI/CD pour l'automatisation de la formation, de l'évaluation et du déploiement.

Orchestration des workflows

Lakeflow Jobs orchestre les workflows ML multi-étapes en tant que pipelines planifiés ou déclenchés.

Gouvernance des assets de données et de modèles

Unity Catalog fournit une gouvernance unifiée pour les données, les fonctionnalités et les modèles enregistrés. Les contrôles d'accès précis, le suivi de la lignée et les logs d'audit s'appliquent à tous les actifs.

Gouvernance des Endpoint de modèle

AI Gateway assure une gouvernance et un monitoring centralisés pour les Endpoint de modèle, y compris les limites de débit, le suivi de l'utilisation et la journalisation de la charge utile.

Support Open source

Databricks prend entièrement en charge l'écosystème ML open source.

Vous pouvez utiliser n'importe quel framework ML open source sur Databricks : scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray, et d'autres. MLflow ou vos outils personnalisés peuvent stocker les artefacts de modèle dans des formats ouverts qui peuvent être exportés et exécutés en dehors de Databricks.

MLflow est open source, créé par Databricks et utilisé par plus de 10 000 organisations. Vos données de suivi d'expérimentation, vos artefacts de modèle et vos définitions de pipeline sont stockés dans des formats ouverts.

La gouvernance des données et de l'IA repose sur les APIs Unity Catalog open source, et le stockage des données est basé sur le format ouvert Delta Lake. Vos données de fonctionnalités et vos datasets d'entraînement restent dans des fichiers ouverts et portables.

Ressources supplémentaires