Aller au contenu principal

Concepts : Data Science et Machine Learning sur Databricks

La Data Science et le Machine Learning (DS et ML) extraient des insight et créent des modèles prédictifs à partir des données. Le DS et le ML incluent à la fois l'exploration et la modélisation interactives et les systèmes de production automatisés. Le ML classique comprend des techniques comme la classification, la régression, la détection d’anomalies, la prévision et la recommandation.

Les méthodes modernes de deep learning et d'IA générative (GenAI) sont techniquement des types de ML. Cette section couvre le deep learning. Pour la GenAI, consultez Concepts : IA générative sur Databricks.

Le cycle de vie ML

Le cycle de vie du ML couvre le parcours de bout en bout des données brutes à un modèle de production et inversement, via le monitoring et le réentraînement. Les étapes clés incluent :

  1. Définissez le périmètre du cas d'usage en définissant la cible de prédiction, les métriques de succès et les exigences de production.
  2. **Exécutez une analyse exploratoire des données (EDA)** pour comprendre les distributions de données, les signaux prédictifs et les problèmes de qualité des données avant la modélisation.
  3. Préparez les données et les fonctionnalités , gérées dans un Magasin de fonctionnalités.
  4. Entraînez les modèles et suivez les expérimentations , en enregistrant les métadonnées d'expérimentation pour l'analyse et le déploiement.
  5. Évaluez la qualité du modèle par rapport aux données de validation et aux critères des parties prenantes.
  6. Enregistrez, mettez en scène et testez les modèles avant de les promouvoir en production.
  7. **Déployer en production** dans des endpoints en temps réel ou des Jobs d'inférence par batch.
  8. Superviser et réentraîner pour adapter les modèles aux données ou comportements des utilisateurs en évolution.

Consultez Cycle de vie du Machine Learning pour un guide de chaque étape.

Développement et opérations assistés par l'IA

Databricks propose Genie Code, un assistant IA intégré dans les Notebooks et le Workspace. Utilisez-le pour le développement, le debugging et les opérations continues, en tirant parti de ses connaissances spécialisées de votre contexte d’entreprise. Voir Utiliser Genie Code pour la data science.

Vous pouvez utiliser Genie Code à chaque étape de votre workflow :

Vous pouvez également utiliser des outils de codage tiers pour développer et maintenir des pipelines de ML sur Databricks. Consultez Compétences d’agent pour les assistants de codage IA.

Qu'est-ce qu'une plateforme de ML ?

Une plateforme ML est la couche combinée d'infrastructure, d'outils et de gouvernance qui prend en charge le cycle de vie complet du ML, des données brutes aux modèles de production. Une plateforme ML bien conçue connecte le Data Engineering, la Data Science interactive et le ML de production dans un système gouverné unique.

Les composants clés comprennent :

  • Assets de données tels que les fichiers, les tables, les pipelines de traitement et les magasins de fonctionnalités
  • Outils d'expérimentation comme les Notebooks et les visualisations, avec une collaboration simple et une assistance par IA.
  • Infrastructure de formation avec des environnements personnalisables et des ressources de compute flexibles.
  • Infrastructure de déploiement et de monitoring pour le service batch et en temps réel, avec des tableaux de bord de production et des alertes.
  • Outils MLOps et de gouvernance pour l'orchestration, le CI/CD, la traçabilité, la gestion des accès et la journalisation des audits

Les principales capacités de gouvernance incluent :

Voir aussi les fonctionnalités de Data Science et de ML de Databricks et l'architecture Databricks.

ML, deep learning et GenAI

Les frontières entre le Machine Learning (ML), le Deep Learning (DL) et l'IA générative (GenAI) peuvent être floues. Ce guide se concentre sur le ML et le deep learning, mais les fonctionnalités de la plateforme suivantes prennent en charge les trois paradigmes :

Ressources supplémentaires