Concepts : Data Science et Machine Learning sur Databricks
La Data Science et le Machine Learning (DS et ML) extraient des insight et créent des modèles prédictifs à partir des données. Le DS et le ML incluent à la fois l'exploration et la modélisation interactives et les systèmes de production automatisés. Le ML classique comprend des techniques comme la classification, la régression, la détection d’anomalies, la prévision et la recommandation.
Les méthodes modernes de deep learning et d'IA générative (GenAI) sont techniquement des types de ML. Cette section couvre le deep learning. Pour la GenAI, consultez Concepts : IA générative sur Databricks.
Le cycle de vie ML
Le cycle de vie du ML couvre le parcours de bout en bout des données brutes à un modèle de production et inversement, via le monitoring et le réentraînement. Les étapes clés incluent :
- Définissez le périmètre du cas d'usage en définissant la cible de prédiction, les métriques de succès et les exigences de production.
- **Exécutez une analyse exploratoire des données (EDA)** pour comprendre les distributions de données, les signaux prédictifs et les problèmes de qualité des données avant la modélisation.
- Préparez les données et les fonctionnalités , gérées dans un Magasin de fonctionnalités.
- Entraînez les modèles et suivez les expérimentations , en enregistrant les métadonnées d'expérimentation pour l'analyse et le déploiement.
- Évaluez la qualité du modèle par rapport aux données de validation et aux critères des parties prenantes.
- Enregistrez, mettez en scène et testez les modèles avant de les promouvoir en production.
- **Déployer en production** dans des endpoints en temps réel ou des Jobs d'inférence par batch.
- Superviser et réentraîner pour adapter les modèles aux données ou comportements des utilisateurs en évolution.
Consultez Cycle de vie du Machine Learning pour un guide de chaque étape.
Développement et opérations assistés par l'IA
Databricks propose Genie Code, un assistant IA intégré dans les Notebooks et le Workspace. Utilisez-le pour le développement, le debugging et les opérations continues, en tirant parti de ses connaissances spécialisées de votre contexte d’entreprise. Voir Utiliser Genie Code pour la data science.
Vous pouvez utiliser Genie Code à chaque étape de votre workflow :
- Démarrez avec Genie chat pour découvrir les modèles, les données et les fonctionnalités pertinents dans votre Workspace et Unity Catalog.
- Utilisez Genie Code pour prototyper des pipelines pour l'ingénierie des fonctionnalités, l'entraînement et l'ajustement des modèles, l'évaluation et le déploiement.
- Analysez les endpoints de service de modèle avec Genie Code pour diagnostiquer et investiguer les problèmes en production.
Vous pouvez également utiliser des outils de codage tiers pour développer et maintenir des pipelines de ML sur Databricks. Consultez Compétences d’agent pour les assistants de codage IA.
Qu'est-ce qu'une plateforme de ML ?
Une plateforme ML est la couche combinée d'infrastructure, d'outils et de gouvernance qui prend en charge le cycle de vie complet du ML, des données brutes aux modèles de production. Une plateforme ML bien conçue connecte le Data Engineering, la Data Science interactive et le ML de production dans un système gouverné unique.
Les composants clés comprennent :
- Assets de données tels que les fichiers, les tables, les pipelines de traitement et les magasins de fonctionnalités
- Outils d'expérimentation comme les Notebooks et les visualisations, avec une collaboration simple et une assistance par IA.
- Infrastructure de formation avec des environnements personnalisables et des ressources de compute flexibles.
- Infrastructure de déploiement et de monitoring pour le service batch et en temps réel, avec des tableaux de bord de production et des alertes.
- Outils MLOps et de gouvernance pour l'orchestration, le CI/CD, la traçabilité, la gestion des accès et la journalisation des audits
Les principales capacités de gouvernance incluent :
- Gouvernance unifiée des données et des assets ML. En savoir plus sur Qu’est-ce que Unity Catalog ?.
- Gouvernance unifiée des endpoints de modèle. En savoir plus sur la passerelle d'IA pour la diffusion d'endpoints.
- Approche de sécurité unifiée. En savoir plus sur Databricks AI Sécurité.
- Administration unifiée des outils de données et de ML. En savoir plus sur Administration.
Voir aussi les fonctionnalités de Data Science et de ML de Databricks et l'architecture Databricks.
ML, deep learning et GenAI
Les frontières entre le Machine Learning (ML), le Deep Learning (DL) et l'IA générative (GenAI) peuvent être floues. Ce guide se concentre sur le ML et le deep learning, mais les fonctionnalités de la plateforme suivantes prennent en charge les trois paradigmes :
-
Model Serving prend en charge les modèles ML classiques, de deep learning et GenAI personnalisés pour l'inférence en temps réel et batch.
-
ai_queryprend en charge les requêtes SQL et les charges de travail d'inférence par batch pour les trois paradigmes. -
Runtime d'IA et Databricks Runtime for Machine Learning avec GPU prennent en charge l’entraînement et l’affinement sur les trois paradigmes.
-
Le suivi des expérimentations MLflow suit les exécutions et les expérimentations pour les trois paradigmes.
-
Databricks AI Search fournit des données non structurées pour les trois paradigmes.
Ressources supplémentaires
- Cycle de vie du Machine Learning – étapes du cycle de vie du ML et bonnes pratiques
- Fonctionnalités de data science et de ML de Databricks — Fonctionnalités ML de Databricks par étape de workflow
- IA sur Databricks – Cas d'usage, clients et autres ressources