Exemples d’entraînement de modèle
Cette section comprend des exemples montrant comment entraîner des modèles de machine learning sur Databricks à l'aide de nombreuses bibliothèques open source populaires.
Vous pouvez également utiliser AutoML, qui prépare automatiquement un dataset pour l'entraînement du modèle, effectue une série d'essais à l'aide de bibliothèques open source telles que scikit-learn et XGBoost, et crée un Notebook Python avec le code source de chaque essai afin que vous puissiez examiner, reproduire et modifier le code.
Exemples de Machine Learning
Package | Notebook(s) | Fonctionnalités |
|---|---|---|
Scikit-learn | Unity Catalog, modèle de classification, MLflow, réglage automatisé des hyperparamètres avec Hyperopt et MLflow | |
Scikit-learn | Unity Catalog, modèle de classification, MLflow, ajustement automatisé des hyperparamètres avec Hyperopt et MLflow, XGBoost | |
mllib | Classification binaire, arbres de décision, régression GBT, Structured Streaming, transformateur personnalisé | |
xgboost | Python, PySpark et Scala, charges de travail à nœud unique et formation distribuée |
Exemples d'ajustement des hyperparamètres
Pour des informations générales sur l’ajustement des hyperparamètres dans Databricks, consultez l’ajustement des hyperparamètres.
La version open source de Hyperopt n'est plus maintenue.
Hyperopt n'est pas inclus dans Databricks Runtime for Machine Learning après 16.4 LTS ML. Databricks recommande d'utiliser soit Optuna pour l'optimisation à nœud unique, soit RayTune pour une expérience similaire à la fonctionnalité obsolète d'ajustement distribué des hyperparamètres d'Hyperopt. En savoir plus sur l'utilisation de RayTune sur Databricks.
Package | Notebook | Fonctionnalités |
|---|---|---|
Optuna | Optuna, Optuna distribué, scikit-learn, MLflow | |
Hyperopt | Hyperopt distribué, scikit-learn, MLflow | |
Hyperopt | Utilisez Hyperopt distribué pour rechercher simultanément l'espace des hyperparamètres pour différents types de modèles. | |
Hyperopt | Hyperopt, MLlib | |
Hyperopt | Bonnes pratiques pour les datasets de différentes tailles |