Utiliser XGBoost sur Databricks
Cet article fournit des exemples d'entraînement de modèles de machine learning à l'aide de XGBoost dans Databricks. Databricks Runtime for Machine Learning inclut les bibliothèques XGBoost pour Python et Scala. Vous pouvez entraîner des modèles XGBoost sur une machine individuelle ou de manière distribuée.
Entraîner des modèles XGBoost sur un nœud unique
Vous pouvez entraîner des modèles en utilisant le package Python xgboost. Ce package prend en charge uniquement les charges de travail à nœud unique. Pour entraîner un pipeline de ML PySpark et tirer parti de la formation distribuée, consultez Formation distribuée de modèles XGBoost.
Notebook Python XGBoost
Formation distribuée de modèles XGBoost
Pour l'entraînement distribué de modèles XGBoost, Databricks inclut des estimateurs PySpark basés sur le package xgboost. Dans Databricks Runtime 16.4 LTS ML et versions antérieures, Databricks inclut également le package Scala xgboost-4j. Pour plus de détails et des exemples de Notebooks, veuillez consulter ce qui suit :
- Formation distribuée de modèles XGBoost à l'aide de
xgboost.spark(Databricks Runtime 12.0 ML et versions supérieures) - Formation distribuée de modèles XGBoost à l'aide de
sparkdl.xgboost(obsolète à partir de Databricks Runtime 12.0 ML) - Formation distribuée de modèles XGBoost utilisant Scala.
Installer XGBoost sur Databricks
Si vous avez besoin d'installer XGBoost sur Databricks Runtime ou d'utiliser une version différente de celle préinstallée avec Databricks Runtime ML, suivez ces instructions.
Installer XGBoost sur Databricks Runtime ML
XGBoost est inclus dans Databricks Runtime ML. Vous pouvez utiliser ces bibliothèques dans Databricks Runtime ML sans installer de packages.
Pour la version de XGBoost installée dans la version de Databricks Runtime ML que vous utilisez, consultez les notes de publication. Pour installer d'autres versions de Python dans Databricks Runtime ML, installez XGBoost en tant que bibliothèque PyPI Databricks. Spécifiez-le comme suit et remplacez <xgboost version> par la version souhaitée.
xgboost==<xgboost version>
Installer XGBoost sur Databricks Runtime
-
Package Python : exécutez la commande suivante dans une cellule de Notebook :
Python%pip install xgboost
Pour installer une version spécifique, remplacez <xgboost version> par la version souhaitée :
%pip install xgboost==<xgboost version>
- Packages Scala/Java : installer en tant que bibliothèque Databricks avec le nom de package
xgboost-linux64Spark.