Utilisez Apache Spark MLlib sur Databricks
Cette page fournit des exemples de notebooks montrant comment utiliser MLlib sur Databricks.
Apache Spark MLlib est la Machine Learning Library (MLlib) d'Apache Spark, composée d'algorithmes d'apprentissage et d'infrastructures publiques courants, incluant la classification, la régression, le clustering, le filtrage collaboratif, la réduction de la dimensionnalité et les primitives d'optimisation sous-jacentes. Pour obtenir des informations de référence sur les fonctionnalités MLlib, Databricks recommande les références API Apache Spark suivantes :
Le package pyspark.ml d'Apache Spark MLlib est pris en charge sur les compute Serverless, standard et dédiés.
Pour plus d'informations sur l'utilisation de Apache Spark MLlib à partir de R, consultez la documentation sur le machine learning avec R.
Exemple de notebook de classification binaire
Ce Notebook vous montre comment créer une application de classification binaire à l'aide de l'API Pipelines d'Apache Spark MLlib.
Notebook de classification binaire
Exemples de Notebooks d'arbres de décision
Ces exemples démontrent diverses applications des arbres de décision utilisant l'API Pipelines Apache Spark MLlib.
Arbres de décision
Ces Notebooks vous montrent comment effectuer des classifications avec des arbres de décision.
Notebook d'arbres de décision pour la reconnaissance de chiffres.
Arbres de décision pour le notebook d'enquête SFO
Régression GBT utilisant les pipelines MLlib
Ce Notebook vous montre comment utiliser les pipelines MLlib pour effectuer une régression à l'aide d'arbres de décision par boosting de gradient afin de prédire le nombre de locations de vélos (par heure) à partir d'informations telles que le jour de la semaine, la météo, la saison, et ainsi de suite.
Notebook de régression de partage de vélos
Exemple de Notebook Apache Spark MLlib avancé
Ce notebook illustre comment créer un transformateur personnalisé.