Aller au contenu principal

Koalas

important

Cette documentation a été retirée et pourrait ne pas être mise à jour. Les produits, services ou technologies mentionnés dans ce contenu ne sont plus pris en charge. Voir l'API Pandas sur Spark.

remarque

Koalas est obsolète. Si vous essayez d'utiliser Koalas sur des clusters exécutant Databricks Runtime 10.0 et versions ultérieures, un message d'information s'affiche, vous recommandant d'utiliser l'API Pandas sur Spark à la place.

Koalas offre un remplacement direct pour pandas. Couramment utilisé par les data scientists, pandas est un package Python qui fournit des structures de données faciles à utiliser et des outils d'analyse de données pour le langage de programmation Python. Cependant, pandas ne prend pas en charge la montée en charge avec le Big Data. Koalas comble cette lacune en fournissant des APIs équivalentes à celles de pandas qui fonctionnent sur Apache Spark. Koalas est utile non seulement pour les utilisateurs de pandas, mais aussi pour les utilisateurs de PySpark, car Koalas prend en charge de nombreuses tâches difficiles à réaliser avec PySpark, par exemple le traçage de données directement à partir d'un DataFrame PySpark.

Exigences

  • Koalas est inclus sur les clusters exécutant Databricks Runtime 7.3 à 9.1. Pour les clusters exécutant Databricks Runtime 10.0 et versions ultérieures, utilisez plutôt l’ API Pandas sur Spark.
  • Pour utiliser Koalas sur un cluster exécutant Databricks Runtime 7.0 ou une version antérieure, installez Koalas comme bibliothèque PyPI Databricks.
  • Pour utiliser Koalas dans un IDE, un serveur de Notebook ou d'autres applications personnalisées qui se connectent à un cluster Databricks, installez Databricks Connect et suivez les instructions d'installation de Koalas.

Notebook

Le Notebook suivant montre comment migrer de pandas à Koalas.

Notebook pandas vers Koalas

Ressources supplémentaires