Aller au contenu principal

API Pandas sur Spark

remarque

Cette fonctionnalité est disponible sur les clusters qui exécutent Databricks Runtime 10.0 et versions ultérieures. Pour les clusters qui exécutent Databricks Runtime 9.1 LTS ou version antérieure, utilisez Koalas à la place.

Couramment utilisé par les data scientists, pandas est un package Python qui fournit des structures de données faciles à utiliser et des outils d'analyse de données pour le langage de programmation Python. Cependant, pandas ne monte pas en charge pour le Big Data. L'API Pandas sur Spark comble cette lacune en fournissant des APIs équivalentes à celles de Pandas qui fonctionnent sur Apache Spark. L'API Pandas sur Spark est utile non seulement pour les utilisateurs de Pandas, mais aussi pour les utilisateurs de PySpark, car l'API Pandas sur Spark prend en charge de nombreuses tâches difficiles à réaliser avec PySpark, par exemple le traçage de données directement à partir d'un DataFrame PySpark.

Exigences

L'API Pandas sur Spark est disponible à partir d'Apache Spark 3.2 (qui est inclus à partir de Databricks Runtime 10.0) en utilisant l'instruction import suivante :

Python
import pyspark.pandas as ps

Notebook

Le notebook suivant montre comment migrer de pandas vers l’API Pandas sur Spark.

pandas vers l'API pandas sur un Notebook Spark

Ressources supplémentaires