API Pandas sur Spark
Cette fonctionnalité est disponible sur les clusters qui exécutent Databricks Runtime 10.0 et versions ultérieures. Pour les clusters qui exécutent Databricks Runtime 9.1 LTS ou version antérieure, utilisez Koalas à la place.
Couramment utilisé par les data scientists, pandas est un package Python qui fournit des structures de données faciles à utiliser et des outils d'analyse de données pour le langage de programmation Python. Cependant, pandas ne monte pas en charge pour le Big Data. L'API Pandas sur Spark comble cette lacune en fournissant des APIs équivalentes à celles de Pandas qui fonctionnent sur Apache Spark. L'API Pandas sur Spark est utile non seulement pour les utilisateurs de Pandas, mais aussi pour les utilisateurs de PySpark, car l'API Pandas sur Spark prend en charge de nombreuses tâches difficiles à réaliser avec PySpark, par exemple le traçage de données directement à partir d'un DataFrame PySpark.
Exigences
L'API Pandas sur Spark est disponible à partir d'Apache Spark 3.2 (qui est inclus à partir de Databricks Runtime 10.0) en utilisant l'instruction import suivante :
import pyspark.pandas as ps
Notebook
Le notebook suivant montre comment migrer de pandas vers l’API Pandas sur Spark.