Aller au contenu principal

Référence PySpark

Cette page fournit un aperçu des références disponibles pour PySpark, une API Python pour Spark. Pour plus d'informations sur PySpark, consultez PySpark sur Databricks.

Types de données

Pour une liste complète des types de données PySpark, consultez types de données PySpark.

Classes

DataFrames

Référence

Description

Colonne

Opérations pour travailler avec les colonnes de DataFrame, y compris les transformations et les expressions.

DataFrame

Collection distribuée de données organisées en colonnes nommées, similaire à une table dans une base de données relationnelle.

DataFrameNaFunctions

Fonctionnalités pour travailler avec les données manquantes dans un DataFrame.

DataFrameReader

Interface utilisée pour charger un DataFrame à partir de systèmes de stockage externes.

DataFrameStatFunctions

Fonctionnalité pour les fonctions statistiques avec un DataFrame.

DataFrameWriter

Interface utilisée pour écrire un DataFrame dans des systèmes de stockage externes.

DataFrameWriterV2

Interface utilisée pour écrire un DataFrame vers un stockage externe (version 2).

GroupedData

Méthodes de regroupement des données et d'exécution des opérations d'agrégation sur des DataFrames groupés.

Ligne

Représente une ligne de données dans un DataFrame, offrant un accès aux valeurs de champ individuelles.

Référence

Description

Colonne

Opérations pour travailler avec les colonnes de DataFrame, y compris les transformations et les expressions.

DataFrame

Collection distribuée de données organisées en colonnes nommées, similaire à une table dans une base de données relationnelle.

DataFrameNaFunctions

Fonctionnalités pour travailler avec les données manquantes dans un DataFrame.

DataFrameReader

Interface utilisée pour charger un DataFrame à partir de systèmes de stockage externes.

DataFrameStatFunctions

Fonctionnalité pour les fonctions statistiques avec un DataFrame.

DataFrameWriter

Interface utilisée pour écrire un DataFrame dans des systèmes de stockage externes.

DataFrameWriterV2

Interface utilisée pour écrire un DataFrame vers un stockage externe (version 2).

GroupedData

Méthodes de regroupement des données et d'exécution des opérations d'agrégation sur des DataFrames groupés.

Ligne

Représente une ligne de données dans un DataFrame, offrant un accès aux valeurs de champ individuelles.

Sources de données personnalisées

Référence

Description

Source de données

APIs pour implémenter des sources de données personnalisées afin de lire à partir de systèmes externes. Pour plus d'informations sur les sources de données personnalisées, consultez les sources de données personnalisées PySpark.

DataSourceArrowWriter

Une classe de base pour les rédacteurs de sources de données qui traitent les données à l'aide de RecordBatch de PyArrow.

DataSourceRegistration

Un wrapper pour l'enregistrement de la source de données.

DataSourceReader

Une classe de base pour les lecteurs de source de données.

DataSourceStreamArrowWriter

Une classe de base pour les enregistreurs de Stream de données qui traitent les données à l'aide du RecordBatch de PyArrow.

DataSourceStreamReader

Une classe de base pour les lecteurs de source de données en streaming.

DataSourceStreamWriter

Une classe de base pour les enregistreurs de données Stream.

DataSourceWriter

Une classe de base pour les rédacteurs de source de données chargés d'enregistrer des données dans une source de données personnalisée en mode batch.

InputPartition

Une classe de base représentant une partition d'entrée retournée par la méthode partitions() de DataSourceReader.

SimpleDataSourceStreamReader

Une classe de base pour les lecteurs de source de données de streaming simplifiés qui lit les données et planifie le dernier décalage simultanément.

Message de commit de l'auteur

Un message de commit renvoyé par DataSourceWriter.write et renvoyé au Driver en tant que paramètre d'entrée de DataSourceWriter.commit ou DataSourceWriter.abort.

Référence

Description

Source de données

APIs pour implémenter des sources de données personnalisées afin de lire à partir de systèmes externes. Pour plus d'informations sur les sources de données personnalisées, consultez les sources de données personnalisées PySpark.

DataSourceArrowWriter

Une classe de base pour les rédacteurs de sources de données qui traitent les données à l'aide de RecordBatch de PyArrow.

DataSourceRegistration

Un wrapper pour l'enregistrement de la source de données.

DataSourceReader

Une classe de base pour les lecteurs de source de données.

DataSourceStreamArrowWriter

Une classe de base pour les enregistreurs de Stream de données qui traitent les données à l'aide du RecordBatch de PyArrow.

DataSourceStreamReader

Une classe de base pour les lecteurs de source de données en streaming.

DataSourceStreamWriter

Une classe de base pour les enregistreurs de données Stream.

DataSourceWriter

Une classe de base pour les rédacteurs de source de données chargés d'enregistrer des données dans une source de données personnalisée en mode batch.

InputPartition

Une classe de base représentant une partition d'entrée retournée par la méthode partitions() de DataSourceReader.

SimpleDataSourceStreamReader

Une classe de base pour les lecteurs de source de données de streaming simplifiés qui lit les données et planifie le dernier décalage simultanément.

Message de commit de l'auteur

Un message de commit renvoyé par DataSourceWriter.write et renvoyé au Driver en tant que paramètre d'entrée de DataSourceWriter.commit ou DataSourceWriter.abort.

Structured Streaming

Référence

Description

DataStreamReader

Interface utilisée pour charger un DataFrame de streaming à partir de systèmes de stockage externes.

DataStreamWriter

Interface utilisée pour écrire un DataFrame de streaming dans des systèmes de stockage externes.

Processeur avec état

Gère l'état entre les batchs de streaming pour les opérations complexes avec état en streaming structuré.

Requête de streaming

Un handle pour une query qui s'exécute en continu en arrière-plan à mesure que de nouvelles données arrivent.

StreamingQueryListener

Classe abstraite pour l'écoute des événements du cycle de vie des queries streaming.

StreamingQueryManager

Gère toutes les instances actives de StreamingQuery associées à un SparkSession.

Référence

Description

DataStreamReader

Interface utilisée pour charger un DataFrame de streaming à partir de systèmes de stockage externes.

DataStreamWriter

Interface utilisée pour écrire un DataFrame de streaming dans des systèmes de stockage externes.

Processeur avec état

Gère l'état entre les batchs de streaming pour les opérations complexes avec état en streaming structuré.

Requête de streaming

Un handle pour une query qui s'exécute en continu en arrière-plan à mesure que de nouvelles données arrivent.

StreamingQueryListener

Classe abstraite pour l'écoute des événements du cycle de vie des queries streaming.

StreamingQueryManager

Gère toutes les instances actives de StreamingQuery associées à un SparkSession.

Fonctions définies par l'utilisateur

Référence

Description

UserDefinedFunction (UDF)

Fonctions définies par l’utilisateur pour appliquer une logique Python personnalisée aux colonnes de DataFrame.

UDFRegistration

Wrapper pour l'enregistrement des fonctions définies par l'utilisateur. Cette instance peut être consultée par spark.udf.

UserDefinedTableFunction (UDTF)

Fonctions de table définies par l’utilisateur qui renvoient plusieurs lignes pour chaque ligne d’entrée.

UDTFRegistration

Wrapper pour l'enregistrement de fonctions de table définies par l'utilisateur. Cette instance peut être consultée par spark.udtf.

Référence

Description

UserDefinedFunction (UDF)

Fonctions définies par l’utilisateur pour appliquer une logique Python personnalisée aux colonnes de DataFrame.

UDFRegistration

Wrapper pour l'enregistrement des fonctions définies par l'utilisateur. Cette instance peut être consultée par spark.udf.

UserDefinedTableFunction (UDTF)

Fonctions de table définies par l’utilisateur qui renvoient plusieurs lignes pour chaque ligne d’entrée.

UDTFRegistration

Wrapper pour l'enregistrement de fonctions de table définies par l'utilisateur. Cette instance peut être consultée par spark.udtf.

Autres classes principales

Référence

Description

Catalogue

Interface pour la gestion des bases de données, des tables, des fonctions et des autres métadonnées du catalogue.

Géographie

Une classe pour représenter une valeur Géographie en Python.

Géométrie

Une classe pour représenter une valeur Géométrie en Python.

Observation

Collecte des métriques et observe les DataFrames pendant l'exécution des query pour le monitoring et le debugging.

PlotAccessor

Accesseur de la fonctionnalité de traçage de DataFrame dans PySpark.

ProtoBuf

Prise en charge de la sérialisation et de la désérialisation des données à l'aide du format Protocol Buffers.

RuntimeConfig

Options de configuration Runtime pour Spark SQL, y compris les paramètres d'exécution et d'optimisation.

Pour des informations sur la configuration qui n'est disponible que sur Databricks, consultez Définir les propriétés de configuration Spark sur Databricks.

SparkSession

Le point d'entrée pour la lecture des données et l'exécution de queries SQL dans les applications PySpark.

VariantVal

Représente des données semi-structurées avec un schéma flexible, qui prend en charge les types dynamiques et les structures imbriquées.

Fenêtre

Fonctions de fenêtre pour effectuer des calculs sur un ensemble de lignes de table liées à la ligne actuelle.

WindowSpec

Fonctions de fenêtre pour effectuer des calculs sur un ensemble de lignes de table liées à la ligne actuelle.

Référence

Description

Catalogue

Interface pour la gestion des bases de données, des tables, des fonctions et des autres métadonnées du catalogue.

Géographie

Une classe pour représenter une valeur Géographie en Python.

Géométrie

Une classe pour représenter une valeur Géométrie en Python.

Observation

Collecte des métriques et observe les DataFrames pendant l'exécution des query pour le monitoring et le debugging.

PlotAccessor

Accesseur de la fonctionnalité de traçage de DataFrame dans PySpark.

ProtoBuf

Prise en charge de la sérialisation et de la désérialisation des données à l'aide du format Protocol Buffers.

RuntimeConfig

Options de configuration Runtime pour Spark SQL, y compris les paramètres d'exécution et d'optimisation.

Pour des informations sur la configuration qui n'est disponible que sur Databricks, consultez Définir les propriétés de configuration Spark sur Databricks.

SparkSession

Le point d'entrée pour la lecture des données et l'exécution de queries SQL dans les applications PySpark.

VariantVal

Représente des données semi-structurées avec un schéma flexible, qui prend en charge les types dynamiques et les structures imbriquées.

Fenêtre

Fonctions de fenêtre pour effectuer des calculs sur un ensemble de lignes de table liées à la ligne actuelle.

WindowSpec

Fonctions de fenêtre pour effectuer des calculs sur un ensemble de lignes de table liées à la ligne actuelle.

Fonctions

Pour une liste complète des fonctions intégrées disponibles, consultez les fonctions PySpark.