Référence PySpark
Cette page fournit un aperçu des références disponibles pour PySpark, une API Python pour Spark. Pour plus d'informations sur PySpark, consultez PySpark sur Databricks.
Types de données
Pour une liste complète des types de données PySpark, consultez types de données PySpark.
Classes
DataFrames
Référence | Description |
|---|---|
Opérations pour travailler avec les colonnes de DataFrame, y compris les transformations et les expressions. | |
Collection distribuée de données organisées en colonnes nommées, similaire à une table dans une base de données relationnelle. | |
Fonctionnalités pour travailler avec les données manquantes dans un DataFrame. | |
Interface utilisée pour charger un DataFrame à partir de systèmes de stockage externes. | |
Fonctionnalité pour les fonctions statistiques avec un DataFrame. | |
Interface utilisée pour écrire un DataFrame dans des systèmes de stockage externes. | |
Interface utilisée pour écrire un DataFrame vers un stockage externe (version 2). | |
Méthodes de regroupement des données et d'exécution des opérations d'agrégation sur des DataFrames groupés. | |
Représente une ligne de données dans un DataFrame, offrant un accès aux valeurs de champ individuelles. |
Sources de données personnalisées
Référence | Description |
|---|---|
APIs pour implémenter des sources de données personnalisées afin de lire à partir de systèmes externes. Pour plus d'informations sur les sources de données personnalisées, consultez les sources de données personnalisées PySpark. | |
Une classe de base pour les rédacteurs de sources de données qui traitent les données à l'aide de | |
Un wrapper pour l'enregistrement de la source de données. | |
Une classe de base pour les lecteurs de source de données. | |
Une classe de base pour les enregistreurs de Stream de données qui traitent les données à l'aide du | |
Une classe de base pour les lecteurs de source de données en streaming. | |
Une classe de base pour les enregistreurs de données Stream. | |
Une classe de base pour les rédacteurs de source de données chargés d'enregistrer des données dans une source de données personnalisée en mode batch. | |
Une classe de base représentant une partition d'entrée retournée par la méthode | |
Une classe de base pour les lecteurs de source de données de streaming simplifiés qui lit les données et planifie le dernier décalage simultanément. | |
Un message de commit renvoyé par |
Structured Streaming
Référence | Description |
|---|---|
Interface utilisée pour charger un DataFrame de streaming à partir de systèmes de stockage externes. | |
Interface utilisée pour écrire un DataFrame de streaming dans des systèmes de stockage externes. | |
Gère l'état entre les batchs de streaming pour les opérations complexes avec état en streaming structuré. | |
Un handle pour une query qui s'exécute en continu en arrière-plan à mesure que de nouvelles données arrivent. | |
Classe abstraite pour l'écoute des événements du cycle de vie des queries streaming. | |
Gère toutes les instances actives de |
Fonctions définies par l'utilisateur
Référence | Description |
|---|---|
Fonctions définies par l’utilisateur pour appliquer une logique Python personnalisée aux colonnes de DataFrame. | |
Wrapper pour l'enregistrement des fonctions définies par l'utilisateur. Cette instance peut être consultée par | |
Fonctions de table définies par l’utilisateur qui renvoient plusieurs lignes pour chaque ligne d’entrée. | |
Wrapper pour l'enregistrement de fonctions de table définies par l'utilisateur. Cette instance peut être consultée par |
Autres classes principales
Référence | Description |
|---|---|
Interface pour la gestion des bases de données, des tables, des fonctions et des autres métadonnées du catalogue. | |
Une classe pour représenter une valeur Géographie en Python. | |
Une classe pour représenter une valeur Géométrie en Python. | |
Collecte des métriques et observe les DataFrames pendant l'exécution des query pour le monitoring et le debugging. | |
Accesseur de la fonctionnalité de traçage de DataFrame dans PySpark. | |
Prise en charge de la sérialisation et de la désérialisation des données à l'aide du format Protocol Buffers. | |
Options de configuration Runtime pour Spark SQL, y compris les paramètres d'exécution et d'optimisation. Pour des informations sur la configuration qui n'est disponible que sur Databricks, consultez Définir les propriétés de configuration Spark sur Databricks. | |
Le point d'entrée pour la lecture des données et l'exécution de queries SQL dans les applications PySpark. | |
Représente des données semi-structurées avec un schéma flexible, qui prend en charge les types dynamiques et les structures imbriquées. | |
Fonctions de fenêtre pour effectuer des calculs sur un ensemble de lignes de table liées à la ligne actuelle. | |
Fonctions de fenêtre pour effectuer des calculs sur un ensemble de lignes de table liées à la ligne actuelle. |
Fonctions
Pour une liste complète des fonctions intégrées disponibles, consultez les fonctions PySpark.