Aller au contenu principal

crosstab (DataFrameStatFunctions)

Calcule une table de fréquences par paires des colonnes données, également appelée table de contingence. La première colonne de chaque ligne contient les valeurs distinctes de col1, et les noms de colonne sont les valeurs distinctes de col2. Le nom de la première colonne est $col1_$col2. Les paires sans occurrences ont un compte de zéro. DataFrame.crosstab et DataFrameStatFunctions.crosstab sont des alias l'un de l'autre.

Syntaxe

crosstab(col1, col2)

parameter

parameter

Type

Description

col1

str

Le nom de la première colonne. Des éléments distincts composent la première colonne de chaque ligne.

col2

str

Le nom de la deuxième colonne. Des éléments distincts constituent les noms de colonne du DataFrame résultant.

parameter

Type

Description

col1

str

Le nom de la première colonne. Des éléments distincts composent la première colonne de chaque ligne.

col2

str

Le nom de la deuxième colonne. Des éléments distincts constituent les noms de colonne du DataFrame résultant.

Renvoie

DataFrame

Exemples

Python
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
df.stat.crosstab("c1", "c2").sort("c1_c2").show()
# +-----+---+---+---+
# |c1_c2| 10| 11| 8|
# +-----+---+---+---+
# | 1| 0| 2| 0|
# | 3| 1| 0| 0|
# | 4| 0| 0| 2|
# +-----+---+---+---+