crosstab (DataFrameStatFunctions)
Calcule une table de fréquences par paires des colonnes données, également appelée table de contingence. La première colonne de chaque ligne contient les valeurs distinctes de col1, et les noms de colonne sont les valeurs distinctes de col2. Le nom de la première colonne est $col1_$col2. Les paires sans occurrences ont un compte de zéro. DataFrame.crosstab et DataFrameStatFunctions.crosstab sont des alias l'un de l'autre.
Syntaxe
crosstab(col1, col2)
parameter
parameter | Type | Description |
|---|---|---|
| str | Le nom de la première colonne. Des éléments distincts composent la première colonne de chaque ligne. |
| str | Le nom de la deuxième colonne. Des éléments distincts constituent les noms de colonne du |
Renvoie
DataFrame
Exemples
Python
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
df.stat.crosstab("c1", "c2").sort("c1_c2").show()
# +-----+---+---+---+
# |c1_c2| 10| 11| 8|
# +-----+---+---+---+
# | 1| 0| 2| 0|
# | 3| 1| 0| 0|
# | 4| 0| 0| 2|
# +-----+---+---+---+