crosstab (DataFrame)
compute une table de fréquences par paires des colonnes données. Également connue sous le nom de table de contingence. La première colonne de chaque ligne sera les valeurs distinctes de col1 et les noms de colonnes seront les valeurs distinctes de col2. Le nom de la 1re colonne sera $col1_$col2. Les paires sans occurrence auront des comptes de zéro. DataFrame.crosstab et DataFrameStatFunctions.crosstab sont des alias.
Syntaxe
crosstab(col1: str, col2: str)
parameter
parameter | Type | Description |
|---|---|---|
| str | Le nom de la première colonne. Les éléments distincts formeront le premier élément de chaque ligne. |
| str | Le nom de la deuxième colonne. Les éléments distincts formeront les noms de colonne du DataFrame. |
Renvoie
DataFrameMatrice de fréquences de deux colonnes.
Exemples
Python
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
df.crosstab("c1", "c2").sort("c1_c2").show()
# +-----+---+---+---+
# |c1_c2| 10| 11| 8|
# +-----+---+---+---+
# | 1| 0| 2| 0|
# | 3| 1| 0| 0|
# | 4| 0| 0| 2|
# +-----+---+---+---+