freqItems (DataFrameStatFunctions)
Trouve les éléments fréquents pour les colonnes, éventuellement avec des faux positifs. Utilise l'algorithme de comptage des éléments fréquents décrit par Karp, Schenker et Papadimitriou. DataFrame.freqItems et DataFrameStatFunctions.freqItems sont des alias l'un de l'autre.
Syntaxe
freqItems(cols, support=None)
parameter
parameter | Type | Description |
|---|---|---|
| liste ou tuple | Noms des colonnes pour lesquelles calculer les éléments fréquents. |
| flottant, facultatif | La fréquence à laquelle considérer un élément comme fréquent. Default est 1 % (0,01). Doit être supérieur à 1e-4. |
Renvoie
DataFrame
Notes
Cette méthode est destinée à l'analyse exploratoire des données. Il n'y a aucune garantie de rétrocompatibilité pour le schéma du DataFrame résultant.
Exemples
Python
from pyspark.sql import functions as sf
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
result = df.stat.freqItems(["c1", "c2"])
result.select([sf.sort_array(c).alias(c) for c in result.columns]).show()
# +------------+------------+
# |c1_freqItems|c2_freqItems|
# +------------+------------+
# | [1, 3, 4]| [8, 10, 11]|
# +------------+------------+