Aller au contenu principal

freqItems (DataFrameStatFunctions)

Trouve les éléments fréquents pour les colonnes, éventuellement avec des faux positifs. Utilise l'algorithme de comptage des éléments fréquents décrit par Karp, Schenker et Papadimitriou. DataFrame.freqItems et DataFrameStatFunctions.freqItems sont des alias l'un de l'autre.

Syntaxe​

freqItems(cols, support=None)

parameter​

parameter

Type

Description

cols

liste ou tuple

Noms des colonnes pour lesquelles calculer les éléments fréquents.

support

flottant, facultatif

La fréquence à laquelle considérer un élément comme fréquent. Default est 1 % (0,01). Doit être supérieur à 1e-4.

parameter

Type

Description

cols

liste ou tuple

Noms des colonnes pour lesquelles calculer les éléments fréquents.

support

flottant, facultatif

La fréquence à laquelle considérer un élément comme fréquent. Default est 1 % (0,01). Doit être supérieur à 1e-4.

Renvoie​

DataFrame

Notes​

Cette méthode est destinée à l'analyse exploratoire des données. Il n'y a aucune garantie de rétrocompatibilité pour le schéma du DataFrame résultant.

Exemples​

Python
from pyspark.sql import functions as sf
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
result = df.stat.freqItems(["c1", "c2"])
result.select([sf.sort_array(c).alias(c) for c in result.columns]).show()
# +------------+------------+
# |c1_freqItems|c2_freqItems|
# +------------+------------+
# | [1, 3, 4]| [8, 10, 11]|
# +------------+------------+