Aller au contenu principal

freqItems (DataFrameStatFunctions)

Trouve les éléments fréquents pour les colonnes, éventuellement avec des faux positifs. Utilise l'algorithme de comptage des éléments fréquents décrit par Karp, Schenker et Papadimitriou. DataFrame.freqItems et DataFrameStatFunctions.freqItems sont des alias l'un de l'autre.

Syntaxe

freqItems(cols, support=None)

parameter

parameter

Type

Description

cols

liste ou tuple

Noms des colonnes pour lesquelles calculer les éléments fréquents.

support

flottant, facultatif

La fréquence à laquelle considérer un élément comme fréquent. Default est 1 % (0,01). Doit être supérieur à 1e-4.

parameter

Type

Description

cols

liste ou tuple

Noms des colonnes pour lesquelles calculer les éléments fréquents.

support

flottant, facultatif

La fréquence à laquelle considérer un élément comme fréquent. Default est 1 % (0,01). Doit être supérieur à 1e-4.

Renvoie

DataFrame

Notes

Cette méthode est destinée à l'analyse exploratoire des données. Il n'y a aucune garantie de rétrocompatibilité pour le schéma du DataFrame résultant.

Exemples

Python
from pyspark.sql import functions as sf
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
result = df.stat.freqItems(["c1", "c2"])
result.select([sf.sort_array(c).alias(c) for c in result.columns]).show()
# +------------+------------+
# |c1_freqItems|c2_freqItems|
# +------------+------------+
# | [1, 3, 4]| [8, 10, 11]|
# +------------+------------+