Aller au contenu principal

freqItems (DataFrame)

Recherche d'éléments fréquents pour les colonnes, éventuellement avec des faux positifs. En utilisant l'algorithme de comptage des éléments fréquents décrit dans « https://doi.org/10.1145/762471.762473 », proposé par Karp, Schenker et Papadimitriou ». DataFrame.freqItems et DataFrameStatFunctions.freqItems sont des alias.

Syntaxe

freqItems(cols: Union[List[str], Tuple[str]], support: Optional[float] = None)

parameter

parameter

Type

Description

cols

liste ou tuple

Noms des colonnes pour calculer les éléments fréquents sous forme de liste ou de tuple de chaînes de caractères.

support

flottant, facultatif

La fréquence à laquelle un élément est considéré comme « fréquent ». default est 1 %. Le support doit être supérieur à 1e-4.

parameter

Type

Description

cols

liste ou tuple

Noms des colonnes pour calculer les éléments fréquents sous forme de liste ou de tuple de chaînes de caractères.

support

flottant, facultatif

La fréquence à laquelle un élément est considéré comme « fréquent ». default est 1 %. Le support doit être supérieur à 1e-4.

Renvoie

DataFrame: DataFrame avec des éléments fréquents.

Notes

Cette fonction est destinée à l'analyse exploratoire des données, car nous ne garantissons pas la rétrocompatibilité du schéma du DataFrame résultant.

Exemples

Python
from pyspark.sql import functions as sf
df = spark.createDataFrame([(1, 11), (1, 11), (3, 10), (4, 8), (4, 8)], ["c1", "c2"])
df = df.freqItems(["c1", "c2"])
df.select([sf.sort_array(c).alias(c) for c in df.columns]).show()
# +------------+------------+
# |c1_freqItems|c2_freqItems|
# +------------+------------+
# | [1, 3, 4]| [8, 10, 11]|
# +------------+------------+