Aller au contenu principal

corr (DataFrame)

Calcule la corrélation de deux colonnes d'un DataFrame sous forme de valeur double. Actuellement, seul le coefficient de corrélation de Pearson est pris en charge. DataFrame.corr et DataFrameStatFunctions.corr sont des alias l'un de l'autre.

Syntaxe

corr(col1: str, col2: str, method: Optional[str] = None)

parameter

parameter

Type

Description

col1

str

Le nom de la première colonne.

col2

str

Le nom de la deuxième colonne.

method

str, facultatif

La méthode de corrélation. Actuellement, ne prend en charge que « pearson ».

parameter

Type

Description

col1

str

Le nom de la première colonne.

col2

str

Le nom de la deuxième colonne.

method

str, facultatif

La méthode de corrélation. Actuellement, ne prend en charge que « pearson ».

Renvoie

Float : Coefficient de corrélation de Pearson de deux colonnes.

Exemples

Python
df = spark.createDataFrame([(1, 12), (10, 1), (19, 8)], ["c1", "c2"])
df.corr("c1", "c2")
# -0.3592106040535498
df = spark.createDataFrame([(11, 12), (10, 11), (9, 10)], ["small", "bigger"])
df.corr("small", "bigger")
# 1.0