corr (DataFrame)
Calcule la corrélation de deux colonnes d'un DataFrame sous forme de valeur double. Actuellement, seul le coefficient de corrélation de Pearson est pris en charge. DataFrame.corr et DataFrameStatFunctions.corr sont des alias l'un de l'autre.
Syntaxe
corr(col1: str, col2: str, method: Optional[str] = None)
parameter
parameter | Type | Description |
|---|---|---|
| str | Le nom de la première colonne. |
| str | Le nom de la deuxième colonne. |
| str, facultatif | La méthode de corrélation. Actuellement, ne prend en charge que « pearson ». |
Renvoie
Float : Coefficient de corrélation de Pearson de deux colonnes.
Exemples
Python
df = spark.createDataFrame([(1, 12), (10, 1), (19, 8)], ["c1", "c2"])
df.corr("c1", "c2")
# -0.3592106040535498
df = spark.createDataFrame([(11, 12), (10, 11), (9, 10)], ["small", "bigger"])
df.corr("small", "bigger")
# 1.0