hachage
Calcule le code de hachage des colonnes données et retourne le résultat sous forme de colonne int. Prend en charge Spark Connect.
Pour la fonction Databricks SQL correspondante, consultez la fonctionhash.
Syntaxe
Python
from pyspark.sql import functions as dbf
dbf.hash(*cols)
parameter
parameter | Type | Description |
|---|---|---|
|
| Une ou plusieurs colonnes à compute. |
Renvoie
pyspark.sql.Column: valeur de hachage en tant que colonne entière.
Exemples
Exemple 1 : calcul du hachage d’une seule colonne
Python
from pyspark.sql import functions as dbf
df = spark.createDataFrame([('ABC', 'DEF')], ['c1', 'c2'])
df.select('*', dbf.hash('c1')).show()
Output
+---+---+----------+
| c1| c2| hash(c1)|
+---+---+----------+
|ABC|DEF|-757602832|
+---+---+----------+
Exemple 2 : calcul du hachage de plusieurs colonnes
Python
from pyspark.sql import functions as dbf
df = spark.createDataFrame([('ABC', 'DEF')], ['c1', 'c2'])
df.select('*', dbf.hash('c1', df.c2)).show()
Output
+---+---+------------+
| c1| c2|hash(c1, c2)|
+---+---+------------+
|ABC|DEF| 599895104|
+---+---+------------+