union
Retourne un nouveau DataFrame contenant l'union des lignes dans ce DataFrame et un autre.
Syntaxe
union(other: "DataFrame")
parameter
parameter | Type | Description |
|---|---|---|
| DataFrame | Un autre DataFrame qui doit être uni. |
Renvoie
DataFrame: une nouvelle DataFrame contenant les lignes combinées avec les colonnes correspondantes.
Notes
Cette méthode effectue une union d'ensembles de style SQL des lignes des deux objets DataFrame, sans déduplication automatique des éléments.
Utilisez la méthode distinct() pour effectuer la déduplication des lignes.
La méthode résout les colonnes par position (et non par nom), suivant le comportement standard en SQL.
Exemples
Python
df1 = spark.createDataFrame([(1, 'A'), (2, 'B')], ['id', 'value'])
df2 = spark.createDataFrame([(3, 'C'), (4, 'D')], ['id', 'value'])
df3 = df1.union(df2)
df3.show()
# +---+-----+
# | id|value|
# +---+-----+
# | 1| A|
# | 2| B|
# | 3| C|
# | 4| D|
# +---+-----+
df1 = spark.createDataFrame([(1, 'A'), (2, 'B'), (3, 'C')], ['id', 'value'])
df2 = spark.createDataFrame([(3, 'C'), (4, 'D')], ['id', 'value'])
df3 = df1.union(df2).distinct().sort("id")
df3.show()
# +---+-----+
# | id|value|
# +---+-----+
# | 1| A|
# | 2| B|
# | 3| C|
# | 4| D|
# +---+-----+