Aller au contenu principal

intersecter

Renvoie un nouveau DataFrame contenant des lignes uniquement dans ce DataFrame et un autre DataFrame. Notez que les doublons sont supprimés. Pour préserver les doublons, utilisez intersectAll.

Syntaxe

intersect(other: "DataFrame")

parameter

parameter

Type

Description

other

DataFrame

Un autre DataFrame qui doit être combiné.

parameter

Type

Description

other

DataFrame

Un autre DataFrame qui doit être combiné.

Renvoie

DataFrame: DataFrame combiné.

Notes

Ceci est équivalent à INTERSECT en SQL.

Exemples

Python
df1 = spark.createDataFrame([("a", 1), ("a", 1), ("b", 3), ("c", 4)], ["C1", "C2"])
df2 = spark.createDataFrame([("a", 1), ("a", 1), ("b", 3)], ["C1", "C2"])
result_df = df1.intersect(df2).sort("C1", "C2")
result_df.show()
# +---+---+
# | C1| C2|
# +---+---+
# | a| 1|
# | b| 3|
# +---+---+

df1 = spark.createDataFrame([(1, "A"), (2, "B")], ["id", "value"])
df2 = spark.createDataFrame([(2, "B"), (3, "C")], ["id", "value"])
result_df = df1.intersect(df2).sort("id", "value")
result_df.show()
# +---+-----+
# | id|value|
# +---+-----+
# | 2| B|
# +---+-----+