Aller au contenu principal

intersecter

Renvoie un nouveau DataFrame contenant des lignes uniquement dans ce DataFrame et un autre DataFrame. Notez que les doublons sont supprimés. Pour préserver les doublons, utilisez intersectAll.

Syntaxe​

intersect(other: "DataFrame")

parameter​

parameter

Type

Description

other

DataFrame

Un autre DataFrame qui doit être combiné.

parameter

Type

Description

other

DataFrame

Un autre DataFrame qui doit être combiné.

Renvoie​

DataFrame: DataFrame combiné.

Notes​

Ceci est équivalent à INTERSECT en SQL.

Exemples​

Python
df1 = spark.createDataFrame([("a", 1), ("a", 1), ("b", 3), ("c", 4)], ["C1", "C2"])
df2 = spark.createDataFrame([("a", 1), ("a", 1), ("b", 3)], ["C1", "C2"])
result_df = df1.intersect(df2).sort("C1", "C2")
result_df.show()
# +---+---+
# | C1| C2|
# +---+---+
# | a| 1|
# | b| 3|
# +---+---+

df1 = spark.createDataFrame([(1, "A"), (2, "B")], ["id", "value"])
df2 = spark.createDataFrame([(2, "B"), (3, "C")], ["id", "value"])
result_df = df1.intersect(df2).sort("id", "value")
result_df.show()
# +---+-----+
# | id|value|
# +---+-----+
# | 2| B|
# +---+-----+