Pular para o conteúdo principal

vector_cosine_similarity

Retorna a similaridade de cosseno entre dois vetores float. Os vetores devem ter a mesma dimensão.

Para a função correspondente do Databricks SQL, consulte funçãovector_cosine_similarity.

Sintaxe​

Python
from pyspark.sql import functions as dbf

dbf.vector_cosine_similarity(left=<left>, right=<right>)

Parâmetros​

Parâmetro

Tipo

Descrição

left

pyspark.sql.Column ou nome da coluna

Primeira coluna vetorial.

right

pyspark.sql.Column ou nome da coluna

Segunda coluna vetorial.

Parâmetro

Tipo

Descrição

left

pyspark.sql.Column ou nome da coluna

Primeira coluna vetorial.

right

pyspark.sql.Column ou nome da coluna

Segunda coluna vetorial.

Devolve​

pyspark.sql.Column: Similaridade de cosseno como um valor de ponto flutuante.

Exemplos​

Python
from pyspark.sql import functions as dbf
from pyspark.sql.types import ArrayType, FloatType, StructType, StructField

schema = StructType([StructField('a', ArrayType(FloatType())), StructField('b', ArrayType(FloatType()))])
df = spark.createDataFrame([([1.0, 2.0, 3.0], [4.0, 5.0, 6.0])], schema)
df.select(dbf.vector_cosine_similarity('a', 'b')).first()[0]
# 0.974631...