Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Devolve a semelhança cosseno entre dois vetores float. Os vetores devem ter a mesma dimensão.
Para a função SQL do Databricks correspondente, veja vector_cosine_similarity função.
Sintaxe
from pyspark.sql import functions as dbf
dbf.vector_cosine_similarity(left=<left>, right=<right>)
Parameters
| Parâmetro | Tipo | Description |
|---|---|---|
left |
pyspark.sql.Column ou nome da coluna |
Primeira coluna vetorial. |
right |
pyspark.sql.Column ou nome da coluna |
Segunda coluna vetorial. |
Returns
pyspark.sql.Column: Similaridade cosseno como valor flutuante.
Examples
from pyspark.sql import functions as dbf
from pyspark.sql.types import ArrayType, FloatType, StructType, StructField
schema = StructType([StructField('a', ArrayType(FloatType())), StructField('b', ArrayType(FloatType()))])
df = spark.createDataFrame([([1.0, 2.0, 3.0], [4.0, 5.0, 6.0])], schema)
df.select(dbf.vector_cosine_similarity('a', 'b')).first()[0]
# 0.974631...