Aller au contenu principal

ai_classify

Classe le contenu des documents dans l'une des étiquettes fournies à l'aide de l'IA/LLM.

Pour la fonction Databricks SQL correspondante, consultez la fonctionai_classify.

Syntaxe

Python
from pyspark.sql import functions as dbf

dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)

parameter

parameter

Type

Description

col

pyspark.sql.Column OU str

Une colonne contenant le contenu du document à classer.

labels

list, dict, pyspark.sql.Column, ou str

Soit un ensemble d'étiquettes littérales (liste Python de chaînes d'étiquettes ou dictionnaire mappant les noms d'étiquettes aux descriptions, sérialisé automatiquement en un littéral JSON) ou une expression de colonne dont la valeur par ligne est un tableau JSON de chaînes d'étiquettes ou un objet JSON mappant les noms d'étiquettes aux descriptions.

options

dict, facultatif

Un dictionnaire d'options pour contrôler le comportement de classification.

parameter

Type

Description

col

pyspark.sql.Column OU str

Une colonne contenant le contenu du document à classer.

labels

list, dict, pyspark.sql.Column, ou str

Soit un ensemble d'étiquettes littérales (liste Python de chaînes d'étiquettes ou dictionnaire mappant les noms d'étiquettes aux descriptions, sérialisé automatiquement en un littéral JSON) ou une expression de colonne dont la valeur par ligne est un tableau JSON de chaînes d'étiquettes ou un objet JSON mappant les noms d'étiquettes aux descriptions.

options

dict, facultatif

Un dictionnaire d'options pour contrôler le comportement de classification.

Renvoie

pyspark.sql.Column: Une nouvelle colonne contenant le résultat de la classification.

Le comportement default est la classification à étiquette unique. Pour activer la classification multi-étiquette et voir l'ensemble complet des options prises en charge, consultez le manuel du langage SQL.

Exemples

Python
# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))

# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))