ai_classify
Classe le contenu des documents dans l'une des étiquettes fournies à l'aide de l'IA/LLM.
Pour la fonction Databricks SQL correspondante, consultez la fonctionai_classify.
Syntaxe
from pyspark.sql import functions as dbf
dbf.ai_classify(col=<col>, labels=<labels>, options=<options>)
parameter
parameter | Type | Description |
|---|---|---|
|
| Une colonne contenant le contenu du document à classer. |
|
| Soit un ensemble d'étiquettes littérales (liste Python de chaînes d'étiquettes ou dictionnaire mappant les noms d'étiquettes aux descriptions, sérialisé automatiquement en un littéral JSON) ou une expression de colonne dont la valeur par ligne est un tableau JSON de chaînes d'étiquettes ou un objet JSON mappant les noms d'étiquettes aux descriptions. |
|
| Un dictionnaire d'options pour contrôler le comportement de classification. |
Renvoie
pyspark.sql.Column: Une nouvelle colonne contenant le résultat de la classification.
Le comportement default est la classification à étiquette unique. Pour activer la classification multi-étiquette et voir l'ensemble complet des options prises en charge, consultez le manuel du langage SQL.
Exemples
# Static labels (same set for every row)
df.select(ai_classify("text", ["positive", "negative", "neutral"]))
df.select(ai_classify("text", {"positive": "Happy tone", "negative": "Unhappy tone"}))
# Per-row labels (a column whose value is a JSON array or JSON object string)
df.select(ai_classify("text", col("labels_json")))