Aller au contenu principal

ai_extract

Extrait des données structurées d'une colonne de document à l'aide de l'IA/LLM.

Pour la fonction Databricks SQL correspondante, consultez la fonctionai_extract.

Syntaxe​

Python
from pyspark.sql import functions as dbf

dbf.ai_extract(col=<col>, schema=<schema>, options=<options>)

parameter​

parameter

Type

Description

col

pyspark.sql.Column OU str

Une colonne contenant le contenu du document à partir duquel extraire.

schema

dict OU list

Un dictionnaire Python (nom de champ vers {"type": ..., "description": ...}) ou une liste de chaînes de noms de champ. Sérialisé automatiquement en un JSON literal.

options

dict, facultatif

Un dictionnaire d'options pour contrôler le comportement d'extraction.

parameter

Type

Description

col

pyspark.sql.Column OU str

Une colonne contenant le contenu du document à partir duquel extraire.

schema

dict OU list

Un dictionnaire Python (nom de champ vers {"type": ..., "description": ...}) ou une liste de chaînes de noms de champ. Sérialisé automatiquement en un JSON literal.

options

dict, facultatif

Un dictionnaire d'options pour contrôler le comportement d'extraction.

Renvoie​

pyspark.sql.Column: Une nouvelle colonne de VariantType contenant les champs extraits.

Exemples​

Python
df.select(ai_extract("text", {"name": {"type": "string", "description": "Name"}}))
df.select(ai_extract("text", ["name", "age"]))

Ressources connexes​