Aller au contenu principal

ai_extract

Extrait des données structurées d'une colonne de document à l'aide de l'IA/LLM.

Pour la fonction Databricks SQL correspondante, consultez la fonctionai_extract.

Syntaxe

Python
from pyspark.sql import functions as dbf

dbf.ai_extract(col=<col>, schema=<schema>, options=<options>)

parameter

parameter

Type

Description

col

pyspark.sql.Column OU str

Une colonne contenant le contenu du document à partir duquel extraire.

schema

dict OU list

Un dictionnaire Python (nom de champ vers {"type": ..., "description": ...}) ou une liste de chaînes de noms de champ. Sérialisé automatiquement en un JSON literal.

options

dict, facultatif

Un dictionnaire d'options pour contrôler le comportement d'extraction.

parameter

Type

Description

col

pyspark.sql.Column OU str

Une colonne contenant le contenu du document à partir duquel extraire.

schema

dict OU list

Un dictionnaire Python (nom de champ vers {"type": ..., "description": ...}) ou une liste de chaînes de noms de champ. Sérialisé automatiquement en un JSON literal.

options

dict, facultatif

Un dictionnaire d'options pour contrôler le comportement d'extraction.

Renvoie

pyspark.sql.Column: Une nouvelle colonne de VariantType contenant les champs extraits.

Exemples

Python
df.select(ai_extract("text", {"name": {"type": "string", "description": "Name"}}))
df.select(ai_extract("text", ["name", "age"]))

Ressources connexes