Aller au contenu principal

phrases

Divise une chaîne en tableaux de phrases, où chaque phrase est un tableau de mots.

Les arguments language et country sont facultatifs. Lorsqu'ils sont omis :

  • S'ils sont tous deux omis, le Locale.ROOT - locale(language='', country='') est utilisé. Le Locale.ROOT est considéré comme la locale de base de toutes les locales, et est utilisé comme locale neutre pour la langue/le pays pour les opérations sensibles à la locale.
  • Si le country est omis, le locale(language, country='') est utilisé.

Lorsqu'ils sont nuls :

  1. Si les deux sont null, le Locale.US - locale(language='en', country='US') est utilisé.
  2. Si le language est nul et le country n'est pas nul, le Locale.US - locale(language='en', country='US') est utilisé.
  3. Si le language n'est pas nul et si le country est nul, le locale(language) est utilisé.
  4. Si aucun des deux n'est null, le locale(language, country) est utilisé.

Pour la fonction Databricks SQL correspondante, consultez la fonctionsentences.

Syntaxe

Python
from pyspark.sql import functions as dbf

dbf.sentences(string=<string>, language=<language>, country=<country>)

parameter

parameter

Type

Description

string

pyspark.sql.Column OU str

une chaîne à fractionner

language

pyspark.sql.Column OU str, optional

une langue du paramètre régional

country

pyspark.sql.Column OU str, optional

un pays de la locale

parameter

Type

Description

string

pyspark.sql.Column OU str

une chaîne à fractionner

language

pyspark.sql.Column OU str, optional

une langue du paramètre régional

country

pyspark.sql.Column OU str, optional

un pays de la locale

Renvoie

pyspark.sql.Column: tableaux de phrases divisées.

Exemples

Python
from pyspark.sql import functions as dbf
df = spark.createDataFrame([("This is an example sentence.", )], ["s"])
df.select("*", dbf.sentences(df.s, dbf.lit("en"), dbf.lit("US"))).show(truncate=False)
df.select("*", dbf.sentences(df.s, dbf.lit("en"))).show(truncate=False)
df.select("*", dbf.sentences(df.s)).show(truncate=False)