phrases
Divise une chaîne en tableaux de phrases, où chaque phrase est un tableau de mots.
Les arguments language et country sont facultatifs. Lorsqu'ils sont omis :
- S'ils sont tous deux omis, le
Locale.ROOT - locale(language='', country='')est utilisé. LeLocale.ROOTest considéré comme la locale de base de toutes les locales, et est utilisé comme locale neutre pour la langue/le pays pour les opérations sensibles à la locale. - Si le
countryest omis, lelocale(language, country='')est utilisé.
Lorsqu'ils sont nuls :
- Si les deux sont
null, leLocale.US - locale(language='en', country='US')est utilisé. - Si le
languageest nul et lecountryn'est pas nul, leLocale.US - locale(language='en', country='US')est utilisé. - Si le
languagen'est pas nul et si lecountryest nul, lelocale(language)est utilisé. - Si aucun des deux n'est
null, lelocale(language, country)est utilisé.
Pour la fonction Databricks SQL correspondante, consultez la fonctionsentences.
Syntaxe
Python
from pyspark.sql import functions as dbf
dbf.sentences(string=<string>, language=<language>, country=<country>)
parameter
parameter | Type | Description |
|---|---|---|
|
| une chaîne à fractionner |
|
| une langue du paramètre régional |
|
| un pays de la locale |
Renvoie
pyspark.sql.Column: tableaux de phrases divisées.
Exemples
Python
from pyspark.sql import functions as dbf
df = spark.createDataFrame([("This is an example sentence.", )], ["s"])
df.select("*", dbf.sentences(df.s, dbf.lit("en"), dbf.lit("US"))).show(truncate=False)
df.select("*", dbf.sentences(df.s, dbf.lit("en"))).show(truncate=False)
df.select("*", dbf.sentences(df.s)).show(truncate=False)