Aller au contenu principal

Fractionnement

Divise la chaîne en fonction des correspondances du motif donné.

Pour la fonction Databricks SQL correspondante, consultez la fonctionsplit.

Syntaxe

Python
from pyspark.sql import functions as dbf

dbf.split(str=<str>, pattern=<pattern>, limit=<limit>)

parameter

parameter

Type

Description

str

pyspark.sql.Column OU str

une expression de chaîne à diviser

pattern

pyspark.sql.Column OU literal string

une chaîne représentant une expression régulière. La chaîne regex doit être une expression régulière Java. accepté comme représentation d'expression régulière, pour la rétrocompatibilité. En plus d'int, limit accepte désormais la colonne et le nom de la colonne.

limit

pyspark.sql.Column ou str ou int

un entier qui contrôle le nombre de fois que pattern est appliqué. _ limit > 0: La longueur du tableau résultant ne dépassera pas limit, et la dernière entrée du tableau résultant contiendra toutes les entrées au-delà du dernier modèle correspondant. _ limit <= 0: pattern sera appliqué autant de fois que possible, et le tableau résultant peut être de n'importe quelle taille.

parameter

Type

Description

str

pyspark.sql.Column OU str

une expression de chaîne à diviser

pattern

pyspark.sql.Column OU literal string

une chaîne représentant une expression régulière. La chaîne regex doit être une expression régulière Java. accepté comme représentation d'expression régulière, pour la rétrocompatibilité. En plus d'int, limit accepte désormais la colonne et le nom de la colonne.

limit

pyspark.sql.Column ou str ou int

un entier qui contrôle le nombre de fois que pattern est appliqué. _ limit > 0: La longueur du tableau résultant ne dépassera pas limit, et la dernière entrée du tableau résultant contiendra toutes les entrées au-delà du dernier modèle correspondant. _ limit <= 0: pattern sera appliqué autant de fois que possible, et le tableau résultant peut être de n'importe quelle taille.

Renvoie

pyspark.sql.Column: tableau de chaînes séparées.

Exemples

Python
from pyspark.sql import functions as dbf
df = spark.createDataFrame([('oneAtwoBthreeC',)], ['s',])
df.select('*', dbf.split(df.s, '[ABC]')).show()
df.select('*', dbf.split(df.s, '[ABC]', 2)).show()
df.select('*', dbf.split('s', '[ABC]', -2)).show()
df = spark.createDataFrame([
('oneAtwoBthreeC', '[ABC]', 2),
('1A2B3C', '[1-9]+', 1),
('aa2bb3cc4', '[1-9]+', -1)], ['s', 'p', 'l'])
df.select('*', dbf.split(df.s, df.p)).show()
df.select(dbf.split('s', df.p, 'l')).show()