point de contrôle
Renvoie une version de ce DataFrame avec des points de contrôle. Le checkpointing peut être utilisé pour tronquer le plan logique de ce DataFrame, ce qui est particulièrement utile dans les algorithmes itératifs où le plan peut croître de manière exponentielle. Il sera enregistré dans les fichiers du répertoire de point de contrôle défini avec la configuration SparkContext.setCheckpointDir ou spark.checkpoint.dir.
Syntaxe
checkpoint(eager: bool = True)
parameter
parameter | Type | Description |
|---|---|---|
| bool, facultatif, default True | Indique s'il faut effectuer un point de contrôle de ce DataFrame immédiatement. |
Renvoie
DataFrame: DataFrame pointé.
Notes
Cette API est expérimentale.
Exemples
:::note Compatibilité Serverless
Databricks recommande de s’éloigner de DataFrame.checkpoint(), car il n’est pas compatible avec l’architecture de compute serverless de Databricks. Écrivez le DataFrame dans une table Delta à la place.
:::
df = spark.createDataFrame([
(14, "Tom"), (23, "Alice"), (16, "Bob")], ["age", "name"])
df.checkpoint(False)
# DataFrame[age: bigint, name: string]