cache
Conserve le DataFrame avec le niveau de stockage default (MEMORY_AND_DISK_DESER).
Syntaxe
cache()
Renvoie
DataFrame: DataFrame mis en cache.
Notes
Le niveau de stockage par default est passé à MEMORY_AND_DISK_DESER pour correspondre à Scala dans la version 3.0.
Les données mises en cache sont partagées entre toutes les sessions Spark du cluster.
Exemples
:::note Compatibilité Serverless
Databricks recommande de s’éloigner de DataFrame.cache(), car il n’est pas compatible avec l’architecture de compute serverless de Databricks. Matérialisez les résultats intermédiaires dans une table Delta à la place.
:::
Python
df = spark.range(1)
df.cache()
# DataFrame[id: bigint]
df.explain()
# == Physical Plan ==
# InMemoryTableScan ...