Aller au contenu principal

cache

Conserve le DataFrame avec le niveau de stockage default (MEMORY_AND_DISK_DESER).

Syntaxe

cache()

Renvoie

DataFrame: DataFrame mis en cache.

Notes

Le niveau de stockage par default est passé à MEMORY_AND_DISK_DESER pour correspondre à Scala dans la version 3.0.

Les données mises en cache sont partagées entre toutes les sessions Spark du cluster.

Exemples

:::note Compatibilité Serverless

Databricks recommande de s’éloigner de DataFrame.cache(), car il n’est pas compatible avec l’architecture de compute serverless de Databricks. Matérialisez les résultats intermédiaires dans une table Delta à la place.

:::

Python
df = spark.range(1)
df.cache()
# DataFrame[id: bigint]

df.explain()
# == Physical Plan ==
# InMemoryTableScan ...