Catalogue
API de catalogue destinée aux utilisateurs, accessible via SparkSession.catalog. Il s'agit d'une simple enveloppe autour de son implémentation Scala org.apache.spark.sql.catalog.Catalog.
Syntaxe
# Access through SparkSession
spark.catalog
Méthodes
Méthode | Description |
|---|---|
Retourne le catalogue default actuel dans cette session. | |
Définit le catalogue default actuel dans cette session. | |
Renvoie une liste de catalogues dans cette session. | |
Renvoie la base de données default actuelle dans cette session. | |
Définit la base de données default actuelle dans cette session. | |
Renvoie une liste de bases de données disponibles pour toutes les sessions. | |
Obtient la base de données avec le nom spécifié. Lève une AnalysisException lorsque la base de données est introuvable. | |
Vérifie si la base de données avec le nom spécifié existe. | |
Renvoie une liste de tables et de vues dans la base de données spécifiée. Inclut toutes les vues temporaires. | |
Récupère la table ou la vue avec le nom spécifié. Déclenche une AnalysisException si aucune table n'est trouvée. | |
Vérifie si la table ou la vue portant le nom spécifié existe. | |
Renvoie la liste des colonnes pour la table ou la vue donnée dans la base de données spécifiée. | |
Renvoie la liste des fonctions enregistrées dans la base de données spécifiée. Inclut toutes les fonctions temporaires. | |
Vérifie si la fonction portant le nom spécifié existe. Comprend les fonctions temporaires. | |
Obtient la fonction avec le nom spécifié. Déclenche une AnalysisException lorsque la fonction est introuvable. | |
| Crée une table basée sur le dataset dans une source de données et renvoie le DataFrame associé. |
Supprime la vue temporaire locale avec le nom donné. Annule également la mise en cache de la vue si elle était en cache. | |
Supprime la vue temporaire globale portant le nom spécifié. Annule également la mise en cache de la vue si elle était en cache. | |
Renvoie true si la table est actuellement mise en cache en mémoire. | |
Met en cache la table spécifiée en mémoire ou avec le niveau de stockage donné. La valeur par default est MEMORY_AND_DISK. | |
Supprime la table spécifiée du cache en mémoire. | |
Supprime toutes les tables mises en cache du cache en mémoire. | |
Invalide et refresh toutes les données et métadonnées mises en cache de la table donnée. | |
Récupère toutes les partitions de la table donnée et met à jour le catalogue. Ne fonctionne qu'avec les tables partitionnées. | |
Invalide et refresh toutes les données et métadonnées mises en cache pour tout DataFrame contenant le chemin de source de données donné. |
Exemples
spark.catalog.currentDatabase()
'default'
spark.catalog.listDatabases()
[Database(name='default', catalog='spark_catalog', description='default database', ...)]
_ = spark.sql("CREATE TABLE tbl1 (name STRING, age INT) USING parquet")
spark.catalog.tableExists("tbl1")
True
spark.catalog.cacheTable("tbl1")
spark.catalog.isCached("tbl1")
True
spark.catalog.uncacheTable("tbl1")
spark.catalog.isCached("tbl1")
False