Aller au contenu principal

Développer et lire les fichiers compressés Zip

Vous pouvez utiliser la commande Bash unzip pour décompresser des fichiers ou des répertoires de fichiers compressés Zip (.zip). La commande magique Databricks %sh permet l'exécution de code Bash arbitraire, y compris la commande unzip.

Apache Spark fournit des codecs natifs pour interagir avec les fichiers Parquet compressés. La plupart des fichiers Parquet écrits par Databricks se terminent par .snappy.parquet, indiquant qu'ils utilisent la compression Snappy.

download et décompressez le fichier

Utilisez curl pour download le fichier compressé, puis unzip pour développer les données. L'exemple suivant utilise un fichier CSV compressé download depuis Internet. Consultez download des données à partir d'Internet.

Bash
%sh curl https://resources.lendingclub.com/LoanStats3a.csv.zip --output /tmp/LoanStats3a.csv.zip
unzip /tmp/LoanStats3a.csv.zip

Déplacer le fichier vers un volume

Déplacez maintenant le fichier décompressé vers un volume Unity Catalog :

Python
%sh mv /tmp/LoanStats3a.csv /Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv

Dans cet exemple, les données téléchargées ont un commentaire dans la première ligne et un en-tête dans la seconde. Maintenant que vous avez déplacé et étendu les données, utilisez les options standards pour la lecture des fichiers CSV, par exemple :

Python
df = spark.read.format("csv").option("skipRows", 1).option("header", True).load("/Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv")
display(df)