Développer et lire les fichiers compressés Zip
Vous pouvez utiliser la commande Bash unzip pour décompresser des fichiers ou des répertoires de fichiers compressés Zip (.zip). La commande magique Databricks %sh permet l'exécution de code Bash arbitraire, y compris la commande unzip.
Apache Spark fournit des codecs natifs pour interagir avec les fichiers Parquet compressés. La plupart des fichiers Parquet écrits par Databricks se terminent par .snappy.parquet, indiquant qu'ils utilisent la compression Snappy.
download et décompressez le fichier
Utilisez curl pour download le fichier compressé, puis unzip pour développer les données. L'exemple suivant utilise un fichier CSV compressé download depuis Internet. Consultez download des données à partir d'Internet.
%sh curl https://resources.lendingclub.com/LoanStats3a.csv.zip --output /tmp/LoanStats3a.csv.zip
unzip /tmp/LoanStats3a.csv.zip
Déplacer le fichier vers un volume
Déplacez maintenant le fichier décompressé vers un volume Unity Catalog :
%sh mv /tmp/LoanStats3a.csv /Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv
Dans cet exemple, les données téléchargées ont un commentaire dans la première ligne et un en-tête dans la seconde. Maintenant que vous avez déplacé et étendu les données, utilisez les options standards pour la lecture des fichiers CSV, par exemple :
df = spark.read.format("csv").option("skipRows", 1).option("header", True).load("/Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv")
display(df)