Options de format de données
Databricks dispose de liaisons de mots-clés intégrées pour tous les formats de données pris en charge en mode natif par Apache Spark. Databricks utilise Delta Lake comme protocole default pour la lecture et l’écriture de données et de tables, tandis qu’Apache Spark utilise Parquet.
Ces articles fournissent un aperçu des nombreuses options et configurations disponibles lorsque vous interrogez des données sur Databricks.
Les formats de données suivants ont des configurations de mots-clés intégrées dans Apache Spark DataFrames et SQL :
Databricks fournit également un mot-clé personnalisé pour le chargement des expérimentations MLflow.
Formats de données avec des considérations particulières
Certains formats de données nécessitent une configuration supplémentaire ou des considérations particulières pour leur utilisation :
- Databricks recommande de charger les images en tant que données
binary. - La plupart des formats prennent en charge la compression en écriture via l'option
compression. Consultez la section sur la compression dans la documentation de chaque format pour les détails de configuration. Databricks peut également lire directement des fichiers pré-compressés dans de nombreux formats, et vous pouvez décompresser les fichiers compressés sur Databricks si nécessaire.- Basé sur le texte (CSV, JSON, XML, texte) :
none(default),bzip2,gzip,lz4,snappy,deflate, etzstd - **Parquet** :
snappy(default),,,,,gziplzo``brotli``lz4etzstd - ORC :
snappy,zlibetlzo - Avro :
snappy(default),deflate,bzip2,xz, etzstandard
- Basé sur le texte (CSV, JSON, XML, texte) :
Pour plus d'informations sur les sources de données Apache Spark, consultez Fonctions de chargement/enregistrement génériques et Options de source de fichiers génériques.