Aller au contenu principal

Installez des bibliothèques à partir d'un repository de packages

Databricks fournit des outils pour installer des bibliothèques à partir des repositories de package PyPI, Maven et CRAN. Consultez Bibliothèques à portée de compute pour connaître tous les détails de compatibilité des bibliothèques.

important

Les bibliothèques peuvent être installées à partir de DBFS lors de l’utilisation de Databricks Runtime 14.3 LTS et versions antérieures. Cependant, tout utilisateur de Workspace peut modifier les fichiers de bibliothèque stockés dans DBFS. Pour améliorer la sécurité des bibliothèques dans un Workspace Databricks, le stockage des fichiers de bibliothèque dans la racine DBFS est obsolète et désactivé par default dans Databricks Runtime 15.1 et versions ultérieures. Consultez Le stockage des bibliothèques dans la racine DBFS est déprécié et désactivé par default.

Au lieu de cela, Databricks recommande d’upload toutes les bibliothèques, y compris les bibliothèques Python, les fichiers JAR et les connecteurs Spark, dans les fichiers Workspace ou les volumes Unity Catalog, ou d’utiliser les repositories de packages de bibliothèques. Si votre charge de travail ne prend pas en charge ces modèles, vous pouvez également utiliser des bibliothèques stockées dans le stockage objet cloud.

package PyPI

  1. Dans la liste de boutons Source de la bibliothèque , sélectionnez PyPI .

  2. Saisissez un nom de package PyPI. Pour installer une version spécifique d'une bibliothèque, utilisez ce format pour la bibliothèque : <library>==<version>. Par exemple, scikit-learn==0.19.1.

remarque

Pour les jobs, Databricks vous recommande de spécifier une version de bibliothèque afin d'assurer un environnement reproductible. Si la version de la bibliothèque n'est pas entièrement spécifiée, Databricks utilise la dernière version correspondante. Cela signifie que différentes exécutions du même job pourraient utiliser différentes versions de bibliothèque à mesure que de nouvelles versions sont publiées. La spécification de la version de la bibliothèque empêche les nouvelles modifications majeures des bibliothèques de perturber vos Jobs.

  1. (Facultatif) Dans le champ URL d'index, saisissez une URL d'index PyPI.

  2. Cliquez sur Installer .

Maven ou package Spark

important

Pour installer des bibliothèques Maven sur un compute configuré avec le mode d'accès standard (anciennement mode d'accès partagé), vous devez définir les autorisations CAN ATTACH TO et CAN MANAGE sur le compute et ajouter les coordonnées Maven à la liste d'autorisation. Consultez Ajouter les coordonnées Maven à la liste d'autorisation.

important

Pour Databricks Runtime 14.3 LTS et versions antérieures, Databricks utilise Apache Ivy 2.4.0 pour résoudre les packages Maven. Pour Databricks Runtime 15,0 et versions ultérieures, Databricks utilise Ivy 2.5.1 ou version supérieure, et la version spécifique d'Ivy est listée dans versions et compatibilité des notes de publication de Databricks Runtime.

L'ordre d'installation des packages Maven peut affecter l'arborescence des dépendances finale, ce qui peut avoir un impact sur l'ordre de chargement des bibliothèques.

  1. Dans la liste des boutons **Source de la bibliothèque**, sélectionnez **Maven**.

  2. Spécifiez une coordonnée Maven. Effectuez l'une des opérations suivantes :

    • Dans le champ des coordonnées, saisissez la coordonnée Maven de la bibliothèque à installer. Les coordonnées Maven sont sous la forme groupId:artifactId:version; par exemple, com.databricks:spark-avro_2.10:1.0.0.
    • Si vous ne connaissez pas les coordonnées exactes, saisissez le nom de la bibliothèque et cliquez sur **Rechercher des packages**. Une liste de packages correspondants s’affiche. Pour afficher les détails d’un package, cliquez sur son nom. Vous pouvez trier les packages par nom, organisation et évaluation. Vous pouvez également filtrer les résultats en écrivant une query dans la barre de recherche. Les résultats se refresh automatiquement.
      1. Sélectionnez Maven Central ou Spark Packages dans la liste déroulante en haut à gauche.
      2. Sélectionnez éventuellement la version du package dans la colonne Versions.
      3. Cliquez sur + Sélectionner à côté d'un package. Le champ Coordonnée est renseigné avec le package et la version sélectionnés.
  3. (Facultatif) Dans le champ Repository, vous pouvez saisir une URL de repository Maven.

remarque

Pour les repository Maven internes, vous devez désactiver le résolveur Maven Central default en définissant spark.databricks.driver.disableDefaultMavenCentralResolver ou spark.databricks.driver.disableSparkPackagesResolver sur true. Cette nouvelle configuration ne désactive pas spark.databricks.driver.preferredMavenCentralMirrorUrl.

  1. Dans le champ **Exclusions**, indiquez éventuellement le groupId et le artifactId des dépendances que vous souhaitez exclure (parlog4j:log4j exemple,).
remarque

Maven utilise la version la plus proche de la racine, et dans le cas de deux packages en concurrence pour des versions avec des dépendances différentes, l’ordre est important, de sorte qu’il peut échouer lorsque le package avec une dépendance plus ancienne est chargé en premier.

Pour contourner ce problème, utilisez le champ Exclusions pour exclure la bibliothèque en conflit.

  1. Cliquez sur Installer .

Package CRAN

  1. Dans la liste de boutons Source de la bibliothèque , sélectionnez CRAN .
  2. Dans le champ Package, saisissez le nom du package.
  3. (Facultatif) Dans le champ Repository, vous pouvez saisir l'URL du repository CRAN.
  4. Cliquez sur Installer .
remarque

Les miroirs CRAN servent la dernière version d'une bibliothèque. Par conséquent, vous pouvez vous retrouver avec différentes versions d'un package R si vous associez la bibliothèque à différents clusters à différents moments. Pour apprendre à gérer et à corriger les versions de package R sur Databricks, consultez la base de connaissances.