Aller au contenu principal

Migrer vers Databricks Connect pour Python

Cet article décrit comment migrer de Databricks Connect pour Databricks Runtime 12,2 LTS et versions antérieures vers Databricks Connect pour Databricks Runtime 13,3 LTS et versions ultérieures pour Python. Databricks Connect vous permet de connecter des IDEs, des serveurs Notebook et des applications personnalisées aux clusters Databricks. See Databricks Connect.

Avant de commencer à utiliser Databricks Connect, vous devez configurer le client Databricks Connect.

Pour la version Scala de cet article, consultez Migrer vers Databricks Connect pour Scala.

Migrer votre projet Python

Pour migrer votre projet de code Python existant ou votre environnement de codage de Databricks Connect pour Databricks Runtime 12.2 LTS et versions antérieures vers Databricks Connect pour Databricks Runtime 13.3 LTS et versions ultérieures :

  1. Installez la bonne version de Python, telle qu'indiquée dans les exigences d'installation, pour correspondre à votre cluster Databricks, si elle n'est pas déjà installée localement.

  2. Mettez à niveau votre environnement virtuel Python pour utiliser la version correcte de Python correspondant à votre cluster, si nécessaire. Pour obtenir des instructions, consultez la documentation de votre fournisseur d’environnement virtuel.

  3. Une fois votre environnement virtuel activé, désinstallez PySpark de votre environnement virtuel :

    Bash
    pip3 uninstall pyspark
  4. Votre environnement virtuel étant toujours activé, désinstallez Databricks Connect pour Databricks Runtime 12.2 LTS et versions antérieures :

    Bash
    pip3 uninstall databricks-connect
  5. Avec votre environnement virtuel toujours activé, installez Databricks Connect pour Databricks Runtime 13.3 LTS et versions ultérieures :

    Bash
    pip3 install --upgrade "databricks-connect==14.0.*"  # Or X.Y.* to match your cluster version.
remarque

Databricks vous recommande d'ajouter la notation « point-astérisque » pour spécifier databricks-connect==X.Y.* au lieu de databricks-connect=X.Y, pour s'assurer que le package le plus récent est installé. Bien que ce ne soit pas une exigence, cela permet de s'assurer que vous pouvez utiliser les dernières fonctionnalités prises en charge pour ce cluster.

  1. Mettez à jour votre code Python pour initialiser la variable spark (qui représente une instanciation de la classe DatabricksSession, similaire à SparkSession dans PySpark). Voir Configuration de Compute pour Databricks Connect.

  2. Migrez vos APIs RDD afin d'utiliser les APIs DataFrame, et migrez vos SparkContext afin d'utiliser des alternatives.

Définir les configurations Hadoop

Côté client, vous pouvez définir les configurations Hadoop à l'aide de l'API spark.conf.set, ce qui s'applique aux Opérations SQL et DataFrame. Les configurations Hadoop définies sur le sparkContext doivent être configurées dans la configuration du cluster ou à l'aide d'un Notebook. C'est parce que les configurations définies sur sparkContext ne sont pas liées aux sessions utilisateur, mais s'appliquent à l'ensemble du cluster.