Migrer vers Databricks Connect pour Python
Cet article décrit comment migrer de Databricks Connect pour Databricks Runtime 12,2 LTS et versions antérieures vers Databricks Connect pour Databricks Runtime 13,3 LTS et versions ultérieures pour Python. Databricks Connect vous permet de connecter des IDEs, des serveurs Notebook et des applications personnalisées aux clusters Databricks. See Databricks Connect.
Avant de commencer à utiliser Databricks Connect, vous devez configurer le client Databricks Connect.
Pour la version Scala de cet article, consultez Migrer vers Databricks Connect pour Scala.
Migrer votre projet Python
Pour migrer votre projet de code Python existant ou votre environnement de codage de Databricks Connect pour Databricks Runtime 12.2 LTS et versions antérieures vers Databricks Connect pour Databricks Runtime 13.3 LTS et versions ultérieures :
-
Installez la bonne version de Python, telle qu'indiquée dans les exigences d'installation, pour correspondre à votre cluster Databricks, si elle n'est pas déjà installée localement.
-
Mettez à niveau votre environnement virtuel Python pour utiliser la version correcte de Python correspondant à votre cluster, si nécessaire. Pour obtenir des instructions, consultez la documentation de votre fournisseur d’environnement virtuel.
-
Une fois votre environnement virtuel activé, désinstallez PySpark de votre environnement virtuel :
Bashpip3 uninstall pyspark -
Votre environnement virtuel étant toujours activé, désinstallez Databricks Connect pour Databricks Runtime 12.2 LTS et versions antérieures :
Bashpip3 uninstall databricks-connect -
Avec votre environnement virtuel toujours activé, installez Databricks Connect pour Databricks Runtime 13.3 LTS et versions ultérieures :
Bashpip3 install --upgrade "databricks-connect==14.0.*" # Or X.Y.* to match your cluster version.
Databricks vous recommande d'ajouter la notation « point-astérisque » pour spécifier databricks-connect==X.Y.* au lieu de databricks-connect=X.Y, pour s'assurer que le package le plus récent est installé. Bien que ce ne soit pas une exigence, cela permet de s'assurer que vous pouvez utiliser les dernières fonctionnalités prises en charge pour ce cluster.
-
Mettez à jour votre code Python pour initialiser la variable
spark(qui représente une instanciation de la classeDatabricksSession, similaire àSparkSessiondans PySpark). Voir Configuration de Compute pour Databricks Connect. -
Migrez vos APIs RDD afin d'utiliser les APIs DataFrame, et migrez vos
SparkContextafin d'utiliser des alternatives.
Définir les configurations Hadoop
Côté client, vous pouvez définir les configurations Hadoop à l'aide de l'API spark.conf.set, ce qui s'applique aux Opérations SQL et DataFrame. Les configurations Hadoop définies sur le sparkContext doivent être configurées dans la configuration du cluster ou à l'aide d'un Notebook. C'est parce que les configurations définies sur sparkContext ne sont pas liées aux sessions utilisateur, mais s'appliquent à l'ensemble du cluster.