Connectez-vous à un serveur RStudio hébergé par Databricks
RStudio Server hébergé par Databricks est obsolète et n'est disponible que sur les versions 15,4 et antérieures de Databricks Runtime. Pour d'autres options, consultez Alternatives à RStudio Server hébergé.
Utilisez votre navigateur web pour vous connecter à votre Databricks Workspace, puis connectez-vous à un compute Databricks qui a RStudio Server installé, dans ce workspace.
Pour RStudio Server hébergé, vous pouvez utiliser l’édition Open Source (OS) ou l’édition RStudio Workbench (anciennement RStudio Server Pro) sur Databricks. Si vous souhaitez utiliser RStudio Workbench (RStudio Server Pro), vous devez transférer votre licence RStudio Workbench (RStudio Server Pro) existante à Databricks. Consultez RStudio Workbench (anciennement RStudio Server Pro).
Databricks vous recommande d'utiliser Databricks Runtime pour le Runtime for Machine Learning (Databricks Runtime ML) sur le compute Databricks avec RStudio Server afin de réduire les temps de start du compute. Databricks Runtime ML comprend une version non modifiée du package RStudio Server Open Source Edition. Le code source de ce package peut être trouvé sur GitHub. Le tableau suivant répertorie la version de RStudio Server Open Source Edition préinstallée sur les versions de Databricks Runtime ML.
Version de Databricks Runtime pour le ML | Version du serveur RStudio |
|---|---|
Databricks Runtime 9.1 LTS ML et 10.4 LTS ML | 1.4 |
RStudio Server Open Source (OS)
RStudio Server Open Source est préinstallé sur les clusters Databricks qui utilisent Databricks Runtime for Machine Learning (Databricks Runtime ML).
Exigences
-
Le cluster doit être un cluster multifonction.
-
Vous devez avoir CAN ATTACH TO permission pour ce cluster. L'administrateur du cluster peut vous accorder cette autorisation. Consultez les autorisations de compute.
-
Le cluster ne doit pas avoir le contrôle d'accès aux tables, l'arrêt automatique, oula transmission des identifiants activés.
-
Le cluster *ne doit pas* utiliser le mode d'accès **Standard**.
-
Le cluster ne doit pas avoir la configuration Spark
spark.databricks.pyspark.enableProcessIsolationdéfinie surtrue. -
Vous devez disposer d'une licence Pro flottante RStudio Server pour utiliser l'édition Pro.
Bien que le cluster puisse utiliser un mode d'accès qui prend en charge Unity Catalog, vous ne pouvez pas utiliser RStudio Server à partir de ce cluster pour accéder aux données dans Unity Catalog.
Ouvrir RStudio Server
Pour ouvrir RStudio Server OS sur un cluster Databricks, procédez comme suit :
-
Ouvrir la page de détails du cluster.
-
Start le cluster, puis cliquez sur l'onglet tab :

-
Sur le tab **Applications**, cliquez sur le bouton **Configurer RStudio**. Ceci génère un mot de passe à usage unique pour vous. Cliquez sur le **Link** show pour l'afficher et copier le mot de passe.
-
Cliquez sur le Open RStudio Link pour ouvrir l'interface utilisateur dans un nouveau tab. Saisissez votre nom d'utilisateur et votre mot de passe dans le formulaire de connexion et connectez-vous.
-
Depuis l’interface utilisateur RStudio, vous pouvez importer le package
SparkRet configurer une sessionSparkRpour lancer des jobs Spark sur votre cluster.Rlibrary(SparkR)
sparkR.session()
# Query the first two rows of a table named "diamonds" in a
# schema (database) named "default" and display the query result.
df <- SparkR::sql("SELECT * FROM default.diamonds LIMIT 2")
showDF(df)
-
Vous pouvez également attacher le package sparklyr et configurer une connexion Spark.
Rlibrary(sparklyr)
sc <- spark_connect(method = "databricks")
# Query a table named "diamonds" and display the first two rows.
df <- spark_read_table(sc = sc, name = "diamonds")
print(x = df, n = 2)
Intégration de RStudio Server
Lorsque vous utilisez RStudio Server sur Databricks, le démon RStudio Server s'exécute sur le nœud Driver d'un cluster Databricks. L'interface web de RStudio est acheminée via l'application web Databricks, ce qui signifie que vous n'avez pas besoin d'apporter de modifications à la configuration réseau de votre cluster. Ce diagramme démontre l'architecture du composant d'intégration de RStudio.

Databricks proxyfie le service web RStudio depuis le port 8787 sur le driver Spark du cluster. Ce proxy web est destiné à être utilisé uniquement avec RStudio. Si vous lancez d’autres services web sur le port 8787, vous pourriez exposer vos utilisateurs à des failles de sécurité potentielles. Databricks n’est pas responsable des problèmes résultant de l’installation d’un logiciel non pris en charge sur un cluster.
RStudio Workbench (anciennement RStudio Server Pro)
Cette section vous montre comment configurer et start à utiliser RStudio Workbench (anciennement RStudio Server Pro) sur un cluster Databricks. Selon votre licence, RStudio Workbench peut inclure RStudio Server Pro.
Configurer le serveur de licences RStudio
Pour utiliser RStudio Workbench sur Databricks, vous devez convertir votre licence Pro en licence flottante. Pour obtenir de l'aide, contactez help@rstudio.com. Lorsque votre licence est convertie, vous devez configurer un serveur de licences pour RStudio Workbench.
Pour configurer un serveur de licences :
- Lancez une petite instance sur le réseau de votre fournisseur cloud ; le démon du serveur de licences est léger.
- download et installez la version correspondante de RStudio License Server sur votre instance, puis start le service. Pour des instructions détaillées, consultez le Guide d'administration RStudio Workbench.
- Vérifiez que le port du serveur de licences est ouvert aux instances Databricks.
Installer RStudio Workbench
Pour configurer RStudio Workbench sur un cluster Databricks, vous devez créer un script d'initialisation pour installer le package binaire RStudio Workbench et le configurer afin qu'il utilise votre serveur de licences pour le bail de licence.
Si vous prévoyez d'installer RStudio Workbench sur une version de Databricks Runtime qui inclut déjà le package RStudio Server Open Source Edition, vous devez d'abord désinstaller ce package pour que l'installation réussisse.
Voici un exemple de fichier .sh que vous pouvez stocker comme script d'initialisation dans un emplacement tel que votre répertoire personnel en tant que fichier de Workspace, dans un volume Unity Catalog, ou dans un stockage d'objets. Pour plus d'information, consultez les scripts d'initialisation à l'échelle du cluster. Le script effectue également des configurations d'authentification supplémentaires qui simplifient l'intégration avec Databricks.
Les scripts d'initialisation en cluster sur DBFS sont en fin de vie. Le stockage des scripts d'initialisation dans DBFS existe dans certains Workspaces pour prendre en charge les Workload hérités et n'est pas recommandé. Tous les scripts d'initialisation stockés dans DBFS doivent être migrés. Pour les instructions de migration, consultez Migrer les scripts d'initialisation de DBFS.
#!/bin/bash
set -euxo pipefail
if [[ $DB_IS_DRIVER = "TRUE" ]]; then
sudo apt-get update
sudo dpkg --purge rstudio-server # in case open source version is installed.
sudo apt-get install -y gdebi-core alien
## Installing RStudio Workbench
cd /tmp
# You can find new releases at https://rstudio.com/products/rstudio/download-commercial/debian-ubuntu/.
wget https://download2.rstudio.org/server/bionic/amd64/rstudio-workbench-2022.02.1-461.pro1-amd64.deb -O rstudio-workbench.deb
sudo gdebi -n rstudio-workbench.deb
## Configuring authentication
sudo echo 'auth-proxy=1' >> /etc/rstudio/rserver.conf
sudo echo 'auth-proxy-user-header-rewrite=^(.*)$ $1' >> /etc/rstudio/rserver.conf
sudo echo 'auth-proxy-sign-in-url=<domain>/login.html' >> /etc/rstudio/rserver.conf
sudo echo 'admin-enabled=1' >> /etc/rstudio/rserver.conf
sudo echo 'export PATH=/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin' >> /etc/rstudio/rsession-profile
# Enabling floating license
sudo echo 'server-license-type=remote' >> /etc/rstudio/rserver.conf
# Session configurations
sudo echo 'session-rprofile-on-resume-default=1' >> /etc/rstudio/rsession.conf
sudo echo 'allow-terminal-websockets=0' >> /etc/rstudio/rsession.conf
sudo rstudio-server license-manager license-server <license-server-url>
sudo rstudio-server restart || true
fi
- Remplacez
<domain>par votre URL Databricks et<license-server-url>par l'URL de votre serveur de licences flottantes. - Stockez ce fichier
.shen tant que script d'initialisation à un emplacement tel que votre répertoire personnel en tant que fichier de workspace, dans un volume Unity Catalog ou dans le stockage d'objets. Pour plus d'informations, consultez Scripts d'initialisation à l'échelle du cluster. - Avant de lancer un cluster, ajoutez ce fichier
.shen tant que script d'initialisation depuis l'emplacement associé. Pour obtenir des instructions, consultez Scripts d'initialisation à l'échelle du cluster. - Lancez le cluster.
Ouvrir RStudio Workbench
-
Ouvrir la page de détails du cluster.
-
Start le cluster, et cliquez sur l'onglet tab :

-
Dans l'onglet Applications , cliquez sur le bouton Configurer RStudio .
-
Vous n’avez pas besoin du mot de passe à usage unique. Cliquez sur le link Ouvrir l'interface utilisateur RStudio pour ouvrir une session RStudio Pro authentifiée.
-
Depuis l'interface utilisateur de RStudio, vous pouvez attacher le package
SparkRet configurer une sessionSparkRpour lancer des Jobs Spark sur votre cluster.Rlibrary(SparkR)
sparkR.session()
# Query the first two rows of a table named "diamonds" in a
# schema (database) named "default" and display the query result.
df <- SparkR::sql("SELECT * FROM default.diamonds LIMIT 2")
showDF(df)
-
Vous pouvez également attacher le package sparklyr et configurer une connexion Spark.
Rlibrary(sparklyr)
sc <- spark_connect(method = "databricks")
# Query a table named "diamonds" and display the first two rows.
df <- spark_read_table(sc = sc, name = "diamonds")
print(x = df, n = 2)
FAQ RStudio Server
Quelle est la différence entre RStudio Server Édition open source et RStudio Workbench ?
RStudio Workbench prend en charge une large gamme de fonctionnalités d'entreprise qui ne sont pas disponibles dans l'Edition open source. Vous pouvez voir la comparaison des fonctionnalités sur le site web de RStudio.
De plus, RStudio Server Open Source Edition est distribué sous la licence publique générale GNU Affero (AGPL), tandis que la version Pro est fournie avec une licence commerciale pour les organisations qui ne peuvent pas utiliser le logiciel AGPL.
Enfin, RStudio Workbench est livré avec un support professionnel et d'entreprise de RStudio, PBC, tandis que RStudio Server Open Source Edition n'est pas accompagné de support.
Puis-je utiliser ma licence RStudio Workbench (RStudio Server Pro) sur Databricks ?
Oui, si vous possédez déjà une licence Pro ou Enterprise pour RStudio Server, vous pouvez utiliser cette licence sur Databricks. Consultez RStudio Workbench (anciennement RStudio Server Pro) pour apprendre à configurer RStudio Workbench sur Databricks.
Où s'exécute RStudio Server ? Dois-je gérer des services/serveurs supplémentaires ?
Comme vous pouvez le voir sur le diagramme de l'intégration de RStudio Server, le démon RStudio Server s'exécute sur le nœud Driver (maître) de votre cluster Databricks. Avec RStudio Server édition open source, vous n'avez pas besoin d'exécuter de serveurs ou de services supplémentaires. Cependant, pour RStudio Workbench, vous devez gérer une instance distincte qui exécute RStudio License Server.
Puis-je utiliser RStudio Server sur un cluster standard ?
Cette page décrit l'ancienne interface utilisateur des clusters. Pour plus d'informations sur la nouvelle interface utilisateur des clusters, y compris les modifications terminologiques concernant les modes d'accès aux clusters, consultez Référence de configuration du compute. Pour une comparaison des nouveaux types de clusters et des types de clusters hérités, consultez Modifications de l'interface utilisateur des clusters et modes d'accès aux clusters.
Oui, vous le pouvez.
Pouvez-vous utiliser RStudio Server sur un cluster avec arrêt automatique ?
Non, vous ne pouvez pas utiliser RStudio lorsque l'arrêt automatique est activé. L'arrêt automatique peut purger les scripts utilisateur et les données non enregistrés dans une session RStudio. Pour protéger les utilisateurs contre ce scénario de perte de données involontaire, RStudio est désactivé par default sur ces clusters.
Pour les clients qui ont besoin de nettoyer les ressources de cluster lorsqu'elles ne sont pas utilisées, Databricks recommande d'utiliser les APIs de cluster pour nettoyer les clusters RStudio selon un calendrier.
Comment dois-je persister mon travail sur RStudio ?
Databricks vous recommande de persister votre travail en utilisant un système de contrôle de version depuis RStudio. RStudio prend en charge différents systèmes de contrôle de version et vous permet d'archiver et de gérer vos projets. Si vous ne persistez pas votre code en utilisant l'une des options suivantes, vous risquez de perdre votre travail si un administrateur du Workspace redémarre ou arrête le cluster.
Une option consiste à enregistrer vos fichiers (code ou données) dans le workspace ou un volume. Par exemple, si vous enregistrez un fichier sous /Workspace/, les fichiers ne seront pas supprimés lorsque votre cluster est terminé ou redémarré.
Une autre option consiste à enregistrer le notebook R dans votre système de fichiers local en l'exportant sous le nom Rmarkdown, puis en important ultérieurement le fichier dans l'instance RStudio. Le blog Partager des notebooks R avec RMarkdown décrit les étapes plus en détail.
Une autre option consiste à monter un volume Amazon Elastic File System (Amazon EFS) sur votre cluster, de sorte que lorsque le cluster est arrêté, vous ne perdiez pas votre travail. Lorsque le cluster redémarre, Databricks remonte le volume Amazon EFS, et vous pouvez reprendre là où vous vous êtes arrêté. Pour monter un volume Amazon EFS existant sur un cluster, appelez l'opération de création de cluster (POST /api/2.0/clusters/create) ou l'opération de modification de cluster (POST /api/2.0/clusters/edit) dans l'API Clusters 2.0, en spécifiant les informations de montage du volume Amazon EFS dans le tableau cluster_mount_infos de l'opération.
Assurez-vous que le cluster que vous créez ou utilisez n'a pas Unity Catalog, d'arrêt automatique ou de mise à l'échelle automatique activés. Assurez-vous également que le cluster dispose des droits d'écriture sur le volume monté, par exemple en exécutant la commande chmod a+w </path/to/volume> sur le cluster. Vous pouvez exécuter cette commande sur un cluster existant via le terminal web du cluster, ou sur un nouveau cluster en utilisant un script d'initialisation que vous spécifiez dans le tableau init_scripts de l'opération précédente.
Si vous n'avez pas de volume Amazon EFS existant, vous pouvez en créer un. Tout d'abord, contactez votre administrateur Databricks et obtenez l'ID de Virtual Private Cloud (VPC), l'ID de sous-réseau public et l'ID de groupe de sécurité pour votre Workspace Databricks. Ensuite, utilisez ces informations, ainsi que la console de gestion AWS, pour créer un système de fichiers avec des paramètres personnalisés à l'aide de la console Amazon EFS. Dans la dernière étape de cette procédure, cliquez sur Attacher et copiez le nom DNS et les options de montage, que vous spécifiez dans le tableau cluster_mount_infos précédent.
Comment start une session SparkR ?
SparkR dans Databricks est obsolète dans Databricks Runtime 16.0 et versions supérieures.
SparkR est inclus dans Databricks Runtime, mais vous devez le charger dans RStudio. Exécutez le code suivant dans RStudio pour initialiser une session SparkR.
library(SparkR)
sparkR.session()
S'il y a une erreur lors de l'importation du package SparkR, exécutez .libPaths() et vérifiez que /home/ubuntu/databricks/spark/R/lib est inclus dans le résultat.
S'il n'est pas inclus, vérifiez le contenu de /usr/lib/R/etc/Rprofile.site. Listez /home/ubuntu/databricks/spark/R/lib/SparkR sur le driver pour vérifier que le package SparkR est installé.
Comment start une session sparklyr ?
Le package sparklyr doit être installé sur le cluster. Utilisez l'une des méthodes suivantes pour installer le package sparklyr :
- En tant que bibliothèque Databricks
install.packages()Commande- Interface utilisateur de gestion des packages RStudio
library(sparklyr)
sc <- spark_connect(method = “databricks”)
Comment RStudio s'intègre-t-il aux Notebooks R Databricks ?
Vous pouvez déplacer votre travail entre les notebooks et RStudio grâce au contrôle de versions.
Quel est le répertoire de travail ?
Lorsque vous start un projet dans RStudio, vous choisissez un répertoire de travail. Par default, il s'agit du répertoire personnel sur le conteneur Driver (maître) où RStudio Server est en cours d'exécution. Vous pouvez modifier ce répertoire si vous le souhaitez.
Puis-je lancer des applications Shiny depuis RStudio exécuté sur Databricks ?
Oui, vous pouvez développer et afficher des applications Shiny dans RStudio Server sur Databricks.
Je ne peux pas utiliser le terminal ou Git dans RStudio sur Databricks. Comment puis-je résoudre ce problème ?
Assurez-vous que vous avez désactivé les websockets. Dans RStudio Server Open Source Edition, vous pouvez effectuer cette opération depuis l’interface utilisateur.

Dans RStudio Server Pro, vous pouvez ajouter allow-terminal-websockets=0 à /etc/rstudio/rsession.conf pour désactiver les websockets pour tous les utilisateurs.
Je ne vois pas l'onglet Apps tab sous les détails des clusters.
Cette fonctionnalité n'est pas disponible pour tous les clients. Vous devez disposer du plan Premium ou supérieur.
Alternatives au RStudio Server hébergé
Databricks continuera à prendre en charge RStudio Server hébergé sur les Databricks runtimes 15.4 et versions antérieures jusqu’à leur fin de support. Par exemple, Databricks Runtime 15.4 LTS continuera à prendre en charge RStudio Server hébergé jusqu’au 19 août 2027.
Si vous avez besoin de plus de temps pour migrer, vous pouvez continuer à utiliser le RStudio Server hébergé jusqu'à la date de fin de support de votre runtime. La mise à niveau vers un runtime LTS plus récent, tel que 15,4, prolongera votre période de support.
Alternative 1 : Posit Workbench
En partenariat avec Databricks, Posit PBC fournit une intégration native de Posit Workbench pour Databricks.
L'intégration vous permet de vous connecter au compute Databricks depuis RStudio Pro, et comprend des fonctionnalités telles que la prise en charge de Unity Catalog et des identifiants Databricks OAuth gérés.
Alternative 2 : RStudio Desktop
Connectez RStudio Desktop à une ressource de compute Databricks ou à un SQL Warehouse à partir de votre machine de développement locale.
Vous pouvez utiliser Databricks Connect via sparklyr, ou le Driver ODBC Databricks via le package R odbc. Cette méthode prend également en charge Unity Catalog.
Alternative 3 : Notebooks Databricks
Utilisez R sur les Notebooks Databricks pour une expérience de développement interactive intégrée au reste de la plateforme Databricks.