Recommandations réseau pour Lakehouse Federation
Cet article fournit des conseils pour la mise en place d'un chemin réseau viable entre vos clusters Databricks ou vos SQL Warehouses et le système de base de données externe auquel vous vous connectez à l'aide de Lakehouse Federation.
Veuillez prendre en compte les points suivants lors de la configuration de la connectivité réseau pour Lakehouse Federation :
- Tout le trafic réseau pour les queries fédérées est directement entre les clusters Databricks (ou SQL Warehouse) et le système de base de données externe. Ni Unity Catalog ni le plan de contrôle Databricks ne se trouvent sur le chemin du réseau.
- Les connexions qui utilisent OAuth ont une exigence supplémentaire. Lorsqu'une connexion s'authentifie avec OAuth, l'échange de jetons OAuth s'effectue à partir du plan de contrôle Databricks, et non du plan de compute. Le plan de contrôle doit pouvoir atteindre l'Endpoint OAuth du système externe. L'inscription sur liste blanche du plan de compute uniquement n'est pas suffisante pour ces connexions. Pour des conseils spécifiques aux connecteurs, consultez la section sur la mise en réseau ou les limitations de la page de connexion pertinente, telle que Exécuter des requêtes fédérées sur Snowflake (OAuth) ou Exécuter des requêtes fédérées sur Microsoft SQL Server. Les connexions HTTP constituent une exception ; elles acheminent l'OAuth via le plan de calcul serverless plutôt que le plan de contrôle.
- Le compute Databricks (c'est-à-dire, les clusters et les SQL Warehouse) se déploie toujours dans le cloud, mais le système de base de données externe peut être on-premise ou hébergé sur n'importe quel fournisseur de cloud, tant qu'il existe un chemin réseau viable entre votre compute Databricks et la base de données externe.
- Si vous avez des restrictions réseau entrantes ou sortantes sur le compute Databricks ou le système de base de données externe, reportez-vous aux sections suivantes pour obtenir des conseils généraux afin de vous aider à créer un chemin réseau viable.
Pour plus d'informations sur le réseautage dans les workspaces Databricks, consultez Réseautage.
Le système de base de données et le compute Databricks sont tous deux accessibles depuis Internet
La connexion devrait fonctionner sans configuration.
Le système de base de données a des restrictions d'accès au réseau
Si le système de base de données externe présente des restrictions d'accès réseau entrantes ou sortantes et que le cluster Databricks ou le SQL Warehouse est accessible depuis Internet, configurez l'une des solutions réseau suivantes pour vous connecter à partir de ressources de compute classiques :
-
Adresse IP de sortie stable sur le compute Databricks.
Depuis le plan de compute classique, configurez une adresse IP stable avec un équilibreur de charge, une passerelle NAT, une passerelle Internet ou un équivalent, et connectez-la au sous-réseau où le compute Databricks est déployé. Ceci permet à la ressource de compute de partager une adresse IP publique stable qui peut être mise en liste blanche côté base de données externe.
-
Private Service Connect (uniquement lorsque la base de données externe se trouve sur le même cloud que le compute Databricks)
À partir du plan de compute classique, configurez une connexion Private Service Connect entre le réseau où la base de données est déployée et le réseau où le compute Databricks est déployé.
Le compute Databricks a des restrictions d'accès au réseau
Si le système de base de données externe est accessible depuis Internet et que le compute Databricks a des restrictions d'accès réseau entrantes ou sortantes (ce qui n'est possible que si vous êtes sur un réseau géré par le client), alors effectuez l'une des configurations suivantes :
-
Autorisez le hostname de la base de données externe dans les règles de pare-feu du sous-réseau où le compute Databricks est déployé.
Si vous choisissez de mettre sur liste blanche l'adresse IP de la base de données externe plutôt que le Hostname, assurez-vous que la base de données externe dispose d'une adresse IP stable.
-
Private Service Connect (uniquement lorsque la base de données externe se trouve sur le même cloud que Databricks compute)
Configurez une connexion Private Service Connect entre le réseau où la base de données est déployée et le réseau où le compute Databricks est déployé.
Le compute Databricks dispose d'un serveur DNS personnalisé
Si le système de base de données externe est accessible depuis Internet et que le compute Databricks dispose d'un serveur DNS personnalisé (ce qui n'est possible que si vous êtes sur un réseau géré par le client), ajoutez le hostname du système de base de données à votre serveur DNS personnalisé afin qu'il puisse être résolu.
Considérations relatives à la mise en réseau Snowflake
-
Si le compute Databricks ne peut pas atteindre le répondeur OCSP Snowflake, les tentatives de connexion peuvent échouer pendant la validation du certificat. Préférez autoriser le trafic sortant vers le répondeur OCSP Snowflake. Si votre configuration de connectivité à sortie restreinte ou privée ne peut pas autoriser ce trafic, définissez l'option de connexion Snowflake
disableOCSPCheckssurtrue. Consultez les options de connexion avancées. -
Snowflake prend en charge la sortie Private Service Connect en tant que fonctionnalité d'aperçu. Snowflake ne prend pas en charge la fourniture d'adresses IP statiques, ce qui empêche la pratique de définition de listes d'autorisation.