Aller au contenu principal

Connecter à StreamSets

info

Aperçu

Cette fonctionnalité est en aperçu public.

StreamSets vous aide à gérer et à surveiller votre flux de données tout au long de son cycle de vie. L'intégration native de StreamSets avec Databricks et Delta Lake vous permet d'extraire des données de diverses sources et de gérer facilement vos pipelines.

Pour une démonstration générale de StreamSets, regardez la vidéo YouTube suivante (10 minutes).

Voici les étapes pour utiliser StreamSets avec Databricks.

Étape 1 : Générer un jeton d'accès personnel Databricks

StreamSets s'authentifie auprès de Databricks en utilisant un jeton d'accès personnel Databricks.

remarque

En tant que bonne pratique de sécurité lorsque vous vous authentifiez avec des outils, des systèmes, des scripts et des applications automatisés, Databricks vous recommande d'utiliser des jetons OAuth.

Si vous utilisez l'authentification par jeton d'accès personnel, Databricks recommande d'utiliser des jetons d'accès personnels appartenant aux Service Principal plutôt qu'aux utilisateurs du Workspace. Pour créer des jetons pour les Service Principals, consultez Gérer les jetons pour un Service Principal.

Étape 2 : Configurez un cluster pour prendre en charge les besoins d'intégration.

StreamSets écrira les données dans un compartiment S3 et le cluster d'intégration Databricks lira les données à partir de cet emplacement. Par conséquent, le cluster d'intégration nécessite un accès sécurisé au compartiment S3.

Sécuriser l'accès à un compartiment S3

Pour accéder aux ressources AWS, vous pouvez lancer le cluster d'intégration Databricks avec un profil d'instance. Le profil d'instance doit avoir accès au bucket S3 de staging et au bucket S3 cible où vous souhaitez écrire les tables Delta. Pour créer un profil d'instance et configurer le cluster d'intégration pour utiliser le rôle, suivez les instructions dans Didacticiel : Configurer l'accès S3 avec un profil d'instance.

Comme alternative, vous pouvez utiliser la fonctionnalité de transmission des identifiants IAM, qui permet un accès par utilisateur aux données S3 à partir d'un cluster partagé.

Spécifier la configuration du cluster

  1. Définissez le Mode du cluster sur Standard .

  2. Définissez la **version de Databricks Runtime** sur Runtime : 6.3 ou supérieure.

  3. Activez les écritures optimisées et le compactage automatique en ajoutant les propriétés suivantes à votre configuration Spark:

    ini
    spark.databricks.delta.optimizeWrite.enabled true
    spark.databricks.delta.autoCompact.enabled true
  4. Configurez votre cluster en fonction de vos besoins d'intégration et de mise à l'échelle.

Pour plus de détails sur la configuration des clusters, consultez la référence de la configuration compute.

Voir Obtenir les détails de connexion pour une ressource de compute Databricks pour les étapes d’obtention de l’URL JDBC et du chemin HTTP.

Étape 3 : Obtenez les détails de connexion JDBC et ODBC pour vous connecter à un cluster.

Pour connecter un cluster Databricks à StreamSets, vous avez besoin des propriétés de connexion JDBC/ODBC suivantes :

  • URL JDBC
  • Chemin HTTP

Étape 4 : Obtenir StreamSets pour Databricks

Inscrivez-vous à StreamSets pour Databricks, si vous n'avez pas déjà un compte StreamSets. Vous pouvez start gratuitement et passer à une version supérieure quand vous êtes prêt ; consultez Tarifs de la plateforme DataOps StreamSets.

Étape 5 : Découvrez comment utiliser StreamSets pour charger des données dans Delta Lake

start with a sample pipeline or see Chargement de données dans Databricks Delta Lake pour savoir comment créer un pipeline qui ingère des données dans Delta Lake.

Ressources supplémentaires

Aide