Aller au contenu principal

Connecteur d'ingestion Microsoft SQL Server

Cette page vous aide à comprendre le flux de travail d'ingestion SQL Server, y compris les facteurs qui déterminent votre approche de configuration et les étapes impliquées pour les différentes personas utilisateur.

CDC standard vs. CDC intégrée

SQL Server prend en charge deux architectures d'ingestion. Le tableau suivant les compare :

Fonctionnalité

CDC standard (basée sur une passerelle)

CDC intégré (Beta)

Nombre de pipelines

Deux (passerelle d'ingestion et pipeline d'ingestion)

Un (pipeline unifié)

Installer

Créez une passerelle, puis créez un pipeline d'ingestion qui référence l'ID de la passerelle

Créez un pipeline unique qui référence une connexion Unity Catalog

Mode passerelle

La passerelle s'exécute en continu

Le pipeline intègre l'extraction dans chaque mise à jour.

Référence de connexion

ingestion_gateway_id

connection_name (une connexion Unity Catalog)

Type de connecteur

Implicite

Explicite : connector_type: CDC

Volume intermédiaire

La passerelle gère le volume intermédiaire en interne.

Vous configurez le volume de staging via data_staging_options. Le pipeline en crée un automatiquement s'il n'est pas spécifié.

Fonctionnalité

CDC standard (basée sur une passerelle)

CDC intégré (Beta)

Nombre de pipelines

Deux (passerelle d'ingestion et pipeline d'ingestion)

Un (pipeline unifié)

Installer

Créez une passerelle, puis créez un pipeline d'ingestion qui référence l'ID de la passerelle

Créez un pipeline unique qui référence une connexion Unity Catalog

Mode passerelle

La passerelle s'exécute en continu

Le pipeline intègre l'extraction dans chaque mise à jour.

Référence de connexion

ingestion_gateway_id

connection_name (une connexion Unity Catalog)

Type de connecteur

Implicite

Explicite : connector_type: CDC

Volume intermédiaire

La passerelle gère le volume intermédiaire en interne.

Vous configurez le volume de staging via data_staging_options. Le pipeline en crée un automatiquement s'il n'est pas spécifié.

La même configuration de base de données source s'applique aux deux architectures. Voir Configurer Microsoft SQL Server pour l'ingestion dans Databricks. Pour plus d'informations, consultez Créer un pipeline CDC intégré pour SQL Server.

Disponibilité des fonctionnalités

Fonctionnalité

Disponibilité

Conception de pipelines via l'interface utilisateur

Icône de coche verte Pris en charge

Création de pipeline par API

Icône de coche verte Pris en charge

Declarative Automation Bundles

Icône de coche verte Pris en charge

Ingestion incrémentielle

Icône de coche verte Pris en charge

Gouvernance Unity Catalog

Icône de coche verte Pris en charge

Orchestration avec Lakeflow Jobs

Icône de coche verte Pris en charge

SCD de type 2

Icône de coche verte Pris en charge

Sélection et désélection de colonnes via API

Icône de coche verte Pris en charge

Filtrage des lignes basé sur l'API

Icône X rouge Non pris en charge

Évolution automatique des schémas : Nouvelles colonnes et colonnes supprimées

Icône de coche verte Pris en charge

Évolution automatisée des schémas : changements de type de données

Icône X rouge Non pris en charge

évolution des schémas automatisée : Renommage de colonnes

Icône X rouge Non pris en charge

Nécessite un full refresh.

Évolution des schémas automatisée : nouvelles tables

Icône de coche verte Pris en charge

Si vous ingérez l’intégralité du schéma. Consulter les limites sur le nombre de tables par pipeline.

Nombre maximal de tables par pipeline

250

Fonctionnalité

Disponibilité

Conception de pipelines via l'interface utilisateur

Icône de coche verte Pris en charge

Création de pipeline par API

Icône de coche verte Pris en charge

Declarative Automation Bundles

Icône de coche verte Pris en charge

Ingestion incrémentielle

Icône de coche verte Pris en charge

Gouvernance Unity Catalog

Icône de coche verte Pris en charge

Orchestration avec Lakeflow Jobs

Icône de coche verte Pris en charge

SCD de type 2

Icône de coche verte Pris en charge

Sélection et désélection de colonnes via API

Icône de coche verte Pris en charge

Filtrage des lignes basé sur l'API

Icône X rouge Non pris en charge

Évolution automatique des schémas : Nouvelles colonnes et colonnes supprimées

Icône de coche verte Pris en charge

Évolution automatisée des schémas : changements de type de données

Icône X rouge Non pris en charge

évolution des schémas automatisée : Renommage de colonnes

Icône X rouge Non pris en charge

Nécessite un full refresh.

Évolution des schémas automatisée : nouvelles tables

Icône de coche verte Pris en charge

Si vous ingérez l’intégralité du schéma. Consulter les limites sur le nombre de tables par pipeline.

Nombre maximal de tables par pipeline

250

Méthodes d'authentification

Méthode d'authentification

Disponibilité

OAuth U2M

Icône de coche verte Pris en charge

OAuth M2M

Icône de coche verte Pris en charge

OAuth (jeton de refresh manuel)

Icône X rouge Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

Icône de coche verte Pris en charge

Authentification de base (clé API)

Icône X rouge Non pris en charge

Authentification de base (clé JSON du compte de service)

Icône X rouge Non pris en charge

Méthode d'authentification

Disponibilité

OAuth U2M

Icône de coche verte Pris en charge

OAuth M2M

Icône de coche verte Pris en charge

OAuth (jeton de refresh manuel)

Icône X rouge Non pris en charge

Authentification de base (nom d’utilisateur/mot de passe)

Icône de coche verte Pris en charge

Authentification de base (clé API)

Icône X rouge Non pris en charge

Authentification de base (clé JSON du compte de service)

Icône X rouge Non pris en charge

Ce qu'il faut savoir avant de start

Sujet

Pourquoi c'est important

Profil d'utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Utilisateur unique : un utilisateur administrateur configure la base de données source et crée une connexion Unity Catalog, une passerelle d'ingestion et un pipeline d'ingestion.
  • Multi-utilisateur : Un utilisateur admin configure la base de données source et crée une connexion pour les utilisateurs non-admin afin qu’ils puissent créer des paires de passerelles-pipelines.

Variante de base de données

La configuration de la base de données source dépend de l'environnement de déploiement de SQL Server.

Modifier la méthode de suivi

La configuration de la base de données source dépend de la manière dont vous choisissez de suivre les modifications dans la source.

Méthode d'authentification

Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez.

Interface

Les étapes pour créer une connexion, une passerelle et un pipeline dépendent de l'interface.

Fréquence d'ingestion

La planification du pipeline dépend de vos exigences en matière de latence et de coût.

Modèles courants

Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations comme le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités.

Sujet

Pourquoi c'est important

Profil d'utilisateur Databricks

Le workflow dépend de votre persona utilisateur Databricks :

  • Utilisateur unique : un utilisateur administrateur configure la base de données source et crée une connexion Unity Catalog, une passerelle d'ingestion et un pipeline d'ingestion.
  • Multi-utilisateur : Un utilisateur admin configure la base de données source et crée une connexion pour les utilisateurs non-admin afin qu’ils puissent créer des paires de passerelles-pipelines.

Variante de base de données

La configuration de la base de données source dépend de l'environnement de déploiement de SQL Server.

Modifier la méthode de suivi

La configuration de la base de données source dépend de la manière dont vous choisissez de suivre les modifications dans la source.

Méthode d'authentification

Les étapes de création d’une connexion dépendent de la méthode d’authentification que vous choisissez.

Interface

Les étapes pour créer une connexion, une passerelle et un pipeline dépendent de l'interface.

Fréquence d'ingestion

La planification du pipeline dépend de vos exigences en matière de latence et de coût.

Modèles courants

Selon vos besoins d'ingestion, le pipeline peut utiliser des configurations comme le suivi de l'historique, la sélection de colonnes et le filtrage de lignes. Les configurations prises en charge varient selon le connecteur. Voir Disponibilité des fonctionnalités.

Start l’ingestion à partir de SQL Server

Le tableau suivant présente une vue d'ensemble du workflow d'ingestion de bout en bout de SQL Server, basé sur le type d'utilisateur :

Utilisateur

Étapes

Admin

  1. Configurer Microsoft SQL Server pour l'ingestion dans Databricks.
  2. Soit :

Non-administrateur

Utilisez toute interface prise en charge pour créer une passerelle et un pipeline. Consultez Ingérer des données depuis SQL Server.

Utilisateur

Étapes

Admin

  1. Configurer Microsoft SQL Server pour l'ingestion dans Databricks.
  2. Soit :

Non-administrateur

Utilisez toute interface prise en charge pour créer une passerelle et un pipeline. Consultez Ingérer des données depuis SQL Server.