Aller au contenu principal

Configurez Microsoft SQL Server pour l'ingestion dans Databricks

Prévisualisez l’ingestion des tâches de configuration source de SQL Server vers Databricks à l’aide de Lakeflow Connect.

Suivi des modifications ou Change Data Capture

Le change tracking et le Change Data Capture (CDC) permettent à Databricks de suivre les modifications dans les tables source. Databricks recommande d'utiliser le suivi des modifications pour toute table dotée d'une clé primaire afin de minimiser la charge sur la base de données source. Si le change tracking et le CDC sont tous deux activés, le connecteur SQL Server utilise le change tracking.

Méthode

Description

Suivi des modifications

Capture le fait que des lignes dans une table ont changé, mais ne capture pas les opérations réelles. Le suivi des modifications exige qu'une table ait une clé primaire, mais c'est un processus léger qui n'a pas un impact important sur la base de données source.

Capture de données modifiées

Capture chaque Opérations sur une table et contient une vue historique des changements effectués au fil du temps. Le CDC n'exige pas qu'une table ait une clé primaire, mais cela peut avoir un impact plus important sur les performances de la base de données source.

Méthode

Description

Suivi des modifications

Capture le fait que des lignes dans une table ont changé, mais ne capture pas les opérations réelles. Le suivi des modifications exige qu'une table ait une clé primaire, mais c'est un processus léger qui n'a pas un impact important sur la base de données source.

Capture de données modifiées

Capture chaque Opérations sur une table et contient une vue historique des changements effectués au fil du temps. Le CDC n'exige pas qu'une table ait une clé primaire, mais cela peut avoir un impact plus important sur les performances de la base de données source.

Pour plus d'informations sur ces options, consultez Suivre les modifications des données (SQL Server) dans la documentation SQL Server.

Vue d'ensemble de la configuration source

Vous devez effectuer les tâches suivantes dans SQL Server avant d'ingérer des données dans Databricks :

  1. Confirmez que vous respectez les exigences de version de SQL Server :

    • Pour utiliser le suivi des modifications, vous devez disposer de SQL Server 2012 ou version ultérieure.
    • Pour utiliser la CDC, vous devez disposer de SQL Server 2012 Service Pack 1 (SP1) Cumulative Update Package 3 (CU3) ou version ultérieure. Pour les versions antérieures à SQL Server 2016, Enterprise Edition est également requise.
  2. Configurez les paramètres du pare-feu, si nécessaire.

  3. Créez un utilisateur de base de données dans SQL Server dédié à l'ingestion Databricks et qui répond aux exigences de privilège.

  4. Configurez la base de données source, y compris la gestion des autorisations, l'activation du suivi des modifications et l'activation du CDC. Voir Préparer SQL Server pour l'ingestion à l'aide du script d'objets d'infrastructures publiques.