Aller au contenu principal

Concepts du connecteur Reddit Ads

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

Le connecteur Reddit Ads vous permet d'ingérer des données publicitaires de Reddit Ads à l'aide de Databricks Lakeflow Connect.

Comment fonctionne l'ingestion de Reddit Ads ?

Le connecteur récupère les données de l'API Reddit Ads et les écrit dans des tables de streaming. Chaque objet Reddit Ads correspond à une table dans votre schéma de destination. Le connecteur prend en charge deux types de tables :

  • Tables d'entités : données de configuration de votre compte Reddit Ads, telles que les campagnes, les groupes d'annonces et les annonces. Les tables d'entité sont entièrement actualisées à chaque exécution de pipeline et ne prennent pas en charge le suivi de l'historique (SCD de type 2).
  • Tables des rapports : Indicateurs de performance, tels que les vues, les clics et les dépenses. Les tables de rapport prennent en charge l'ingestion incrémentielle avec une fenêtre rétrospective configurable pour capturer les données tardives et les mises à jour d'attribution.

Modèle de données du connecteur

Le connecteur Reddit Ads peut ingérer les objets suivants depuis votre compte Reddit Ads :

  • ad_account: Les comptes publicitaires accessibles à l'utilisateur authentifié
  • campaign, ad_group, ad: objets d’entité qui décrivent la structure de votre compte
  • Tables de rapports (par exemple, campaign_report, ad_group_report, ad_report) : Mesures de performance prédéfinies à chaque niveau de la hiérarchie du compte
  • custom_report: Un rapport défini par l'utilisateur avec une répartition et une combinaison de champs configurables

Pour la liste complète des tables prises en charge et de leurs schémas, consultez la référence du connecteur Reddit Ads.

Schémas source

Reddit Ads organise les tables en schémas (espaces de noms) sources qui correspondent à la hiérarchie du compte :

  • La table d'entité ad_account se trouve dans le schéma spécial default. Il répertorie tous les comptes publicitaires accessibles à l'utilisateur authentifié.
  • Toutes les autres tables – campaign, ad_group, ad et toutes les tables de rapport – se trouvent sous un schéma nommé par l'ID du compte publicitaire (par exemple, t2_abc123). Le nom de ce schéma est la valeur que vous avez définie comme source_schema dans votre spécification de pipeline.

Un pipeline peut ingérer depuis plusieurs schémas de compte publicitaire, et chaque entrée source_schema correspond à un compte publicitaire.

Tables de rapport

Les tables de rapport fournissent des métriques de performance pour vos campagnes publicitaires. Le connecteur fournit des données de rapport provenant des 24 derniers mois environ. Quel que soit le sync_start_date parameter, les tables de rapport ne peuvent pas récupérer de données antérieures à cette fenêtre — les requêtes pour des données plus anciennes sont rejetées par Reddit. Cette limite s'applique uniquement aux tables de rapport, et non aux tables d'entité.

Rapports personnalisés

L'objet custom_report vous permet de définir votre propre rapport avec une répartition et une combinaison de champs configurables. Vous contrôlez la configuration à l'aide de custom_report_options, et chaque rapport personnalisé ingère dans un destination_table séparé. La liste breakdowns doit inclure au moins une dimension temporelle (DATE ou HOUR), qui devient le curseur incrémental de la table.

Pour les répartitions et les champs pris en charge, consultez Répartitions et champs de rapport personnalisés.

Notions de base du connecteur

  • Lors de la première exécution du pipeline, le connecteur ingère les données historiques des objets sélectionnés.
  • Lors des exécutions de pipeline ultérieures, le connecteur ingère les enregistrements nouvellement créés ou modifiés dans les tables de rapport à l'aide de l'ingestion incrémentielle, et refresh complètement les tables d'entités.
  • Le connecteur transforme automatiquement les types de données Reddit Ads en types de données compatibles avec Delta.
  • Chaque table de destination est une table de streaming, qui est une table Delta avec un support supplémentaire pour le traitement incrémentiel des données.

Ingestion incrémentielle

By default, le connecteur ingère deux ans de données historiques pour les tables de rapport lors de la première exécution. Vous pouvez configurer ceci en utilisant le paramètre sync_start_date, qui accepte une date au format YYYY-MM-DD. Le parameter s'applique uniquement à la première exécution. Après le premier point de contrôle, toute modification est sans effet sans un refresh complet.

Lors des exécutions ultérieures, le connecteur utilise l'ingestion incrémentielle pour les tables de rapport. Étant donné que les métriques Reddit Ads peuvent changer après leur première publication — par exemple, lorsque les conversions ou l'attribution sont recalculées —, le connecteur relit les données des jours les plus récents à chaque synchronisation. Les tables d'entités sont entièrement actualisées à chaque exécution.

Attribution et fenêtres de rétrospection

Pour capturer les conversions arrivées tardivement et les mises à jour d'attribution, le connecteur relit un nombre configurable de jours récents à chaque synchronisation. By default, il relit les 30 derniers jours. Vous pouvez modifier cela avec le paramètre lookback_window_days (toute valeur comprise entre 1 et 30).

Définissez lookback_window_days pour qu'il corresponde à la fenêtre d'attribution de conversion de votre organisation. Par exemple, si votre organisation utilise une fenêtre d'attribution de 14 jours, définissez lookback_window_days: 14.

Fuseau horaire

Les limites de date du rapport sont interprétées dans le fuseau horaire propre au compte publicitaire. Le connecteur lit cela automatiquement depuis le compte. Vous ne définissez pas de fuseau horaire dans la spécification du pipeline.

Devise

Les colonnes monétaires — par exemple, spend, cpc, bid_value — sont stockées dans la devise du compte publicitaire sous forme de montants décimaux (par exemple, 12.34), et non en micros. Le code de devise du compte est disponible dans la colonne ad_account.currency et dans la colonne currency du rapport.

Authentification

Le connecteur utilise l'authentification OAuth 2.0 utilisateur-machine (U2M) avec PKCE pour s'authentifier auprès de Reddit Ads. Vous créez une application de développement dans Reddit Ads Business Manager et configurez les paramètres OAuth pour permettre à Databricks d'accéder à vos données publicitaires. La portée adsread est définie automatiquement par Databricks. Les informations d'identification de connexion sont stockées en toute sécurité dans Unity Catalog.

Ressources supplémentaires