Aller au contenu principal

Limitations du connecteur de données brutes Google Analytics

Cette page liste les limitations et les considérations pour l'ingestion de données brutes au niveau des événements de Google Analytics à l'aide de Databricks Lakeflow Connect et Google BigQuery.

Limitations générales des connecteurs SaaS

Les limitations de cette section s'appliquent à tous les connecteurs SaaS de Lakeflow Connect.

  • Lorsque vous exécutez un pipeline planifié, les alertes ne se Trigger pas immédiatement. Au lieu de cela, ils Trigger lors de l’exécution de la prochaine mise à jour.
  • Lorsqu’une table source est supprimée, la table de destination n’est pas automatiquement supprimée. Vous devez supprimer la table de destination manuellement. Ce comportement n'est pas cohérent avec le comportement de Spark Declarative Pipelines sur Lakeflow.
  • Pendant les périodes de maintenance de la source, Databricks pourrait ne pas être en mesure d'accéder à vos données.
  • Si un nom de table source entre en conflit avec un nom de table de destination existant, la mise à jour du pipeline échoue.
  • La prise en charge des pipelines multi-destination est uniquement via l'API.
  • Vous pouvez éventuellement renommer une table que vous ingérez. Si vous renommez une table dans votre pipeline, il devient un pipeline API uniquement, et vous ne pouvez plus modifier le pipeline dans l'interface utilisateur.
  • Si vous sélectionnez une colonne après qu'un pipeline a déjà start, le connecteur ne renseigne pas automatiquement les données historiques pour la nouvelle colonne. Pour ingérer des données historiques, exécutez manuellement un refresh complet sur la table.
  • Databricks ne peut pas ingérer deux tables ou plus portant le même nom dans le même pipeline, même si elles proviennent de schémas sources différents.
  • Le système source suppose que les colonnes du curseur augmentent de façon monotone.
  • Le connecteur ingère des données brutes sans transformations. Utilisez les Spark Declarative Pipelines en aval sur les Lakeflow Pipelines pour les transformations.

Limitations spécifiques au connecteur

Les limitations de cette section sont spécifiques au connecteur GA4.

Authentification

  • Le connecteur prend en charge l'authentification OAuth (recommandée) et JSON de compte de service. L'interface utilisateur de Databricks ne prend en charge qu'OAuth. Pour utiliser l'authentification JSON du compte de service, vous devez créer la connexion à l'aide des APIs Databricks. Consultez Créer une connexion de données brutes Google Analytics.
  • La récupération parallèle n'est prise en charge que pour les connexions qui utilisent l'authentification JSON de compte de service. Les connexions qui utilisent OAuth (U2M) récupèrent les données dans une seule tâche Spark plutôt que de distribuer la récupération sur plusieurs tâches parallèles. Pour les grandes tables où le throughput d'ingestion est important, utilisez l'authentification JSON du compte de service.

pipeline

  • Les mises à jour et les suppressions dans GA4 ne sont pas ingérées.
  • Le connecteur ne prend en charge qu'une seule propriété GA4 par pipeline.
  • L'ingestion depuis Universal Analytics (UA) n'est pas prise en charge.

Tables

  • Le connecteur ne peut pas ingérer de manière fiable les tables partitionnées par date BigQuery d'une taille supérieure à 150 Go.
  • Le connecteur n'ingère que les données brutes que vous exportez de GA4 vers BigQuery, et il hérite des limites de GA4 sur la quantité de données historiques que vous pouvez exporter vers BigQuery.
  • Le chargement initial récupère les données pour toutes les dates qui sont présentes dans votre projet GA4/BigQuery.
  • Databricks ne peut garantir la rétention des données events_intraday pour un jour donné après que les données soient disponibles dans la table events. Ceci parce que la table events_intraday est uniquement destinée à une utilisation provisoire jusqu'à ce que la table events soit prête pour cette journée.
  • Le connecteur suppose que chaque ligne est unique. Databricks ne peut garantir un comportement correct en cas de doublons inattendus.