Aller au contenu principal

Guides de données

La Databricks Data Intelligence Platform permet aux experts en données de toute votre organisation de collaborer et de mettre en production des solutions de données à l'aide d'assets et d'outils de données partagés et sous gouvernance sécurisée.

Cette page vous aide à identifier le bon point de départ pour votre cas d'utilisation.

De nombreuses tâches sur Databricks nécessitent des autorisations élevées. De nombreuses organisations limitent ces autorisations élevées à un petit nombre d'utilisateurs ou d'équipes. Cette page distingue les actions qui peuvent être effectuées par la plupart des utilisateurs du Workspace des actions qui sont réservées aux utilisateurs privilégiés.

Les administrateurs du Workspace peuvent vous aider à déterminer si vous devez demander l'accès aux assets ou des autorisations élevées.

Rechercher et accéder aux données

Cette section fournit un bref aperçu des tâches pour vous aider à découvrir les assets de données à votre disposition. La plupart de ces tâches supposent qu'un administrateur a configuré les autorisations sur les assets de données. Voir Configurer l'accès aux données.

Zone de fonctionnalité

Ressources

Découverte des données

Pour un aperçu plus détaillé des tâches de découverte des données, consultez Découvrir les données.

Catalogues

Les catalogues sont l'objet de niveau supérieur dans le modèle de gouvernance des données Unity Catalog. Utilisez l'Explorateur de catalogues pour trouver des tables, des vues et d'autres asset de données. Voir Explorer les objets de base de données.

Stockage connecté

Si vous avez accès à des ressources compute, vous pouvez utiliser des commandes intégrées pour explorer les fichiers dans le stockage connecté. Consultez Explorer le stockage et trouver des fichiers de données.

upload des fichiers locaux

By default, les utilisateurs disposent d'autorisations pour upload de petits fichiers de données depuis votre machine locale, tels que les fichiers CSV. Consultez Créer ou modifier une table à l'aide d'un upload de fichier.

Zone de fonctionnalité

Ressources

Découverte des données

Pour un aperçu plus détaillé des tâches de découverte des données, consultez Découvrir les données.

Catalogues

Les catalogues sont l'objet de niveau supérieur dans le modèle de gouvernance des données Unity Catalog. Utilisez l'Explorateur de catalogues pour trouver des tables, des vues et d'autres asset de données. Voir Explorer les objets de base de données.

Stockage connecté

Si vous avez accès à des ressources compute, vous pouvez utiliser des commandes intégrées pour explorer les fichiers dans le stockage connecté. Consultez Explorer le stockage et trouver des fichiers de données.

upload des fichiers locaux

By default, les utilisateurs disposent d'autorisations pour upload de petits fichiers de données depuis votre machine locale, tels que les fichiers CSV. Consultez Créer ou modifier une table à l'aide d'un upload de fichier.

Travailler avec les données

Cette section donne un aperçu des tâches de données courantes et des outils utilisés pour effectuer ces tâches.

Pour toutes les tâches décrites, les utilisateurs doivent disposer des autorisations appropriées pour les outils, les ressources de compute, les données et les autres artefacts du workspace. Voir Configurer l'accès aux données et Configurer les workspaces et l'infrastructure.

Zone de fonctionnalité

Ressources

Objets de base de données

En plus des tables et des vues, Databricks utilise d'autres objets de base de données sécurisables, tels que les volumes, pour gouverner les données en toute sécurité. Voir les objets de base de données dans Databricks.

Autorisations de données

Unity Catalog gouverne toutes les opérations de lecture et d'écriture dans les Workspaces activés. Vous devez disposer d'autorisations suffisantes pour effectuer ces opérations. Voir Objets sécurisables dans Unity Catalog.

etl

Les charges de travail d'extraction, transformation et chargement (ETL) figurent parmi les utilisations les plus courantes d'Apache Spark et Databricks, et la plupart des fonctionnalités de la plateforme sont conçues et optimisées pour l'ETL. Voir Didacticiel : Créer un pipeline ETL avec LakeFlow Pipelines.

Requêtes

Tableaux de bord et insights

  • Les tableaux de bord AI/BI vous permettent d’extraire et de visualiser facilement des insights dans l’interface utilisateur. Consultez Tableaux de bord.
  • Les Agents Genie utilisent des invites textuelles pour répondre aux questions et fournir des insights basés sur vos données. Voir Agents Genie.

Ingérer

  • Lakeflow Connect ingère des données provenant de systèmes externes populaires. Consultez les connecteurs gérés dans Lakeflow Connect.
  • Auto Loader peut être utilisé avec les LakeFlow Pipelines ou les Structured Streaming Jobs pour ingérer de manière incrémentielle des données à partir du stockage d'objets cloud. Consultez Qu'est-ce qu'Auto Loader ?.
  • Vous pouvez utiliser Lakeflow Pipelines ou Structured Streaming pour ingérer des données depuis des files d'attente de messages, notamment Kafka. Consultez query les données en streaming.

Transformations

Databricks utilise une syntaxe et des outils courants pour des transformations dont la complexité varie des instructions SQL CTAS aux applications de streaming quasi temps réel.

IA et machine learning

La Databricks Data Intelligence Platform fournit une suite d'outils pour la Data Science, le Machine Learning et les applications d'IA. Voir Machine Learning sur Databricks.

Zone de fonctionnalité

Ressources

Objets de base de données

En plus des tables et des vues, Databricks utilise d'autres objets de base de données sécurisables, tels que les volumes, pour gouverner les données en toute sécurité. Voir les objets de base de données dans Databricks.

Autorisations de données

Unity Catalog gouverne toutes les opérations de lecture et d'écriture dans les Workspaces activés. Vous devez disposer d'autorisations suffisantes pour effectuer ces opérations. Voir Objets sécurisables dans Unity Catalog.

etl

Les charges de travail d'extraction, transformation et chargement (ETL) figurent parmi les utilisations les plus courantes d'Apache Spark et Databricks, et la plupart des fonctionnalités de la plateforme sont conçues et optimisées pour l'ETL. Voir Didacticiel : Créer un pipeline ETL avec LakeFlow Pipelines.

Requêtes

Tableaux de bord et insights

  • Les tableaux de bord AI/BI vous permettent d’extraire et de visualiser facilement des insights dans l’interface utilisateur. Consultez Tableaux de bord.
  • Les Agents Genie utilisent des invites textuelles pour répondre aux questions et fournir des insights basés sur vos données. Voir Agents Genie.

Ingérer

  • Lakeflow Connect ingère des données provenant de systèmes externes populaires. Consultez les connecteurs gérés dans Lakeflow Connect.
  • Auto Loader peut être utilisé avec les LakeFlow Pipelines ou les Structured Streaming Jobs pour ingérer de manière incrémentielle des données à partir du stockage d'objets cloud. Consultez Qu'est-ce qu'Auto Loader ?.
  • Vous pouvez utiliser Lakeflow Pipelines ou Structured Streaming pour ingérer des données depuis des files d'attente de messages, notamment Kafka. Consultez query les données en streaming.

Transformations

Databricks utilise une syntaxe et des outils courants pour des transformations dont la complexité varie des instructions SQL CTAS aux applications de streaming quasi temps réel.

IA et machine learning

La Databricks Data Intelligence Platform fournit une suite d'outils pour la Data Science, le Machine Learning et les applications d'IA. Voir Machine Learning sur Databricks.

Configurer l'accès aux données

La plupart des workspaces Databricks s'appuient sur un administrateur de workspace ou d'autres utilisateurs avancés pour configurer les connexions aux sources de données externes et appliquer des privilèges aux assets de données basés sur l'appartenance à une équipe, la région ou les rôles. Cette section fournit un aperçu des tâches courantes de configuration et de contrôle de l'accès aux données qui nécessitent des autorisations élevées.

remarque

Avant de demander des autorisations élevées pour configurer une nouvelle connexion à une source de données, vérifiez si vous ne manquez pas de privilèges sur une connexion, un catalogue ou une table existante. Si une source de données n'est pas disponible, consultez votre organisation pour connaître la politique d'ajout de nouvelles données à votre Workspace.

Zone de fonctionnalité

Ressources

Unity Catalog

  • Unity Catalog alimente les fonctionnalités de gouvernance des données intégrées à la Databricks Data Intelligence Platform. Voir Qu'est-ce que Unity Catalog ?
  • Les administrateurs de compte Databricks, les administrateurs d'workspace et les administrateurs de métastore disposent de privilèges par default pour gérer les privilèges de données de Unity Catalog pour les utilisateurs. Consultez Gérer les privilèges dans Unity Catalog.

Connexions et accès

Partage de catalogues et de tableaux de bord

  • Les administrateurs peuvent créer de nouveaux catalogues. Les catalogues fournissent une abstraction de haut niveau pour l’isolation des données et peuvent être liés à des Workspaces individuels ou partagés entre tous les Workspaces d’un compte. Voir Créer des catalogues.
  • Les tableaux de bord AI/BI encouragent les propriétaires à intégrer leurs identifiants lors de la publication, afin de garantir que les spectateurs puissent obtenir des insights à partir des résultats partagés. Pour plus de détails, consultez Partager un tableau de bord.

Zone de fonctionnalité

Ressources

Unity Catalog

  • Unity Catalog alimente les fonctionnalités de gouvernance des données intégrées à la Databricks Data Intelligence Platform. Voir Qu'est-ce que Unity Catalog ?
  • Les administrateurs de compte Databricks, les administrateurs d'workspace et les administrateurs de métastore disposent de privilèges par default pour gérer les privilèges de données de Unity Catalog pour les utilisateurs. Consultez Gérer les privilèges dans Unity Catalog.

Connexions et accès

Partage de catalogues et de tableaux de bord

  • Les administrateurs peuvent créer de nouveaux catalogues. Les catalogues fournissent une abstraction de haut niveau pour l’isolation des données et peuvent être liés à des Workspaces individuels ou partagés entre tous les Workspaces d’un compte. Voir Créer des catalogues.
  • Les tableaux de bord AI/BI encouragent les propriétaires à intégrer leurs identifiants lors de la publication, afin de garantir que les spectateurs puissent obtenir des insights à partir des résultats partagés. Pour plus de détails, consultez Partager un tableau de bord.

Configurez les Workspace et l'infrastructure

Cette section donne un aperçu des tâches courantes associées à l'administration des ressources et de l'infrastructure du workspace. Au sens large, les assets du Workspace incluent les éléments suivants :

  • **Ressources de compute** : Les ressources de compute comprennent des clusters interactifs polyvalents, des SQL Warehouse, des clusters de Jobs et du compute de pipeline. Un utilisateur ou une charge de travail doit disposer d'autorisations pour se connecter aux ressources de compute en cours d'exécution afin de traiter la logique spécifiée.
remarque

Les utilisateurs qui n'ont pas accès pour se connecter à des ressources de compute ont des fonctionnalités très limitées sur Databricks.

  • Outils de la plateforme : La Databricks Data Intelligence Platform fournit une suite d'outils adaptés à différents cas d'usage et personas, tels que les notebooks, Databricks SQL et les fonctionnalités Databricks AI. Les administrateurs peuvent personnaliser les paramètres qui incluent les comportements par default, les fonctionnalités facultatives et l'accès utilisateur pour nombre de ces outils.

  • Artefacts : les artefacts incluent les Notebooks, les requêtes, les tableaux de bord, les fichiers, les bibliothèques, les pipelines et les Jobs. Les artefacts contiennent du code et des configurations que les utilisateurs créent afin d'effectuer les actions souhaitées sur leurs données.

important

L'utilisateur qui crée un asset de Workspace se voit attribuer le rôle de propriétaire by default. Pour la plupart des assets, les propriétaires peuvent accorder des autorisations à tout autre utilisateur ou groupe du Workspace.

Pour garantir la sécurité des données et du code, Databricks recommande de configurer le rôle de propriétaire pour tous les artefacts et les ressources de compute déployés dans un workspace de production.

Zone de fonctionnalité

Ressources

Droits du Workspace

Les droits du Workspace incluent l’accès de base au Workspace, l’accès à Databricks SQL et la création de clusters illimitée. Voir Gérer les droits.

Accès aux ressources de compute & politiques

  • La plupart des coûts sur Databricks sont destinés aux Ressources de compute. Le contrôle des utilisateurs ayant la capacité de configurer, déployer, start et utiliser diverses ressources est essentiel pour maîtriser les coûts. Consultez la vue d'ensemble de Classic compute.
  • Les stratégies de compute fonctionnent de concert avec les droits de compute du workspace pour garantir que les utilisateurs autorisés ne déploient des ressources de compute que conformément aux règles de configuration spécifiées. Consultez Créer et gérer des politiques de compute.
  • Les administrateurs peuvent configurer les comportements par default, les politiques d'accès aux données et l'accès des utilisateurs aux SQL Warehouse. Consultez les paramètres d'administration du SQL Warehouse.

Outils de plateforme

Utilisez la console d’administration pour configurer des comportements allant de la personnalisation de l’apparence du Workspace à l’activation ou la désactivation de produits et de fonctionnalités. Veuillez consulter Gérer votre Workspace.

ACLs de Workspace

Les listes de contrôle d'accès (ACL) du Workspace régissent la manière dont les utilisateurs et les groupes peuvent interagir avec les assets du Workspace, y compris les ressources de compute, les artefacts de code et les Jobs. Voir les listes de contrôle d'accès.

Zone de fonctionnalité

Ressources

Droits du Workspace

Les droits du Workspace incluent l’accès de base au Workspace, l’accès à Databricks SQL et la création de clusters illimitée. Voir Gérer les droits.

Accès aux ressources de compute & politiques

  • La plupart des coûts sur Databricks sont destinés aux Ressources de compute. Le contrôle des utilisateurs ayant la capacité de configurer, déployer, start et utiliser diverses ressources est essentiel pour maîtriser les coûts. Consultez la vue d'ensemble de Classic compute.
  • Les stratégies de compute fonctionnent de concert avec les droits de compute du workspace pour garantir que les utilisateurs autorisés ne déploient des ressources de compute que conformément aux règles de configuration spécifiées. Consultez Créer et gérer des politiques de compute.
  • Les administrateurs peuvent configurer les comportements par default, les politiques d'accès aux données et l'accès des utilisateurs aux SQL Warehouse. Consultez les paramètres d'administration du SQL Warehouse.

Outils de plateforme

Utilisez la console d’administration pour configurer des comportements allant de la personnalisation de l’apparence du Workspace à l’activation ou la désactivation de produits et de fonctionnalités. Veuillez consulter Gérer votre Workspace.

ACLs de Workspace

Les listes de contrôle d'accès (ACL) du Workspace régissent la manière dont les utilisateurs et les groupes peuvent interagir avec les assets du Workspace, y compris les ressources de compute, les artefacts de code et les Jobs. Voir les listes de contrôle d'accès.

Mettre en production les charges de travail

Tous les produits Databricks sont conçus pour accélérer le cheminement du développement à la production, et pour l'évolutivité et la stabilité. Cette section fournit une brève introduction à la suite d'outils recommandés pour la mise en production des workloads.

Zone de fonctionnalité

Ressources

Pipelines ETL

Les Lakeflow Pipelines offrent une syntaxe déclarative pour créer et mettre en production des pipelines ETL. See Spark Declarative Pipelines.

Orchestration

Les tâches vous permettent de définir des workflows complexes avec des dépendances, des triggers et des planifications. See Lakeflow Jobs.

CI/CD

Les Declarative Automation Bundles facilitent la gestion et le déploiement des données, des assets et des artefacts sur plusieurs workspaces. Consultez Que sont les Declarative Automation Bundles ?

Zone de fonctionnalité

Ressources

Pipelines ETL

Les Lakeflow Pipelines offrent une syntaxe déclarative pour créer et mettre en production des pipelines ETL. See Spark Declarative Pipelines.

Orchestration

Les tâches vous permettent de définir des workflows complexes avec des dépendances, des triggers et des planifications. See Lakeflow Jobs.

CI/CD

Les Declarative Automation Bundles facilitent la gestion et le déploiement des données, des assets et des artefacts sur plusieurs workspaces. Consultez Que sont les Declarative Automation Bundles ?