Guides de données
La Databricks Data Intelligence Platform permet aux experts en données de toute votre organisation de collaborer et de mettre en production des solutions de données à l'aide d'assets et d'outils de données partagés et sous gouvernance sécurisée.
Cette page vous aide à identifier le bon point de départ pour votre cas d'utilisation.
De nombreuses tâches sur Databricks nécessitent des autorisations élevées. De nombreuses organisations limitent ces autorisations élevées à un petit nombre d'utilisateurs ou d'équipes. Cette page distingue les actions qui peuvent être effectuées par la plupart des utilisateurs du Workspace des actions qui sont réservées aux utilisateurs privilégiés.
Les administrateurs du Workspace peuvent vous aider à déterminer si vous devez demander l'accès aux assets ou des autorisations élevées.
Rechercher et accéder aux données
Cette section fournit un bref aperçu des tâches pour vous aider à découvrir les assets de données à votre disposition. La plupart de ces tâches supposent qu'un administrateur a configuré les autorisations sur les assets de données. Voir Configurer l'accès aux données.
Zone de fonctionnalité | Ressources |
|---|---|
Découverte des données | Pour un aperçu plus détaillé des tâches de découverte des données, consultez Découvrir les données. |
Catalogues | Les catalogues sont l'objet de niveau supérieur dans le modèle de gouvernance des données Unity Catalog. Utilisez l'Explorateur de catalogues pour trouver des tables, des vues et d'autres asset de données. Voir Explorer les objets de base de données.
|
Stockage connecté | Si vous avez accès à des ressources compute, vous pouvez utiliser des commandes intégrées pour explorer les fichiers dans le stockage connecté. Consultez Explorer le stockage et trouver des fichiers de données. |
upload des fichiers locaux | By default, les utilisateurs disposent d'autorisations pour upload de petits fichiers de données depuis votre machine locale, tels que les fichiers CSV. Consultez Créer ou modifier une table à l'aide d'un upload de fichier. |
Travailler avec les données
Cette section donne un aperçu des tâches de données courantes et des outils utilisés pour effectuer ces tâches.
Pour toutes les tâches décrites, les utilisateurs doivent disposer des autorisations appropriées pour les outils, les ressources de compute, les données et les autres artefacts du workspace. Voir Configurer l'accès aux données et Configurer les workspaces et l'infrastructure.
Zone de fonctionnalité | Ressources |
|---|---|
Objets de base de données | En plus des tables et des vues, Databricks utilise d'autres objets de base de données sécurisables, tels que les volumes, pour gouverner les données en toute sécurité. Voir les objets de base de données dans Databricks. |
Autorisations de données | Unity Catalog gouverne toutes les opérations de lecture et d'écriture dans les Workspaces activés. Vous devez disposer d'autorisations suffisantes pour effectuer ces opérations. Voir Objets sécurisables dans Unity Catalog. |
etl | Les charges de travail d'extraction, transformation et chargement (ETL) figurent parmi les utilisations les plus courantes d'Apache Spark et Databricks, et la plupart des fonctionnalités de la plateforme sont conçues et optimisées pour l'ETL. Voir Didacticiel : Créer un pipeline ETL avec LakeFlow Pipelines. |
Requêtes |
|
Tableaux de bord et insights |
|
Ingérer |
|
Transformations | Databricks utilise une syntaxe et des outils courants pour des transformations dont la complexité varie des instructions SQL CTAS aux applications de streaming quasi temps réel.
|
IA et machine learning | La Databricks Data Intelligence Platform fournit une suite d'outils pour la Data Science, le Machine Learning et les applications d'IA. Voir Machine Learning sur Databricks. |
Configurer l'accès aux données
La plupart des workspaces Databricks s'appuient sur un administrateur de workspace ou d'autres utilisateurs avancés pour configurer les connexions aux sources de données externes et appliquer des privilèges aux assets de données basés sur l'appartenance à une équipe, la région ou les rôles. Cette section fournit un aperçu des tâches courantes de configuration et de contrôle de l'accès aux données qui nécessitent des autorisations élevées.
Avant de demander des autorisations élevées pour configurer une nouvelle connexion à une source de données, vérifiez si vous ne manquez pas de privilèges sur une connexion, un catalogue ou une table existante. Si une source de données n'est pas disponible, consultez votre organisation pour connaître la politique d'ajout de nouvelles données à votre Workspace.
Zone de fonctionnalité | Ressources |
|---|---|
Unity Catalog |
|
Connexions et accès |
|
Partage de catalogues et de tableaux de bord |
|
Configurez les Workspace et l'infrastructure
Cette section donne un aperçu des tâches courantes associées à l'administration des ressources et de l'infrastructure du workspace. Au sens large, les assets du Workspace incluent les éléments suivants :
- **Ressources de compute** : Les ressources de compute comprennent des clusters interactifs polyvalents, des SQL Warehouse, des clusters de Jobs et du compute de pipeline. Un utilisateur ou une charge de travail doit disposer d'autorisations pour se connecter aux ressources de compute en cours d'exécution afin de traiter la logique spécifiée.
Les utilisateurs qui n'ont pas accès pour se connecter à des ressources de compute ont des fonctionnalités très limitées sur Databricks.
-
Outils de la plateforme : La Databricks Data Intelligence Platform fournit une suite d'outils adaptés à différents cas d'usage et personas, tels que les notebooks, Databricks SQL et les fonctionnalités Databricks AI. Les administrateurs peuvent personnaliser les paramètres qui incluent les comportements par default, les fonctionnalités facultatives et l'accès utilisateur pour nombre de ces outils.
-
Artefacts : les artefacts incluent les Notebooks, les requêtes, les tableaux de bord, les fichiers, les bibliothèques, les pipelines et les Jobs. Les artefacts contiennent du code et des configurations que les utilisateurs créent afin d'effectuer les actions souhaitées sur leurs données.
L'utilisateur qui crée un asset de Workspace se voit attribuer le rôle de propriétaire by default. Pour la plupart des assets, les propriétaires peuvent accorder des autorisations à tout autre utilisateur ou groupe du Workspace.
Pour garantir la sécurité des données et du code, Databricks recommande de configurer le rôle de propriétaire pour tous les artefacts et les ressources de compute déployés dans un workspace de production.
Zone de fonctionnalité | Ressources |
|---|---|
Droits du Workspace | Les droits du Workspace incluent l’accès de base au Workspace, l’accès à Databricks SQL et la création de clusters illimitée. Voir Gérer les droits. |
Accès aux ressources de compute & politiques |
|
Outils de plateforme | Utilisez la console d’administration pour configurer des comportements allant de la personnalisation de l’apparence du Workspace à l’activation ou la désactivation de produits et de fonctionnalités. Veuillez consulter Gérer votre Workspace. |
ACLs de Workspace | Les listes de contrôle d'accès (ACL) du Workspace régissent la manière dont les utilisateurs et les groupes peuvent interagir avec les assets du Workspace, y compris les ressources de compute, les artefacts de code et les Jobs. Voir les listes de contrôle d'accès. |
Mettre en production les charges de travail
Tous les produits Databricks sont conçus pour accélérer le cheminement du développement à la production, et pour l'évolutivité et la stabilité. Cette section fournit une brève introduction à la suite d'outils recommandés pour la mise en production des workloads.
Zone de fonctionnalité | Ressources |
|---|---|
Pipelines ETL | Les Lakeflow Pipelines offrent une syntaxe déclarative pour créer et mettre en production des pipelines ETL. See Spark Declarative Pipelines. |
Orchestration | Les tâches vous permettent de définir des workflows complexes avec des dépendances, des triggers et des planifications. See Lakeflow Jobs. |
CI/CD | Les Declarative Automation Bundles facilitent la gestion et le déploiement des données, des assets et des artefacts sur plusieurs workspaces. Consultez Que sont les Declarative Automation Bundles ? |