Aller au contenu principal

Glossaire de la terminologie technique Databricks.

A

liste de contrôle d'accès (ACL)

Liste des autorisations attachées au Workspace, au cluster, au Job, à la table ou à l'Experimentation. Une ACL spécifie quels utilisateurs ou processus système sont autorisés à accéder aux objets, et quelles Opérations sont autorisées sur les assets. Chaque entrée dans une ACL typique spécifie un sujet et une opération. Voir les listes de contrôle d'accès.

mode d'accès

Une fonctionnalité de sécurité qui détermine qui peut utiliser une ressource de compute et les données auxquelles ces utilisateurs peuvent accéder lors de l'utilisation de la ressource de compute. Chaque ressource de compute dans Databricks a un mode d'accès. Voir Modes d'accès.

Transactions ACID

Transactions de base de données traitées de manière fiable. ACID signifie atomicité, cohérence, isolation, durabilité. Voir les bonnes pratiques en matière de fiabilité.

Agent Bricks

Fonctionnalités Databricks qui vous permettent de créer une solution d'IA de haute qualité.

intelligence artificielle (IA)

La capacité d'un ordinateur à imiter un comportement humain intelligent. Voir Machine Learning sur Databricks.

Agent IA

Une application dotée de capacités de raisonnement complexes qui lui permet de créer son propre plan et d'exécuter la tâche selon les outils à sa disposition. Voir les modèles de conception de système d'agent.

Fonctions IA

Les fonctions SQL intégrées qui vous permettent d'appliquer l'IA à vos données directement depuis SQL dans Databricks. Consultez Enrichir des données à l'aide des AI Functions.

Passerelle IA

La solution Databricks pour la gouvernance et le monitoring des endpoints LLM, des agents de codage et des endpoints de service de modèles. Utilisez la Passerelle IA pour analyser l'utilisation, configurer les autorisations et gérer la capacité entre les fournisseurs. Voir Gouvernance de l’IA avec Unity AI Gateway.

Espace d'expérimentation IA

Une fonctionnalité Databricks où les utilisateurs peuvent interagir avec, tester et comparer les modèles d'IA générative servis dans votre workspace Databricks. Consultez Discuter avec des LLM et prototyper des applications d'IA générative à l'aide d'AI Playground.

Détection d'anomalies

Techniques et outils utilisés pour identifier les modèles inhabituels qui ne sont pas conformes au comportement attendu dans les datasets. Databricks facilite la détection d'anomalies grâce à ses capacités de Machine Learning et de traitement des données.

Apache Iceberg

Un format de table open source pour les charges de travail analytiques qui prend en charge l'évolution des schémas, le time travel et le partitionnement caché. Databricks prend en charge les tables Iceberg gérées par Unity Catalog et par des catalogues étrangers. Consultez Qu'est-ce qu'Apache Iceberg dans Databricks ?.

Apache Spark

Un système de calcul distribué open source, utilisé pour les charges de travail Big Data. Voir la vue d'ensemble d'Apache Spark.

réseau de neurones artificiels (ANN)

Un système informatique dont le fonctionnement est calqué sur celui des neurones dans le cerveau humain.

asset

Une entité dans un Databricks Workspace (par exemple, un objet ou un fichier).

audit log

Un enregistrement des activités et actions des utilisateurs au sein de l'environnement Databricks, essentiel pour la sécurité, la conformité et le monitoring opérationnel. Voir Audit Logs reference.

Auto Loader

Une fonctionnalité d'ingestion de données qui traite de manière incrémentielle et efficace les nouveaux fichiers de données à mesure qu'ils arrivent dans le stockage cloud sans aucune configuration supplémentaire. Consultez Qu'est-ce qu'Auto Loader ?.

AutoML

Une fonctionnalité Databricks qui simplifie le processus d'application du Machine Learning à vos datasets en trouvant automatiquement le meilleur algorithme et la meilleure configuration d'hyperparamètres pour vous. Consultez Qu'est-ce qu'AutoML ?.

data lineage automatisé

Le processus de suivi et de visualisation automatiques du flux de données, de son origine à sa forme finale, en passant par diverses Transformations, essentiel pour le debugging, la conformité et la compréhension des dépendances de données. Databricks facilite cela grâce à des intégrations avec des outils de data lineage.

mise à l'échelle automatique, horizontale

Ajout ou suppression d'exécuteurs en fonction du nombre de tâches en attente de planification. Cela se produit dynamiquement lors d'une seule mise à jour.

autoscaling, verticale

Augmenter ou diminuer la taille d’une machine (driver ou exécuteur) en fonction de la pression de la mémoire (ou de son absence). Cela ne se produit qu'au start d'une nouvelle mise à jour.

Azure Databricks

Une version de Databricks optimisée pour la plateforme cloud Microsoft Azure.

B

Traitement par batch

Une méthode de traitement des données qui vous permet de définir des instructions explicites pour traiter une quantité fixe de données statiques et non modifiables comme une seule opération. Databricks utilise Spark SQL ou DataFrames. Consultez les connecteurs standard dans Lakeflow Connect.

détection et atténuation des biais

Le processus d'identification et de correction des biais dans les données et les modèles de machine learning pour garantir l'équité et la précision. Databricks propose des outils et des intégrations pour aider à détecter et à atténuer les biais. Voir Surveiller l'équité et les biais pour les modèles de classification.

Business Intelligence (BI)

Les stratégies et les technologies utilisées par les entreprises pour l'analyse et la gestion des données commerciales.

C

catalogue (Unity Catalog)

Le premier niveau de l'espace de noms à trois niveaux de Unity Catalog (catalog.schema.table-etc). Un catalogue est un conteneur pour les schémas, qui à leur tour contiennent des tables, des vues, des volumes, des modèles et des fonctions. Consultez Que sont les catalogues dans Databricks ?

Explorateur de catalogue

Une fonctionnalité Databricks qui fournit une interface utilisateur pour explorer et gérer les données, les schémas (bases de données), les tables, les modèles, les fonctions et d'autres assets d'IA. Vous pouvez l'utiliser pour trouver des objets de données et des propriétaires, comprendre les relations de données entre les tables et gérer les autorisations et le partage. Voir Qu'est-ce que l'Explorateur de catalogue ?

instance enfant

Une instance enfant est un clone en écriture sur copie de l'instance de la base de données d'origine. Il peut être créé à partir de l'instant actuel ou d'un instant historique dans la fenêtre de rétention. Consulter Restaurer les données et time travel.

CICD ou CI/CD

Les pratiques combinées d'intégration continue (CI) et de livraison continue (CD). Voir le CI/CD sur Databricks.

nettoyer des données

Données qui ont subi un processus de nettoyage de données, qui est le processus de détection et de correction (ou de suppression) d'enregistrements corrompus ou inexacts d'un ensemble d'enregistrements, d'une table ou d'une base de données et qui fait référence à l'identification des parties incomplètes, incorrectes, inexactes ou non pertinentes des données, puis au remplacement, à la modification ou à la suppression des données brutes ou sales.

Salles blanches

Une fonctionnalité Databricks qui utilise OpenSharing et le compute serverless pour fournir un environnement sécurisé et protégeant la confidentialité où plusieurs parties peuvent partager des données d’entreprise sensibles et collaborer sans accès direct aux données de chacun. Avec les Clean Rooms, les utilisateurs d’autres comptes Databricks peuvent collaborer pour générer des insights sur des projets partagés, tels que des campagnes publicitaires, des décisions d’investissement, ou de la recherche et développement, sans partager l’accès aux données sous-jacentes sensibles. Voir Qu’est-ce que Databricks Clean Rooms ?.

Fournisseur de plateforme cloud

Une entreprise qui fournit une plateforme de cloud computing. Par exemple, Microsoft Azure, Amazon Web Services (AWS) et Google Cloud Platform (GCP).

cluster

Une ressource de compute non Serverless utilisée dans les Notebooks, les Jobs et les LakeFlow Pipelines. Le terme *compute* a remplacé *cluster* dans toute l’interface utilisateur de Databricks, mais il est toujours utilisé dans l’API Clusters et dans les métadonnées.

Calculer

Désigne les ressources de compute, qui sont des éléments d'infrastructure, qu'ils soient matériels ou outils/solutions/technologies/plateformes, permettant la résolution de problèmes et la création de solutions par la réception, l'analyse et le stockage de données. compute.

pipeline continu

Un pipeline qui met à jour toutes les tables en continu, à mesure que de nouvelles données arrivent en entrée sans s'arrêter. Voir mode de pipeline Déclenché ou continu.

D

graphe orienté acyclique (DAG)

Une méthode de représentation des dépendances entre les tâches dans un workflow ou un pipeline. Dans un modèle de traitement DAG, les tâches sont représentées comme des nœuds dans un graphe orienté acyclique, où les arêtes représentent les dépendances entre les tâches.

data catalog

Un outil de gestion des métadonnées pour gérer les sources de données, fournissant des informations sur la structure, l'emplacement et l'utilisation des données. Databricks s'intègre aux catalogues de données externes pour une gestion améliorée des métadonnées.

Gouvernance des données

La pratique consistant à gérer la disponibilité, l'intégrité, la sécurité et l'utilisabilité des données, impliquant des politiques, des procédures et des technologies pour garantir la qualité et la conformité des données.

ingestion de données

Le processus d'importation, de transfert, de chargement et de traitement des données provenant de diverses sources vers Databricks pour le stockage, l'analyse et le traitement.

data lake

Un grand repository de stockage qui contient une grande quantité de données brutes dans leur format natif jusqu'à ce qu'elles soient nécessaires.

Data Lakehouse

Un système de gestion de données qui combine les avantages des data lakes et des data warehouses. Un data lakehouse offre des capacités de stockage et de traitement évolutives pour les organisations modernes qui veulent éviter les systèmes isolés pour le traitement de différentes charges de travail, comme le Machine Learning (ML) et la Business Intelligence (BI). Un data lakehouse peut aider à établir une source unique de vérité, à éliminer les coûts redondants et à assurer la fraîcheur des données. Voir Qu'est-ce qu'un data lakehouse ?.

profilage des données

Elle surveille les propriétés statistiques et la qualité des données de toutes les tables de votre compte. Vous pouvez également l’utiliser pour suivre les performances des modèles de machine learning et des endpoints de service de modèles en monitoring les tables d'inférence qui contiennent les entrées et les prédictions des modèles. See profilage des données.

pipeline de données

Une série d'étapes au cours desquelles les données sont générées, collectées, traitées et déplacées vers une destination. Databricks facilite la création et la gestion de pipelines de données complexes pour le traitement des données par batch et en temps réel.

confidentialité des données

La pratique qui consiste à protéger les données personnelles contre l’accès non autorisé, l’utilisation, la divulgation ou le vol. Databricks met l'accent sur des fonctionnalités robustes de confidentialité et de sécurité des données, y compris le chiffrement de bout en bout, le contrôle d'accès basé sur les rôles et la conformité avec les principales réglementations pour la protection des données, afin de protéger les informations sensibles et d'assurer la gouvernance des données.

visualisation des données

Une approche de gestion de données qui permet à une application de récupérer et de manipuler des données sans exiger de détails techniques sur celles-ci, comme leur format ou leur emplacement physique. Databricks peut faire partie d'une couche de virtualisation des données en offrant un accès et une analyse transparents des données à travers des sources disparates.

Entreposage des données

Fait référence à la collecte et au stockage de données provenant de sources multiples afin qu’elles puissent être rapidement consultées pour les insights métier et les rapports. L’architecture lakehouse et Databricks SQL apportent les capacités d’entreposage des données dans le cloud à vos data lakes. Voir l’ architecture d’entreposage des données.

catalogue de bases de données

Une entité de catalogue Unity Catalog représentant une base de données Postgres dans une seule instance. Ceci est conceptuellement similaire à un catalogue étranger dans Unity Catalog. Consultez Enregistrer votre base de données dans Unity Catalog.

instance de base de données

Une instance de base de données gère les ressources de stockage et de compute et fournit les Endpoint auxquels les utilisateurs se connectent. Voir Lakebase provisionnée.

Databricks

Une plateforme d'analytique unifiée et ouverte pour créer, déployer, partager et maintenir des solutions de données, d'analytique et d'IA de niveau entreprise à l'échelle. La Databricks Data Intelligence Platform s'intègre avec le stockage et la sécurité cloud dans votre compte cloud, et gère et déploie l'infrastructure cloud en votre nom. Consulter Qu'est-ce que Databricks ?.

Databricks AI/BI

Un produit de Business Intelligence pour comprendre la sémantique de vos données, permettant l'analyse de données en libre-service. AI/BI repose sur un système d'IA composé qui tire des insights du cycle de vie complet de vos données sur l'ensemble de la plateforme Databricks, notamment les pipelines ETL, le lineage et d'autres query. Consultez Databricks AI/BI.

Fonctionnalités Databricks AI

Le moteur de data intelligence qui alimente la Databricks Platform. Il s'agit d'un système d'IA composé qui combine l'utilisation de modèles d'IA, de systèmes de récupération, de classement et de personnalisation pour comprendre la sémantique des données et des modèles d'utilisation de votre organisation. Voir les fonctionnalités d'assistance Databricks AI.

Databricks AI Search

Un index de recherche vectorielle intégré à la Databricks Data Intelligence Platform et à ses outils de gouvernance et de productivité. Voir les recherches Databricks AI.

Databricks AI Search était auparavant connu sous le nom de Databricks Vector Search.

Databricks Apps

Une fonctionnalité Databricks qui permet aux développeurs de créer et de déployer des applications sécurisées de données et d'IA directement sur la plateforme Databricks à l'aide des frameworks Python ou Node.js. Les applications s'exécutent sur du Serverless compute et s'intègrent à Unity Catalog, Databricks SQL et OAuth. See Databricks Apps.

Declarative Automation Bundles

Un outil pour faciliter l'adoption des meilleures pratiques d'ingénierie logicielle, y compris le contrôle de code source, la révision de code, les tests et l'intégration et la livraison continues (CI/CD), pour vos projets de données et d'IA. Les Bundles permettent de décrire les Ressources Databricks, tels que les Jobs, les pipelines et les Notebooks, sous forme de fichiers sources. Consultez Qu’est-ce qu’un Declarative Automation Bundles ?.

Databricks CLI

Une interface de ligne de commande pour Databricks qui permet aux utilisateurs de gérer et d'automatiser les workspaces Databricks et de déployer des jobs, des notebooks et des bibliothèques. Voir Databricks CLI.

Databricks Connect

Une bibliothèque cliente qui permet aux développeurs de connecter leurs IDEs, Notebooks et autres outils préférés au compute Databricks et d'exécuter du code Spark à distance. See Databricks Connect.

Databricks Container Services

Une fonctionnalité Databricks qui vous permet de spécifier une image Docker lorsque vous créez du compute. Voir Databricks Container Services pour le compute dédié.

Databricks Marketplace

Un forum ouvert pour l'échange de produits de données. Les fournisseurs doivent avoir un compte Databricks, mais les destinataires peuvent être n'importe qui. Les assets de la marketplace incluent les datasets, les Notebooks Databricks, les accélérateurs de Solutions Databricks et les modèles de Machine Learning (IA). Les datasets sont généralement disponibles sous forme de catalogues de données tabulaires, bien que les données non tabulaires, sous forme de volumes Databricks, soient également prises en charge. Consultez Qu'est-ce que Databricks Marketplace ?.

Environnement d'exécution Databricks

Un environnement d'exécution optimisé pour l'analytique Big Data. Databricks propose également Databricks Runtime for Machine Learning, qui est optimisé pour les charges de travail de machine learning. Voir Notes de version et compatibilité de Databricks Runtime.

Databricks SQL (DBSQL)

La collection de services qui apportent des capacités d'entreposage des données et des performances à vos data lake existants. Databricks SQL prend en charge les formats ouverts et la norme ANSI SQL. Un éditeur SQL intégré à la plateforme et des outils de tableau de bord permettent aux membres de l'équipe de collaborer avec d'autres utilisateurs Databricks directement dans le Workspace. Voir Entreposage des données sur Databricks.

DBUs

Une unité Databricks (DBU) est une unité normalisée de puissance de traitement sur la Databricks Lakehouse Platform utilisée à des fins de mesure et de Tarifs. Le nombre de DBU consommées par une charge de travail est déterminé par des métriques de traitement, qui peuvent inclure les ressources de compute utilisées et la quantité de données traitées. Consultez les composants Databricks.

Système de fichiers Databricks (DBFS)

Un système de fichiers distribué monté dans un Workspace Databricks et disponible sur le compute Databricks. Databricks recommande d'utiliser les volumes Unity Catalog plutôt que DBFS pour régir l'accès aux données non tabulaires. Consultez Qu'est-ce que DBFS ?.

DataFrame

Une structure de données qui organise les données dans un tableau bidimensionnel de lignes et de colonnes, un peu comme une feuille de calcul. Les DataFrames sont l'une des structures de données les plus courantes utilisées dans l'analytique de données moderne, car elles constituent un moyen flexible et intuitif de stocker et de travailler avec les données. Consultez le Didacticiel : Charger et transformer des données à l'aide des DataFrames Apache Spark.

Jeu de données

Une collection structurée de données organisées et stockées ensemble pour l'analyse ou le traitement. Les données d'un dataset ont généralement des points communs et proviennent d'une même source, ou sont destinées à un même projet.

Delta Lake

Une surcouche de stockage open source qui apporte la fiabilité aux data lakes. Delta Lake propose des transactions ACID, une gestion évolutive des métadonnées et unifie le traitement des données en streaming et en batch. Voir Qu'est-ce que Delta Lake dans Databricks ?

Pipelines

Pipelines de traitement de données basées sur Apache Spark™ Declarative Pipelines (SDP). Vous définissez les Transformations à effectuer sur vos données, et LakeFlow Pipelines gèrent l'orchestration des tâches, la gestion des clusters, le monitoring, la qualité des données et la gestion des erreurs. See Spark Declarative Pipelines.

pipeline dataset

Les tables de streaming, les vues matérialisées et les vues maintenues en tant que résultats de query déclaratives.

OpenSharing

Vous permet de partager des données et des assets d'IA dans Databricks avec des utilisateurs extérieurs à votre organisation, que ces utilisateurs utilisent Databricks ou non. Également disponible en tant que projet open source pour le partage de données tabulaires, son utilisation dans Databricks ajoute la capacité de partager des données non tabulaires et non structurées (volumes), des modèles d'IA, des vues, des données filtrées et des Notebooks. Consultez Qu'est-ce qu'OpenSharing ?.

Tables Delta

Le format de table de données par default dans Databricks est une fonctionnalité du framework de données open source Delta Lake. Les tables Delta sont généralement utilisées pour les data lakes, où les données sont ingérées via streaming ou par grands lots. Voir les tables Databricks.

DLT

Le nom déprécié pour les LakeFlow Pipelines. Le produit anciennement connu sous le nom de Delta Live Tables (DLT) a été renommé ; le code existant ne nécessite aucune migration. Voir Qu’est-il arrivé à Delta Live Tables (DLT) ?

E

intégration (nom)

Une représentation mathématique du contenu sémantique des données, telles que du texte ou des images, exprimée sous forme de vecteur de nombres. Les incorporations sont utilisées dans Databricks pour la recherche vectorielle, la génération augmentée par récupération et d'autres applications d'IA. Différent du terme « embedding » tel que l'intégration d'un tableau de bord dans une interface utilisateur. Voir Databricks AI Search.

ETL (extraction, transformation, chargement)

Une approche moderne de l'intégration de données qui extrait des données des sources, les charge dans le système cible, puis les transforme au sein du système cible. Voir Didacticiel : Créer un pipeline ETL avec LakeFlow Pipelines.

table externe

Une table enregistrée dans Unity Catalog où les données résident dans un emplacement de stockage cloud externe. Unity Catalog gère les métadonnées et le contrôle d'accès, mais le cycle de vie des données est géré en dehors de Databricks. Consultez Utiliser des tables externes.

F

Feature Store

Un repository centralisé pour stocker, gérer et servir des fonctionnalités pour les modèles de machine learning. Voir Magasin de fonctionnalités Databricks.

affinement

Le processus consistant à prendre un modèle de machine learning pré-entraîné et à l'entraîner davantage sur un dataset plus petit et spécifique au domaine afin d'optimiser ses performances pour une application particulière. Voir Former des modèles d'IA et de ML.

flux

Un flux est un processus dans Lakeflow Pipelines qui lit les données, les transforme et les écrit vers une destination.

table externe

Une table en lecture seule dans Unity Catalog dont les données sont gérées par un catalogue en dehors de Unity Catalog, tel qu'AWS Glue ou Snowflake. Databricks utilise Lakehouse Federation pour récupérer les métadonnées et lire la table à partir du stockage d'objets. Consultez Travailler avec des tables étrangères.

modèles de fondation

Grands modèles de ML pré-entraînés dans l'intention d'être affinés pour des tâches plus spécifiques de compréhension et de génération de langage. Voir APIs du modèle de fondation Databricks.

G

Genie Code

Un partenaire IA autonome conçu spécifiquement pour le traitement des données dans Databricks. Genie Code est profondément intégré à Unity Catalog, et fournit une connaissance contextuelle de vos tables, colonnes et de votre traçabilité afin d’accélérer les tâches de données complexes et en plusieurs étapes. See Genie Code.

Genie Agent

Une fonctionnalité Databricks AI/BI qui permet aux équipes métier d'interagir avec leurs données en langage naturel. Les experts du domaine configurent les Agents Genie avec des datasets, des exemples de query et des directives afin que Genie puisse traduire les questions commerciales en query SQL. Voir Agents Genie.

Genie One

Une interface Databricks simplifiée, conçue pour les utilisateurs professionnels, offrant un point d'entrée unique pour interagir avec les tableaux de bord AI/BI, les agents Genie et les Databricks Apps sans naviguer dans les concepts techniques du Workspace. Voir Utiliser Genie One.

IA générative

Un type d'intelligence artificielle axé sur la capacité des ordinateurs à utiliser des modèles pour créer du contenu comme des images, du texte, du code et des données synthétiques. Les applications d'IA générative sont construites sur des modèles d'IA générative : les grands modèles de langage (LLM) et les modèles de fondation. Consultez l'article dédié au Machine Learning sur Databricks.

Dossiers Git

Un client Git visuel intégré au Workspace Databricks qui fournit des capacités de contrôle de version, de collaboration et de CI/CD pour les Notebooks et les fichiers. Anciennement connu sous le nom de Repos. Voir les dossiers Git Databricks.

I

inférence

Le processus d'utilisation d'un Modèle de machine learning entraîné pour générer des prédictions ou des résultats à partir de nouvelles données d'entrée. Databricks prend en charge l'inférence en temps réel et par batch via Model Serving. Consultez Déployer des modèles à l'aide de Model Serving.

script d’initialisation

Un script Shell qui s'exécute au Startup d'une ressource de compute Databricks. Les scripts d'initialisation peuvent installer des packages, modifier des configurations ou définir des variables d'environnement. Voir Que sont les scripts d'initialisation ?.

J

Job

L'unité principale pour la planification et l'orchestration des charges de travail de production sur Databricks. Les Jobs se composent d'une ou plusieurs tâches. See Lakeflow Jobs.

L

LakeFlow Connect

Propose des connecteurs intégrés pour l'ingestion à partir d'applications d'entreprise et de bases de données. Le pipeline d'ingestion résultant est régi par Unity Catalog et est alimenté par le compute serverless et LakeFlow Pipelines. Consultez les connecteurs gérés dans Lakeflow Connect.

Lakehouse Federation

La plateforme de fédération de requêtes pour Databricks. Le terme « fédération de query » décrit un ensemble de fonctionnalités qui permettent aux utilisateurs et aux systèmes d'exécuter des queries sur plusieurs sources de données sans qu'il soit nécessaire de migrer toutes les données vers un système unifié. Databricks utilise Unity Catalog pour gérer la fédération de requêtes. Voir Se connecter à des bases de données et catalogues externes.

Lakebase

Databricks Lakebase est une base de données OLTP intégrée à votre Lakehouse. Une base de données OLTP (traitement transactionnel en ligne) est un système de base de données spécialisé conçu pour gérer efficacement des volumes élevés de données transactionnelles en temps réel. Lakebase vous permet de créer une base de données OLTP sur Databricks et d’intégrer les charges de travail OLTP à votre Lakehouse.

Voir Lakebase Postgres.

Endpoint Lakebase

Un endpoint Lakebase est le point d'accès principal à la base de données pour votre base de données Lakebase Postgres. Chaque endpoint est identifié par un ID d'endpoint unique et opère au sein d'une seule région cloud. Un Endpoint peut être configuré en tant que compute unique ou avec une haute disponibilité, qui associe une instance de compute principale à une ou plusieurs instances de compute secondaires pour un basculement automatique. Vous vous connectez à votre base de données par les chaînes de connexion de l'endpoint.

Consultez Haute disponibilité.

Lakebase Change Data Feed (CDF)

Une fonctionnalité Lakebase qui stocke les changements au niveau des lignes à partir des tables Postgres en tant que tables Delta gérées par Unity Catalog. Chaque insertion, mise à jour et suppression est capturée à partir du log de pré-écriture et écrite comme une nouvelle ligne dans une table d'historique Delta, traitée par batch et vidée toutes les ~15 secondes. La destination a la même forme que Delta Change Data Feed, de sorte que les pipelines en aval, les vues matérialisées et les query d'audit peuvent consommer les changements opérationnels en mode natif. S'exécute dans le compute Lakebase sans nécessiter de pipelines externes. Voir Flux de données de modification Lakebase.

grand modèle de langage (LLM)

Un modèle de traitement du langage naturel (NLP) conçu pour des tâches telles que répondre à des questions ouvertes, le chat, la synthèse de contenu, l'exécution d'instructions quasi arbitraires, la traduction, et la génération de contenu et de code. Les LLM sont entraînés sur des datasets extrêmement volumineux à l'aide d'algorithmes sophistiqués de machine learning, grâce auxquels ils apprennent les motifs et les structures du langage humain. Consultez Créer des agents d’IA sur Databricks.

Bibliothèque

Un package de code disponible pour le Notebook ou le Job s'exécutant sur votre cluster. Les Databricks Runtime incluent de nombreuses bibliothèques, et vous pouvez également upload les vôtres. Voir Installer les bibliothèques.

clustering liquide

Une fonctionnalité d'optimisation du Layout des données Databricks pour les tables Delta et Iceberg qui fait du clustering des données de manière incrémentielle en fonction de colonnes spécifiées pour améliorer les performances des query. Contrairement au partitionnement traditionnel, le clustering liquide s'adapte aux modèles de données changeants. Consultez Utiliser le clustering liquide pour les tables.

M

table gérée

Une table dont les fichiers de données et les métadonnées sont tous deux entièrement managés par Unity Catalog. Les tables gérées sont toujours stockées au format Delta ou Iceberg et bénéficient d'une maintenance automatisée grâce à l'optimisation prédictive. Voir tables gérées du Unity Catalog pour Delta Lake et Apache Iceberg.

vue matérialisée

Une vue qui a été précalculée et stockée afin de pouvoir être interrogée avec une latence plus faible ou à plusieurs reprises sans calcul redondant. Consultez les vues matérialisées.

architecture en médaillon

Un schéma de conception de données utilisé pour organiser logiquement les données dans un lakehouse, dans le but d'améliorer progressivement et incrémentiellement la structure et la qualité des données à mesure qu'elles traversent chaque couche de l'architecture (des tables des couches Bronze, Silver et Gold). Qu'est-ce que l'architecture lakehouse en médaillon ?.

métastore

Le composant qui stocke toutes les informations de structure des différentes tables et partitions du data warehouse, y compris les informations sur les colonnes et les types de colonnes, les sérialiseurs et désérialiseurs nécessaires pour lire et écrire les données, ainsi que les fichiers correspondants où les données sont stockées. Voir Metastore.

Vue métrique

Un objet Unity Catalog qui fournit un moyen centralisé de définir et de gérer des métriques commerciales réutilisables. Les vues Indicateur séparent les définitions de mesure des regroupements de dimensions, vous permettant de définir des métriques une seule fois et de les query de manière flexible sur n'importe quelle dimension. Découvrez les vues de métriques de Unity Catalog.

MLflow

La plus grande plateforme d'ingénierie d'IA open source pour les agents, les LLM et les modèles ML. MLflow permet aux équipes de toutes tailles de déboguer, d'évaluer, de surveiller et d'optimiser leurs applications d'IA tout en contrôlant les coûts et en gérant l'accès aux modèles et aux données. MLflow sur Databricks est un service entièrement managé avec des fonctionnalités supplémentaires pour les clients d'entreprise, offrant un déploiement managé évolutif et sécurisé de MLflow. Consultez MLflow sur Databricks.

MLflow Tracing

Une fonctionnalité de MLflow pour GenAI qui offre une observabilité de bout en bout en enregistrant chaque étape qu'un agent ou une application d'IA effectue. Utilisez MLflow Tracing pour déboguer, surveiller et auditer le comportement des agents en développement et en production. Consultez MLflow Tracing - Observabilité GenAI.

Model Context Protocol (MCP)

Une norme open source qui connecte les agents d'IA à des outils, des ressources, des invites et d'autres informations contextuelles par le biais d'une interface standardisée. Databricks fournit des serveurs MCP gérés, externes et personnalisés. Consultez le Model Context Protocol (MCP) sur Databricks.

Model Training

Le processus d'entraînement de modèles de Machine Learning et de deep learning sur Databricks à l'aide de nombreuses bibliothèques open source populaires. Voir Former des modèles d'IA et de ML.

Mise à disposition de modèles

L'interface unifiée pour déployer, gouverner et query les modèles d'IA pour l'inférence en temps réel et par batch. Consultez Déployer des modèles à l'aide de Model Serving.

Entraînement de modèles Databricks

La fonctionnalité vous permet d'utiliser vos données pour personnaliser un modèle de fondation afin d'optimiser ses performances pour votre application spécifique. En effectuant l'affinement complet des paramètres ou en poursuivant l'entraînement d'un modèle de fondation, vous pouvez entraîner votre propre modèle en utilisant beaucoup moins de données, de temps et de ressources de compute que l'entraînement d'un modèle à partir de zéro. Voir l’**affinement** du modèle de fondation (obsolète).

N

Notebook

Une interface web interactive utilisée par les data scientists et les ingénieurs pour écrire et exécuter du code dans plusieurs langages (par exemple, Python, Scala, SQL) dans le même document. Consultez les notebooks Databricks.

O

OAuth

OAuth est un standard ouvert de délégation d'accès, couramment utilisé par les utilisateurs d'Internet pour accorder aux sites web ou aux applications l'accès à leurs informations sur d'autres sites web, mais sans leur communiquer les mots de passe. Consultez Autoriser l'accès aux ressources Databricks.

P

Partner Connect

Un programme Databricks qui fournit des intégrations maintenues par des éditeurs de logiciels indépendants pour se connecter à la plupart des systèmes de données d'entreprise. Reportez-vous à Qu'est-ce que Databricks Partner Connect ?.

jeton d'accès personnel (PAT)

Une chaîne de caractères utilisée pour authentifier un utilisateur lors de l'accès à un système informatique, au lieu d'un mot de passe. Consultez Autoriser l'accès aux ressources Databricks.

Photon

Un moteur de requête vectorisé hautes performances, natif de Databricks, qui exécute plus rapidement vos charges de travail SQL et vos appels d'API DataFrame afin de réduire votre coût total par charge de travail. Photon est compatible avec les APIs Apache Spark, il fonctionne donc avec votre code existant. Voir Qu'est-ce que Photon ?.

Optimisation prédictive

Une fonctionnalité Databricks qui identifie et exécute automatiquement des opérations de maintenance sur les tables gérées par Unity Catalog afin d'améliorer les performances des requêtes et de réduire les coûts de stockage. Consultez Optimisation prédictive pour les tables gérées par Unity Catalog.

Pipeline

Un graphe de tables, de vues, de vues matérialisées, de flux et de récepteurs qui sont mis à jour de manière différée selon un ordre de dépendance déterminé par le système.

R

génération augmentée de récupération (RAG)

Une technique qui permet à un grand modèle de langage (LLM) de générer des réponses enrichies en complétant l'invite d'un utilisateur avec des données d'appui récupérées d'une source d'information externe. En intégrant ces informations récupérées, le RAG permet au LLM de générer des réponses plus précises et de meilleure qualité par rapport à la non-augmentation de l'invite avec un contexte supplémentaire. Consultez RAG (Génération augmentée de récupération) sur Databricks.

S

schéma (Unity Catalog)

L'enfant d'un catalogue dans Unity Catalog qui peut contenir des tables, des vues, des volumes, des modèles et des fonctions. Un schéma est le deuxième niveau de l'espace de noms à trois niveaux d'Unity Catalog (catalogue.schéma.table, etc.). Consultez Qu'est-ce que Unity Catalog ?.

Compute serverless

Compute géré par Databricks, ce qui réduit la charge de gestion et fournit un compute instantané pour améliorer la productivité de l'utilisateur. Voir Se connecter au compute Serverless.

Service Principal

Une identité créée pour être utilisée avec des outils automatisés, des jobs en cours d'exécution et des applications. Vous pouvez restreindre l'accès d'un Service Principal aux Ressources à l'aide d'autorisations, de la même manière qu'un utilisateur Databricks. Contrairement à un utilisateur Databricks, un Service Principal est une identité uniquement API ; il ne peut pas accéder directement à l'interface utilisateur ou à la CLI de Databricks. See Service Principal.

puits (pipelines)

Un puits est une destination pour un flux qui écrit dans un système externe (par exemple, Kafka, Kinesis, Delta).

SQL Warehouse

Une ressource de compute qui vous permet d'interroger et d'explorer les données sur Databricks. Voir Se connecter à un SQL warehouse.

traitement de Stream

Une méthode de traitement des données qui vous permet de définir une query par rapport à un dataset illimité et en croissance continue, puis de traiter les données par petits batchs incrémentiels. Le traitement de flux Databricks utilise Structured Streaming. Consultez les concepts de Structured Streaming.

Streaming

Le streaming fait référence à tout contenu multimédia — en direct ou enregistré — (c'est-à-dire un Stream de données) diffusé sur les ordinateurs et les appareils mobiles via Internet et lu en temps réel. Consultez les concepts de Structured Streaming.

analytique en streaming

Le processus d'analyse des données générées en continu par différentes sources. Databricks prend en charge l'analytique en streaming via Structured Streaming, permettant le traitement et l'analyse de données en direct pour des insights en temps réel.

streaming structuré

Un moteur évolutif et tolérant aux pannes de traitement de Stream basé sur le moteur Spark SQL, permettant des calculs complexes en tant que queries de streaming. Consultez les concepts de Structured Streaming.

table de streaming

Une table gérée à laquelle un stream écrit. Voir Tables de streaming.

Tables système

Entrepôt de données analytiques hébergé par Databricks pour les données opérationnelles de votre compte, tels que les Logs d'audit, l'utilisation facturable et la lignée. Les tables système sont disponibles dans le catalogue system dans Unity Catalog. Consultez la référence des tables système.

table synchronisée

Une table synchronisée est une table Postgres en lecture seule d'Unity Catalog qui synchronise automatiquement les données d'une table Unity Catalog vers votre instance de base de données. Voir Servir les données lakehouse avec des tables synchronisées (Lakebase provisionné).

T

Table

Une table réside dans un schéma et contient des lignes de données. Toutes les tables créées dans Databricks utilisent Delta Lake par défaut. Les tables sauvegardées par Delta Lake sont aussi appelées tables Delta. Consultez les tables Databricks.

pipeline déclenché

Un pipeline qui ingère toutes les données disponibles au start de la mise à jour pour chaque table, s'exécutant dans l'ordre des dépendances, puis se terminant. Voir mode de pipeline Déclenché ou continu.

U

fonction définie par l'utilisateur (UDF)

Une fonction personnalisée créée par un utilisateur pour étendre les capacités intégrées de SQL ou d'un langage de programmation. Dans Databricks, les UDF peuvent être enregistrées dans Unity Catalog pour la gouvernance et la réutilisation dans les Workspaces. Consultez Que sont les fonctions définies par l'utilisateur (UDF) ?

Unity Catalog

Une fonctionnalité Databricks qui fournit des capacités centralisées de contrôle d'accès, d'audit, de lignage et de découverte des données à travers les workspaces Databricks. Voir Qu'est-ce que Unity Catalog ?

V

base de données vectorielle

Une base de données optimisée pour stocker et récupérer des embeddings. Les embeddings sont des représentations mathématiques du contenu sémantique des données, généralement des données textuelles ou d'image. Databricks fournit un index AI Search qui vous permet d'utiliser les fonctionnalités de base de données vectorielle sur vos tables Delta. Voir Databricks AI Search.

Afficher

Une table virtuelle définie par une requête SQL. Il ne stocke pas lui-même les données, mais offre un moyen de présenter les données d'une ou plusieurs tables, dans un format ou une abstraction spécifique. Consultez Qu’est-ce qu’une vue ?.

volumes (Unity Catalog)

Objets Unity Catalog qui permettent la gouvernance des datasets non tabulaires. Les volumes représentent un volume de stockage logique dans un emplacement de stockage d’objets cloud. Les volumes permettent d'accéder aux fichiers, de les stocker, de les gérer et de les organiser. Voir Qu'est-ce que les volumes Unity Catalog ?.

W

Tâches Lakeflow

L'ensemble d'outils qui vous permettent de planifier et d'orchestrer les tâches de traitement de données sur Databricks. See Lakeflow Jobs.

charge de travail

La quantité de capacité de traitement nécessaire pour effectuer une tâche ou un groupe de tâches. Databricks identifie deux types de charges de travail : le data engineering (Job) et l'analytique des données (tout usage). Consultez les composants Databricks.

Espace de travail

Un environnement organisationnel qui permet aux utilisateurs Databricks de développer, de parcourir et de partager des objets tels que des notebooks, des expérimentations, des queries et des tableaux de bord. Voir Interface utilisateur de workspace.

Z

Zerobus Ingest

Une API d'ingestion Serverless basée sur le push qui écrit directement les données dans des tables Delta gérées dans Unity Catalog. Zerobus Ingest monte automatiquement en charge avec les connexions entrantes, sans infrastructure de bus de messages, partitions ou brokers à gérer. Consultez la présentation du connecteur Zerobus Ingest.

Sur cette page