Types de SQL Warehouse
Databricks SQL prend en charge les types serverless, pro et classic. Cet article présente les fonctionnalités disponibles pour chaque type et compare les performances et les fonctionnalités.
De plus, Lakehouse Real-Time (Bêta) est un type spécialisé de warehouse serverless pour les requêtes en lecture à high concurrency en moins d'une seconde. Consultez les entrepôts SQL Lakehouse Real-Time.
Capacités de performance par type
Chaque type de SQL Warehouse a des capacités de performance différentes. Le tableau suivant présente les fonctionnalités de performance prises en charge par chaque type de SQL Warehouse.
Type de warehouse | Moteur Photon | E/S prédictives | Gestion intelligente des charges de travail |
|---|---|---|---|
Serverless | ✓ | ✓ | ✓ |
Pro | ✓ | ✓ | |
Classique | ✓ |
La liste suivante décrit chaque fonctionnalité de performance :
-
Photon : Le moteur de query vectorisé intégré à Databricks. Il accélère vos appels SQL et DataFrame API existants et réduit votre coût total par charge de travail.
-
**Predictive IO** : Une suite de fonctionnalités pour accélérer les Opérations de balayage sélectif dans les query SQL. Les E/S prédictives peuvent fournir un large éventail d'accélérations.
-
Gestion intelligente de la charge de travail (IWM) : Un ensemble de fonctionnalités qui améliore la capacité de Databricks SQL Serverless à traiter un grand nombre de queries rapidement et de manière rentable. À l’aide de techniques de prédiction basées sur l’IA et de gestion dynamique, IWM s’assure que les charges de travail disposent rapidement de la quantité appropriée de Ressources. La principale différence réside dans les capacités d’IA de Databricks SQL à répondre dynamiquement aux demandes de charge de travail plutôt que d’utiliser des thresholds statiques.
Pour connaître les tarifs de chaque type de warehouse et une comparaison détaillée des fonctionnalités, consultez Databricks SQL. Pour en savoir plus sur les dernières fonctionnalités de Databricks SQL, consultez les Notes de version de Databricks SQL.
Différences de performances entre les types de SQL Warehouse
Chaque type de SQL Warehouse possède des caractéristiques de performance différentes.
Serverless SQL Warehouse
En utilisant l’ architecture serverless de Databricks, un SQL Warehouse Serverless prend en charge toutes les fonctionnalités de performance de Databricks SQL. Avec un SQL Warehouse Serverless et ses fonctionnalités de performance, vous obtenez :
- Temps de Startup rapide (généralement entre 2 et 6 secondes).
- Mise à l'échelle rapide pour acquérir plus de compute lorsque nécessaire afin de maintenir une faible latence.
- L'admission de la query est plus proche de la limitation du matériel que de la machine virtuelle.
- Réduction rapide de l'échelle pour minimiser les coûts lorsque la demande est faible, offrant des performances constantes avec des coûts et des ressources optimisés.
Choisissez un SQL Warehouse Serverless pour les meilleures performances au Startup, les E/S les plus efficaces, une gestion plus intelligente de la demande de requêtes qui varie considérablement dans le temps, et un autoscaling rapide en cas de mise en file d'attente des requêtes. Voir Gestion intelligente des Workload et mise à l'échelle automatique.
Un SQL Warehouse serverless fonctionne bien avec ces types de workloads :
- etl
- Business Intelligence
- Analyse exploratoire
Les SQL Warehouse ne prennent pas en charge la transmission des identifiants. Databricks recommande d'utiliser Unity Catalog pour la gouvernance des données. Consultez Qu'est-ce que Unity Catalog ?.
SQL Warehouses Pro
Un pro SQL warehouse prend en charge Photon et Predictive IO, mais pas la gestion intelligente des Workload. Avec un pro SQL warehouse (contrairement à un Serverless SQL warehouse), la couche de compute existe dans votre compte AWS plutôt que dans votre compte Databricks. Sans gestion intelligente des Workload, les warehouse sont moins réactifs aux demandes de query qui varient considérablement au fil du temps et ne peuvent pas monter en charge automatiquement aussi rapidement qu'un SQL Warehouse Serverless. Un SQL Warehouse Pro prend plusieurs minutes à démarrer (généralement environ 4 minutes) et monte et descend en charge avec moins de réactivité qu'un SQL Warehouse Serverless. Voir Logique de mise en file d'attente et de mise à l'échelle automatique.
Utilisez un SQL Warehouse Pro quand :
- Les SQL Warehouse Serverless ne sont pas disponibles dans une région.
- Vous disposez d'un réseau personnalisé et souhaitez vous connecter à des bases de données de votre réseau dans le cloud ou on-premise pour une fédération ou une architecture de type hybride. Par exemple, utilisez un SQL Warehouse professionnel si vous souhaitez intégrer d'autres services à votre réseau, tels qu'un bus d'événements ou des bases de données, ou si vous souhaitez connecter votre réseau à votre réseau on-premise.
Warehouses SQL classiques
Un SQL warehouse classique prend en charge Photon mais ne prend pas en charge les E/S prédictives ou la Gestion intelligente des Workload. Avec un SQL Warehouse classique (contrairement à un SQL Warehouse Serverless), la couche compute existe dans votre compte AWS plutôt que dans votre compte Databricks. Sans la prise en charge de Predictive IO ou de la gestion intelligente des Workload, un SQL Warehouse classique n'offre qu'une performance d'entrée de gamme et moins de performance qu'un SQL Warehouse serverless ou Pro. Un SQL Warehouse classique prend également plusieurs minutes pour start (généralement environ 4 minutes) et s'adapte à la hausse et à la baisse avec moins de réactivité qu'un SQL Warehouse Serverless. Voir Logique de mise en file d'attente et de mise à l'échelle automatique.
Utilisez un SQL warehouse classique pour exécuter des requêtes interactives pour l'exploration de données avec des performances d'entrée de gamme et des fonctionnalités Databricks SQL.
Pour des informations sur le dimensionnement de votre SQL Warehouse et la façon dont il s'adapte en réponse à la mise en file d'attente des queries, consultez Logique de mise en file d'attente et d'auto-mise à l'échelle.
Lakehouse Real-Time SQL Warehouse
Bêta
Lakehouse Real-Time (Lakehouse//RT) est en version bêta.
Lakehouse Real-Time (Lakehouse//RT) est un type de warehouse Serverless conçu pour les charges de travail à faible latence et à high concurrency. Il fournit des queries SQL de lecture en sub-seconde sur les tables Unity Catalog, ce qui le rend adapté à la fourniture de données analytiques aux applications, à l'exécution d'analytiques opérationnelles et à l'alimentation de tableaux de bord BI avec des centaines à des milliers d'utilisateurs simultanés.
Lakehouse//RT ne prend en charge que les requêtes (SELECT). Pour plus de détails, les exigences et les limitations, consultez Lakehouse Real-Time.
Quelles sont les valeurs par default du type de warehouse ?
Pour les Workspace dans les régions qui prennent en charge les SQL Warehouse Serverless et satisfont les exigences:
-
Via l'interface utilisateur, le type de SQL Warehouse par default est serverless.
- Si votre compte nécessite une mise à jour des conditions d'utilisation, les administrateurs du Workspace sont invités à agir dans l'interface utilisateur de Databricks SQL.
-
En utilisant l'API des SQL Warehouses avec des paramètres par default, le type de SQL Warehouse par default est classique. Pour utiliser Serverless, définissez le parameter
enable_serverless_computesurtrueetwarehouse_typesurpro. Si ce Workspace a utilisé l’API SQL warehouses pour créer un warehouse entre le 1er septembre 2022 et le 30 avril 2023, et qu’il répond aux exigences des SQL warehouses Serverless, le default reste défini surtrue. Pour éviter toute ambiguïté, en particulier pour les organisations ayant de nombreux Workspace, Databricks recommande de toujours configurer ce champ. -
Si le Workspace utilise un Hive metastore externe hérité, les SQL Warehouses serverless ne sont pas pris en charge. Le type de SQL Warehouse par default est le même que si le compute serverless était désactivé, c’est-à-dire pro dans l’interface utilisateur et classique via l’API. Contactez également votre équipe de compte Databricks pour en savoir plus sur Unity Catalog ou d'autres options.
Pour les Workspace qui ne prennent pas en charge les SQL Warehouse Serverless :
- Dans l'interface utilisateur, le type de SQL Warehouse default est Pro.
- En utilisant l'API SQL Warehouse avec des parameters par default, le type de SQL Warehouse par default est classique.
Si votre compte nécessite une mise à jour des conditions d'utilisation, les administrateurs du Workspace sont invités à agir dans l'interface utilisateur de Databricks SQL.