Aller au contenu principal

Notes de version de Databricks SQL 2021

Le texte suivant décrit les améliorations et les mises à jour de Databricks SQL de janvier à décembre 2021.

15 décembre 2021

  • Databricks SQL est désormais disponible de manière générale. Cela marque une étape majeure en vous offrant la première Plateforme lakehouse qui unifie les charges de travail de données, d'IA et de BI en un seul endroit. Avec la GA, vous pouvez vous attendre au plus haut niveau de stabilité, de support et de préparation à l'entreprise de Databricks pour les charges de travail stratégiques. Lisez le blog d'annonce de disponibilité générale pour en savoir plus.
  • Les alertes sont désormais planifiées indépendamment des requêtes. Lorsque vous créez une nouvelle alerte et une query, vous êtes invité à également créer un planning pour l'alerte. Si vous aviez une alerte existante, nous avons dupliqué le planning de la requête d'origine. Cette modification vous permet également de définir des alertes pour les requêtes **Exécuter en tant que propriétaire** et **Exécuter en tant qu'observateur**. Les requêtes **Exécuter en tant que propriétaire** s'exécutent selon la planification d'alerte désignée avec les identifiants du propriétaire de la requête. Les requêtes **Exécuter en tant qu'observateur** s'exécutent selon la planification d'alerte désignée avec les identifiants du créateur de l'alerte. Consultez les alertes Databricks SQL et planifiez une requête.
  • Vous pouvez désormais réorganiser les paramètres à la fois dans l'éditeur SQL et dans les tableaux de bord.
  • La documentation pour la création de visualisations de cartes thermiques a été étendue. Consultez les options de carte thermique.

9 décembre 2021

  • Lorsque vous créez une visualisation de tableau, vous pouvez désormais définir la couleur de la police pour une colonne sur une valeur statique ou une plage de valeurs basée sur les valeurs du champ de la colonne. La valeur littérale est comparée au threshold. Par exemple, pour coloriser les résultats dont les valeurs dépassent 500000, créez le threshold > 500000, plutôt que > 500,000. Consultez Mettre en forme conditionnellement les couleurs de colonne.
  • Les icônes dans le navigateur de schémas de l'éditeur SQL à onglets vous permettent désormais de distinguer les tables des vues.

1er décembre 2021

  • Vous pouvez maintenant appliquer les paramètres de configuration SQL au niveau du Workspace. Ces paramètres s'appliquent automatiquement à tous les SQL endpoints existants et nouveaux dans le Workspace. Consultez Configurer les paramètres SQL.

18 novembre 2021

  • Vous pouvez maintenant ouvrir l’éditeur SQL en utilisant un raccourci de la barre latérale. Pour ouvrir l'éditeur SQL, cliquez sur SQL Editor .
  • Si vous disposez des autorisations nécessaires pour créer des clusters Data Science & Data Engineering, vous pouvez désormais créer des SQL Endpoint en cliquant sur Créer dans la barre latérale, puis sur SQL Endpoint .
  • Les administrateurs peuvent désormais transférer la propriété d'une query, d'un tableau de bord ou d'une alerte à un autre utilisateur via l'interface utilisateur. Voir :
  • Transférer la propriété d'une query
  • Transférer la propriété d'un tableau de bord hérité.
  • Transférer la propriété d'une alerte

4 novembre 2021

  • Dans une visualisation carte (choroplèthe), le nombre maximal d'étapes de dégradé pour les couleurs de la légende a été augmenté de 11 à 20. Le default est de 5 étapes de dégradé, y compris la couleur minimale et la couleur maximale .
  • L'éditeur SQL à onglets prend désormais en charge la gestion groupée des onglets. Si vous cliquez avec le bouton droit sur un tab, vous verrez l'option Fermer les autres , Fermer à gauche , Fermer à droite et Tout fermer . Notez que si vous faites un clic droit sur le premier ou le dernier tab, vous ne verrez pas les options Fermer à gauche ou Fermer à droite .

28 octobre 2021

  • Lorsque vous affichez une table dans l'Explorateur de catalogues, vous disposez de deux options pour simplifier l'interaction avec la table :
  • Cliquez sur **Créer > Query** pour créer une query qui sélectionne toutes les colonnes et renvoie les 1000 premières lignes.
  • Cliquez sur Créer > Tableau de bord rapide pour ouvrir une page de configuration où vous pouvez sélectionner les colonnes d'intérêt et créer un tableau de bord ainsi que des queries complémentaires qui fournissent des informations de base en utilisant ces colonnes et présentent les parameters au niveau du tableau de bord et d'autres fonctionnalités.

19 octobre 2021

  • De nouveaux raccourcis clavier sont désormais disponibles dans l'éditeur à tab :

  • Ouvrir un nouveau tab :

    • Windows: Cmd+Alt+T
    • Mac : Cmd+Option+T
  • Fermer l'onglet actuel

    • Windows: Cmd+Alt+W
    • Mac : Cmd+Option+W
  • Ouvrir la boîte de dialogue de requête

    • Windows: Cmd+Alt+O
    • Mac : Cmd+Option+O

23 septembre 2021

  • Vous pouvez maintenant créer un nouveau tableau de bord en clonant un tableau de bord existant, à condition que vous disposiez des autorisations CAN RUN, CAN EDIT et CAN MANAGE sur le tableau de bord et toutes les query en amont. Consultez Cloner un tableau de bord hérité.
  • Vous pouvez désormais utiliser GROUP BY dans une visualisation avec plusieurs colonnes d'axe Y. Voir Nuage de points.
  • Vous pouvez maintenant utiliser {{ @@yPercent}} pour formater les étiquettes de données dans un graphique à barres empilées non normalisées. Consultez le graphique à barres.
  • Si vous utilisez l'authentification SAML et que vos informations d'identification SAML expirent dans quelques minutes, il vous est maintenant proactivement demandé de vous connecter à nouveau avant d'exécuter une query ou d'actualiser un tableau de bord. Cela permet d'éviter une disruption due à un identifiant qui expire pendant l'exécution de la query.

20 septembre 2021

  • Vous pouvez maintenant transférer la propriété des tableaux de bord, des queries et des alertes en utilisant l'API REST des autorisations. Veuillez consulter les ACL de query.

16 septembre 2021

  • Dans les résultats de query, BIGINT résultats sont maintenant sérialisés sous forme de chaînes de caractères lorsqu'ils sont supérieurs à 9 007 199 254 740 991. Ceci corrige un problème où les résultats BIGINT pouvaient être tronqués dans les résultats de query. Les autres résultats entiers sont toujours sérialisés sous forme de nombres. Le formatage des nombres sur les étiquettes d'axe et les infobulles ne s'applique pas aux résultats BIGINT qui sont sérialisés en chaînes de caractères. Pour plus d'informations sur les types de données dans Databricks SQL, consultez BIGINT type.

7 septembre 2021

Databricks déploie les changements qui suivent au cours d'une semaine. Votre Workspace pourrait ne pas être activé pour ces changements avant le 7 septembre.

  • Databricks SQL est maintenant en préversion publique et activé pour tous les utilisateurs dans les nouveaux workspaces.
remarque

Si votre workspace a été activé pour Databricks SQL pendant la prévisualisation publique — c'est-à-dire, avant la semaine commençant le 7 septembre 2021 — les utilisateurs conservent le droit attribué avant cette date, sauf si vous le modifiez. Autrement dit, si un utilisateur n'avait pas accès à Databricks SQL pendant l'aperçu public, il ne l'aura pas maintenant à moins qu'un administrateur ne le lui accorde.

  • Les administrateurs peuvent gérer les utilisateurs ayant accès à Databricks SQL en attribuant le droit d' accès à Databricks SQL (databricks-sql-access dans l'API) aux utilisateurs ou aux groupes. Par default, les nouveaux utilisateurs disposent de ce droit.

Les administrateurs peuvent limiter un utilisateur ou un groupe à l'accès uniquement à Databricks SQL et les empêcher d'accéder au Workspace en supprimant le droit Accès au Workspace (workspace-access dans l'API) de l'utilisateur ou du groupe. Par default, les nouveaux utilisateurs disposent de ce droit.

important

Pour vous connecter et accéder à Databricks, un utilisateur doit disposer de l'autorisation **Accès Databricks SQL** ou **Accès Workspace** (ou les deux).

  • Un petit classic SQL Endpoint appelé Starter Endpoint est préconfiguré sur tous les workspaces, afin que vous puissiez vous start à créer des tableaux de bord, des visualisations et des requêtes immédiatement. Pour gérer des charges de travail plus complexes, vous pouvez facilement augmenter sa taille (afin de réduire la latence) ou le nombre de clusters sous-jacents (afin de gérer davantage d'utilisateurs simultanés). Pour gérer les coûts, l'endpoint de démarrage est configuré pour s'arrêter après 120 minutes d'inactivité.

  • Si le compute Serverless est activé pour votre Workspace et que vous activez les SQL Endpoints Serverless, un SQL Endpoint Serverless appelé **Endpoint Serverless de démarrage** est automatiquement créé, et vous pouvez l'utiliser pour les tableaux de bord, les visualisations et les queries. Les Serverless SQL Endpoint démarrent plus rapidement que les SQL Endpoint classiques et se terminent automatiquement après 10 minutes d’inactivité.

  • Pour vous aider à démarrer rapidement, une nouvelle expérience d'intégration guidée est disponible pour les administrateurs et les utilisateurs. Le panneau d'intégration est visible par default et vous pouvez toujours voir le nombre de tâches d'intégration restantes dans la barre latérale. Cliquez sur tâches restantes pour rouvrir le panneau d'intégration.

  • Vous pouvez rapidement start à utiliser Databricks SQL avec deux riches datasets dans un catalogue en lecture seule appelé SAMPLES, qui est disponible depuis tous les Workspaces. Lorsque vous vous familiarisez avec Databricks SQL, vous pouvez utiliser ces schémas pour créer des requêtes, des visualisations et des tableaux de bord. Aucune configuration n'est requise, et tous les utilisateurs ont accès à ces schémas.

    • Le schéma nyctaxi contient des données de trajets de taxi dans la table trips.
    • Le schéma tpch contient des données sur les revenus de détail et la chaîne d'approvisionnement dans les tables suivantes :
      • customer
      • lineitem
      • nation
      • orders
      • part
      • partsupp
      • region
      • supplier

    Cliquez sur Exécuter votre première query dans le panneau d'intégration pour générer une nouvelle query du schéma nyctaxi.

  • Pour en savoir plus sur la visualisation des données dans Databricks SQL sans configuration requise, vous pouvez importer des tableaux de bord à partir de la Galerie d'exemples de tableau de bord. Ces tableaux de bord sont alimentés par les datasets du catalogue SAMPLES.

    Pour afficher la Galerie d'exemples de tableau de bord, cliquez sur Importer un exemple de tableau de bord dans le panneau d'intégration.

  • Vous pouvez désormais créer et supprimer des fonctions SQL natives à l'aide des commandes CREATE FUNCTION et DROP FUNCTION.

2 septembre 2021

  • Les utilisateurs disposant de la permission CAN EDIT sur un tableau de bord peuvent désormais gérer le refresh schedule et la liste d'abonnement du tableau de bord. Auparavant, l'autorisation CAN MANAGE était requise. Pour plus d'informations, consultez refresh automatiquement un tableau de bord.

  • Vous pouvez maintenant mettre en pause temporairement l'exportation planifiée vers les abonnés du tableau de bord sans modifier la planification. Auparavant, vous deviez supprimer tous les abonnés, désactiver la planification, puis recréer. Pour plus d'informations, consultez Mettre en pause temporairement les mises à jour planifiées des tableaux de bord.

  • By default, les visualisations ne se redimensionnent plus dynamiquement en fonction du nombre de résultats renvoyés, mais conservent la même hauteur quel que soit le nombre de résultats. Pour revenir au comportement précédent et configurer une visualisation pour qu'elle se redimensionne dynamiquement, activez **Redimensionner dynamiquement la hauteur du panneau** dans les paramètres de la visualisation dans le tableau de bord. Pour plus d'informations, consultez Options de table.

  • Si vous avez accès à plusieurs Workspace dans le même compte, vous pouvez changer de Workspace à partir de Databricks SQL. Cliquez sur Icône de compte dans le coin inférieur gauche de votre workspace Databricks, puis sélectionnez un workspace pour y passer.

30 août 2021

  • Les SQL endpoints serverless offrent un compute instantané, une gestion minimale et une optimisation des coûts pour les requêtes SQL.

    Jusqu'à présent, le calcul pour les SQL endpoints avait lieu dans le plan de calcul de votre compte AWS. La version initiale de serverless compute ajoute des Serverless SQL Endpoint à Databricks SQL, déplaçant ces ressources compute vers votre compte Databricks.

    Vous utilisez des entrepôts SQL serverless avec des requêtes Databricks SQL tout comme vous utilisez les SQL endpoints qui résident dans votre propre compte AWS, désormais appelés Classic SQL endpoints . Mais les SQL Warehouse Serverless start généralement avec une faible latence par rapport aux SQL Endpoint classiques, sont plus faciles à gérer et sont optimisés en termes de coût.

    Avant de pouvoir créer des SQL Warehouse Serverless, un administrateur doit activer l'option Serverless SQL Endpoint pour votre Workspace. Une fois activés, les nouveaux SQL endpoints sont Serverless par default, mais vous pouvez continuer à créer des SQL endpoints en tant que Serverless ou Classic comme vous le souhaitez.

    Pour plus de détails sur l'architecture de compute Serverless et les comparaisons avec le plan de compute classique, consultez Plan de compute Serverless. Pour plus de détails sur la configuration des SQL Warehouse Serverless — y compris la conversion des SQL Endpoint Classic en Serverless — consultez Configurer les SQL Warehouse Serverless.

    Pour la liste des régions prises en charge pour les SQL Warehouse Serverless, consultez les cloud et régions Databricks.

important

Le Compute Serverless est soumis aux conditions applicables qui doivent être acceptées par un propriétaire de compte ou un administrateur de compte afin d'activer la fonctionnalité.

12 août 2021

  • Vous pouvez désormais envoyer une mise à jour planifiée du tableau de bord à des adresses e-mail qui ne sont pas associées à des comptes Databricks. Lorsque vous consultez un tableau de bord, cliquez sur Planifié pour afficher ou mettre à jour la liste des adresses e-mail abonnées. Si une adresse e-mail n'est pas associée à un compte Databricks, elle doit être configurée comme destination de notification. Pour plus d'informations, consultez refresh automatiquement un tableau de bord.

  • Un administrateur peut désormais mettre fin à la requête d’un autre utilisateur pendant son exécution. Pour plus d’informations, consultez Mettre fin à une query en cours d’exécution.

5 août 2021

29 juillet 2021

  • Gérer plusieurs queries est devenu plus facile grâce à la prise en charge de plusieurs tabs dans l'éditeur de query. Pour utiliser l’éditeur à tab, consultez la section Modifier plusieurs queries.

8 juillet 2021

  • Les widgets de visualisation dans les tableaux de bord ont désormais des titres et des descriptions afin que vous puissiez adapter le titre et la description des visualisations utilisées dans plusieurs tableaux de bord au tableau de bord lui-même.
  • La barre latérale a été mise à jour pour une meilleure visibilité et navigation :
    • Warehouses sont désormais des SQL Endpoints et History est renommée en Query History.
    • Les paramètres du compte (anciennement appelés Utilisateurs ) ont été déplacés vers Icône de compte SQL Compte . Lorsque vous sélectionnez Compte , vous pouvez modifier l’ workspace Databricks et vous déconnecter.
    • Les paramètres utilisateur ont été déplacés vers Icône des paramètres utilisateur **Paramètres** et ont été divisés en **Paramètres** et **Console d'administration SQL**. La Console d'administration SQL n'est visible que par les administrateurs.
    • L'icône d'aide est passée à Icône d'aide Aide .

1er juillet 2021

  • Le nouvel explorateur de catalogues vous permet d'explorer et de gérer facilement les autorisations sur les bases de données et les tables. Les utilisateurs peuvent consulter les détails du schéma, prévisualiser les données d'échantillon et voir les détails et les propriétés des tables. Les administrateurs peuvent afficher et modifier les propriétaires d'objets de données, et les propriétaires d'objets de données peuvent accorder et révoquer des autorisations. Pour plus de détails, consultez Qu’est-ce que Catalog Explorer ?.
  • Les axes Y des graphiques horizontaux ont été mis à jour afin de refléter le même ordre que dans les tables. Si vous avez précédemment sélectionné l'ordre inverse, vous pouvez utiliser le bouton bascule Ordre inverse sur la tab de l'axe des Y pour inverser le nouvel ordre.

23 juin 2021

  • Les vues temporaires sont désormais prises en charge.

17 juin 2021

  • Photon, le nouveau moteur d'exécution vectorisé de Databricks, est maintenant activé par default pour les nouveaux SQL Endpoints créés (UI et API REST). Photon accélère de manière transparente

    • Gravures sur les tables Parquet et Delta.
    • Nombreuses requêtes SQL. Consulter Limitations.
  • Gérez facilement les utilisateurs et les groupes avec les commandes CREATE GROUP, DROP GROUP, ALTER GROUP, SHOW GROUPS et SHOW USERS. Pour plus de détails, consultez Instructions de sécurité et Instructions SHOW.

  • Le navigateur de schéma de l'éditeur de query schema browser est plus réactif et plus rapide sur les schémas comportant plus de 100 tables. Sur ces schémas, le navigateur de schéma ne chargera pas toutes les colonnes automatiquement ; la liste des tables s'affiche toujours comme d'habitude, mais les colonnes ne se chargent que lorsque vous cliquez sur une table. Ce changement affecte l'autocomplétion des query dans l'éditeur de query, car il dépend de ces informations pour afficher des suggestions. Jusqu'à ce que vous développiez une table et chargiez ses colonnes, ces suggestions ne sont pas disponibles.

3 juin 2021

  • Les administrateurs des workspaces Databricks nouvellement activés reçoivent désormais le droit Databricks SQL par default et ne sont plus tenus de s'octroyer le droit d'accès Databricks SQL à l'aide de la console d'administration.
  • Photon est désormais en aperçu public et activé par default pour les nouveaux SQL Endpoints.
  • L'équilibrage de charge multi-clusters est désormais en aperçu public.
  • Vous pouvez maintenant activer la collaboration sur les tableaux de bord et les queries avec d’autres membres de votre organisation à l’aide de l’autorisation CAN EDIT. Voir les listes de contrôle d'accès.

26 mai 2021

  • L'Analytique SQL est renommée en Databricks SQL. Ce changement a les conséquences suivantes pour les clients :

    • Les références dans l'interface utilisateur web ont été mises à jour.

    • L’autorisation d’accès à Databricks SQL a été renommée :

      • UI : Accès Databricks SQL (précédemment Accès SQL Analytique )
      • SCIM API : databricks-sql-access (précédemment sql-analytics-access)

      Les utilisateurs, les groupes et les Service Principals dotés de l'ancien droit ont été migrés vers le nouveau droit.

    • Les tags pour les événements du journal d'audit liés à Databricks SQL ont changé :

      • Le préfixe des événements Databricks SQL est maintenant databrickssql.
      • changeSqlAnalyticsAcl est maintenant changeDatabricksSqlAcl.
  • Mises à jour du tableau de bord

    • Le nom de fichier d'exportation du tableau de bord a été mis à jour pour être le nom du tableau de bord + le timestamp, plutôt qu'un UUID.

    • La limite des enregistrements d'exportation a été relevée de 22 000 à 64 000.

    • Les auteurs de tableaux de bord ont désormais la possibilité d'exporter et d'envoyer périodiquement par e-mail des instantanés de tableaux de bord. Les instantanés de tableau de bord sont pris à partir de l'état par default du tableau de bord, ce qui signifie que toute interaction avec les visualisations ne sera pas présente dans l'instantané.

      • Si vous êtes le propriétaire d'un tableau de bord, vous pouvez créer un refresh schedule et abonner d'autres utilisateurs, qui recevront des instantanés du tableau de bord par e-mail chaque fois qu'il est refresh.
      • Si vous disposez d'une autorisation d'affichage pour un tableau de bord, vous pouvez vous abonner aux fréquences de refresh existantes.

      Consultez Abonnements aux instantanés du tableau de bord.

    • Les expressions de prédicat pushdown (StartsWith, EndsWith, Contains, Not(EqualTo()) et DataType) sont désactivées pour AWS Glue Catalog car elles ne sont pas prises en charge.

13 mai 2021

  • Databricks SQL n'essaie plus de deviner les types de colonnes. Auparavant, une colonne au format xxxx-yy-dd était automatiquement traitée comme une date, même s’il s’agissait d’un code d’identification. Désormais, cette colonne n'est plus automatiquement traitée comme une date. Vous devez spécifier cela dans la query si vous le souhaitez. Cette modification peut entraîner que certaines visualisations qui reposaient sur le comportement précédent ne fonctionnent plus. Dans cette version, vous pouvez modifier Icône des paramètres utilisateur l'option > **Paramètres** > **Rétrocompatibilité** pour revenir au comportement précédent. Dans une future version, nous supprimerons cette fonctionnalité.

  • L'éditeur de query dispose désormais d'un indicateur de progression des queries. Les changements d'état sont désormais visibles dans une barre de progression continuellement mise à jour.

    Barre de progression

Problèmes résolus

  • Éditeur SQL. L'éditeur SQL conservera désormais le texte sélectionné et la position de défilement lors du basculement entre les onglets de requête.
  • Éditeur SQL. Si vous cliquez sur « Exécuter » sur une query dans l'éditeur SQL, puis naviguez vers une autre page et revenez pendant que la query est toujours en cours d'exécution, l'éditeur affichera l'état correct de la query. Si la query se termine pendant que vous êtes sur une autre page, les résultats de la query seront disponibles au retour sur la page de l'éditeur SQL.
  • Vous pouvez maintenant utiliser MySQL 8.0 comme métastore externe.
  • DESCRIBE DETAIL les commandes sur les tables Delta ne échouent plus avec java.lang.ClassCastException: java.sql.Timestamp cannot be cast to java.time.Instant.
  • La lecture des fichiers Parquet avec des Timestamp INT96 ne se solde plus par un échec.
  • Lorsqu'un utilisateur dispose de l'autorisation CAN RUN sur une query et l'exécute, si la query a été créée par un autre utilisateur, l'historique des queries affiche l'exécutant de la query comme étant cet utilisateur.
  • Les valeurs nulles sont désormais ignorées lors du rendu d'un graphique, ce qui améliore l’ergonomie des graphiques. Par exemple, auparavant, les barres d'un graphique à barres semblaient très petites lorsque des valeurs nulles étaient présentes. Désormais, les axes sont définis uniquement en fonction des valeurs non nulles.