Pular para o conteúdo principal

Configure uma fonte de dados Parquet para ingestão do Microsoft Dynamics 365

info

Beta

A ingestão de Parquet está em Beta.

Saiba como configurar o Microsoft Dynamics 365 como uma fonte de dados para ingestão no Databricks usando o Lakeflow Connect quando seus dados forem exportados como Parquet. Este fluxo de trabalho usa um workspace do Azure Synapse Analytics e um pool do Apache Spark para exportar tabelas do Dataverse como tabelas Delta no formato Parquet e, em seguida, configura a autenticação que o Databricks usa para lê-las.

nota

Esta página aborda o fluxo de trabalho Parquet , que requer um workspace do Azure Synapse Analytics e um pool do Apache Spark. A exportação Parquet usa a exportação Delta Lake do Azure Synapse Link para o ADLS Gen2, que não é o mesmo que o Microsoft Fabric Link. O conector não oferece suporte ao Fabric Link. Se o seu Azure Synapse Link exportar dados como CSV, use Configurar fonte de dados para ingestão do Microsoft Dynamics 365 em vez disso.

Para obter informações sobre como o conector acessa seus dados de origem, consulte Como o conector acessa os dados do D365?. Para obter uma lista de aplicativos Dataverse compatíveis, consulte Quais aplicativos Dynamics 365 são compatíveis?.

Pré-requisitos

Antes de configurar a fonte de dados do Dynamics 365, você deve ter:

  • Uma inscrição ativa do Azure com permissões para criar recursos.
  • Um ambiente do Microsoft Dynamics 365 com acesso de administrador.
  • Um ambiente do Dataverse associado à sua instância do Dynamics 365.
  • Permissões de administrador de workspace ou administrador de metastore no Databricks.
  • Permissões para criar e configurar o Azure Synapse Link em seu ambiente Dataverse.
  • Permissões para criar um workspace do Azure Synapse Analytics e um pool do Apache Spark.
  • Uma account de armazenamento ADLS Gen2 (ou permissões para criar uma).
  • Permissões para criar e configurar aplicações Microsoft Entra ID.
  • API do Dataverse v9.2 ou posterior.
  • Versão 2021-08-06 da API REST do Azure Storage.
  • Azure Synapse Link para Dataverse versão 1.0 ou posterior.

Criar um workspace do Azure Synapse Analytics

O workspace do Synapse Analytics hospeda o pool do Apache Spark que o Azure Synapse Link usa para exportar suas tabelas do Dataverse como Parquet.

  1. No portal do Azure, vá para Azure Synapse Analytics e clique em Criar .
  2. Selecione a inscrição, o grupo de recursos e a conta do Data Lake Storage Gen2 para associar ao workspace.
  3. Selecione Assign myself the Storage Blob Data Contributor role on the Data Lake Storage Gen2 account to interactively query in the workspace .
  4. Na tab Segurança , em Método de autenticação , selecione Usar apenas autenticação do Microsoft Entra ID .
  5. Clique em Revisar + Criar e, em seguida, clique em Criar .
  6. Aguarde a conclusão da implantação antes de continuar.

Criar um pool do Apache Spark

O Azure Synapse Link usa um pool do Apache Spark para gravar as tabelas Delta em formato Parquet exportadas.

  1. Na página Visão geral do workspace, clique em Novo pool do Apache Spark .
  2. Forneça um nome para o pool.
  3. Para datasets grandes, aumente o Tamanho do nó para Large e defina o Número de nós para 10 . Você não precisa de nenhuma configuração adicional.
  4. Clique em Revisar + Criar e, em seguida, clique em Criar .

Nesta etapa, você usa o Azure Synapse Link para escolher as tabelas que deseja ingerir e exportá-las como Parquet através do Spark pool.

Configurar entidades virtuais ou tabelas diretas (opcional)

Entidades virtuais e tabelas diretas disponibilizam dados de fontes que não sejam Dataverse (como Dynamics 365 Finance & Operations) no Dataverse sem copiar os dados. Para fontes que não sejam Dataverse, você deve configurar entidades virtuais ou tabelas diretas antes de configurar o Azure Synapse Link.

Para configurar entidades virtuais:

  1. No Power Apps , vá para a página Ambientes e clique em Aplicativos do Dynamics 365 .
  2. Para link entidades do F&O como entidades virtuais no Dataverse, instale a solução Finance and Operations Virtual Entity .
  3. Configure a autorização de serviço para serviço (S2S) entre o Dataverse e seu aplicativo F&O. Com esta autorização, o Dataverse pode se comunicar com seu aplicativo. Para obter detalhes, consulte a documentação da Microsoft Configurar entidades virtuais do Dataverse.
  4. Para cada entidade virtual que você deseja ingerir, ative Track Changes em Advanced Properties .
  5. Por default, a solução F&O Virtual Entity expõe algumas entidades virtuais na lista de tabelas do Dataverse. No entanto, você pode expor entidades adicionais manualmente:
    1. Vá para a página Configurações avançadas do seu ambiente do Dataverse.
    2. Clique no ícone de filtro no canto superior direito para acessar a pesquisa avançada.
    3. Selecione Available Finance and Operações Entities no menu suspenso e clique em Results .
    4. Selecione a entidade virtual que você deseja expor.
    5. Na página Entity Admin , alterne Visible para True e, em seguida, clique em Save and Close .

Agora você pode ver a entidade na lista de tabelas do Dataverse com um nome que começa com mserp_.

importante

Entidades virtuais e tabelas diretas aparecem no Azure Synapse Link somente após o Dataverse terminar de sincronizá-las. Isso geralmente leva até 15 minutos, mas pode levar até 30. Se as tabelas estiverem ausentes após 30 minutos, consulte Virtual entities not appearing in schema discovery.

  1. Vá para make.powerapps.com e clique em Tabelas .

  2. Na parte superior da página, clique em Analyze e, em seguida, em Azure Synapse Link .

  3. Clique em New Link .

  4. Selecione a caixa de seleção Connect to your Azure Synapse Analytics workspace e, em seguida, preencha os detalhes. Selecione o Pool do Apache Spark e a account de armazenamento que você criou nos os passos anteriores. Selecionar esta caixa de seleção é o que exporta seus dados como Parquet, e não há uma opção separada de formato de exportação para definir.

  5. Selecione a tabela ou as tabelas que deseja sincronizar.

    • Se estiver fazendo a ingestão a partir de um aplicativo nativo do Dataverse, selecione as tabelas relevantes do Dataverse diretamente na seção Dataverse .
    • Se estiver ingerindo do F&O, você pode selecionar tabelas diretas na seção D365 Finance & Operations ou entidades virtuais na seção Dataverse (prefixo mserp_). Para obter mais informações sobre entidades virtuais, consulte Configurar entidades virtuais ou tabelas diretas (opcional).
  6. Clique em Salvar e aguarde a conclusão da sincronização inicial.

    O Synapse Link grava cada tabela como uma tabela Delta em formato Parquet sob <profileRoot>/deltalake/<tableName>/ na account de armazenamento ADLS Gen2 associada.

  7. Para ver a exportação, clique em Ir para o Azure Synapse Analytics Workspace .

nota

Para usuários do F&O, essa sincronização inicial pode levar horas para tabelas grandes com centenas de gigabytes.

Configurar autenticação para o Databricks

Você deve configurar a autenticação como default, com base na sua configuração do Dynamics. Neste o passo, você coleta o Microsoft Entra ID e os detalhes de armazenamento necessários para criar uma conexão do Unity Catalog e, em seguida, concede à aplicação do Microsoft Entra ID acesso às tabelas Delta em formato Parquet exportadas.

Coletar detalhes do Entra ID e de armazenamento

  1. Colete o ID do tenant do seu tenant do Entra ID (portal.azure.com >> Microsoft Entra ID >> tab Visão geral >> ID do tenant , listado no painel à direita).
  2. Ao criar um Azure Synapse Link, o Azure Synapse cria um contêiner ADLS na account de armazenamento associada para as tabelas Delta em formato Parquet exportadas. Localize o nome do contêiner ADLS visitando a Página de Administração do Synapse Link.
  3. Colete o nome da conta do Azure Storage da conta de armazenamento associada ao workspace.
  4. Colete as credenciais de acesso para o contêiner ADLS.
    1. Crie um aplicativo Microsoft Entra ID, caso ainda não tenha um.
    2. Colete o segredo do cliente .
    3. Colete o App ID (portal.azure.com >> Microsoft Entra ID >> Gerenciar >> App Registrations ).

Conceda à aplicação Entra ID acesso ao armazenamento

Conceda ao aplicativo do Entra ID acesso ao contêiner do ADLS, caso ainda não o tenha feito.

nota

Verifique se o seu aplicativo do Entra ID tem acesso aos containers ADLS associados a cada perfil do Synapse Link. Se você estiver ingerindo dados de vários ambientes ou aplicativos, confirme se o aplicativo tem atribuições de função em todos os containers relevantes.

  1. Vá para Azure Storage Accounts e selecione seu contêiner ou conta de armazenamento. (O Databricks recomenda o nível de contêiner para manter o menor privilégio.)
  2. Clique em Controle de Acesso (IAM) e, em seguida, em Adicionar atribuição de função .
  3. Selecione a função de acesso Storage Blob Data Contributor → Read/Write/Delete. Se sua organização não permitir isso, entre em contato com sua equipe de conta da Databricks.
  4. Clique em Avançar e, em seguida, em Selecionar membros .
  5. Selecione User, group, or service principal e, em seguida, Search for your App Registration . (Se o aplicativo não estiver presente no resultado da pesquisa, você pode inserir explicitamente o ID do objeto na barra de pesquisa e, em seguida, pressionar Enter ).
  6. Clique em Review + Assign (Revisar + Atribuir).
  7. Para confirmar se as permissões estão configuradas corretamente, você pode verificar o Access Control do seu contêiner.

Passos seguintes

Após configurar a fonte de dados Parquet, crie uma conexão e um pipeline de ingestão no Databricks: