Pular para o conteúdo principal

Ingerir dados da Anysphere Organization

info

Beta

Esse recurso está em Beta. Os administradores do workspace podem controlar o acesso a esse recurso na página Previews . Consulte Gerenciar prévias do Databricks.

Esta página mostra como criar um pipeline de ingestão gerenciado da Organização Anysphere usando o Lakeflow Connect.

Requisitos

  • Para criar um pipeline de ingestão, primeiro você deve atender aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve estar habilitado para o seu workspace. Consulte Requisitos de compute serverless.

    • Para criar uma nova conexão, você deve ter privilégios CREATE CONNECTION no metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector for compatível com a criação de pipeline baseada em interface do usuário (UI), um administrador poderá criar a conexão e o pipeline ao mesmo tempo, concluindo os passos desta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • Você deve ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou o privilégio CREATE SCHEMA no catálogo de destino.

  • Para fazer a ingestão da Anysphere Organization, você deve primeiro configurar a autenticação do Databricks. Consulte Configurar a autenticação para a Anysphere Organization.

Criar um pipeline de ingestão

  1. Na barra lateral do workspace do Databricks, clique em Ingestão de dados .
  2. Na página Add data , em Databricks connectors , clique em Anysphere Organization .
  3. Na página Connection do assistente de ingestão, selecione a conexão que armazena suas credenciais de acesso da Anysphere Organization. Se você tiver o privilégio CREATE CONNECTION no metastore, poderá clicar em Ícone de mais. Create connection para criar uma nova conexão com os detalhes de autenticação em Criar uma conexão com a Anysphere Organization.
  4. Clique em Avançar .
  5. Na página Ingestion setup , insira um nome exclusivo para o pipeline.
  6. Selecione um catálogo e um esquema para gravar os logs de eventos. Se você tiver os privilégios USE CATALOG e CREATE SCHEMA no catálogo, poderá clicar em Ícone de mais. Criar esquema no menu suspenso para criar um novo esquema.
  7. Clique em Criar pipeline e continuar .
  8. Na página Source , selecione as tabelas para ingestão.
  9. Clique em Salvar e continuar .
  10. On the Destination page, select a catalog and a schema to load data into. If you have USE CATALOG and CREATE SCHEMA privileges on the catalog, you can click Ícone de mais. Create schema in the drop-down menu to create a new schema.
  11. Clique em Salvar e continuar .
  12. (Opcional) Na página Schedules and notifications , clique em Ícone de mais. programar . Defina a frequência para refresh as tabelas de destino.
  13. (Opcional) Clique em Ícone de mais. Adicionar notificação para definir notificações por email para o sucesso ou falha da operação do pipeline e, em seguida, clique em Salvar e executar o pipeline .

Exemplos

Use estes exemplos para configurar seu pipeline.

Ingerir o esquema inteiro

The following pipeline definition file ingests all supported Anysphere Organization tables into a destination schema:

YAML
resources:
pipelines:
anysphere_organization_pipeline:
name: anysphere_organization_pipeline
catalog: 'main'
target: 'anysphere_organization_data'
ingestion_definition:
connection_name: anysphere_organization_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'anysphere_organization_data'

Ingerir tabelas específicas

Ingest individual Anysphere Organization tables. For a full list of supported tables, see Supported source tables.

O seguinte arquivo de definição de pipeline ingere tabelas individuais da Anysphere Organization:

YAML
resources:
pipelines:
anysphere_organization_pipeline:
name: anysphere_organization_pipeline
catalog: 'main'
target: 'anysphere_organization_data'
ingestion_definition:
connection_name: anysphere_organization_connection
objects:
- table:
source_schema: 'default'
source_table: 'organization_groups'
destination_catalog: 'main'
destination_schema: 'anysphere_organization_data'
destination_table: 'organization_groups'
- table:
source_schema: 'default'
source_table: 'organization_group_members'
destination_catalog: 'main'
destination_schema: 'anysphere_organization_data'
destination_table: 'organization_group_members'
- table:
source_schema: 'default'
source_table: 'organization_members'
destination_catalog: 'main'
destination_schema: 'anysphere_organization_data'
destination_table: 'organization_members'

Arquivo de definição de job dos Pacotes de Automação Declarativa

YAML
resources:
jobs:
anysphere_organization_job:
name: anysphere_organization_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: anysphere_organization_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.anysphere_organization_pipeline.id}

Padrões comuns

Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.

Próximos passos

Começar, programar e definir alertas no seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.

Recursos adicionais