Ingerir dados do Atlassian
Beta
Esse recurso está em Beta. Para usá-lo, o administrador do workspace deve ativar o Lakeflow Connect for Atlassian Audit Logs na página Pré-visualizações . Consulte Gerenciar prévias do Databricks.
Create a managed Atlassian Audit Logs ingestion pipeline in Lakeflow Connect to ingest organization audit log events into Databricks.
Requisitos
-
Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:
-
Seu workspace deve estar habilitado para o Unity Catalog.
-
O compute serverless deve estar habilitado para o seu workspace. Consulte Requisitos de compute serverless.
-
To create a new connection, you must have
CREATE CONNECTIONprivileges on the metastore. See Manage privileges in Unity Catalog.If the connector supports UI-based pipeline authoring, an admin can create the connection and the pipeline at the same time by completing os passos on this page. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.
-
Para usar uma conexão existente, você deve ter os privilégios
USE CONNECTIONouALL PRIVILEGESno objeto de conexão. -
Você deve ter privilégios
USE CATALOGno catálogo de destino. -
Você deve ter os privilégios
USE SCHEMAeCREATE TABLEem um esquema existente ou privilégiosCREATE SCHEMAno catálogo de destino.
-
-
Para fazer a ingestão do Atlassian, primeiro configure a autenticação do Databricks e crie uma conexão. Consulte Configure authentication to Atlassian e Create an Atlassian Audit Logs connection.
Opções do conector
A opção de conector Atlassian Audit Logs é em nível de pipeline. Defina-o no bloco source_configurations da sua definição de pipeline. Consulte Exemplos para ver o uso.
Opção | Obrigatório | Aplica-se a | Descrição |
|---|---|---|---|
| Não | Todas as tabelas | O início da janela de preenchimento inicial, como um timestamp ISO 8601 (por exemplo, |
Criar um pipeline de ingestão
Para ver a lista de tabelas de origem com suporte, consulte Tabelas de origem com suporte.
- Databricks UI
- Declarative Automation Bundles
- Databricks notebook
- Na barra lateral do workspace do Databricks, clique em Ingestão de dados .
- On the Add data page, under Databricks connectors , click Atlassian Audit Logs .
- On the Connection page of the ingestion wizard, select the connection that stores your Atlassian credentials. If you have the
CREATE CONNECTIONprivilege on the metastore, clickCreate connection to create a connection with the credentials from Configure authentication to Atlassian.
- Clique em Avançar .
- Na página Ingestion setup , insira um nome para o pipeline.
- Selecione um catálogo e um esquema para gravar logs de eventos. Se você tiver os privilégios
USE CATALOGeCREATE SCHEMAno catálogo, clique emCreate schema no menu suspenso para criar um esquema.
- Clique em Criar pipeline e continuar .
- Na página Source , selecione as tabelas para ingestão.
- Clique em Salvar e continuar .
- Na página Destination , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios
USE CATALOGeCREATE SCHEMAno catálogo, clique emCreate schema no menu suspenso para criar um esquema.
- Clique em Salvar e continuar .
- (Opcional) Na página Cronogramas e notificações , clique em
Crie um agendamento . Defina a frequência para refresh das tabelas de destino.
- (Opcional) Clique em
Add notification para definir notificações por email para o sucesso ou falha da operação do pipeline e, em seguida, clique em Save and run pipeline .
Use os Pacotes de Automação Declarativa para gerenciar pipelines do Atlassian Audit Logs como código. Os pacotes podem conter definições YAML de jobs e tarefas, são gerenciados usando a CLI do Databricks e podem ser compartilhados e ter execução em diferentes workspaces de destino (como desenvolvimento, staging e produção). Para obter mais informações, consulte O que são os Pacotes de Automação Declarativa?.
-
Criar um pacote usando a CLI do Databricks:
Bashdatabricks bundle init -
Adicione dois novos arquivos de recurso ao pacote:
- Um arquivo de definição de pipeline (por exemplo,
resources/atlassian_audit_logs_pipeline.yml). Consulte pipeline.ingestion_definition e Examples. - Um arquivo de definição de job que controla a frequência da ingestão de dados (por exemplo,
resources/atlassian_audit_logs_job.yml).
- Um arquivo de definição de pipeline (por exemplo,
-
Implantar o pipeline usando a CLI do Databricks:
Bashdatabricks bundle deploy
- Importe o seguinte notebook para o seu workspace do Databricks:
-
Deixe as células um e dois como estão. Não modifique.
-
Modifique a célula três com os detalhes da configuração do seu pipeline. Consulte pipeline.ingestion_definition e Exemplos.
-
Optionally configure advanced pipeline settings. See Common patterns for gerenciados ingestion pipelines.
-
Clique em Executar tudo .
Exemplos
The Atlassian Audit Logs connector makes available 1 source table in the default source schema. Ingest the table or the entire schema.
Ingerir tabelas específicas
Use esta opção para personalizar a nomenclatura de destino da tabela.
- Declarative Automation Bundles
- Databricks notebook
O arquivo de definição de pipeline a seguir ingere a tabela Atlassian Audit Logs:
resources:
pipelines:
atlassian_audit_logs_pipeline:
name: atlassian_audit_logs_pipeline
catalog: 'main'
target: 'atlassian_audit_logs_data'
ingestion_definition:
connection_name: atlassian_audit_logs_connection
source_configurations:
- api_source_connector_config:
configs:
start_datetime: '<start-datetime>'
objects:
- table:
source_schema: 'default'
source_table: 'audit_logs'
destination_catalog: 'main'
destination_schema: 'atlassian_audit_logs_data'
destination_table: 'audit_logs'
A especificação de pipeline a seguir ingere a tabela Atlassian Audit Logs:
pipeline_name = "atlassian_audit_logs_pipeline"
connection_name = "<atlassian-audit-logs-connection>"
pipeline_spec = {
"name": pipeline_name,
"ingestion_definition": {
"connection_name": connection_name,
"source_configurations": [
{
"api_source_connector_config": {
"configs": {
"start_datetime": "<start-datetime>"
}
}
}
],
"objects": [
{
"table": {
"source_schema": "default",
"source_table": "audit_logs",
"destination_catalog": "main",
"destination_schema": "atlassian_audit_logs_data",
"destination_table": "audit_logs"
}
}
]
}
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Ingerir o esquema inteiro
Use esta opção para ingerir todas as tabelas de origem do Atlassian Audit Logs em um único esquema de destino com uma declaração.
- Declarative Automation Bundles
- Databricks notebook
The following pipeline definition file ingests all supported Atlassian Audit Logs tables into a destination schema:
resources:
pipelines:
atlassian_audit_logs_pipeline:
name: atlassian_audit_logs_pipeline
catalog: 'main'
target: 'atlassian_audit_logs_data'
ingestion_definition:
connection_name: atlassian_audit_logs_connection
source_configurations:
- api_source_connector_config:
configs:
start_datetime: '<start-datetime>'
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'atlassian_audit_logs_data'
A seguinte especificação de pipeline ingere todas as tabelas de Atlassian Audit Logs suportadas em um esquema de destino:
pipeline_name = "atlassian_audit_logs_pipeline"
connection_name = "<atlassian-audit-logs-connection>"
pipeline_spec = {
"name": pipeline_name,
"ingestion_definition": {
"connection_name": connection_name,
"source_configurations": [
{
"api_source_connector_config": {
"configs": {
"start_datetime": "<start-datetime>"
}
}
}
],
"objects": [
{
"schema": {
"source_schema": "default",
"destination_catalog": "main",
"destination_schema": "atlassian_audit_logs_data"
}
}
]
}
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Arquivo de definição de job de Pacotes de Automação Declarativa
O arquivo a seguir é um exemplo de definição de job para uso com Declarative Automation Bundles. O job executa diariamente.
- Declarative Automation Bundles
resources:
jobs:
atlassian_audit_logs_job:
name: atlassian_audit_logs_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: atlassian_audit_logs_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.atlassian_audit_logs_pipeline.id}
Padrões comuns
Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.
Passos seguintes
Começar, programar e definir alertas no seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.