Ingerir dados do Anysphere (Cursor)
Beta
Este recurso está em Beta. To use it, a workspace admin must turn on Lakeflow Connect for Anysphere Audit Logs from the Previews page. See Gerenciar Databricks previews.
Esta página mostra como criar um pipeline de ingestão gerenciado de Logs de auditoria da Anysphere usando o Lakeflow Connect.
Requisitos
-
Para criar um pipeline de ingestão, você deve primeiro atender aos seguintes requisitos:
-
Seu workspace deve estar habilitado para o Unity Catalog.
-
O compute serverless deve estar habilitado para seu workspace. Consulte Requisitos de compute serverless.
-
Para criar uma nova conexão, você deve ter privilégios
CREATE CONNECTIONno metastore. Consulte Gerenciar privilégios no Unity Catalog.Se o conector oferecer suporte à criação de pipeline baseada na IU, um administrador poderá criar a conexão e o pipeline ao mesmo tempo, concluindo os passos nesta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.
-
Para usar uma conexão existente, você deve ter privilégios
USE CONNECTIONouALL PRIVILEGESno objeto de conexão. -
Você deve ter privilégios
USE CATALOGno catálogo de destino. -
Você deve ter os privilégios
USE SCHEMAeCREATE TABLEem um esquema existente ou privilégiosCREATE SCHEMAno catálogo de destino.
-
-
Para ingerir a partir dos logs de auditoria do Anysphere, você deve primeiro configurar a autenticação a partir do Databricks. Consulte Configurar autenticação para o Anysphere (Cursor).
Criar um pipeline de ingestão
- Databricks UI
- Declarative Automation Bundles
- Databricks notebook
- Na barra lateral do workspace do Databricks, clique em Ingestão de dados .
- Na página Adicionar dados , em Conectores Databricks , clique em Logs de auditoria do Anysphere .
- Na página Conexão do assistente de ingestão, selecione a conexão que armazena suas credenciais de acesso aos Logs de Auditoria do Anysphere. Se você tiver o privilégio
CREATE CONNECTIONno metastore, poderá clicar emCriar conexão para criar uma nova conexão com os detalhes de autenticação em Criar uma conexão de Logs de Auditoria do Anysphere.
- Clique em Avançar .
- Na página Configuração de ingestão , insira um nome exclusivo para o pipeline.
- Selecione um catálogo e um esquema para gravar logs de eventos. Se você tiver os privilégios
USE CATALOGeCREATE SCHEMAno catálogo, poderá clicar emCriar esquema no menu suspenso para criar um novo esquema.
- Clique em Criar pipeline e continuar .
- Na página Source , selecione as tabelas para ingestão.
- Clique em Salvar e continuar .
- Na página Destino , selecione um catálogo e um esquema para carregar os dados. Se você tiver os privilégios
USE CATALOGeCREATE SCHEMAno catálogo, poderá clicar emCriar esquema no menu suspenso para criar um novo esquema.
- Clique em Salvar e continuar .
- (Opcional) Na página Schedules and notifications , clique em
Create schedule . Defina a frequência para refresh das tabelas de destino.
- (Opcional) Clique em
Adicionar notificação para definir notificações por email para sucesso ou falha da operação de pipeline e, em seguida, clique em Salvar e executar pipeline .
Use os Pacotes de Automação Declarativa para gerenciar pipelines de Logs de auditoria do Anysphere como código. Os pacotes podem conter definições YAML de jobs e tarefas, são gerenciados usando a CLI do Databricks e podem ser compartilhados e ter execução em diferentes workspaces de destino (como desenvolvimento, staging e produção). Para obter mais informações, consulte O que são os Pacotes de Automação Declarativa?.
-
Crie um pacote usando a CLI do Databricks:
Bashdatabricks bundle init -
Adicione dois novos arquivos de recurso ao pacote:
- Um arquivo de definição de pipeline (por exemplo,
resources/anysphere_audit_logs_pipeline.yml). Veja pipeline.ingestion_definition e Exemplos. - Um arquivo de definição de job que controla a frequência da ingestão de dados (por exemplo,
resources/anysphere_audit_logs_job.yml).
- Um arquivo de definição de pipeline (por exemplo,
-
Implante o pipeline usando a CLI do Databricks:
Bashdatabricks bundle deploy
- Importe o seguinte notebook para o seu workspace do Databricks:
-
Deixe as células um e dois como estão. Não modifique.
-
Modifique a célula três com os detalhes da configuração do seu pipeline. Consulte pipeline.ingestion_definition e Exemplos.
-
Opcionalmente, configure as definições avançadas do pipeline. Consulte Padrões comuns para pipelines de ingestão gerenciados.
-
Clique em Executar tudo .
Exemplos
Use estes exemplos para configurar seu pipeline.
Ingerir o esquema inteiro
- Declarative Automation Bundles
- Databricks notebook
O seguinte arquivo de definição de pipeline ingere todas as tabelas de Logs de auditoria da Anysphere suportadas em um esquema de destino:
resources:
pipelines:
anysphere_audit_logs_pipeline:
name: anysphere_audit_logs_pipeline
catalog: 'main'
target: 'anysphere_audit_logs_data'
ingestion_definition:
connection_name: anysphere_audit_logs_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'anysphere_audit_logs_data'
A especificação de pipeline a seguir ingere todas as tabelas de Logs de auditoria da Anysphere compatíveis em um esquema de destino:
pipeline_name = "anysphere_audit_logs_pipeline"
connection_name = "<anysphere-audit-logs-connection>"
pipeline_spec = {
"name": pipeline_name,
"ingestion_definition": {
"connection_name": connection_name,
"objects": [
{
"schema": {
"source_schema": "default",
"destination_catalog": "main",
"destination_schema": "anysphere_audit_logs_data"
}
}
]
}
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Ingerir tabelas específicas
Ingira tabelas individuais de Logs de auditoria da Anysphere. Para obter uma lista completa de tabelas suportadas, consulte Tabelas de origem suportadas.
- Declarative Automation Bundles
- Databricks notebook
O seguinte arquivo de definição de pipeline ingere tabelas individuais de logs de auditoria do Anysphere:
resources:
pipelines:
anysphere_audit_logs_pipeline:
name: anysphere_audit_logs_pipeline
catalog: 'main'
target: 'anysphere_audit_logs_data'
ingestion_definition:
connection_name: anysphere_audit_logs_connection
objects:
- table:
source_schema: 'default'
source_table: 'audit_logs'
destination_catalog: 'main'
destination_schema: 'anysphere_audit_logs_data'
destination_table: 'audit_logs'
A especificação de pipeline a seguir ingere tabelas individuais de logs de auditoria da Anysphere:
pipeline_name = "anysphere_audit_logs_pipeline"
connection_name = "<anysphere-audit-logs-connection>"
pipeline_spec = {
"name": pipeline_name,
"ingestion_definition": {
"connection_name": connection_name,
"objects": [
{
"table": {
"source_schema": "default",
"source_table": "audit_logs",
"destination_catalog": "main",
"destination_schema": "anysphere_audit_logs_data",
"destination_table": "audit_logs"
}
}
]
}
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Arquivo de definição de job de Pacotes de Automação Declarativa
- Declarative Automation Bundles
resources:
jobs:
anysphere_audit_logs_job:
name: anysphere_audit_logs_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: anysphere_audit_logs_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.anysphere_audit_logs_pipeline.id}
Padrões comuns
Para configurações avançadas de pipeline, consulte Padrões comuns para pipelines de ingestão gerenciados.
Passos seguintes
Comece, programe e defina alertas em seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.