Pular para o conteúdo principal

Ingerir dados do CrowdStrike Falcon

info

Beta

Este recurso está em Beta. To use it, a Workspace admin must turn on Lakeflow Connect for CrowdStrike Falcon Transmissão de Eventos from the Previews page. See Gerenciar Databricks previews.

Crie um pipeline de ingestão do CrowdStrike Falcon Event Stream gerenciado no Lakeflow Connect para ingerir eventos do Falcon Event Stream no Databricks.

Requisitos​

  • Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:

    • Seu workspace deve estar habilitado para o Unity Catalog.

    • O compute serverless deve estar habilitado para o seu workspace. Consulte Serverless compute requirements.

    • To create a new connection, you must have CREATE CONNECTION privileges on the metastore. Consulte Gerenciar privilégios no Unity Catalog.

      Se o conector oferecer suporte à criação de pipeline baseada na interface do usuário, um administrador poderá criar a conexão e o pipeline ao mesmo tempo, concluindo os passos desta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.

    • Para usar uma conexão existente, você deve ter privilégios USE CONNECTION ou ALL PRIVILEGES no objeto de conexão.

    • Você deve ter privilégios USE CATALOG no catálogo de destino.

    • Você deve ter os privilégios USE SCHEMA e CREATE TABLE em um esquema existente ou os privilégios CREATE SCHEMA no catálogo de destino.

  • Para fazer a ingestão do CrowdStrike Falcon, primeiro configure a autenticação no Databricks e crie uma conexão. Consulte Configure a autenticação para o CrowdStrike Falcon e Crie uma conexão com o CrowdStrike Falcon Event transmissão.

Criar um pipeline de ingestão​

Para obter a lista de tabelas de origem compatíveis, consulte Tabelas de origem compatíveis.

Use Declarative Automation Bundles to manage CrowdStrike Falcon Event transmissão pipelines as code. Bundles can contain YAML definitions of Jobs and tarefas, are gerenciados using the Databricks CLI, and can be shared and run in different target Workspaces (such as development, staging, and production). For more information, see What are Declarative Automation Bundles?.

  1. Crie um pacote usando a CLI do Databricks:

    Bash
    databricks bundle init
  2. Add two new resource files to the bundle:

    • Um arquivo de definição de pipeline (por exemplo, resources/crowdstrike_falcon_event_stream_pipeline.yml). Consulte pipeline.ingestion_definition e Exemplos.
    • Um arquivo de definição de job que controla a frequência da ingestão de dados (por exemplo, resources/crowdstrike_falcon_event_stream_job.yml).
  3. Implantar o pipeline usando a CLI do Databricks:

    Bash
    databricks bundle deploy

Exemplos​

O conector CrowdStrike Falcon Event transmissão disponibiliza 1 tabela de origem no esquema de origem default. Ingerir a tabela ou o esquema inteiro.

Ingerir tabelas específicas​

Use this option to customize destination naming for the table.

O arquivo de definição de pipeline a seguir ingere a tabela do CrowdStrike Falcon Transmissão de Eventos:

YAML
resources:
pipelines:
crowdstrike_falcon_event_stream_pipeline:
name: crowdstrike_falcon_event_stream_pipeline
catalog: 'main'
target: 'crowdstrike_falcon_event_stream_data'
ingestion_definition:
connection_name: crowdstrike_falcon_event_stream_connection
objects:
- table:
source_schema: 'default'
source_table: 'events'
destination_catalog: 'main'
destination_schema: 'crowdstrike_falcon_event_stream_data'
destination_table: 'events'

Ingerir todo o esquema​

Use esta opção para ingerir todas as tabelas de origem do CrowdStrike Falcon Transmissão de Eventos em um único esquema de destino com uma declaração.

The following pipeline definition file ingests all supported CrowdStrike Falcon Event transmissão tables into a destination schema:

YAML
resources:
pipelines:
crowdstrike_falcon_event_stream_pipeline:
name: crowdstrike_falcon_event_stream_pipeline
catalog: 'main'
target: 'crowdstrike_falcon_event_stream_data'
ingestion_definition:
connection_name: crowdstrike_falcon_event_stream_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'crowdstrike_falcon_event_stream_data'

Arquivo de definição de job dos Pacotes de Automação Declarativa​

The following is an example job definition file for use with Declarative Automation Bundles. The job runs daily.

YAML
resources:
jobs:
crowdstrike_falcon_event_stream_job:
name: crowdstrike_falcon_event_stream_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: crowdstrike_falcon_event_stream_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.crowdstrike_falcon_event_stream_pipeline.id}

Padrões comuns​

For advanced pipeline configurations, see Common patterns for managed ingestion pipelines.

Passos seguintes​

Comece, programe e defina alertas no seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.

Outros recursos​