Ingerir dados do CrowdStrike Falcon
Beta
Este recurso está em Beta. To use it, a Workspace admin must turn on Lakeflow Connect for CrowdStrike Falcon Transmissão de Eventos from the Previews page. See Gerenciar Databricks previews.
Crie um pipeline de ingestão do CrowdStrike Falcon Event Stream gerenciado no Lakeflow Connect para ingerir eventos do Falcon Event Stream no Databricks.
Requisitos
-
Para criar um pipeline de ingestão, primeiro atenda aos seguintes requisitos:
-
Seu workspace deve estar habilitado para o Unity Catalog.
-
O compute serverless deve estar habilitado para o seu workspace. Consulte Serverless compute requirements.
-
To create a new connection, you must have
CREATE CONNECTIONprivileges on the metastore. Consulte Gerenciar privilégios no Unity Catalog.Se o conector oferecer suporte à criação de pipeline baseada na interface do usuário, um administrador poderá criar a conexão e o pipeline ao mesmo tempo, concluindo os passos desta página. No entanto, se os usuários que criam pipelines usarem a criação de pipeline baseada em API ou forem usuários não administradores, um administrador deverá primeiro criar a conexão no Catalog Explorer. Consulte Conectar-se a fontes de ingestão gerenciadas.
-
Para usar uma conexão existente, você deve ter privilégios
USE CONNECTIONouALL PRIVILEGESno objeto de conexão. -
Você deve ter privilégios
USE CATALOGno catálogo de destino. -
Você deve ter os privilégios
USE SCHEMAeCREATE TABLEem um esquema existente ou os privilégiosCREATE SCHEMAno catálogo de destino.
-
-
Para fazer a ingestão do CrowdStrike Falcon, primeiro configure a autenticação no Databricks e crie uma conexão. Consulte Configure a autenticação para o CrowdStrike Falcon e Crie uma conexão com o CrowdStrike Falcon Event transmissão.
Criar um pipeline de ingestão
Para obter a lista de tabelas de origem compatíveis, consulte Tabelas de origem compatíveis.
- Declarative Automation Bundles
- Databricks notebook
Use Declarative Automation Bundles to manage CrowdStrike Falcon Event transmissão pipelines as code. Bundles can contain YAML definitions of Jobs and tarefas, are gerenciados using the Databricks CLI, and can be shared and run in different target Workspaces (such as development, staging, and production). For more information, see What are Declarative Automation Bundles?.
-
Crie um pacote usando a CLI do Databricks:
Bashdatabricks bundle init -
Add two new resource files to the bundle:
- Um arquivo de definição de pipeline (por exemplo,
resources/crowdstrike_falcon_event_stream_pipeline.yml). Consulte pipeline.ingestion_definition e Exemplos. - Um arquivo de definição de job que controla a frequência da ingestão de dados (por exemplo,
resources/crowdstrike_falcon_event_stream_job.yml).
- Um arquivo de definição de pipeline (por exemplo,
-
Implantar o pipeline usando a CLI do Databricks:
Bashdatabricks bundle deploy
- Importe o seguinte notebook para o seu workspace do Databricks:
-
Deixe as células um e dois como estão. Não modifique.
-
Modifique a célula três com os detalhes da configuração do seu pipeline. Consulte pipeline.ingestion_definition e Exemplos.
-
Configure opcionalmente as configurações avançadas do pipeline. Consulte Padrões comuns para pipelines de ingestão gerenciados.
-
Clique em Executar tudo .
Exemplos
O conector CrowdStrike Falcon Event transmissão disponibiliza 1 tabela de origem no esquema de origem default. Ingerir a tabela ou o esquema inteiro.
Ingerir tabelas específicas
Use this option to customize destination naming for the table.
- Declarative Automation Bundles
- Databricks notebook
O arquivo de definição de pipeline a seguir ingere a tabela do CrowdStrike Falcon Transmissão de Eventos:
resources:
pipelines:
crowdstrike_falcon_event_stream_pipeline:
name: crowdstrike_falcon_event_stream_pipeline
catalog: 'main'
target: 'crowdstrike_falcon_event_stream_data'
ingestion_definition:
connection_name: crowdstrike_falcon_event_stream_connection
objects:
- table:
source_schema: 'default'
source_table: 'events'
destination_catalog: 'main'
destination_schema: 'crowdstrike_falcon_event_stream_data'
destination_table: 'events'
A especificação de pipeline a seguir ingere a tabela do CrowdStrike Falcon Transmissão de Eventos:
pipeline_name = "crowdstrike_falcon_event_stream_pipeline"
connection_name = "<crowdstrike-falcon-event-stream-connection>"
pipeline_spec = {
"name": pipeline_name,
"ingestion_definition": {
"connection_name": connection_name,
"objects": [
{
"table": {
"source_schema": "default",
"source_table": "events",
"destination_catalog": "main",
"destination_schema": "crowdstrike_falcon_event_stream_data",
"destination_table": "events"
}
}
]
},
"channel": "PREVIEW"
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Ingerir todo o esquema
Use esta opção para ingerir todas as tabelas de origem do CrowdStrike Falcon Transmissão de Eventos em um único esquema de destino com uma declaração.
- Declarative Automation Bundles
- Databricks notebook
The following pipeline definition file ingests all supported CrowdStrike Falcon Event transmissão tables into a destination schema:
resources:
pipelines:
crowdstrike_falcon_event_stream_pipeline:
name: crowdstrike_falcon_event_stream_pipeline
catalog: 'main'
target: 'crowdstrike_falcon_event_stream_data'
ingestion_definition:
connection_name: crowdstrike_falcon_event_stream_connection
objects:
- schema:
source_schema: 'default'
destination_catalog: 'main'
destination_schema: 'crowdstrike_falcon_event_stream_data'
The following pipeline specification ingests all supported CrowdStrike Falcon Event transmissão tables into a destination schema:
pipeline_name = "crowdstrike_falcon_event_stream_pipeline"
connection_name = "<crowdstrike-falcon-event-stream-connection>"
pipeline_spec = {
"name": pipeline_name,
"ingestion_definition": {
"connection_name": connection_name,
"objects": [
{
"schema": {
"source_schema": "default",
"destination_catalog": "main",
"destination_schema": "crowdstrike_falcon_event_stream_data"
}
}
]
},
"channel": "PREVIEW"
}
json_payload = json.dumps(pipeline_spec, indent=2)
create_pipeline(json_payload)
Arquivo de definição de job dos Pacotes de Automação Declarativa
The following is an example job definition file for use with Declarative Automation Bundles. The job runs daily.
- Declarative Automation Bundles
resources:
jobs:
crowdstrike_falcon_event_stream_job:
name: crowdstrike_falcon_event_stream_job
schedule:
quartz_cron_expression: '0 0 0 * * ?'
timezone_id: 'UTC'
tasks:
- task_key: crowdstrike_falcon_event_stream_ingestion
pipeline_task:
pipeline_id: ${resources.pipelines.crowdstrike_falcon_event_stream_pipeline.id}
Padrões comuns
For advanced pipeline configurations, see Common patterns for managed ingestion pipelines.
Passos seguintes
Comece, programe e defina alertas no seu pipeline. Consulte Tarefas comuns de manutenção de pipeline.