operadores integrados no LakeFlow Designer
O Lakeflow Designer inclui operadores integrados para tarefas comuns de preparação e transformação de dados. Abra o menu do operador no painel lateral esquerdo para navegar pelos operadores por categoria, ou use Procurar um operador... na parte superior do painel. A pesquisa de operador sugere operadores com base na sua intenção. Por exemplo, digitar average by month retorna o operador Aggregate. Para configurar um operador após adicioná-lo à tela, clique duas vezes nele ou passe o mouse sobre ele e clique em ( Editar operador), para abrir o painel de configuração.

Cada operador exibe uma descrição gerada por AI do que ele faz. A descrição também atua como um editor para o operador: editar a descrição reconfigura o operador para corresponder à sua descrição.
Para aprender como criar seus próprios operadores definidos pelo usuário, consulte Operadores definidos pelo usuário no Lakeflow Designer.
Fonte e saída
Fonte
Importa dados para o Designer de uma tabela do Unity Catalog ou outra origem compatível. Para selecionar uma origem, procure uma tabela ou arquivo por nome ou navegue por catálogo e esquema. Você também pode criar uma nova tabela a partir deste painel.
Após selecionar uma tabela, o painel exibe o nome da tabela, o proprietário e a hora da última atualização. Clique em Selecionar uma nova fonte de dados para alterar a fonte. A alteração da origem invalida o cache de saída para todos os operadores downstream.
Você também pode usar uma view de métricas do Unity Catalog como fonte. Ao selecionar uma view de métricas, selecione as dimensões e medidas a incluir, e o Designer gera a query agregada para você.
Para obter a gama completa de opções de ingestão de dados, incluindo o direcionamento de um volume ou pasta inteira do Unity Catalog, consulte Ingerir dados no Lakeflow Designer.
Insira Dados
Cria uma tabela digitando valores em um editor no estilo de planilha. Use este operador para adicionar pequenas quantidades de dados de referência, como valores de consulta ou dados de teste, sem criar uma tabela de origem separada.
campo | Descrição |
|---|---|
Dados da tabela | Insira seus dados como uma tabela. A primeira linha define os cabeçalhos das colunas, e as linhas restantes são os dados. O Designer infere o tipo de dados de cada coluna a partir de seus valores. |
Saída
Exporta dados do Designer. O operador de saída pode gravar resultados em uma tabela do Unity Catalog, publicá-los como uma view materializada ou gravá-los em um arquivo em um volume do Unity Catalog. Selecione o destino com **Tipo de saída**.
Tipo de saída | Descrição |
|---|---|
Tabela | Grava os resultados em uma tabela gerenciada do Unity Catalog. Defina um nome de tabela e um local de saída (catálogo e esquema), em seguida, selecione um modo de gravação . |
Visualização materializada | Publica os resultados como uma view materializada no Unity Catalog que refresh quando a preparação visual de dados é executada. |
Arquivo | Grava os resultados em um arquivo em um volume do Unity Catalog. Selecione um Tipo de arquivo de CSV, Excel ou JSON e, em seguida, defina o volume de destino e o nome do arquivo. |
Para uma saída de **Tabela** ou **Arquivo**, selecione como cada execução grava no destino com o **Modo de gravação**:
Modo de escrita | Descrição |
|---|---|
Substituir | Substitui o conteúdo existente com os resultados da execução atual. Este é o default. |
Acrescentar | Adiciona os resultados da execução atual às linhas existentes. |
Merge | Realiza upsert de linhas na tabela de destino correspondendo às chaves de merge que você especifica. Disponível para saídas de tabela. |
Clique em **Executar** para executar a preparação visual de dados e gravar os resultados. Para uma saída de tabela, se a tabela não existir, o operador a cria. Execuções programadas gravam no destino usando o mesmo modo de gravação.
Depois que um operador de saída gravar uma tabela, view materializada ou arquivo, conecte sua porta de saída para continuar o fluxo de trabalho. Para tabelas, views materializadas e saídas simples de arquivo único, a porta de saída lê diretamente do ativo persistente que o operador de saída acabou de gravar. Para saídas divididas, gravações de intervalo do Excel e arquivos sem cabeçalhos, a porta de saída transmite as linhas de entrada.
Para saídas de arquivo, expanda Avançado para configurar as seguintes opções:
- Split by distinct values : selecione uma coluna para gravar um arquivo para cada valor distinto. Para a saída do Excel, você pode gravar cada valor em uma planilha separada em uma única pasta de trabalho. Uma execução pode criar até 50 arquivos ou planilhas.
- Nome da planilha : para a saída do Excel, defina a planilha de destino.
- Incluir linha de cabeçalho : incluir nomes de colunas na saída CSV ou Excel.
- Intervalo de células : para a saída do Excel no modo Substituir , defina a célula inicial e uma célula final opcional. O Designer preserva a formatação fora do intervalo e causa falha na execução se os dados não couberem em um intervalo fixo. Não é possível combinar um intervalo de células com Dividir por valores distintos .
Quando o modo Overwrite divide a saída em arquivos, o Designer remove os arquivos existentes que correspondem ao padrão de nome gerado. Isso pode incluir arquivos criados manualmente com o mesmo padrão na pasta de volume.
FunçãoAI
Executa uma operação de AI integrada em seus dados. No painel de configuração, abra Selecione uma função e selecione uma das funções na tabela a seguir. Cada função expõe opções no painel para entradas (por exemplo, colunas, prompts, rótulos ou idiomas) e saídas.
Função | Descrição |
|---|---|
| Realiza análise de sentimento no texto de entrada. |
| Classifica textos ou documentos analisados usando o rótulo fornecido. |
| Extrai dados estruturados de textos ou documentos analisados usando campos definidos por você. |
| Corrige erros gramaticais no texto. |
| Prevê dados de série temporal até um horizonte e uma frequência especificados por você. |
| Responde a uma pergunta fornecida pelo usuário com base na entrada de dados. |
| Mascara entidades específicas no texto (por exemplo, para desidentificação). |
| Extrai texto, tabelas e disposição de documentos não estruturados. |
| Transforma a saída do documento analisado em segmentos prontos para pesquisa para pesquisa vetorial e pipelines de geração aumentada de recuperação (RAG). |
| Responde a um prompt usando qualquer modelo de fundação compatível, para flexibilidade de tarefa e modelo de uso geral. |
| Compara duas strings e retorna uma pontuação de similaridade semântica. |
| Gera um resumo do texto. |
| Traduz o texto para um idioma de destino especificado. |
Para obter detalhes sobre cada função, consulte Transform unstructured data using AI Functions.
transformações
Os seguintes operadores realizam transformações nos seus dados.
Agregar
Resume as linhas agrupando os dados e calculando os valores agregados.
campo | Descrição |
|---|---|
Agregar por | Selecione uma coluna, selecione uma função de agregação e forneça um nome para a coluna de saída. Clique em + Adicionar agregação para adicionar mais. Funções compatíveis: |
Agrupar por | Selecione as colunas para agrupar. Clique em **+ Adicionar agrupamento** para adicionar mais. As colunas usadas em **Agrupar por** são incluídas automaticamente na saída. |
Combinar
Combina dados de várias tabelas em uma única saída usando uma operação de conjunto.
campo | Descrição |
|---|---|
Definir operação | Selecione **Union**, **Intersecção** ou **Exceto**. |
Estratégia de merge | Selecione **Distinto** para excluir linhas duplicadas da saída, ou **Todos** para manter todas as linhas, incluindo as duplicadas. |
União por nome | Para Union , selecione Union by name em Advanced para corresponder colunas por nome em vez de posição. |
Permitir colunas ausentes | Para Union , primeiro selecione Union by name e, em seguida, selecione Allow missing columns para preencher as colunas ausentes de uma entrada com valores null. Se essa opção estiver desativada, cada entrada deverá conter o mesmo conjunto de colunas. |
Exclusivo
Remove linhas duplicadas dos dados de entrada. Por default, o operador deduplica em todas as colunas. Em vez disso, você pode escolher um subconjunto de colunas como key e ordenar as linhas para controlar qual duplicata será mantida.
campo | Descrição |
|---|---|
Exclusivo por | Selecione "Todas as colunas" para remover as linhas idênticas em todas as colunas ou selecione "Colunas selecionadas" para remover as linhas duplicadas apenas nas colunas escolhidas como chave. |
Ordenar por | Opcional: selecione uma ou mais colunas e uma direção de classificação para controlar qual linha é mantida para cada conjunto de duplicatas. Se você não definir uma ordem, o operador manterá a primeira linha que encontrar. |
Filtro
Divide linhas com base no atendimento a uma ou mais condições, usando um construtor de condições gráfico.
campo | Descrição |
|---|---|
Condição | Para cada condição, selecione uma coluna , um tipo de condição e um valor para correspondência condicional. Tipos de condição suportados:
Para condições em colunas de data, o seletor de data oferece suporte à navegação entre anos e meses. Quando uma condição corresponde aos valores de uma coluna (por exemplo, Is one of ), a lista de valores mostra uma amostra dos valores distintos da coluna com base na entrada. Selecione Load more para buscar valores adicionais sob demanda. |
O operador de filtro tem duas saídas para que você possa Branch dados com base em se eles atendem às condições:
Saída | Descrição |
|---|---|
Incluído | Linhas que atendem às condições do filtro. |
Excluídas | Linhas que não atendem às condições de filtro, incluindo linhas em que a condição é avaliada como nula. |
Guardrails
Valida os dados de entrada em relação a uma lista ordenada de verificações e separa as linhas que passam das que falham.
campo | Descrição |
|---|---|
Verificações | Adicione verificações de Colunas obrigatórias , Contagem de linhas , Não nulo , Exclusivo , Valores aceitos , Valores não permitidos , Intervalo de valores , Correspondência de regex ou Expressão . |
Quando uma verificação falha | Escolha uma das três opções para controlar a saída e o comportamento downstream. |
-
Avisar e continuar com as linhas aprovadas :
- A execução downstream continua.
- As linhas que passam em todas as verificações ativadas são enviadas para Passed .
- As linhas que falham em pelo menos uma verificação habilitada são enviadas para Failed .
- Errors contém uma linha para cada verificação que falhou, incluindo seu tipo, severidade e mensagem.
-
Aviso e bloqueio de saída aprovada :
- Se uma verificação falhar, a execução subsequente continuará, mas Passed não conterá nenhuma linha.
- Failed ainda contém as linhas com falha, e Errors ainda contém os detalhes da falha.
- Use esta opção para impedir o processamento downstream de linhas aprovadas, permitindo o tratamento downstream de Falhas e Erros .
-
Falhar no fluxo de trabalho :
- Se uma verificação falhar, a execução será interrompida antes que os operadores downstream sejam executados.
- Eles não recebem as saídas Passed , Failed ou Errors .
- Em um Job agendado, a execução é marcada como com falha, o que pode trigger o tratamento de falhas configurado, como notificações de Job.
When you preview the Guardrails operator itself, you can still inspect all three outputs in Fail the fluxo de trabalho mode.
Para persistir linhas de uma saída em qualquer um dos modos de aviso, conecte-a a um operador de saída.
join
Links tabelas combinando datasets de entrada com base em valores de coluna correspondentes.
campo | Descrição |
|---|---|
Tabela de entrada | Select the two input tables to join. Para unir três ou mais tabelas, expanda Advanced options , selecione Join more than two tables e clique em Add input para cada tabela adicional. |
Condição de join | Especifique pelo menos uma condição de join selecionando colunas correspondentes de duas tabelas. Clique em + Adicionar expressão de join para adicionar mais condições. Opcional: clique na seta entre duas tabelas para adicionar uma condição de join personalizada e, em seguida, edite a descrição gerada por AI ou escreva SQL. Com três ou mais entradas, cada tabela adicionada deve definir uma relação com outra entrada. |
Corresponder maiúsculas/minúsculas | Quando desativado (o default), as chaves de junção de string correspondem sem distinção entre maiúsculas e minúsculas (e ignoram espaços em branco à esquerda e à direita). Ative **Corresponder maiúsculas/minúsculas** para corresponder as chaves de string exatamente. Esta opção aplica-se às chaves de junção, não às condições de junção personalizadas. |
Tipo de join | Para duas tabelas de entrada, selecione o tipo de join. Por default, o operador Join divide seus resultados em três saídas (consulte a seção a seguir). Selecione Full join , Inner join , Left join ou Right join para produzir uma única saída unida em vez disso. Com três ou mais entradas, o operador segue as relações de tabela configuradas, usa inner joins e produz uma única saída unida. |
Colunas de saída | Opcional: selecione quais colunas incluir. Por default, as colunas de cada tabela de entrada são incluídas. Com duas entradas, nomes duplicados da tabela à direita recebem um prefixo |
Colunas de expressão personalizadas | Opcional: adicione colunas de expressão personalizadas com base no resultado da junção. |
Com duas entradas, o operador Join tem três saídas por default para que você possa criar um branch em um fluxo de trabalho com base nos resultados do join:
Saída | Descrição |
|---|---|
Deixado sem correspondência | Linhas da entrada esquerda que não têm correspondência na entrada direita. |
Correspondido | Linhas que correspondem em ambas as entradas. |
Direita não correspondente | Linhas da entrada direita que não têm correspondência na entrada esquerda. |
Com duas entradas, selecionar um Tipo de join específico (full, inner, left ou right) produz uma única saída unida em vez das três saídas divididas.
Limite
Restringe a contagem de linhas, permitindo a passagem apenas até o número máximo de linhas especificado.
campo | Descrição |
|---|---|
Máximo de linhas | Especifique o número máximo de linhas a serem passadas. |
Pivô
Reforma dados tabulares em duas direções. Use as tabs na parte superior do painel de configuração para selecionar o modo.
Linhas → Colunas (dinamizar)
Transforma valores distintos em uma coluna em novos cabeçalhos de coluna, preenchidos com valores agregados de outra coluna.
campo | Descrição |
|---|---|
Coluna dinâmica | Selecione a coluna cujos valores distintos se tornam os novos cabeçalhos. |
Valor e agregação | Selecione a coluna cujos valores preenchem as células dinamizadas e selecione uma função de agregação. As funções disponíveis dependem do tipo de dados da coluna selecionada:
Configure como os valores ausentes são tratados (por exemplo, null ou zero), se disponível no painel. |
Colunas → Linhas (desdinamizar)
Transforma uma ou mais colunas em linhas.
campo | Descrição |
|---|---|
Colunas de desdinamização | Selecione as colunas para anular a dinamização. |
Colunas de key e valor | Defina nomes para as colunas de key e valor de saída. |
Incluir colunas
Para qualquer modo, selecione quais colunas permanecem na saída juntamente com os valores dinamizados ou não dinamizados, e descarte as colunas que você não precisa antes da transformação. O Designer infere colunas fixas (de agrupamento) a partir das colunas que você não atribui a funções de dinamização, valor ou não dinamização.
Organizar
Ordena linhas em uma ou mais colunas.
campo | Descrição |
|---|---|
Ordem de classificação | Selecione ASC (crescente) ou DESC (decrescente) para cada coluna. Clique em + Adicionar expressão de classificação para classificar por colunas adicionais. A classificação segue a ordem lexical padrão. |
SQL
Escreve código SQL personalizado para quaisquer transformações não abrangidas pelos outros operadores.
campo | Descrição |
|---|---|
Editor de SQL | Digite uma instrução SQL SQL Clique no botão |
Parâmetros | Para fazer referência a um parâmetro visual de preparação de dados, use a sintaxe de marcador de parâmetro nomeado, como |
Selecionar
Seleciona, renomeia e reordena colunas dos dados de entrada.
campo | Descrição |
|---|---|
Incluir ou excluir colunas | Selecione **Começar com todas as colunas** ou **Começar sem colunas**, em seguida, use as caixas de seleção para incluir ou excluir colunas individuais. Arraste as colunas para reordená-las. |
Renomear uma coluna | Digite um novo nome no campo Renomear ao lado de qualquer coluna. |
Selecionar colunas dinamicamente | Em vez de escolher colunas individualmente, selecione colunas por uma regra para que a saída se adapte conforme o esquema de entrada muda. Escolha entre Manter colunas correspondentes ou Remover colunas correspondentes e, em seguida, faça a correspondência das colunas por:
|
Preparar
Limpa e deriva colunas encadeando uma ou mais ações nos dados de entrada. Clique em + Adicionar ação e selecione uma ação. Adicione quantas ações precisar. Eles são aplicados em ordem.
Ação | Descrição |
|---|---|
Fórmula | Crie uma nova coluna ou sobrescreva uma coluna existente usando linguagem natural ou uma expressão SQL. |
Alterar tipo | Converter uma coluna para outro tipo de dados. |
Substituir valor | Encontrar e substituir valores em uma coluna. |
Preencher nulos | Substitua valores nulos por uma constante. |
Maiúsculas e minúsculas | Altere as letras para minúsculas, maiúsculas ou maiúsculas no início da palavra. |
Cortar | Remover espaços em branco de uma ou ambas as extremidades. |
Substituição Regex | Substitua o texto que corresponde a um padrão regex. |
Extrair | Extrai uma substring que corresponda a um grupo de regex. |
Analisar data | Analisar uma cadeia de caracteres em uma data ou timestamp. |
Para remover uma ação, passe o cursor sobre sua linha e clique em .
Colunas personalizadas
A ação Fórmula abre o editor de expressões, onde é possível criar uma nova coluna ou sobrescrever uma coluna existente usando linguagem natural ou código SQL. O editor tem duas caixas de entrada e é bidirecional:
- Descrição : Digite uma descrição em linguagem natural do que você deseja que a coluna faça. O designer usa o Genie para gerar a expressão de código correspondente abaixo.
- Expressão : Se preferir escrever ou editar o código diretamente, clique no botão "Editar expressão". A edição da expressão gera automaticamente uma descrição em linguagem natural.
No editor de expressão, digite @ para abrir um menu das colunas de entrada do operador e das funções SQL integradas. Digite após @ para filtrar a lista e, em seguida, selecione uma entrada para inseri-la: uma coluna insere seu nome e uma função insere sua chamada com o cursor posicionado dentro dos parênteses. O mesmo menu @ está disponível nos editores de expressão de outros operadores, como condições personalizadas de Filtro e join.
Python
Executa Python (PySpark) personalizado nos dados de entrada.
campo | Descrição |
|---|---|
| Atribua um único DataFrame a |
| Uma lista de DataFrames de entrada, em ordem upstream. O painel de detalhes do operador mostra o nome de cada entrada, em ordem. Por exemplo, |
Parâmetros | Chame |
Um padrão mínimo é usar a primeira entrada quando presente, ou um DataFrame vazio caso contrário:
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
A partir daí, você pode encadear operações DataFrame (por exemplo, select, filter, withColumn ou join) em result antes que a atribuição termine, ou substituir result por um novo DataFrame construído a partir de inputs["data"].
Durante uma pré-visualização, a saída do operador é transmitida para o painel de saída à medida que é produzida, incluindo tudo o que você renderizar com display() e o texto que imprimir, para que você possa ver os resultados antes que a execução termine.
Modo de pré-visualização do Python
À medida que você cria uma preparação de dados visuais, o Designer visualiza continuamente a saída de cada operador em uma amostra dos seus dados. Essas visualizações executam seu código Python da mesma maneira que uma execução completa. Isso é um problema quando seu código tem efeitos colaterais, como chamar uma API externa, enviar uma notificação ou gravar em um sistema fora do Unity Catalog. Geralmente, você não deseja que esses efeitos colaterais sejam disparados em cada visualização.
Para permitir que seu código diferencie as duas opções, leia config["is_preview"], um valor Boolean definido pelo Designer para você:
Truedurante uma execução de visualização, para que você possa ignorar efeitos colaterais.Falsedurante uma execução completa, como quando você clica em Executar ou em uma execução agendada.
Por exemplo, proteja efeitos colaterais para que eles sejam executados apenas fora das pré-visualizações:
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
write_results_to_external_system(result)
Organização
Observação
Adiciona uma nota na tela para que você possa documentar o próprio fluxo de trabalho: seu propósito, premissas, ressalvas ou contexto de entrega para qualquer pessoa que abra a preparação de dados visuais mais tarde.
campo | Descrição |
|---|---|
conteúdo | Edite o conteúdo da nota diretamente na tela com um editor de texto formatado. É possível adicionar títulos, estilo de texto, links, imagens e tabelas onde o texto simples não é suficiente. As notas não afetam como os dados fluem pelos operadores. |
Grupo
Agrupa visualmente operadores na tela sem alterar o fluxo de dados entre eles, o que é útil quando uma preparação visual de dados se torna grande ou quando você deseja refletir estágios lógicos.
campo | Descrição |
|---|---|
Adicionar ao grupo | Arraste um ou mais operadores para um grupo para adicioná-los a ele. |
Criar a partir da seleção | Selecione um ou vários operadores, abra o menu de atalho (clique com o botão direito) e selecione Criar novo grupo para agrupar a seleção em um novo grupo. |
Nome | Dê ao grupo um nome descritivo. |
Minimizar / expandir | Clique em minimizar ou expandir para mostrar ou ocultar o conteúdo do grupo na tela. |
Ativar / desativar | Clique com o botão direito no cabeçalho do grupo e selecione Desativar para excluir todos os operadores do grupo das execuções, ou Ativar para incluí-los novamente. Operadores desativados não produzem linhas de saída, portanto, os operadores downstream recebem um resultado vazio até que você os ative. Você também pode ativar ou desativar um operador individual. Consulte Ativar ou desativar operadores. |
Visualização
Cria uma visualização a partir dos dados de entrada e a renderiza diretamente na tela. Conecte um operador de visualização a qualquer operador que produza dados tabulares para plotar os resultados sem sair do Designer.
Para configurar a visualização, abra o operador e selecione um tipo de Visualização , em seguida, mapeie suas colunas para o gráfico.
campo | Descrição |
|---|---|
Visualização | O tipo de gráfico para renderizar, como **Barra**, **Área** ou **Contador**. |