Plataforma aberta, pipelines unificados: por que o dbt no Databricks está acelerando


dbt traz estrutura aos fluxos de trabalho de transformação de dados. As equipes o utilizam para transformar dados brutos em conjuntos de dados selecionados que potencializam o consumo downstream, como painéis de BI, modelos de IA/ML e relatórios multifuncionais.

Mas aqui está a realidade: o dbt é tão poderoso quanto a plataforma de dados em que é executado.

A maioria das pilhas de dados força você a reunir armazenamento, computação, governança, orquestração e monitoramento em vários sistemas. O resultado? Dados duplicados, permissões inconsistentes, observabilidade fragmentada e ajuste de desempenho que se tornam um trabalho de meio período. É por isso que um número crescente de equipas está a consolidar os seus fluxos de trabalho dbt em Databricks.

Para executar o dbt de maneira eficaz, uma plataforma precisa de quatro coisas:

  1. Fundações abertas para que seus fluxos de trabalho dbt não fiquem presos a uma pilha proprietária
  2. Orquestração perfeita para executar pipelines dbt de ponta a ponta em um só lugar
  3. Governança integrada isso faz parte do fluxo de trabalho padrão do dbt
  4. Forte relação preço-desempenho então o dbt roda rápido desde o primeiro dia sem ajuste handbook

Databricks oferece todos os quatro pilares integrados nativamente em uma plataforma. Ao executar o dbt no Databricks, você obtém a experiência do desenvolvedor do dbt em cima de uma arquitetura lakehouse projetada para abertura, governança, desempenho e simplicidade operacional desde o primeiro dia. Vejamos como cada um deles funciona na prática:

Plataforma aberta, pipelines unificados: por que o dbt no Databricks está acelerando

A execução do dbt no Databricks nos permite consolidar um amplo legado de notebooks e mais de 7 sistemas de origem em uma plataforma de dados única e governada. Com o Unity Catalog, gerenciamos 341 locatários, vários ambientes e compartilhamento de dados de parceiros externos por meio do isolamento em nível de catálogo. Nossa documentação dbt flui diretamente para o UC, para que os analistas possam atender por conta própria sem gargalos. Ao publicar em formatos abertos e Delta Sharing, parceiros e equipes downstream podem consumir facilmente conjuntos de dados gerados por dbt em ferramentas e ambientes. É uma plataforma para construção, mas uma plataforma aberta para consumo. —Sohan Chatterjee, chefe de dados e análises, iSolved

Execute dbt em bases abertas sem dependência de fornecedor

A dependência do fornecedor é um dos riscos estratégicos mais significativos para a estratégia de dados de uma organização. O dbt é construído com uma estrutura de adaptador aberta, o que significa que sua lógica de transformação não está bloqueada para nenhuma plataforma única. O dbt é aberto por design e o Databricks fornece uma plataforma aberta para executá-lo. Muitas pilhas de dados modernas concentram-se em uma camada de armazenamento proprietária que oferece conveniência a curto prazo, mas introduz atrito a longo prazo. Com o tempo, isso leva à duplicação de dados e pipelines de exportação para atender diferentes consumidores, formatos de armazenamento que limitam a interoperabilidade e custos crescentes de mudança à medida que os requisitos da plataforma evoluem.

Databricks é um lago aberto: uma plataforma unificada onde seus dados residem em formatos de tabela abertos e são acessíveis por meio de interfaces abertas, garantindo que o armazenamento e a governança não estejam vinculados a um único mecanismo de consulta. No Databricks, os modelos dbt tornam-se tabelas em formatos abertos, Lago Delta e Iceberg Apachegarantindo que seus dados transformados permaneçam acessíveis em todo o cenário de dados sem exportar ou manter cópias paralelas. Essa abertura é importante especificamente para fluxos de trabalho dbt. Suas tabelas Silver e Gold cuidadosamente modeladas tornam-se produtos de dados reutilizáveis ​​que os usuários downstream podem consumir por meio de qualquer mecanismo de consulta, não apenas pela plataforma onde o dbt é executado.

Essa abertura vai além do armazenamento. Catálogo de Unidade é construído em torno de catálogo aberto e padrões de acesso que suportam leituras e gravações controladas de mecanismos externos. SQL de blocos de dados segue os padrões ANSI, garantindo que suas consultas permaneçam portáteis entre plataformas para reduzir reescritas específicas do fornecedor. Isso significa que seus fluxos de trabalho dbt são executados em uma pilha projetada para portabilidade, não para bloqueio.

Orquestre pipelines dbt de ponta a ponta com Lakeflow Jobs

A orquestração é onde a complexidade operacional se acumula. Emparelhar o dbt com um orquestrador externo junto com o Databricks significa dois sistemas para operar, dois locais para depurar e transferências frágeis entre eles.

Lakeflow Jobs take away essa complexidade tratando dbt como um tipo de tarefa de primeira classe dentro de um pipeline unificado. Em vez de manter uma camada de orquestração separada, as equipes executam o dbt junto com a ingestão upstream e ações downstream em um único fluxo de trabalho. Por exemplo, você pode ingerir dados brutos com Carregador automáticotransforme dados com modelos dbt e, em seguida, acione atualizações do painel ou retreinamento de ML, tudo em um pipeline com lógica de repetição unificada e gerenciamento de dependências. dbt on Databricks também permite a ingestão diretamente por meio tabelas de streaming. Para usuários da plataforma dbt, o tarefa da plataforma dbt (em Beta) permite que o Lakeflow acione e gerencie fluxos de trabalho dbt em execução na plataforma dbt.

Orquestração dbt

Quando o dbt é orquestrado por meio do Lakeflow, falhas, novas tentativas e contexto ficam visíveis em um só lugar. Em vez de alternar entre um orquestrador dbt separado e registos de Databricks, pode ver a falha, as tarefas a jusante afetadas e os dashboards afetados diretamente na mesma vista de execução de trabalho.

Torne a governança parte do fluxo de trabalho padrão do dbt

À medida que os fluxos de trabalho do dbt aumentam, a governança se torna o gargalo. As equipes precisam de respostas claras sobre o conteúdo da tabela, propriedade e permissões de acesso. Nas pilhas tradicionais, esse contexto é fragmentado em ferramentas de catálogo separadas, sistemas de permissão e visualizações de linhagem incompletas que não se conectam de ponta a ponta.

Databricks resolve isso com Catálogo de Unidadeque unifica o controle de acesso, a descoberta e a linhagem para todo o seu lakehouse, não apenas no dbt, mas em ingestão, BI, ML/AI e muito mais. Com o Unity Catalog, você não precisa executar novamente as instruções de concessão sempre que o dbt recriar uma tabela. As permissões são gerenciadas no nível do esquema e persistem nas reconstruções da tabela. Controles refinados como filtros em nível de linha, máscaras de colunae controle de acesso baseado em atributos aplicam-se de forma consistente em dbt, ferramentas de BI e notebooks.

Por exemplo, quando você persiste a documentação do dbt no Unity Catalog usando persist_docs do dbt funcionalidade, descrições de colunas e contexto criado em dbt tornam-se detectáveis ​​onde os dados são consultados e consumidos. O Unity Catalog fornece informações em nível de coluna linhagem de dados que rastreia o fluxo de dados desde a ingestão bruta por meio de transformações dbt até o uso downstream. Quando um esquema de origem é alterado, você pode ver instantaneamente quais modelos dbt e ativos downstream são afetados. Este nível de visibilidade é impossível quando os pipelines de dados abrangem sistemas desconectados.

A governança de custos é tão importante quanto a governança de dados. Com tags de consultavocê pode anexar o contexto de negócios às execuções do dbt e acompanhar os gastos por equipe, projeto ou ambiente por meio de Tabelas do sistema. As equipes podem finalmente responder “quanto custam nossos pipelines de análise de advertising and marketing dbt?” com dados reais em vez de estimativas. Adicionalmente, Monitoramento granular de custos DBSQL (na visualização privada) também fornece monitoramento de custos agregados em todas as cargas de trabalho do dbt.

Execute dbt com forte relação preço-desempenho desde o primeiro dia

Otimizar o desempenho de um knowledge warehouse normalmente requer trabalho handbook contínuo. As equipes muitas vezes acabam trocando a velocidade do desenvolvedor pela higiene do desempenho.

O Databricks abstrai essa complexidade combinando um mecanismo de execução de alto desempenho com recursos que funcionam nativamente com dbt, proporcionando melhorias de velocidade sem sobrecarga handbook.

Desempenho integrado

  • Fóton mecanismo acelera cargas de trabalho SQL por meio de execução vetorizada, entregando até Preço-desempenho 12x melhor em comparação com knowledge warehouses em nuvem. Os armazéns SQL sem servidor incluem Photon por padrão, para que as equipes obtenham desempenho acelerado sem custos adicionais.
  • Otimização Preditiva usa IA para monitorar tabelas e automatizar a manutenção, alcançando até Consultas 20x mais rápidas. Isso reduz a necessidade de pós-ganchos OPTIMIZE manuais nos quais os engenheiros de dbt historicamente dependiam.

Recursos de desempenho desbloqueados por meio da configuração do dbt

  • integração do dbt com Clustering líquido que substitui estratégias rígidas de particionamento por uma abordagem flexível que se ajusta dinamicamente à medida que o quantity de dados cresce, resultando em até Velocidades 10x mais rápidas sem ajuste handbook
  • Visualizações materializadas em dbtdesenvolvido com Spark Declarative Pipelines de código aberto, lida com o processamento incremental automaticamente. O Databricks gerencia a complexidade de determinar o que precisa ser atualizado e processa apenas registros novos ou modificados, em vez de recalcular conjuntos de dados inteiros. Isso proporciona custos de computação mais baixos em comparação com atualizações em lote programadas e ineficientes.

Com esses recursos, os usuários gastam menos tempo ajustando e mais tempo criando pipelines que mantêm o desempenho à medida que os conjuntos de dados crescem. Somente em 2025, o Databricks SQL alcançou um melhoria de desempenho de 10% em cargas de trabalho ETL (consultas com gravações) sem precisar de configurações adicionais.

Comece hoje

Databricks reúne armazenamento aberto, governança unificada, forte desempenho de preços e operações integradas em um só lugar para fluxos de trabalho dbt. Junte-se a mais de 2.900 clientes que já executam dbt no Databricks. Comece seguindo o guia de início rápido.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *