A próxima period do Open Lakehouse: Apache Iceberg™ v3 em visualização pública no Databricks


Hoje, O suporte do Databricks ao Iceberg v3 entra em visualização públicadesbloqueando as mais recentes inovações da comunidade Iceberg nativamente na casa do lago aberta.

O Iceberg v3 marca um grande avanço para formatos de tabelas abertas, desbloqueando casos de uso em processamento incremental de dados e análise de dados semiestruturados que anteriormente exigiam soluções alternativas frágeis. Além disso, o Iceberg v3 representa uma inovação tecnológica significativa ao unificar ainda mais a camada de dados do Iceberg e do Delta Lake, eliminando a necessidade de reescrever dados ao construir pipelines interoperáveis.

Aqui estão as novidades do Iceberg v3, por que ele é importante e por que o Databricks é o melhor lugar para administrar sua casa no lago.

O que há de novo no Iceberg v3?

Catálogo de Unidade Iceberg gerenciado As tabelas v3 suportam Row Lineage, Deletion Vectors e VARIANT, desbloqueando novos casos de uso e benefícios significativos de desempenho. Databricks também podem interoperar com esses recursos em mesas Iceberg estrangeiras (tabelas Iceberg registradas em outros catálogos), permitindo que os clientes construam agentes e aplicações de IA com base em seus dados, independentemente de onde eles estejam.

Processamento incremental em escala: linhagem de linha e vetores de exclusão

A maioria dos dados chega como um fluxo de alterações (INSERTs, UPDATEs, MERGEs, DELETEs) em vez de em lotes, normalmente provenientes de bancos de dados operacionais, fluxos de eventos e APIs de terceiros. Historicamente, processar essas mudanças exigia a solução de dois problemas difíceis:

  1. Identificando quais linhas foram alteradas em conjuntos de dados bronze
  2. Aplicando essas mudanças de forma eficiente a conjuntos de dados prata/ouro

As equipes geralmente recorriam a varreduras completas de tabelas ou sistemas CDC externos para detectar alterações e reescritas caras de arquivos para aplicá-las. Isso resultou em pipelines lentos, de manutenção cara e propensos a desvios e silos de dados.

Agora, linhagem de linha permite que as equipes identifiquem rapidamente quais linhas foram alteradas. Cada linha em uma tabela Iceberg v3 carrega um valor permanente ID da linha e um número de sequência que reflete quando a linha foi modificada pela última vez.

A próxima period do Open Lakehouse: Apache Iceberg™ v3 em visualização pública no Databricks

Adicionalmente, vetores de exclusão torne a aplicação de alterações em conjuntos de dados com mais desempenho do que nunca. Os vetores de exclusão permitem que o Iceberg rastreie quais linhas foram excluídas logicamente sem reescrever imediatamente os arquivos de dados subjacentes. Em vez de excluir fisicamente linhas reescrevendo grandes arquivos Parquet, o mecanismo grava um arquivo de exclusão leve junto com os dados. O resultado é um desempenho de manipulação de dados de até 10x mais rápido do que a abordagem tradicional de cópia na gravação.

Com Deletion Vectors agora nativos do Iceberg, a Geodis pode construir seu Iceberg Lakehouse em Databricks sem comprometer o desempenho ou a escolha do motor.

“Agora que os vetores de exclusão chegaram ao Iceberg, podemos centralizar nosso conjunto de dados do Iceberg no Unity Catalog, aproveitando ao mesmo tempo o mecanismo de nossa escolha e mantendo o melhor desempenho da categoria.” — Delio Amato, arquiteto-chefe e diretor de dados, Geodis

Juntos, a linhagem de linha e os vetores de exclusão tornam o CDC uma propriedade nativa da própria tabela. As equipes podem criar pipelines com foco no processamento incremental apenas o que realmente mudou, reduzindo custos e acelerando o tempo de obtenção de insights para cada analista e cientista de dados downstream.

Dados semiestruturados como cidadão de primeira classe through VARIANT

Logs, respostas de API, clickstreams e cargas úteis de IoT são fontes de dados semiestruturadas muito valiosas. À medida que evoluem, os modelos de IA podem adaptar-se juntamente com eles, aprendendo diretamente com as mudanças nos sinais do mundo actual.

No entanto, historicamente, as equipes de dados enfrentaram uma difícil troca ao trabalhar com dados semiestruturados. Uma abordagem padrão period impor esquemas rígidos, mas isso gerava pipelines frágeis que quebravam sempre que os dados upstream evoluíam. Outra solução canônica period armazenar os dados como despejos de strings brutas, mas isso tornava as consultas muito complexas e lentas. Nenhuma das abordagens period escalonável.

O Iceberg v3 VARIANTE kind resolve essa compensação. VARIANT é um tipo de coluna nativa que armazena cargas semiestruturadas junto com colunas relacionais na mesma tabela Iceberg. Isso não requer nivelamento, armazenamento em um sistema separado ou pipeline ETL para normalização. Em vez disso, as equipes de dados podem ingerir dados semiestruturados brutos no estado em que se encontram e consultá-los com SQL padrão.

variante

O Panther usa VARIANT para potencializar ingestão e análise em larga escala em logs de segurança semiestruturados.

“O Unity Catalog e o Iceberg v3 revelam o poder dos dados semiestruturados por meio do VARIANT. Isso permite interoperabilidade e coleta de log econômica em escala de petabytes.” — Russell Leighton, arquiteto-chefe, Panther

Com a VARIANT, seus modelos de IA e pipelines de análise funcionam diretamente com dados dinâmicos e em evolução em uma única tabela governada. Quando novos campos aparecem nas respostas da API ou novos tipos de eventos entram em clickstreams, eles podem ser consultados imediatamente, sem uma migração de esquema. Com otimizações de desempenho como trituraçãoos clientes podem se beneficiar do desempenho colunar em seus dados semiestruturados, desbloqueando BI, painéis e pipelines de alerta de baixa latência.

O Unity Catalog oferece interoperabilidade e desempenho para empresas com vários mecanismos e vários catálogos

As empresas modernas contam com vários mecanismos e catálogos para oferecer suporte a diversos casos de uso em unidades de negócios e sistemas legados. O Unity Catalog foi projetado para permitir interoperabilidade e governança entre catálogos, além de otimizar layouts de dados com base em padrões de consulta.

Governança unificada entre catálogos e mecanismos

As APIs abertas do Unity Catalog permitem que os clientes escrevam uma vez e leiam em qualquer lugar, sem mais duplicação de dados ou controles de acesso isolados. O UC pode ser federado com outros catálogos Iceberg, permitindo interoperabilidade bidirecional. Todos os dados do Iceberg no Snowflake, AWS Glue, Salesforce e outros catálogos importantes podem ser lidos pelo Unity Catalog, e todos os dados no UC podem ser acessados ​​por essas mesmas plataformas de terceiros por meio de APIs abertas.

Além disso, o Unity Catalog é o primeiro catálogo a oferecer suporte controle de acesso refinado em mecanismos externoscapacitando as equipes a definir filtros de linha e máscaras de coluna uma vez e aplicá-los em todos os lugares em que os dados são acessados. Centralizar a governança no Unity Catalog torna significativamente mais fácil para as equipes de segurança governar e monitorar seu lakehouse, ao mesmo tempo que dá autonomia às equipes de dados para apontar qualquer ferramenta para seu lakehouse.

Interoperabilidade Delta e Iceberg

Delta Lake com UniForm desbloqueia a interoperabilidade entre os ecossistemas Delta Lake e Iceberg dos clientes: escreva uma vez para Delta Lake e leia como Iceberg de Snowflake, BigQuery, Redshift, Athena, Trino ou qualquer outro mecanismo Iceberg. Com o Iceberg v3 adotando vetores de exclusão, linhagem de linha e VARIANT nativamente, os clientes não enfrentam mais uma compensação entre os recursos de desempenho do Delta Lake e a compatibilidade do Iceberg. O resultado é uma cópia única dos dados que atende a todos os mecanismos da sua pilha, sem pipelines de replicação para manter ou risco de desvio. Um provedor líder de serviços financeiros substituiu um serviço caro de replicação de tabela completa pelo UniForm, permitindo que o Snowflake lesse diretamente das tabelas gerenciadas do Unity Catalog.

Desempenho e otimização automatizados

Além da interoperabilidade, o Databricks reúne desempenho, otimização de structure e governança em um único sistema para que as equipes não tenham que unir esses recursos sozinhas. Databricks combina manutenção inteligente (Otimização Preditiva), otimizações de structure físico com base em padrões de consulta (Clustering líquido automático) e governança entre mecanismos (Catálogo de Unidade) em uma camada, sem necessidade de configuração guide.

Outras ofertas gerenciadas do Iceberg exigem que as equipes gerenciem a manutenção de tabelas, o structure de arquivos e a aplicação de políticas de acesso de forma independente. No Databricks, esses recursos são unificados e automáticos, eliminando toda uma classe de sobrecarga operacional e, ao mesmo tempo, preservando a portabilidade complete dos dados.

Introdução ao Apache Iceberg v3 no Databricks

Iceberg v3 no Databricks está em pré-visualização pública hoje! As equipes agora podem aproveitar os melhores recursos da Delta e do Iceberg sem comprometer desempenho e interoperabilidade.

O Iceberg v3 está disponível no Databricks Runtime 18.0+ com o Unity Catalog habilitado.

Criar uma tabela Iceberg gerenciada pelo Unity Catalog com a v3 habilitada é fácil:

Criar uma tabela Delta gerenciada pelo Unity Catalog com UniForm e v3 habilitados é igualmente simples:

Olhando para o futuro: Iceberg v4

O Iceberg v3 unifica a camada de dados Delta e Iceberg em uma base interoperável e de alto desempenho – a próxima fronteira é a camada de metadados. Os engenheiros do Databricks estão conduzindo ativamente várias propostas principais do Iceberg v4 na comunidade Apache para tornar os metadados mais simples, rápidos e escaláveis. Estes incluem o árvore de metadados adaptávelo que simplifica a estrutura de metadados para que a maioria das operações exija a gravação de apenas um único arquivo em vez de vários. Propostas adicionais incluem suporte de caminho relativo para realocação perfeita de tabelas entre ambientes e um modelo estatístico modernizado que se estende a tipos de dados mais recentes, como VARIANT e GEOMETRY. Juntos, esses avanços significarão ingestão mais rápida, planejamento de consultas mais eficiente e gerenciamento de tabelas mais simples em escala empresarial. Estamos entusiasmados em continuar avançando na especificação Iceberg com a comunidade.

Saiba mais no Knowledge and AI Summit

Comece com o Iceberg v3 e junte-se a nós nas próximas Encontro de Dados e IA em São Francisco, de 15 a 18 de junho de 2026, para saber mais sobre nosso roteiro do Iceberg e trabalhar em todo o ecossistema.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *