Dremio aprofunda a liderança do Apache Iceberg com suporte V3


Dremio aprofunda a liderança do Apache Iceberg com suporte V3Dremio aprofunda a liderança do Apache Iceberg com suporte V3

SÃO FRANCISCO — Dremio, a empresa Agentic Lakehouse, destacou hoje sua liderança em todo o ecossistema Apache Iceberg, incluindo suporte V3 agora disponível no Dremio Cloud, a eleição do engenheiro da Dremio JB Onofre para o conselho da Apache Software program Basis e o impulso contínuo por trás do Apache Polaris. Defensor de longa information da colaboração de código aberto e da eliminação da dependência de fornecedores, Dremio fez contribuições fundamentais para projetos incluindo Apache Arrow (cocriador e contribuidor principal), Apache Iceberg (colaborador e educador líder) e Apache Polaris (cocriador). Reforçando esse compromisso, JB Onofre, que conduziu a Polaris durante a incubação, foi eleito para o conselho da Apache Software program Basis.

O Iceberg V3 foi projetado para oferecer suporte a tipos de dados mais diversos e complexos, oferecer maior controle sobre a evolução do esquema e fornecer melhorias de desempenho para ambientes de grande escala e alta simultaneidade. A integração V3 do Dremio avança no tratamento de dados semiestruturados, alterações em nível de linha e evolução de esquema, com suporte complete no Dremio Cloud, incluindo o tipo de dados VARIANT para JSON, vetores de exclusão para CDC (captura de dados de alteração) mais rápido e evolução de esquema aprimorada.

“A casa do lago Iceberg se tornou a arquitetura padrão para IA e análises”, disse Rahim Bhojani, CTO da Dremio. “A maioria das plataformas adicionou o Iceberg como um recurso, mas o Dremio foi construído desde o início. Recursos como Autonomous Reflections, Iceberg Clustering e agora o V3 se combinam, proporcionando uma plataforma Iceberg que é ao mesmo tempo a mais rápida e a mais fácil de gerenciar.”

Dremio continua a definir o padrão para Apache Iceberg com:

  • Suporte ao Apache Iceberg V3: Dremio oferece suporte completo de leitura e gravação para as especificações Iceberg mais recentes. Os vetores de exclusão aceleram as operações em nível de linha para CDC e cargas de trabalho de streaming. O tipo VARIANT elimina o gargalo do esquema na gravação para dados semiestruturados. A linhagem em nível de linha fornece criação integrada e rastreamento de atualização para setores regulamentados, sem a necessidade de ferramentas adicionais.
  • Mecanismo SQL baseado em seta para Iceberg: O mecanismo de consulta da Dremio foi construído nativamente no Apache Arrow, o padrão colunar aberto co-criado pela Dremio, tornando-o especialmente adequado para cargas de trabalho Iceberg. Ele processa dados Iceberg e Parquet em lotes vetorizados sem conversão para um formato proprietário, fornecendo análises rápidas e escaláveis ​​sem dependência.
  • Reflexões autônomas: Dremio elimina a sobrecarga de gerenciamento de administrar uma casa no lago Iceberg. O Autonomous Reflections observa padrões de consulta e cria, atualiza e retira materializações automaticamente, acelerando as consultas de segundos para menos de um segundo, sem alterações de código ou ajuste handbook. A atualização incremental do Reflections mantém os dados atualizados com baixo custo de recursos.
  • Agrupamento de icebergs: usa a ordem Z para posicionar dados em várias colunas simultaneamente. Com a remoção de dois níveis que ignora dados tanto no nível do manifesto quanto no nível do grupo de linhas, ele minimiza a E/S executando continuamente em tabelas em escala de petabytes sem reescritas completas da tabela. Manutenção automática de tabelas: compactação, expiração de snapshots e limpeza de arquivos órfãos são executadas em programações baseadas em políticas, sem intervenção handbook, mantendo o desempenho das tabelas e os custos de armazenamento sob controle. Permite que os engenheiros se concentrem na criação de produtos de dados, e não na manutenção de tabelas.
  • Catálogo aberto (desenvolvido por Apache Polaris): Dremio cofundou o Apache Polaris, o padrão de catálogo aberto do Iceberg agora transformado em um projeto Apache de nível superior. Construído no Polaris, o Catálogo Aberto da Dremio fornece um catálogo Iceberg que suporta leitura e gravação completa de qualquer mecanismo compatível com REST, incluindo Spark, Flink, Trino e DuckDB, todos compartilhando as mesmas tabelas Iceberg. A governança, incluindo RBAC, filtros em nível de linha, mascaramento de coluna e venda de credenciais just-in-time, é aplicada de forma consistente na camada de catálogo, independentemente de qual mecanismo está consultando. Cada tabela gerenciada pelo Dremio é acessível a qualquer mecanismo compatível com Iceberg.
  • Ingestão e Transformação: Dremio oferece suporte a toda a gama de operações DML em tabelas Iceberg usando SQL padrão. A ingestão contínua through CREATE PIPE, carregamentos em lote through COPY INTO e integração com dbt Core tornam o Dremio uma plataforma completa para construção e manutenção de pipelines de dados nativos do Iceberg.

Saiba mais sobre os recursos Iceberg da Dremio em https://www.dremio.com/platform/apache-iceberg/

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *