Como a Amazon está migrando para integrar catálogos para melhorar a descoberta de dados com o Amazon SageMaker


As empresas enfrentam desafios quando as equipes criam ativos de dados fora dos catálogos de dados centrais. Acrescenta sobrecarga para descoberta e limita a colaboração. A equipe de Enterprise Information Applied sciences (BDT) da Amazon construiu um catálogo de dados corporativos (Andes) para compartilhar conjuntos de dados sob políticas bem definidas. No entanto, as equipes criaram catálogos de conjuntos de dados locais e outros ativos não tabulares, como painéis e métricas, fora dos Andes. Isto dificultou a descoberta de todos os ativos de forma consolidada.

Nesta postagem, compartilhamos como a Amazon.com está trabalhando para integrar catálogos, estendendo o catálogo de dados corporativos Andes com Amazon Sage Maker.

Necessidade de expansão do catálogo e governança de conjuntos de dados para ativos de dados

Sem uma solução única, os usuários tinham que pesquisar vários catálogos dependendo do tipo de ativo. As equipes gastaram um tempo considerável indexando os diferentes catálogos e identificando o mais adequado para sua tarefa. Isso os atrasou e tirou tempo para resolver os problemas de negócios.

Para enfrentar esses desafios, a equipe do BDT identificou quatro capacidades críticas necessárias:

  1. Catálogo multimodal – Os consumidores de dados precisavam da capacidade de combinar dados empresariais com conjuntos de dados locais e usá-los juntos para casos de uso específicos. As equipes procuraram descobrir não apenas conjuntos de dados, mas também ativos como métricas, painéis e arquivos de negócios, para obter uma visão completa dos recursos disponíveis. Isso exigia um catálogo que consolidasse conjuntos de dados e ativos de dados em um único native.
  2. Governança e aplicação uniformes – Para manter as melhores práticas de proteção de dados e apoiar os objetivos de negócios, as equipes precisam de uma governança de dados consistente em toda a empresa, onde solicitem acesso uma vez e o sistema imponha esse acesso de maneira uniforme em todos os mecanismos de computação, aliviando o gerenciamento de acesso fragmentado ou redundante. Para sistemas internos, havia necessidade de propagação de identidade confiável portanto, a identidade do usuário é preservada e usada na AWS e em sistemas internos para uma aplicação consistente.
  3. Fluxos de trabalho de múltiplas aprovações – A solução oferece suporte a vários fluxos de trabalho de aprovação em um único sistema, usando o Andes para aprovações de conjuntos de dados e um fluxo de trabalho personalizado para aprovações de painéis para manter complete governança e visibilidade dos ativos de dados.
  4. Propriedade delegada – Embora as equipes empresariais mantenham a responsabilidade abrangente de governança, os administradores de dados específicos do negócio exigiam a capacidade de modificar atributos selecionados e aplicar tags apropriadas aos ativos produzidos por seus respectivos produtores e consumidores.

Solução: unifique conjuntos de dados e ativos de dados com o Amazon SageMaker

A Amazon optou por estender a Andes com o Amazon SageMaker para aprimorar a experiência de descoberta. O SageMaker oferece suporte nativo para catálogos multimodais e integrado ao gerenciamento de identidade empresarial, tornando-o a base best para ampliar o modelo de governança da Andes.

Em vez de transmitir ativos em vários domínios, um único domínio empresarial padroniza e sincroniza ativos de dados em um só lugar. Este domínio está associado a Centro de identidade AWS IAMque está conectado ao sistema de identidade corporativa da Amazon para manter as melhores práticas de proteção de dados, limitando permissões diretas e usando identidade corporativa e permissões baseadas em grupo.

Como a Amazon está migrando para integrar catálogos para melhorar a descoberta de dados com o Amazon SageMaker

Esta arquitetura integrada aborda diretamente os desafios identificados:

  • Descoberta de ativos em painel único – Conjuntos de dados e ativos de dados são acessíveis por meio de uma visão única e consolidada, evitando a necessidade de navegar por sistemas ou domínios diferentes. Isso simplifica a descoberta e reduz o tempo de obtenção de insights para as equipes de toda a organização.
  • Governança estendida – A governança de conjuntos de dados locais e de toda a empresa é orquestrada por meio de um único sistema.
  • Observabilidade estendida – A propagação de identidade confiável (TIP) por meio do AWS IAM Identification Heart permite que usuários humanos acessem dados de forma interativa usando suas identidades corporativas. Isso fornece visibilidade da trilha de auditoria sobre quem está acessando quais dados para auditorias e os requisitos de observabilidade da organização.
  • Integração de ferramentas Amazon – A integração com Git e outros sistemas internos automatiza o gerenciamento de contas, permissões e aprovações. Isso reduz a sobrecarga handbook e ajuda a manter os controles de acesso alinhados aos fluxos de trabalho comerciais existentes.

Visão geral do projeto

Esta seção descreve os principais recursos e o design da integração do Amazon SageMaker. A implementação técnica consiste em três componentes principais:

1) Conectores de catálogo

A Amazon criou conectores e caminhos de ingestão para trazer ativos de dados para o Amazon SageMaker, mantendo a continuidade dos negócios e preservando a governança existente:

  • Integração dos Andes: SageMaker fornece APIs para sincronizar ativos de catálogos externos. O BDT estendeu isso para trazer conjuntos de dados dos Andes (com seus metadados sofisticados e contexto de negócios) para a experiência integrada. A integração preserva o modelo de permissão e os fluxos de trabalho de governança da Andes, para manter intactos os padrões de segurança e as melhores práticas existentes.
  • Integração da conta: As equipes realizam autoatendimento em suas contas da AWS por meio de uma integração baseada no AWS Lambda. Ao criar projetos, o SageMaker consulta esse serviço para determinar quais contas a identidade de um usuário pode acessar.

2) Propriedade delegada

Quando os sistemas de dados são dimensionados entre unidades de negócios, as equipes de governança centralizadas precisam delegar permissões para enriquecimento de catálogo, aplicação de políticas e gerenciamento de metadados.

  • Aprimoramento de catálogo permite que as equipes de negócios definam e publiquem seus próprios glossários de negóciosvocabulários selecionados de termos, definições e relacionamentos específicos de domínio, diretamente no catálogo. Permitir que os proprietários de empresas criem e mantenham esses glossários aumentou a precisão e a capacidade de descoberta dos ativos do catálogo. Os consumidores de dados em toda a empresa beneficiam de uma terminologia mais clara e consistente.

3) Integração com ferramentas de consumo e acesso

As equipes descobrem dados em Estúdio unificado SageMaker e consumi-lo por meio do SageMaker Unified Studio e de ferramentas internas:

  • Descoberta de dados: O SageMaker Unified Studio integra-se ao Identification Heart em toda a Amazon, permitindo que quase todos os usuários da Amazon se autentiquem e pesquisem ativos catalogados. Essa integração aborda o problema de descoberta de dados, fornecendo visibilidade em toda a empresa sobre os recursos de dados disponíveis.
  • Ambiente de desenvolvimento integrado: O SageMaker Unified Studio fornece ferramentas integradas prontas para uso, incluindo um Question Editor para análise SQL e Amazon SageMaker AI para machine studying (ML), que ajuda as equipes a acessar dados, criar modelos e colaborar entre fronteiras organizacionais.
  • Integração do repositório de código: Gerencie código com operações Git completas suportadas pelo SageMaker Unified Studio. O código de consulta e o código do pocket book persistem no GitFarm (sistema Git interno da Amazon), permitindo que as equipes visualizem e gerenciem seu trabalho por meio do sistema de controle de versão padrão da Amazon.
  • Integração analítica nativa: Os projetos se conectam diretamente aos mecanismos de análise da AWS, incluindo Amazon Athena para SQL, AWS Glue e Amazon EMR para Apache Spark, e Amazon Redshift para armazenamento de dados. Os trabalhos criados pelo usuário usam a governança e as permissões do Andes em todos os mecanismos para um controle de acesso consistente.

Resultados da implementação do SageMaker

Catálogo SageMaker agora abrange vários tipos de ativos de dados de toda a organização, representando uma expansão de conjuntos de dados apenas para um inventário completo de dados, painéis, métricas, modelos e outros ativos de dados, tudo isso mantendo as melhores práticas e acesso apropriado e proteções de uso.

“SageMaker fornece um sistema unificado catálogo que simplifica a descoberta e o compartilhamento de ativos de dados, métricas e painéis entre equipes, com integração direta aos conjuntos de dados da Andes. SageMaker oferece integração profunda por meio de conexões de repositório Git e gerenciamento de identidade empresarial que se alinham aos fluxos de trabalho existentes da Amazon.”

– Gerry Moses, diretor sênior TPM, Amazon

  • Descoberta de dados mais rápida – Os consumidores de dados podem ir a um único native para localizar ativos confiáveis ​​e de alta qualidade com significativamente menos atrito, o que reduz o tempo entre a pergunta e o perception. Ao trazer à tona ativos governados e bem documentados por meio de um catálogo enriquecido, as equipes podem identificar com segurança os dados certos para seus casos de uso, sem navegar em inventários extensos e inconsistentes ou depender de conhecimento tribal.
  • Colaboração aprimorada – Elimina silos de dados, tornando os ativos selecionados detectáveis ​​e reutilizáveis ​​em toda a Amazon. Quando as equipes podem desenvolver conjuntos de dados confiáveis ​​e compartilhados, em vez de criar cópias redundantes, a proliferação de dados é reduzida.

Conclusão

Ao integrar as ferramentas de governança existentes com o Amazon SageMaker para criar um catálogo de dados centralizado, a BDT está criando uma base para uma descoberta de dados mais rápida e eficiente entre as equipes. O Amazon SageMaker ajudou a unificar diversos tipos de dados com o catálogo existente e possibilitou a colaboração entre equipes para ajudá-las a encontrar os dados certos. Ao integrar-se às estruturas de governança existentes, o BDT demonstra como as organizações podem expandir seus recursos de catálogo e, ao mesmo tempo, preservar os investimentos empresariais existentes.

Para saber mais e começar a usar o Amazon SageMaker Unified Studio, visite aws.amazon.com/sagemaker/unified-studio ou o Console AWS.


Sobre os autores

Mateus David

Mateus David

Matt é PMM sênior, especializado em ajudar equipes de dados com análises baseadas em IA. Suas áreas de interesse incluem análise de autoatendimento, democratização de dados e preparação de organizações para a period dos agentes de IA. Ele traz ampla experiência de suas funções na Atlassian, Hex e DataCamp.

Gerry Moisés

Gerry Moisés

Gerry é gerente sênior de programa técnico principal em tecnologias de dados empresariais, onde lidera programas conjuntos Amazon/AWS. Seu trabalho melhorou a governança de dados para o information lake dos Andes da Amazon, permitiu uma adoção mais ampla da tecnologia AWS pelos usuários do information lake e influenciou melhorias de produtos que beneficiaram todos os clientes da AWS.

Ramesh Singh

Ramesh Singh

Ramesh é gerente técnico sênior de produto na AWS em Seattle, Washington, atualmente na equipe Amazon SageMaker. Ele é apaixonado por criar produtos de análise e ML/IA de alto desempenho que ajudam os clientes corporativos a atingir seus objetivos críticos usando tecnologia de ponta.

Pradeep Misra

Pradeep Misra

Pradeep é líder principal em análise e IA aplicada na AWS. Ele é apaixonado por resolver os desafios dos clientes usando dados, análises e IA/ML. Fora do trabalho, ele gosta de explorar novos lugares, experimentar novas culinárias e jogar badminton com a família. Ele também gosta de fazer experimentos científicos, construir LEGOs e assistir filmes com as filhas.

Eunji Kang

Eunji Kang

Eunji é gerente técnico principal de produtos com foco na democratização de dados nas equipes da Amazon para decisões de negócios rápidas baseadas em dados, sem comprometer a segurança e a conformidade.

Trevor Gasdaska

Trevor Gasdaska

Trevor é engenheiro principal com foco em conformidade de dados e fluxos de trabalho de IA de agentes para tecnologias de Massive Information na Amazon. Ele cria ferramentas que ajudam as equipes a governar e usar dados em grande escala.

Brad Porter

Brad Porter

Brad é gerente principal de desenvolvimento de negócios na Amazon Internet Companies. Ele trabalha com a Amazon.com e clientes empresariais para definir e acelerar estratégias de entrada no mercado em análise de dados, IA/ML e IA generativa. Ele tem mais de 20 anos de experiência em estratégia de nuvem, infraestrutura empresarial e liderança tecnológica.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *