Analisando seu catálogo de dados: consulte metadados do catálogo SageMaker com SQL


À medida que seus dados e ativos de aprendizado de máquina (ML) crescem, rastrear quais ativos carecem de documentação ou monitorar tendências de registro de ativos torna-se um desafio sem uma infraestrutura de relatórios personalizada. Você precisa de visibilidade da integridade do seu catálogo, sem a sobrecarga de gerenciamento de trabalhos de ETL. O recurso de metadados de Amazon Sage Maker fornece esse recurso aos usuários. Convertendo metadados de ativos de catálogo em Iceberg Apache tabelas armazenadas em Tabelas Amazon S3 elimina a necessidade de construir e manter pipelines ETL personalizados. Sua equipe pode então consultar metadados de ativos diretamente usando ferramentas SQL padrão. Agora você pode responder a questões de governança, como tendências de registro de ativos, standing de classificação e integridade de metadados, usando consultas SQL padrão por meio de ferramentas como Amazon Atenas, Estúdio unificado Amazon SageMaker notebooks e sistemas BI.

Essa abordagem automatizada reduz o tempo de desenvolvimento de ETL e dá à sua equipe visibilidade sobre a integridade do catálogo, lacunas de conformidade e padrões de ciclo de vida de ativos. As tabelas exportadas incluem metadados técnicos, metadados de negócios, detalhes de propriedade do projeto e carimbos de information/hora, particionados por information do instantâneo para permitir consultas de viagem no tempo e análise histórica. As equipes podem usar esse recurso para monitorar proativamente a integridade do catálogo, identificar lacunas na documentação, rastrear padrões de ciclo de vida de ativos e garantir que as políticas de governança sejam aplicadas de forma consistente.

Como funciona a exportação de metadados

Depois de ativar o recurso de exportação de metadados, ele será executado automaticamente em uma programação diária:

  1. O Catálogo SageMaker cria a infraestrutura — Um bucket de tabela do Amazon Easy Storage Service (Amazon S3) denominado aws-sagemaker-catalog é criado com um asset_metadata namespace e uma tabela de ativos vazia.
  2. Instantâneos diários são capturados — Um trabalho programado é executado uma vez por dia, por volta da meia-noite (horário native por região da AWS) para exportar metadados de ativos atualizados.
  3. Os metadados são estruturados e particionados — A exportação captura metadados técnicos (resource_id, resource_type), metadados de negócios (asset_name, business_description), detalhes de propriedade do projeto e carimbos de information/hora, particionados por snapshot_date para desempenho de consulta.
  4. Os dados tornam-se consultáveis — Dentro de 24 horas, a tabela de ativos aparece no Amazon SageMaker Unified Studio sob o aws-sagemaker-catalog bucket e torna-se acessível por meio do Amazon Athena, de notebooks Studio ou de ferramentas externas de BI.
  5. Consulta de equipes usando SQL padrão — As equipes de dados agora podem responder perguntas como “Quantos ativos foram registrados no mês passado?” ou “Quais ativos não possuem descrições de negócios?” sem construir pipelines ETL personalizados.

A exportação avalia os ativos do catálogo e suas propriedades de metadados no domínio, convertendo-os no formato de tabela Apache Iceberg. Os dados fluem imediatamente para operações analíticas downstream, sem ETL separado ou processos em lote para manter. Os metadados exportados tornam-se parte de um information lake consultável que oferece suporte a consultas de viagem no tempo e análise histórica.

Nesta postagem, demonstramos como usar o recurso de exportação de metadados no Amazon SageMaker Catalog e realizar análises nessas tabelas. Exploramos os seguintes casos de uso específicos.

  • Audite as alterações históricas para investigar a aparência de um ativo em um momento específico.
  • Monitore o crescimento dos ativos e veja como o catálogo de dados cresceu nos últimos 30 dias.
  • Acompanhe as melhorias nos metadados para ver quais ativos ganharam descrições ou propriedade ao longo do tempo.

Visão geral da solução

Analisando seu catálogo de dados: consulte metadados do catálogo SageMaker com SQL

Figura 1 – Exportação do catálogo SageMaker para tabelas S3

A arquitetura consiste em três componentes principais:

  1. O Amazon SageMaker Catalog exporta metadados de ativos diariamente para o Amazon S3.
  2. O S3 Tables armazena metadados como tabelas Apache Iceberg no aws-sagemaker-catalog balde com conformidade ACID e viagem no tempo.
  3. Mecanismos de consulta (Amazon Athena, Redshift da Amazone Apache Spark) acessam metadados usando SQL padrão do asset_metadata.asset mesa.

Quais metadados são expostos?

O Catálogo SageMaker exporta metadados no asset_metadata.asset mesa:

Tipo de metadadosCamposDescrição
Metadados técnicosresource_id, resource_type_enum, account_id, areaIdentificadores de recursos (ARN), tipos (GlueTable, RedshiftTable, S3Collection) e localização
Hierarquia de namespacecatalog, namespace, resource_nameEstrutura organizacional para ativos
Metadados de negóciosasset_name, business_descriptionNomes e descrições legíveis por humanos
Propriedadeextended_metadata('owningEntityId')Informações de propriedade de ativos
Carimbos de information e horaasset_created_time, asset_updated_time, snapshot_timeCriação
Metadados personalizadosextended_metadata('form-name.field-name')Formulários de metadados definidos pelo usuário como pares de valores-chave

O snapshot_time coluna suporta análise pontual e consulta de estados históricos do catálogo.

Pré-requisitos

Para acompanhar esta postagem, você deve ter o seguinte:

Para obter instruções de configuração de domínio do SageMaker Unified Studio, consulte o SageMaker Unified Studio Começando guia.

Depois de concluir os pré-requisitos, conclua as etapas a seguir.

  1. Adicione esta política ao nosso usuário ou função do IAM para permitir a exportação de metadados. Se estiver usando o SageMaker Unified Studio para consultar o catálogo, adicione esta política ao AmazonSageMakerAdminIAMExecutionRole função gerenciada.
{ "Model": "2012-10-17", 
"Assertion": ( 
{
 "Impact": "Enable",
 "Motion": ( "datazone:GetDataExportConfiguration",
 "datazone:PutDataExportConfiguration"
 ),
 "Useful resource": "*"
 },
 {
 "Impact": "Enable",
 "Motion": (
 "s3tables:CreateTableBucket",
 "s3tables:PutTableBucketPolicy"
 ),
 "Useful resource": "arn:aws:s3tables:*:*:bucket/aws-sagemaker-catalog" 
} 
)
}
  1. Conceder descrição e selecione permissões para SageMaker Catalog com AWS Lake Formation. Esta etapa pode ser executada no console do AWS Lake Formation.
    1. Selecione Permissões -> Permissões de dados e escolha Conceder.

      Interface de permissões de concessão do AWS Lake Formation mostrando a seleção do tipo principal com a opção de usuários e funções do IAM selecionada e AmazonSageMakerAdminIAMExecutionRole atribuído

      Figura 2 – Permissão de concessão do AWS Lake Formation

    2. Sob Tipo principalselecione Diretores, Usuários e funções do IAM e a AWS gerenciada AmazonSageMakerAdminIAMExecutionRole função de execução.
    3. Escolher Recursos nomeados do Knowledge Catalog.
    4. Sob Catálogospesquise e selecione :s3tablecatalog/aws-sagemaker-catalog.
    5. Sob Bancos de dadosselecione ativos_metadados banco de dados.
      Página de permissões de concessão do AWS Lake Formation mostrando o método de recursos do Named Data Catalog com s3tablescatalog/aws-sagemaker-catalog selecionado, banco de dados asset_metadata e tabela de ativos configurada

      Figura 3 – Catálogo, banco de dados e tabela do AWS Lake Formation

      Interface de permissões de concessão do AWS Lake Formation mostrando permissões de tabela com Selecionar e Descrever marcado, seção de permissões concedíveis e botão de opção Todos os acessos a dados selecionado

      Figura 4 – permissão de concessão do AWS Lake Formation

    6. Para Mesaselecione ativo.
    7. Sob Permissões de tabelaverificar Selecione e Descrever.
    8. Escolher Conceder para salvar as permissões.

Habilite a exportação de dados usando a AWS CLI

Configure a exportação de metadados usando o PutDataExportConfiguration API. O Zona de dados da Amazon service cria automaticamente um bucket de tabela S3 chamado aws-sagemaker-catalog com um asset_metadata namespace e agenda um trabalho de exportação diário. Os metadados de ativos são exportados uma vez por dia, por volta da meia-noite, horário native, por região da AWS.

O identificador de domínio SageMaker está disponível na página de detalhes do domínio no Console de gerenciamento da AWS. O acesso à tabela de ativos por meio do console S3 Tables ou da guia Dados no SageMaker Unified Studio pode levar até 24 horas.

Comando AWS CLI para habilitar a exportação do catálogo SageMaker:

aws datazone put-data-export-configuration --domain-identifier  --region  --enable-export

Use este comando AWS CLI para validar se a configuração está habilitada:

aws datazone get-data-export-configuration --domain-identifier  --region 
{
    "isExportEnabled": true,
    "standing": "COMPLETED",
    "s3TableBucketArn": "arn:aws:s3tables:::bucket/aws-sagemaker-catalog",
    "createdAt": "2025-11-26T18:24:02.150000+00:00",
    "updatedAt": "2026-02-23T19:33:40.987000+00:00"
}

Acesse a tabela de ativos exportados

  1. Navegue até Amazon SageMaker Domínios no Console de gerenciamento da AWS.
  2. Selecione seu domínio e selecione Abrir.
    Página de gerenciamento de domínios do Amazon SageMaker mostrando um domínio baseado no Identity Center com status Disponível, criado em 26 de fevereiro de 2026, com o botão Open unified studio destacado

    Figura 5 – Abra o Amazon SageMaker Unified Studio

  3. No SageMaker Unified Studio, escolha um projeto na lista Selecione um projeto lista suspensa.
  4. Para consultar os dados do catálogo do SageMaker, selecione Construir na barra de menu e escolha Editor de consultas. Para criar um novo projeto, siga as instruções no Guia do usuário do Amazon SageMaker Unified Studio.
    Painel de visão geral do projeto SageMaker Unified Studio mostrando IDE e aplicativos, análise de dados e integração com editor de consultas em destaque, orquestração e categorias de aprendizado de máquina e IA generativa

    Figura 6 – Abra o editor de consultas do SageMaker Unified Studio

O asset_metadata.asset tabela está disponível no Knowledge Explorer. Usar Explorador de dados para visualizar o esquema e consultar dados para realizar análises.

  1. Expandir Catálogos no Explorador de dados. Em seguida, selecione e expanda s3tablecatalog, catálogo aws-sagemaker, ativos_metadados, e ativo.
  2. Teste a consulta do catálogo com SELECT * FROM asset_metadata.asset LIMIT 10;.
SageMaker Unified Studio Query Editor com Data Explorer mostrando a hierarquia do Lakehouse, incluindo s3tablescatalog, aws-sagemaker-catalog, banco de dados assets_metadata e esquema de tabela de ativos com consulta SQL SELECT

Figura 7 – Consulta ao catálogo do SageMaker

Consultas para observabilidade e análise

Com a configuração concluída, execute consultas para obter insights sobre o uso e as alterações do catálogo. Para monitorar o crescimento dos ativos e ver como o catálogo de dados cresceu nos últimos cinco dias:

SELECT 
    DATE (snapshot_time) as date,
    COUNT (*) as total_assets
FROM asset_metadata.asset
WHERE 
     DATE (snapshot_time) >= CURRENT_DATE - INTERVAL '5' DAY
GROUP BY DATE (snapshot_time)
ORDER BY date DESC;

Editor de consultas do SageMaker Unified Studio mostrando consulta de agregação SQL na tabela assets_metadata.asset com resultados exibindo colunas de data e total_assets, retornando 42 ativos de 7 a 8 de março de 2026"

Figura 8 – Crescimento dos ativos de consulta

Use o catálogo para rastrear alterações de metadados e determinar quais ativos ganharam descrições ou propriedade ao longo do tempo. Use esta consulta para identificar ativos que obtiveram descrições de negócios nos últimos cinco dias, comparando o instantâneo de hoje com o instantâneo anterior.

SELECT
    t.asset_id,
    t.resource_name,
    p.business_description as description_before,
    t.business_description as description_now
FROM asset_metadata.asset t
JOIN asset_metadata.asset p ON t.asset_id = p.asset_id
WHERE DATE(t.snapshot_time) = CURRENT_DATE
    AND DATE(p.snapshot_time) = CURRENT_DATE - INTERVAL '5' DAY
    AND p.business_description IS NULL
    AND t.business_description IS NOT NULL;

Investigue os valores dos ativos em um momento específico usando esta consulta para recuperar metadados de qualquer information de snapshot.

SELECT
     asset_id,
     resource_name,
     business_description,
     extended_metadata('owningEntityId') as proprietor,
     snapshot_time
FROM asset_metadata.asset
WHERE asset_id = 'your-asset-id'
     AND DATE(snapshot_time) = DATE('2025-11-26');

Limpar recursos

Para evitar cobranças contínuas, limpe os recursos criados neste passo a passo:

  1. Desative a exportação de metadados:

Desative a exportação diária de metadados para interromper novos snapshots:

aws datazone put-data-export-configuration 
  --domain-identifier 

  1. Exclua recursos de tabelas do S3:

Opcionalmente, exclua o namespace S3 Tables que contém os metadados exportados para remover snapshots históricos e interromper cobranças de armazenamento. Para obter instruções sobre como excluir tabelas do S3, consulte Excluir uma tabela do Amazon S3 no Guia do usuário do Amazon Easy Storage Service.

Conclusão

Nesta postagem, você ativou o recurso de exportação de metadados do Catálogo SageMaker e usou consultas SQL para obter visibilidade em seu inventário de ativos. O recurso converte metadados de ativos em tabelas Apache Iceberg particionadas por information de snapshot, para que você possa realizar consultas de viagem no tempo, monitorar o crescimento do catálogo, rastrear a integridade dos metadados e auditar estados históricos de ativos. Isto proporciona uma forma repetível e de baixo custo para manter a integridade do catálogo e atender aos requisitos de governança ao longo do tempo.

Para saber mais sobre o catálogo do Amazon SageMaker, consulte o Documentação do catálogo Amazon SageMaker. Para explorar os formatos de tabela do Apache Iceberg e consultas de viagem no tempo, consulte o Documentação de tabelas do Amazon S3.


Sobre os Autores

Foto do autor Ramesh Singh

Ramesh é gerente técnico sênior de produtos (serviços externos) na AWS em Seattle, Washington, atualmente na equipe Amazon SageMaker. Ele é apaixonado por criar produtos de análise e ML/IA de alto desempenho que ajudam os clientes corporativos a atingir seus objetivos críticos usando tecnologia de ponta.

Foto do autor Pradeep Misra

Pradeep é arquiteto principal de soluções de análise e IA aplicada na AWS. Ele é apaixonado por resolver os desafios dos clientes usando dados, análises e IA aplicada. Fora do trabalho, ele gosta de explorar novos lugares e jogar badminton com a família. Ele também gosta de fazer experimentos científicos, construir LEGOs e assistir animes com suas filhas.

Foto do autor - Rohith Kayathi

Rohith é engenheiro de software program sênior na Amazon Internet Providers (AWS) e trabalha com a equipe Amazon SageMaker. Ele lidera catálogo de dados de negócios, curadoria generativa de metadados com tecnologia de IA e soluções de linhagem. Ele é apaixonado por construir sistemas distribuídos em larga escala, resolver problemas complexos e estabelecer o padrão de excelência em engenharia para sua equipe.

Foto do autor - Steve Phillips

Steve é gerente técnico principal de contas e especialista em análise da AWS na região da América do Norte. Atualmente, Steve se concentra no projeto arquitetônico de information warehouse, information lakes, pipelines de ingestão de dados e arquiteturas distribuídas em nuvem.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *