Apresentando visualizações de recursos | Weblog de tijolos de dados


Em um mundo perfeito, os recursos de ML são criados apenas uma vez. Mas para muitas equipes, um recurso que funciona em um pocket book ainda se transforma em lógica duplicada, pipelines frágeis, preenchimentos únicos, encanamento de loja on-line e sobrecarga de governança. Para casos de uso em tempo actual, como detecção de fraudes, personalização e recomendações, essa complexidade fica ainda mais difícil de absorver porque os modelos dependem de novos sinais para fazer previsões precisas. Os desafios comuns incluem:

  • Reimplementando a lógica de recursos em treinamento histórico e em tempo actual
  • Treinamento/servimento distorcido degradando o desempenho do modelo
  • Descobrindo e reutilizando recursos em casos de uso
  • Recursos de preenchimento com grande retrospectiva histórica da loja on-line
  • Manter infraestrutura de produção complexa em escala
  • Governando e rastreando a linhagem entre componentes e pipelines

A Databricks tem o prazer de anunciar a visualização pública de visualizações de recursos, uma estrutura para a criação de pipelines de recursos gerenciados diretamente no Databricks. Com Characteristic Views, você cria um recurso uma vez e deixa a plataforma cuidar de tudo, desde a experimentação até a veiculação em tempo actual.

O que são visualizações de recursos?

Uma Characteristic View é uma abstração simples e poderosa que abrange todo o ciclo de vida do ML. Um cientista de dados ou engenheiro de ML outline sua lógica de recursos – a fonte, a entidade, a coluna da série temporal e a computação. A partir dessa definição, o Characteristic Retailer do Databrick gera dados históricos com precisão pontual para experimentação e treinamento. Quando estiverem prontos, os usuários materializar o Characteristic View e o Databricks executam os pipelines que calculam os dados do recurso para uma inferência eficiente.

O mesmo A definição de recurso oferece suporte a fontes em lote e streaming. A experimentação e a produção são iguais para ambas as fontes. Mudar de uma fonte em lote para uma fonte de streaming é tão simples quanto algumas linhas de código.

Aqui está a mesma definição de visualização de recurso, executada como um recurso de streaming e em lote.

Por que visualizações de recursos?

1. Uma definição, sem distorções

A maior fonte de falha no ML em tempo actual é a lacuna entre como um recurso é calculado para treinamento e como é calculado no momento da veiculação. As Characteristic Views fecham essa lacuna por construção: há uma definição única e a plataforma calcula os valores de treinamento e os valores de inferência on-line em relação a essa definição única para que correspondam. Para as equipes de ML, isso significa muito menos código para manter e um caminho muito mais fácil para a produção.

Melhores recomendações para centenas de milhões de viajantes começam com melhores recursos. As visualizações de recursos reduzem drasticamente nosso código de recursos – nossos cientistas de dados vão mais rápido e se concentram no que impulsiona o valor do viajante, não em como calculá-lo.—Jules Marshall, diretor sênior de dados, Skyscanner

2. Código Genie para Experimentação

Apresentando visualizações de recursos | Weblog de tijolos de dados

Comece a construir de forma rápida e fácil com o Characteristic Engineering Consumer SDK e o Genie Code. O SDK simplifica a declaração de recursos localmente em um pocket book, calcula-os instantaneamente de maneira correta em dados históricos e monta um conjunto de treinamento preciso em um determinado momento.

Como o Databricks coloca definições de recursos, dados de recursos, treinamento de modelo e MLflow em um ambiente, os cientistas de dados podem passar da ideia de recurso ao experimento de modelo em um único pocket book.

Com o Genie Code, as equipes podem usar Characteristic Views para executar fluxos de trabalho únicos de experimentação de modelos: identificando as fontes de dados corretas, gerando ideias de recursos e experimentando modelos e dados em um único pocket book.

3. Pipelines prontos para produção que você não precisa operar

Quando um recurso estiver pronto para produção, registre-o no Catálogo do Unity e chame materialize_features. A Databricks cria e gerencia os pipelines em seu nome, escrevendo para as lojas on-line e offline apropriadas.

Pronto para produção significa dados de alta qualidade, infraestrutura escalonável e confiabilidade de missão crítica. O Characteristic Views orquestra produtos GA testados em batalha, como Lakebase e RTM, otimizando como os componentes funcionam juntos para oferecer suporte a cargas de trabalho do Characteristic Serving. Os casos de canto funcionam imediatamente, como preencher janelas longas, recursos de fluxo ou expirar linhas obsoletas da loja on-line.

4. Atualização em tempo actual quando você precisar

Para casos de uso em que cada novo evento deve alterar imediatamente o valor servido ao modelo, as Characteristic Views oferecem suporte a recursos de streaming provenientes do Kafka, fornecendo latência p99 ponta a ponta de 200 ms desde o evento até a disponibilidade on-line. Um RollingWindow analisa o carimbo de knowledge/hora de cada evento com resolução de milissegundos, portanto, um agregado como “soma das transações nos últimos 10 minutos” é sempre atual.

Nos bastidores, o Databricks orquestra os componentes que tornam isso rápido: o Spark Realtime Mode processa eventos continuamente e atualiza agregados contínuos por evento, em vez de esperar por microlotes; Lakebase serve como uma loja on-line otimizada para streaming que minimiza a amplificação de gravação para upserts pequenos e frequentes; e o Mannequin Serving recupera recursos no momento da inferência. Você cria o recurso de janela rolante – a plataforma cria o pipeline.

5. Catálogo governado no Unity, integrado em toda a plataforma

Recursos materializados são dados e devem ser governados como dados. No Databricks, as Characteristic Views são objetos do Unity Catalog de primeira classe – detectáveis, com acesso controlado e rastreados com linhagem completa. Os recursos são empacotados com o modelo: quando você registra um modelo com MLflow, suas dependências de recursos são registradas e, no momento da inferência, o Mannequin Serving procura automaticamente os recursos necessários — sem código de pesquisa personalizado, sem encanamento handbook. Combinadas com MLflow, Mannequin Serving e Genie Code, as Characteristic Views tornam o Databricks um lugar único para desenvolver, implantar e controlar toda a sua pilha de ML.

GIF do Genie Code adicionando recursos a um notebook

O Genie Code é nativamente integrado ao Characteristic Views, para que os cientistas de dados possam criar e iterar recursos a partir de prompts simples. Peça para adicionar novos recursos a um pocket book e o Genie Code poderá gerar o código certo no contexto, usando os dados e a governança já existentes no Databricks.

Como as equipes estão usando as visualizações de recursos

  • Serviços financeiros as equipes usam os recursos de streaming do RollingWindow para sinais de transação em menos de um segundo para detecção de fraudes.
  • Personalização e recomendação as equipes capturam as intenções mais recentes do usuário na sessão para impulsionar o engajamento, enquanto reutilizam as mesmas definições off-line para o treinamento do modelo.
  • Equipes de plataforma consolide pipelines de recursos anteriormente fragmentados em objetos governados do Unity Catalog, eliminando a carga operacional de lojas on-line autogerenciadas e processadores de fluxo.

Começando

Para começar, basta pedir ao Genie para usar Characteristic Views para criar um novo experimento.

Isso pode ajudá-lo definir um recursoanalise a importância do seu conjunto de dados, crie um conjunto de treinamento e, quando estiver pronto para produção, registre e materializá-lo. A materialização de streaming também requer um espaço de trabalho de nível empresarial em uma região que ofereça suporte ao Lakebase.

Para saber mais, confira a documentação:

As visualizações de recursos permitem criar um recurso uma vez e usá-lo em experimentação, lote e veiculação em tempo actual, sem operar você mesmo a infraestrutura subjacente. Pegue um recurso de lote existente e veja quão mais forte é o sinal que ele fornece com atualização em nível de milissegundos e deixe o Databricks executar os pipelines que o levam até lá.

Se esses são os tipos de problemas que você deseja resolver, estamos contratando.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *