De PDFs de manutenção a insights acionáveis com agentes de IA
Os fornecedores de operações e manutenção de usinas solares e eólicas normalmente entregam relatórios em formato PDF, com informações importantes espalhadas em textos, tabelas e imagens livres. Este formato é acessível, mas não escalável: as equipas devem ler manualmente cada documento para compreender falhas, tendências ou problemas recorrentes, tornando as comparações entre fábricas lentas e inconsistentes à medida que o número de ativos aumenta.
A Plenitude e a Databricks criaram um sistema baseado em agente que converte esses relatórios de manutenção em PDF em dados estruturados. A ideia central é simples: transformar documentos em dados e, em seguida, usar um agente de IA para obter insights acionáveis desses dados. Os usuários agora podem fazer perguntas em linguagem pure, analisar tendências ao longo do tempo, comparar fábricas e exportar resultados estruturados, em vez de navegar pelos relatórios um por um.
Arquitetura baseada em agente para PDF para análise de dados
A solução começa com a ingestão orientada por eventos de relatórios em PDF no nível da planta. Cada novo relatório aciona um trabalho do Databricks que analisa o documento e aplica a extração baseada em LLM. Os elementos extraídos são serializados como JSON e armazenados no Delta Lake, que mantém o histórico completo da versão para auditoria e reprodução.

Para resolver o problema basic de que as informações de manutenção residem quase inteiramente em PDFs não estruturados, o Plenitude usa Databricks Doc Intelligence AI Features – especificamente ai_parse_documentpara extrair vários tipos de elementos de cada página, incluindo blocos de texto, tabelas, figuras e metadados. Cada elemento é enriquecido com atributos como planta, período do relatório, número de página e tipo de conteúdo, e cada registro mantém um hyperlink direto para o relatório unique para rastreabilidade.
Essa estrutura libera recursos poderosos:
- Filtrando por tempo, categoria e geografia.
- Identificando tipos de conteúdo e usando coordenadas espaciais.
- Rastreando cada perception até o PDF unique.
- Integração com ferramentas de BI e agentes digitais sem alterar os documentos subjacentes.
Em vez de arquivos estáticos, os relatórios de manutenção tornam-se uma camada de dados persistente, pronta para análises avançadas e raciocínio do agente.
Processamento de dados em Databricks: do PDF ao Delta Lake
A arquitetura é organizada em três camadas principais: ingestão e análise, estruturação de dados e interação baseada em agentes.

Etapa 1: análise
Usando ai_parse_documento pipeline extrai texto, tabelas e metadados de cada página e os serializa como objetos JSON estruturados. Até tabelas complexas são capturadas com contexto completo, incluindo sua localização na página e representação HTML.
Etapa 2: normalização e armazenamento
Para cada página (page_id) e objeto (id), o sistema cria uma linha em uma tabela Delta Lake. Cada linha contém:
- O conteúdo JSON extraído.
- Identificadores de páginas e objetos.
- Coordenadas (coords) que representam a caixa delimitadora na página.
- Tipo de conteúdo (por exemplo, texto ou tabela).
- Metadados de alto valor, como mês, ano, nome do arquivo, categoria e país.
Esse modelo normalizado transforma os PDFs em um conjunto de dados unificado e consultável, transparente e fácil de combinar com outras fontes, preservando ao mesmo tempo a rastreabilidade complete até os documentos originais.
Etapa 3: espaço Genie e modo Agente
Além dessa camada de dados selecionada, o Plenitude cria um espaço Genie dedicado e, em seguida, aproveita o modo Agente do Genie para realizar pesquisas profundas nos dados. Gênio usa as tabelas estruturadas do Delta Lake como contexto principal e permite que os usuários interajam com os dados de manutenção usando linguagem pure.
Quando um usuário faz uma pergunta, o Genie:
- Usa metadados semânticos em Catálogo de Unidade para identificar tabelas e colunas disponíveis.
- Aproveita descrições detalhadas de colunas, um armazenamento de conhecimento selecionado e amostras SQL para orientar a geração de consultas.
- Gera e executa SQL na camada estruturada.
- Retorna respostas, visualizações e resultados opcionalmente exportáveis.

Esse design permite que o Genie entenda a semântica comercial dos dados de manutenção e sua estrutura subjacente, resultando em respostas precisas e conscientes do contexto.

Por que metadados e instruções são importantes para o Genie
Para obter resultados confiáveis de conjuntos de dados complexos derivados de PDF, o contexto por si só não é suficiente. A Plenitude descobriu que dois padrões de design são críticos: metadados ricos e instruções explícitas para o espaço Genie.
Metadados como contrato com o agente
Descrições bem definidas de tabelas e colunas informam ao Genie o que cada campo significa e como deve ser usado. Por exemplo, page_id identifica a página de origem no relatório unique, kind indica se o elemento é texto ou uma tabela, coords codifica a localização espacial e content material contém o texto extraído ou a representação de tabela. Esses metadados transformam JSON bruto em conhecimento compreensível que o Genie pode raciocinar.
Instruções gerais como aterramento operacional
Quando os dados são fragmentados ou abrangem várias páginas, instruções específicas do domínio são adicionadas ao arquivo native do espaço Genie. armazenamento de conhecimento tornar-se essencial. O Plenitude codifica regras para lidar com tabelas de múltiplas páginas, ignorando artefatos HTML, excluindo linhas de cabeçalho e aplicando filtros específicos da planta.
Um exemplo prático: mesmo com metadados completos, o Genie pode calcular um complete trimestral incorreto se somar as colunas acumuladas no ano ou ignorar os meses faltantes. Ao adicionar instruções claras, como “usar apenas colunas no nível do mês, nunca campos acumulados no ano” e “validar se todos os meses obrigatórios estão presentes antes da soma”, a equipe fornece à Genie proteções operacionais que garantem resultados consistentes.
Essas instruções específicas do espaço do Genie, combinadas com metadados do Unity Catalog, ajudam o Genie a aplicar a lógica correta para interpretar os dados corretamente.
Usando Genie e Agent Bricks para fluxos de trabalho de agentes escaláveis
Embora o Genie forneça uma experiência poderosa ao agente de pesquisa além da camada de manutenção estruturada, o Plenitude também precisa de fluxos de trabalho repetíveis e orquestração para dar suporte a um conjunto crescente de casos de uso. Agente Tijolos é o próximo passo nessa evolução.
Com Agent Bricks, o Plenitude pode passar de padrões “LLM mais immediate” para fluxos de trabalho de agente que executam sequências de ações em nome de analistas e engenheiros de manutenção. As mesmas tabelas, metadados e instruções selecionadas do Delta Lake que alimentam o Genie podem ser reutilizadas por agentes estilo Supervisor criados com Agent Bricks para:
- Decomponha questões complexas em tarefas analíticas menores.
- Chame os fluxos da ferramenta Genie para gerar e executar SQL.
- Acione ações downstream, como geração de relatórios ou criação de alertas.
O que antes exigia a fiação guide de prompts, ferramentas e lógica de validação agora pode ser centralizado em Agent Bricks, na mesma plataforma Databricks que gerencia os dados.
Otimizando o desempenho com agrupamento automático de líquidos
Como as consultas orientadas por agente são exploratórias e dinâmicas, o ajuste tradicional baseado em Z-ORDER nem sempre é excellent. A Plenitude observou que os padrões de acesso evoluem à medida que novos relatórios, usuários e perguntas aparecem, o que dificulta a manutenção do agrupamento guide.
O agrupamento líquido automático, por outro lado, aprende como as tabelas são realmente usadas e adapta o format de acordo. Isso reduz a necessidade de design inicial de índices e ajustes contínuos, o que é especialmente importante durante as fases de prova de conceito e de entrada em operação. Nesse contexto, o clustering automático é a escolha preferida para cargas de trabalho orientadas por agente e LLM em tabelas Delta.
Protegendo o acesso a dados para Genie Rooms
Os dados de manutenção geralmente têm requisitos de acesso específicos do país ou da região. Para impor essas regras de forma consistente, o Plenitude usa segurança em nível de linha em combinação com o Unity Catalog e tabelas.
Uma função do Unity Catalog determina quais países o usuário atual pode acessar e retorna uma lista ou a palavra-chave ALL se eles tiverem visibilidade complete. Uma tabela então filtra as linhas com base nessa função, para que cada usuário veja apenas os dados dos países autorizados.
Quando os usuários interagem por meio do Genie Room, todas as consultas são executadas na tabela filtrada, de modo que a segurança em nível de linha é aplicada automaticamente. Isso significa que os usuários podem fazer perguntas em linguagem pure, mas apenas receber resultados dos dados que têm permissão para ver. O mesmo conjunto de dados alimenta o Genie, os agentes e as ferramentas de BI, enquanto a visibilidade se ajusta por usuário.
Melhorias futuras: rumo à manutenção preditiva
Como os relatórios de manutenção contêm incidentes abertos e detalhes de falhas, o modelo de dados estruturado é uma base sólida para a manutenção preditiva. Os inversores são um bom exemplo: falhas podem levar à perda de vários megawatts-hora por unidade, e problemas recorrentes geralmente aparecem primeiro nas notas de manutenção.
Ao analisar padrões de falhas ao longo do tempo, o Plenitude pode:
- Identifique possíveis problemas de gravação.
- Detecte sinais de alerta precoce.
- Priorize plantas que precisam de investigação mais profunda.
- Alimente modelos preditivos com históricos de incidentes de maior qualidade.
O sistema baseado em agentes transforma esses sinais em análises, tendências e visualizações acessíveis para que as equipes possam antecipar problemas em vez de simplesmente reagir a eles.
Principais benefícios e capacidades
Na abordagem anterior, a análise limitava-se à leitura particular person dos relatórios, o que dificultava a construção de tendências históricas, a comparação de fábricas ou a geração de resultados estruturados. Criar gráficos, exportar resultados ou combinar insights de vários relatórios period, na melhor das hipóteses, guide e muitas vezes inviável.
Com o Modo Agente Genie baseado em Databricks e em um modelo de dados amigável ao agente, o Plenitude pode:
- Discover dados de manutenção ao longo do tempo e entre plantas.
- Gere visualizações e exporte resultados, incluindo saídas em PDF.
- Detecte sinais precoces e padrões recorrentes.
- Análise de escala sem esforço guide de escalonamento.
Ao combinar dados estruturados, metadados de negócios e raciocínio de IA, o sistema gera análises, tendências e visualizações que apoiam a detecção precoce e a antecipação de problemas, e não apenas relatórios retrospectivos.
Saiba mais sobre Gênio dos Databricks e Agente Tijolos.