Desbloqueando os Arquivos: Transformando Documentos Não Estruturados em um Banco de Dados Pesquisável para Descoberta de Águas Subterrâneas


Introdução

Em todo o Sudão, as comunidades dependem das águas subterrâneas para beber, irrigar e sobreviver, mas a perfuração de um poço produtivo está longe de ser garantida. A geologia é complexa, os aquíferos variam muito e um furo falhado pode custar milhares de dólares. Décadas de pesquisas geológicas e relatórios de campo contêm os dados necessários para melhorar os resultados, mas esta informação tem sido dispersa em arquivos e nunca organizada de forma sistemática, tornando-a invisível para as pessoas que mais precisam dela.

MapaAid é uma organização sem fins lucrativos fundada na Universidade de Stanford cuja missão é capacitar intervenientes humanitários e de desenvolvimento, principalmente em África, para tomarem decisões baseadas em dados através de mapeamento melhorado por IA. Sua principal ferramenta, o BemMapr app (de uso gratuito), usa IA e dados geoespaciais para identificar zonas de águas subterrâneas rasas, orientando a perfuração de baixo custo para água potável e irrigação de pequenos agricultores. Uma contribuição crítica para estes modelos são os dados históricos sobre poços, furos e geologia dos aquíferos.

A Associação Sudanesa para Arquivamento de Conhecimento (SUDAAK) mantém uma das coleções mais ricas desses dados: quase 700 PDFs, TIFFs e JPGs digitalizados, totalizando mais de 5.000 páginas de pesquisas geológicas, relatórios de perfuração de poços e estudos de campo, disponíveis publicamente em www.wossac.com. No entanto, disponibilidade não é o mesmo que acessibilidade. Um investigador que procurasse dados de poços numa parte específica do Sudão teria de examinar manualmente centenas de documentos. Os dados foram digitalizados, mas sem um sistema de recuperação, permaneceram inexplorados.

Classificação de documentos digitalizados com IA multimodal

A Databricks fez parceria com a MapAid para construir um pipeline alimentado por IA que classifica todos os documentos do arquivo, marca-os com metadados geográficos e de assunto e extrai registros estruturados de poços e furos de documentos relacionados à água. O sistema é executado inteiramente em Databricks e é empacotado para implantação de comando único. Este artigo aborda a abordagem técnica e como ela se generaliza para qualquer organização que busca extrair conhecimento estruturado de grandes coleções de documentos digitalizados não estruturados.

O arquivo apresentou desafios que excluíram a extração tradicional de texto. Os documentos são digitalizações de relatórios físicos, com muitas décadas de existência, sem camada de texto incorporada. Algumas páginas estão distorcidas, outras combinam inglês e árabe e muitas incluem notas de campo manuscritas. Em vez de tentar o OCR como primeiro passo, a equipe reformulou o problema como um problema de compreensão visible: enviar imagens de páginas digitalizadas diretamente para modelos multimodais de IA que poderiam interpretar o conteúdo visualmente.

As páginas de cada documento são renderizadas como imagens e armazenadas em Volumes do catálogo do Unitycriando um conjunto de dados básico limpo e versionado. A partir daí, uma estratégia de amostragem inteligente reduz os custos de processamento: documentos mais curtos são analisados ​​na íntegra, enquanto documentos mais longos são amostrados a partir das suas secções mais informativas (páginas de título, introduções e conclusões). Isto reduziu o quantity de processamento de IA em mais de 70%, preservando a qualidade da classificação.

Cada página de amostra é analisada usando Funções de IA do Databricks (ai_query), que oferece suporte nativo a entradas multimodais e saída JSON estruturada. O modelo examina cada imagem de página e retorna:

  • Códigos de classificação Decimal Dewey, o sistema common de classificação de bibliotecas
  • Geografias sudanesas referenciadas no conteúdo
  • Um sinalizador de relevância hídrica que indica se a página contém dados de poço, poço ou aquífero

Como o AI Capabilities é executado diretamente no SQL, a equipe pode iterar em prompts e esquemas de saída sem criar uma infraestrutura separada de atendimento de modelo. Os resultados em nível de página são agregados em classificações em nível de documento, produzindo um catálogo estruturado e pesquisável, onde cada documento é marcado com o que cobre e onde se aplica.

Desbloqueando os Arquivos: Transformando Documentos Não Estruturados em um Banco de Dados Pesquisável para Descoberta de Águas Subterrâneas

Fig 1: Pipeline de documentos: extrair, classificar, avaliar e, opcionalmente, extrair dados de água by way of OCR

Extração de registros de poços e furos estruturados

Muitos dos documentos sinalizados pela água contêm exatamente o tipo de informação estruturada da qual os modelos WellMapr da MapAid dependem: localizações de poços, profundidades de perfuração, medições do lençol freático e taxas de rendimento. Essas informações geralmente são distribuídas por todo o documento, com coordenadas aparecendo em uma seção, medições de profundidade em outra e dados de rendimento em uma tabela de resumo, várias páginas depois. Extrair e vincular esses dados period um objetivo central da parceria.

Para cada documento relevante para a água, o gasoduto processa todas as páginas, em vez de apenas o subconjunto amostrado usado para classificação. OCR é realizado página por página usando um modelo multimodal servido através do API do modelo básicoque lida com layouts complexos em inglês, árabe e incluindo notas de campo manuscritas, dados tabulares e páginas de formato misto. Durante o OCR, o sistema também aplica uma abordagem de reconhecimento de entidades, identificando identificadores de poços e furos como entidades âncora, para que os registros que abrangem múltiplas páginas possam ser vinculados a um único native.

O texto extraído de todas as páginas é mesclado em uma representação de documento unificada, que é então processado em uma segunda passagem para extrair registros estruturados em formato JSON, capturando nomes de locais, coordenadas GPS, profundidades de perfuração, níveis de água estáticos e rendimentos de testes de bombas. Funções de IA do Databricks imponha respostas restritas por esquema, garantindo que esses atributos sejam capturados de forma consistente, mesmo quando aparecem em diferentes formatos ou seções no documento. O resultado é um conjunto de registros estruturados de poços e furos prontos para integração direta nos modelos de previsão WellMapr da MapAid.

Avaliação automatizada da qualidade em escala

A validação guide de centenas de classificações hidrogeológicas especializadas exigiria recursos significativos e profundo conhecimento do domínio. Em vez de tratar a avaliação como uma etapa separada a ser realizada após o fato, a equipe incorporou a avaliação automatizada da qualidade diretamente no pipeline como um estágio de primeira classe. Um modelo de IA separado, também chamado de AI Capabilities, atua como juiz: pontuando cada classificação em uma rubrica estruturada que abrange precisão, integridade e consistência. Para cada documento, o avaliador compara os códigos decimais de Dewey e as tags geográficas atribuídos com o conteúdo da página amostrada, verificando se as classificações são suportadas pelo que o modelo realmente observou.

Cada avaliação produz uma classificação categórica (excelente, bom, common ou ruim) e uma justificativa por escrito explicando a pontuação, criando uma trilha auditável para cada decisão tomada pelo pipeline. Os documentos com pontuação abaixo de um limite de confiança são sinalizados para revisão guide, direcionando o esforço humano limitado para os casos em que é mais importante. Na primeira execução completa, apenas uma pequena fração das classificações exigiu atenção humana.

Implantando uma solução independente em databricks

Um projeto como este abrange todas as camadas da pilha de dados e IA: armazenamento de arquivos, engenharia de dados, inferência de IA, análise estruturada de resultados, avaliação de qualidade e governança. O Databricks forneceu tudo isso em um único espaço de trabalho. Os arquivos brutos são armazenados em Catálogo de Unidade Volumes e todas as saídas do pipeline são gravadas em Lago Delta tabelas com confiabilidade ACID, evolução de esquema e linhagem completa de dados. O pipeline é orquestrado como um Trabalho de fluxo de lago sobre computação sem servidorentão o MapAid paga apenas pelo que cada execução consome.

Todo o sistema é empacotado como um Pacote de ativos do Databrickso que significa que pode ser implantado, atualizado e executado com um único comando. A MapAid recebeu uma solução independente que pode ser mantida sem experiência em vários serviços em nuvem. Como a lógica do gasoduto é dissociada do arquivo específico que processa, o mesmo sistema pode ser adaptado a outros arquivos hídricos, outras regiões ou outros domínios onde grandes coleções de documentos digitalizados precisam ser classificadas e tornadas pesquisáveis.

O que isso significa no terreno

Em sua primeira execução completa, o pipeline entregou:

  • 654 documentos e 5.570 páginas classificado
  • Concluído em menos de três horas
  • 95% das classificações classificado como “excelente” ou “bom” pelo avaliador automatizado
  • ~50% do arquivo identificado como contendo dados relacionados à água
  • 299 poço estruturado e furo registros extraídos com nomes de locais, profundidades e medições de rendimento

O pipeline reduziu o que levaria semanas ou meses para os especialistas do domínio em um processo que seria concluído em horas. O arquivo agora pode ser pesquisado por classificação, geografia ou presença de dados hídricos. Cada registro extraído com coordenadas e dados de profundidade alimenta diretamente as previsões de águas subterrâneas do MapAid, apoiando taxas de sucesso de perfuração mais altas e entrega mais rápida de água às comunidades necessitadas.

À medida que o SUDAAK continua a digitalizar novos documentos, o pipeline pode processar cada novo lote com um único comando, garantindo que o catálogo permaneça atualizado à medida que o arquivo cresce. O trabalho da MapAid abrange a África Oriental, incluindo a Etiópia e o Malawi, e existem arquivos semelhantes não classificados em todo o continente. A metodologia e a infraestrutura estão prontas para escalar.

Rupert Douglas-Bate, CEO (CEO) da MapAid, compartilhou a seguinte perspectiva sobre a parceria: “Nosso sistema de IA em evolução, WellMapr, pretende revolucionar a busca e localização de baixo custo de fontes sustentáveis de água subterrânea, mas precisa de dados de água de poço. Nossa missão para atingir esse objetivo foi bastante acelerada por nossa colaboração com Databricks for Good, que se conectou conosco através do Rotary Worldwide. O projeto Databricks for Good foi elementary no desenvolvimento de nossa Biblioteca On-line de Água (OWL) com o apoio de a Associação do Sudão para Arquivamento de Conhecimento (SUDAAK). A equipe da Databricks ajudou a transformar um grande arquivo desorganizado de dados históricos de água e solo do Sudão em um sistema estruturado usando a classificação Decimal de Dewey. Isso nos permite identificar rapidamente dados de poços de águas subterrâneas sustentáveis a um baixo custo, que agora podem ser usados para ajudar a desenvolver nosso algoritmo WellMapr. quem mais precisa.”

Leia mais sobre alguns de nossos outros projetos professional bono abaixo:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *