Modelos mais antigos de Nanopore lideram a análise de CpG, enquanto ferramentas mais recentes se destacam em outras marcas de DNA


Um benchmark comparativo mostra por que o algoritmo mais recente nem sempre é a melhor escolha e como o contexto de sequenciamento pode determinar em qual pesquisador de chamada de metilação deve confiar.

Modelos mais antigos de Nanopore lideram a análise de CpG, enquanto ferramentas mais recentes se destacam em outras marcas de DNA

Estudar: Benchmarking abrangente de ferramentas para detecção de metilação de DNA baseada em nanoporos. Crédito da imagem: gerado por IA usando ChatGPT/OpenAI

O sequenciamento de Nanopore pode detectar ADN modificações básicas diretamente do nativo ADNmas identificar com precisão essas marcas químicas continua a ser um desafio. Um artigo recente, publicado on-line como um ‘Artigo no Imprensa’ em Comunicações da Natureza, ferramentas de software program sistematicamente comparadas para detectar ADN modificações dos dados de sequenciamento de nanoporos.

Os pesquisadores descobriram que modelos mais recentes específicos ofereciam o melhor desempenho geral para não-CpG 5-metilcitosina (5mC), significando citosinas metiladas fora da citosina-guanina, ou CpGlocais, 6-metiladenina (6mA) e 4-metilcitosina (4mC), enquanto o modelo Dorado v4r1 mais antigo e o RockFish permaneceram os mais confiáveis ​​para CpG perfil de metilação. Essas descobertas fornecem orientação prática para a seleção de ferramentas computacionais para pesquisa epigenética e análise genômica baseada em nanoporos.

O papel do sequenciamento de nanoporos

ADN a metilação é uma importante modificação epigenética que contribui para a regulação da expressão gênica, estabilidade do genoma e desenvolvimento celular. Os métodos tradicionais para detectar essas modificações, como o sequenciamento de bissulfito, requerem tratamento químico que pode danificar ADNintroduzem viés de amplificação e complicam o mapeamento em regiões genômicas complexas.

Neste contexto, o sequenciamento de nanoporos fornece uma alternativa direta ao analisar ADN sem conversão química. Como indivíduo ADN moléculas passam através de um nanoporo de bioengenharia, mudanças na corrente elétrica revelam a presença de bases modificadas.

As células de fluxo R10 da Oxford Nanopore usam um nanoporo de bioengenharia mais estável com uma região de detecção mais longa, melhorando a resolução de sequências de homopolímeros e a precisão geral do sequenciamento. Algoritmos baseados em redes neurais interpretam esses sinais elétricos para identificar ADN modificações de base ao longo da sequência de nucleotídeos. À medida que a precisão do sequenciamento melhorou, o principal desafio passou da aquisição de sinais para a interpretação computacional desses sinais elétricos complexos.

Fontes de DNA e fluxo de trabalho de sequenciamento do genoma completo usado neste estudo. O DNA genômico de amostras de bactérias/plantas/mamíferos foi sequenciado nas células de fluxo R10.4.1. Um subconjunto de amostras (caixa direita no topo) também foi submetido ao Metil-Seq Enzimático (EMSeq) como referência para 5-metilcitosina (5mC). Imagem adaptada da fig 1a. Kulkarni, O., et al. (2026). Benchmarking abrangente de ferramentas para detecção baseada em nanoporos de ADN metilação. Comunidade Nacional. DOI: 10.1038/s41467-026-75183-6 usando ChatGPT/OpenAI.

Estrutura para benchmarking de ferramentas de metilação

Para avaliar os métodos computacionais atuais para análise de metilação de nanoporos, os pesquisadores compararam software program amplamente utilizado usando dados de sequenciamento do genoma completo de diversas fontes biológicas. Esses dados foram gerados a partir de cinco espécies bacterianas, duas espécies de plantas e amostras de mamíferos, incluindo tecido cerebral complete de camundongo, células-tronco embrionárias de camundongo e a linhagem celular humana HG002. Este conjunto de dados diversificado capturou uma ampla gama de ADN modificações, desde os padrões de metilação comuns encontrados em mamíferos até modificações menos frequentes presentes em plantas e bactérias.

Os conjuntos de dados incluíram dados de sequenciamento gerados usando células de fluxo Oxford Nanopore R10.4.1 em taxas de amostragem de 4 kHz e 5 kHz. O Metil-seq enzimático forneceu o 5mC dados de referência para as amostras de plantas e ratos e E. colienquanto os dados do HG002 humano foram comparados com um conjunto de dados de sequenciamento de bissulfito de genoma completo disponível publicamente. Dados públicos da Pacific Biosciences fornecidos 6mA e 4mC comparações para três espécies bacterianas, enquanto REBASE informações do motivo foram usadas para as outras duas espécies.

Os sinais brutos de nanoporos foram processados ​​com DeepBAM, DeepMod2, DeepPlant, f5C, RockFish e múltiplas versões dos modelos Dorado. O benchmark comparou cada modelo em diferentes modos de operação, incluindo configurações de alta precisão e superprecisão. O estudo também avaliou a precisão da detecção, taxas de falsos positivos, velocidade de processamento, uso de memória e os efeitos da profundidade de sequenciamento, qualidade de leitura e vizinhança. ADN modificações comparando as previsões de nanoporos com os conjuntos de dados de referência.

Limitações de desempenho e algoritmos

O benchmark mostrou diferenças claras no desempenho entre modelos computacionais. Para padrão CpG metilação, Dorado v4r1 e RockFish alcançaram a maior precisão e concordância com os conjuntos de dados de referência. Embora os modelos Dorado mais recentes tenham mostrado menor precisão em rotinas CpG perfil de metilação devido a taxas de falso-negativos mais altas, o Dorado v5r3 teve melhor desempenho geral para não-CpG 5mC e 4mCenquanto o Dorado v5r1 foi preferido em geral para 6mA. Os modelos v5.2 mais recentes reduziram alguns efeitos falso-positivos de modificações vizinhas, mas não foram consistentemente superiores porque vários tiveram uma recordação pior.

A análise também identificou limitações importantes compartilhadas por muitos algoritmos. Como o sinal elétrico medido por um nanoporo reflete múltiplas bases vizinhas, próximas ADN modificações podem aumentar chamadas falso-positivas ou falso-negativas dependendo da modificação, contexto de sequência, distância e modelo.

O DeepPlant teve um bom desempenho para não-CpG metilação em dados de plantas quando particular person ADN leituras foram avaliadas, mas tiveram um desempenho ruim em conjuntos de dados de mamíferos, indicando um forte viés de treinamento específico da espécie. O Dorado v5r3 geralmente proporcionou melhor desempenho quando as estimativas de metilação foram agregadas em locais genômicos individuais. O desempenho computacional também variou consideravelmente. Dorado forneceu o maior rendimento geral nos benchmarks bacterianos ao usar 12–14 GB de memória, enquanto o DeepPlant exigia uma média de mais de 84 GB. No entanto, o f5C superou o modelo Dorado 5mCG de superprecisão em velocidade e uso de memória.

O estudo também descobriu que a correlação no arroz CpG as análises geralmente estabilizaram após uma cobertura mediana de cerca de 20×, embora o erro continuasse a diminuir em coberturas mais altas. Os autores, portanto, recomendaram uma cobertura mediana de pelo menos 20×. Em três bactérias 6mA conjuntos de dados, a filtragem lê abaixo de uma pontuação de qualidade Phred de 20 reduziu a subclassificação dependente da qualidade e produziu estimativas de metilação mais consistentes.

Limitações do estudo

O estudo utilizou Metil-seq enzimático como dados de referência, apesar de seus possíveis vieses, não comparou a 5-hidroximetilcitosina e avaliou 4mC em relativamente poucos contextos de sequência. Também se baseou REBASE em vez de dados diretos da Pacific Biosciences para duas espécies bacterianas, e algumas análises foram limitadas ao cromossomo 1 ou exigiram que grandes conjuntos de dados fossem divididos em lotes computacionais menores.

Implicações para a pesquisa epigenética

Esta pesquisa oferece orientação prática para a seleção de ferramentas computacionais para análise epigenética baseada em nanoporos. Ao combinar algoritmos com ADN modificações, os cientistas podem aumentar a precisão do perfil de metilação e, ao mesmo tempo, reduzir erros analíticos. Essas descobertas são particularmente valiosas para a genômica de plantas, onde a detecção precisa deCpG a metilação pode apoiar pesquisas sobre desenvolvimento, respostas ao estresse e silenciamento de transposons.

De modo mais geral, a detecção confiável de ADN metilação do nativo ADN apoia o uso de sequenciamento de nanoporos em estudos epigenéticos. No entanto, este estudo de benchmarking não avaliou amostras clínicas, precisão diagnóstica, aplicações de medicina de precisão, características de culturas ou biomarcadores de doenças. À medida que os métodos computacionais avançam, o sequenciamento de nanoporos pode se tornar uma ferramenta mais confiável para estudar alterações epigenéticas associadas a doenças e outros biomarcadores relevantes, mas essas aplicações potenciais requerem validação separada.

Direções Futuras no Sequenciamento de Nanoporos

Em resumo, este estudo de benchmarking fornece uma avaliação abrangente das atuais ferramentas de análise de metilação de nanoporos, destacando seus pontos fortes e suas limitações. Embora os avanços no {hardware} de sequenciamento de nanoporos tenham melhorado a qualidade dos dados, a interpretação precisa de ADN modificações ainda dependem de métodos computacionais robustos.

O trabalho futuro deve concentrar-se no desenvolvimento de algoritmos que considerem melhor a influência dos países vizinhos. ADN modificações, mantendo alta precisão e eficiência computacional. Os conjuntos de dados de acesso aberto e a estrutura de benchmarking estabelecida pelos pesquisadores fornecem um recurso valioso para refinar a análise de metilação de nanoporos e apoiar avanços futuros em epigenética e genômica.

Isenção de responsabilidade: As opiniões expressas aqui são de responsabilidade do autor, expressas em sua capacidade privada e não representam necessariamente as opiniões da AZoM.com Restricted T/A AZoNetwork, proprietária e operadora deste web site. Esta isenção de responsabilidade faz parte do Termos e Condições de uso deste web site.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *