AUDITORIA CIENTIFICA COMPARATIVA ENTRE WHOLE-GENOME SEQUENCING E MICROARRAY: EVIDENCIA DE MAIOR FIDELIDADE GENOTIPICA DO WGS EM LOCI DISCORDANTES

Fabiano de Abreu Agrela Rodrigues, PhD, Pos-PhD, MRSB/P0149176

Centro de Pesquisa e Analises Heraclito (CPAH); Genetic Intelligence Project (GIP); Porto, Portugal

ORCID: 0000-0002-5487-5852 | Ciencia Vitae: 8316-38CC-0664 | Lattes: 1428461891222558

DOI: 10.66741/prp.2026.006

Resumo

Introducao: A genotipagem por microarray e o whole-genome sequencing (WGS) sao amplamente utilizados em genomica pessoal e pesquisa. A fidelidade relativa quando as tecnologias discordam requer avaliacao especifica.

Objetivo: Avaliar comparativamente a fidelidade genotipica de WGS e microarray por uma auditoria em duas fases: adjudicacao intrassujeito de discordancias e validacao externa de uma pipeline WGS contra o benchmark Genome in a Bottle (GIAB).

Metodos: Foram identificados 1.008 loci nos quais TellmeGen e MyHeritage concordavam entre si e discordavam do WGS. Esses loci foram reavaliados por BCFtools e GATK HaplotypeCaller a partir das reads WGS. Em paralelo, uma pipeline WGS reconstruida para HG002 foi comparada ao benchmark GIAB v5.0q com vcfeval.

Resultados: BCFtools sustentou o genotipo WGS em 991/1.008 loci (98,31%; IC95% de Wilson: 97,32-98,94%) e GATK HaplotypeCaller em 1.007/1.008 loci (99,90%; IC95%: 99,44-99,98%). Na validacao HG002, a pipeline apresentou precision de 0,9705, sensitivity de 0,9703 e F1 de 0,9704.

Conclusao: No desenho avaliado, as reanalises algoritmicas das reads sustentaram fortemente o WGS nos loci discordantes. A validacao externa contra GIAB apoia a qualidade global da pipeline WGS, sem demonstrar superioridade universal sobre todos os microarrays, variantes ou contextos genomicos.

Palavras-chave: whole-genome sequencing; microarray; genotipagem; GIAB; BCFtools; GATK HaplotypeCaller; benchmarking.

1. Introducao

Microarrays interrogam um conjunto predefinido de variantes por hibridizacao de sondas; o WGS permite avaliar uma faixa muito mais ampla do genoma acessivel. Ambas as abordagens podem apresentar elevada concordancia em SNPs comuns, mas discordancias exigem evidencia adicional para distinguir concordancia de verdade biologica.

Esta auditoria avaliou se, nos loci em que dois resultados de microarray concordavam e divergiam do WGS, a evidencia de rechamada a partir das reads WGS favorecia uma das chamadas. Uma segunda fase avaliou a performance de uma pipeline WGS reconstruida contra um benchmark externo GIAB.

2. Materiais e Metodos

2.1 Estrutura experimental

Fase Amostra Comparacao Funcao
Fase 1 Mesmo individuo TellmeGen x MyHeritage x WGS Identificar e adjudicar loci discordantes
Fase 2B2 HG002 WGS reconstruido x GIAB v5.0q Medir desempenho externo da pipeline WGS
Consolidacao Duas linhas de evidencia Interpretacao conjunta Delimitar forca e limites da conclusao

2.2 Fase 1: comparacao intrassujeito

Foram comparados genotipos validos em TellmeGen, MyHeritage e WGS do mesmo individuo. O subconjunto de interesse foi definido como TellmeGen = MyHeritage != WGS. Os 1.008 loci assim selecionados foram reavaliados com BCFtools, em configuracao padrao e Q20/MQ20, e com GATK HaplotypeCaller.

BCFtools e GATK representam independencia algoritmica de variant calling, mas nao independencia tecnologica integral, pois operam sobre as mesmas reads e alinhamento do WGS.

2.3 Fase 2B2: benchmark externo

A pipeline WGS reconstruida foi aplicada a amostra HG002. O alinhamento utilizou BWA 0.7.19, seguido por fixmate, ordenacao e markdup. O conjunto de comparacao foi o benchmark GIAB HG002 v5.0q, e a avaliacao foi conduzida com vcfeval.

O BAM foi verificado por samtools quickcheck. Foram registadas aproximadamente 806,7 milhoes de reads e 6,22 milhoes de duplicatas primarias (~0,78%); o read group indicava HG002, biblioteca PCR-free e plataforma DNBSEQ.

2.4 Estatistica

Foram calculadas proporcoes de suporte ao WGS no subconjunto condicionado de 1.008 loci; intervalos de confianca de 95% foram calculados pelo metodo de Wilson. Para GIAB, foram reportadas precision, sensitivity e F1-score.

3. Resultados

3.1 Concordancia inicial

Entre 455.598 SNPs com genotipo valido nas tres fontes, 454.401 (99,7373%) concordaram entre TellmeGen, MyHeritage e WGS. Ocorreram 1.197 conflitos 2×1, dos quais 1.008 apresentaram TellmeGen = MyHeritage != WGS.

Fonte unica divergente SNPs % dos conflitos 2×1
WGS/CRAM 1.008 84,28%
TellmeGen 163 13,63%
MyHeritage 25 2,09%

3.2 Rechamada dos 1.008 loci

Metodo Favoreceu WGS Favoreceu microarrays Terceiro genotipo Suporte ao WGS
BCFtools 991 15 2 98,31% (IC95% 97,32-98,94%)
GATK HaplotypeCaller 1.007 1 0 99,90% (IC95% 99,44-99,98%)

Essas proporcoes descrevem apenas o subconjunto selecionado por discordancia e nao constituem estimativas de acuracia global de WGS ou microarray.

3.3 Benchmark HG002 contra GIAB

Metrica Valor
True positive baseline 4.273.478
True positive call 4.328.758
False positive 131.612
False negative 130.802
Precision 0,9705
Sensitivity 0,9703
F1-score 0,9704

O resultado sem o threshold selecionado foi praticamente identico: precision 0,9703, sensitivity 0,9705 e F1 0,9704. O vcfeval tambem reportou regioes Evaluation too complex e 5.390 variantes problematicas no baseline ignoradas; portanto, essas metricas se referem ao espaco de variantes e regioes efetivamente avaliaveis pelo benchmark.

4. Discussao

4.1 Interpretacao da Fase 1

A convergencia de BCFtools e GATK com a chamada WGS torna improvavel que a maior parte das discordancias seja atribuivel exclusivamente ao caller WGS original. No entanto, todos os callers examinaram as mesmas moleculas sequenciadas e podem reproduzir erros pre-calling, incluindo basecalling, alinhamento, referencia, mapeamento em paralogos, vies de GC e artefatos de biblioteca.

4.2 Interpretacao dos microarrays

A concordancia entre TellmeGen e MyHeritage e relevante, mas nao e um truth set independente. Ambos pertencem a mesma classe tecnologica e podem compartilhar vieses relacionados a design de sondas, clusters de intensidade, strand, representacao REF/ALT, assembly ou conversao/harmonizacao de arquivos. Sem dados de intensidade originais e manifestos de chip, as discordancias devem ser atribuidas a resultados processados de microarray, e nao automaticamente a falha fisica de sonda.

4.3 Interpretacao do benchmark GIAB

A comparacao HG002-GIAB fornece validacao externa da pipeline WGS, mas F1=0,9704 nao significa que 97,04% de todas as bases do genoma estejam corretas. A metrica corresponde a media harmonica entre precision e sensitivity dentro das regioes e variantes avaliaveis no benchmark utilizado.

4.4 Limitacoes

  • Nao foi realizada comparacao head-to-head entre WGS e microarray da mesma amostra HG002 contra o mesmo truth set GIAB.

  • Os 1.008 loci foram selecionados por discordancia; por isso, os percentuais de 98,31% e 99,90% nao estimam taxas globais de erro das tecnologias.

  • BCFtools e GATK fornecem independencia algoritmica, nao validacao tecnologica ortogonal.

  • Nao foi realizada validacao direta dos loci pessoais por Sanger, amplicon deep sequencing independente ou long-read com preparacao de biblioteca distinta.

4.5 Implicacao operacional

Os resultados sustentam a classificacao WGS_FAVORECIDO_NO_DESENHO_DA_AUDITORIA. Para fusao de dados, a chamada WGS deve ser priorizada em conflitos do padrao TellmeGen = MyHeritage != WGS quando ha suporte de reads e de rechamada independente; conflitos de baixa qualidade ou regioes complexas devem permanecer anotados como nao resolvidos ate validacao ortogonal.

5. Conclusao

Nesta auditoria, o WGS foi fortemente favorecido nos loci discordantes investigados: 98,31% das rechamadas por BCFtools e 99,90% das rechamadas por GATK sustentaram o genotipo WGS em loci onde dois resultados de microarray concordavam entre si. A performance da pipeline reconstruida em HG002 contra GIAB forneceu apoio externo adicional a sua qualidade analitica.

A evidencia nao demonstra que WGS seja universalmente superior a qualquer microarray, nem quantifica uma diferenca absoluta de acuracia global. O experimento decisivo seria uma comparacao WGS e microarray da mesma amostra HG002 contra GIAB, complementada por validacao ortogonal de uma amostra representativa dos loci discordantes.

Declaracoes

Conflito de interesses

O autor e Diretor Cientifico do Centro de Pesquisa e Analises Heraclito (CPAH) e criador do Genetic Intelligence Project (GIP), iniciativas que utilizam analise genomica. Essa relacao foi declarada para transparencia e nao altera as limitacoes metodologicas nem a interpretacao restrita apresentada neste manuscrito.

Etica e privacidade

A Fase 1 utilizou dados genomicos pessoais do autor, que nao serao disponibilizados publicamente por razoes de privacidade. A Fase 2 utilizou dados publicos de referencia HG002.

Disponibilidade de dados e codigo

Os dados de HG002 e os benchmarks GIAB sao publicamente disponiveis atraves do NIST Genome in a Bottle. O codigo, parametros e listas de loci podem ser disponibilizados de forma reprodutivel, mediante remocao de identificadores pessoais e sob solicitacao razoavel ao autor correspondente.

Contribuicoes do autor

Fabiano de Abreu Agrela Rodrigues: concepcao do estudo, curadoria dos dados, analise, interpretacao, redacao do manuscrito e aprovacao da versao final.

Agradecimentos

O autor agradece ao Genome in a Bottle Consortium e ao NIST pela disponibilizacao de materiais e benchmarks publicos, bem como as comunidades mantenedoras de BCFtools, GATK, samtools, BWA e RTG Tools.

Referencias essenciais

  1. Li H. A statistical framework for SNP calling, mutation discovery, association mapping and population genetical parameter estimation from sequencing data. Bioinformatics. 2011;27(21):2987-2993.

  2. Van der Auwera GA, OConnor BD. Genomics in the Cloud: Using Docker, GATK, and WDL in Terra. OReilly Media; 2020.

  3. Li H, Durbin R. Fast and accurate short read alignment with Burrows-Wheeler transform. Bioinformatics. 2009;25(14):1754-1760.

  4. Li H, et al. The Sequence Alignment/Map format and SAMtools. Bioinformatics. 2009;25(16):2078-2079.

  5. Zook JM, et al. A robust benchmark for detection of germline large deletions and insertions. Nat Biotechnol. 2020;38:1347-1355.

  6. Krusche P, et al. Best practices for benchmarking germline small-variant calls in human genomes. Nat Biotechnol. 2019;37:555-560.

  7. Wilson EB. Probable inference, the law of succession, and statistical inference. J Am Stat Assoc. 1927;22:209-212.

  8. Genome in a Bottle Consortium, NIST. HG002 benchmark v5.0q: release documentation and truth-set resources. https://www.nist.gov/programs-projects/genome-bottle

  9. Cleary S, et al. Comparing variant call files for performance benchmarking of next-generation sequencing variant calling pipelines. bioRxiv. 2015. doi:10.1101/023754.

Nota biografica do autor

Fabiano de Abreu Agrela Rodrigues, MRSB/P0149176, e Pos-PhD em Neurociencias, Doutor em Neurociencias e Doutor em Ciencias da Saude. e Diretor Cientifico do Centro de Pesquisa e Analises Heraclito (CPAH) e criador do Genetic Intelligence Project (GIP). e membro da Royal Society of Biology, Society for Neuroscience, European Society of Human Genetics, Sociedade das Ciencias Medicas de Lisboa, entre outras entidades cientificas. ORCID: 0000-0002-5487-5852.

Related posts

CINETOSE, FUNÇÃO VESTIBULAR E NEURODEGENERAÇÃO: PROPOSTA CONCEITUAL SOBRE A RESPONSIVIDADE VESTIBULAR COMO POSSÍVEL MARCADOR DE PRESERVAÇÃO COGNITIVA

A DISSOCIAÇÃO ENTRE REGISTRO E MANUTENÇÃO DA INFORMAÇÃO NEGATIVA NO ENVELHECIMENTO: POR QUE O IDOSO PARECE ESQUECER O PROBLEMA E LEMBRA QUANDO RECEBE A PISTA

QI É UNIVERSAL? NORMAS POPULACIONAIS, NEUROCIÊNCIA DA INTELIGÊNCIA E TRANSFERIBILIDADE GENÔMICA ENTRE BRASIL E EUROPA