🧬Ask My DNA

Datos abiertos: qué marcadores lleva el chip del que salió tu archivo de ADN

dna-chip-coverage — una tabla de cobertura por marcador y por plataforma, construida a partir de los manifiestos publicados de cada array. CC BY 4.0, archivada con DOI.

Un archivo de datos brutos de ADN de consumo es la lista de marcadores que un array de genotipado concreto midió. Si un marcador no está en ese array, nada en el archivo respalda una afirmación sobre él — pero el archivo no lo dice, y las herramientas que lo leen a menudo devuelven una respuesta igualmente.

Este conjunto de datos convierte la cobertura en un hecho verificable. Responde a una sola pregunta y a ninguna más: ¿lleva el array X el marcador rsY?

Qué contiene

70 marcadores de relevancia clínica, resueltos contra cinco manifiestos publicados de arrays de Illumina, más productos de consumo y marcadores observados en archivos de datos brutos publicados.

  • Cada dato registra la evidencia en la que se apoya: un manifiesto, un archivo observado o una inferencia a partir de una base documentada.
  • Donde el registro público no resuelve la pregunta, el valor es unknown en lugar de una conjetura. unknown es un valor real, y la columna notes explica por qué.
  • Un script de construcción regenera la tabla completa desde los manifiestos originales, así que cada cifra de esta página es reproducible desde cero.
  • Queda fuera del alcance, deliberadamente: interpretación de genotipos, estimaciones de riesgo, frecuencias alélicas y cualquier cosa que se parezca a consejo médico.

Cobertura en los cinco arrays publicados

De los 70 marcadores del conjunto de datos, esto es lo que lleva cada array publicado:

Cobertura de 70 SNP de relevancia clínica en cinco arrays de genotipado de Illumina publicados
ArrayLlevaAusentesSin determinar
Infinium OmniExpress-24 v1.2 A133370
Infinium OmniExpress-24 v1.3 A133370
Infinium GSA-24 v1.0 C1 (build 37)56131
Infinium GSA-24 v1.0 C2 (build 38)56131
Infinium GSA-24 v2.0 A26451

«Ausente» significa: este array no tiene sonda para ese locus. Un chip de consumo construido sobre uno de estos arrays puede añadir sondas propias, así que un hueco en la base no es automáticamente un hueco en el chip — y ningún fabricante de consumo publica el manifiesto de su chip.

Qué muestran los datos

Cinco hallazgos, cada uno desarrollado caso por caso en notable-gaps.md.

1. Media pareja es peor que ninguna

Asignar un genotipo APOE ε exige rs429358 y rs7412 a la vez; ninguno de los dos sitios significa nada por separado. Los cinco arrays llevan rs7412. Exactamente uno lleva rs429358. Así que un archivo de un chip basado en OmniExpress-24 o GSA v1.0 entrega la mitad que parece una respuesta, y nada en él advierte de que el otro sitio nunca se midió. La misma forma reaparece en TPMT (*3B sin *3C), HFE (H63D sin C282Y) y SERPINA1 (PiZ sin PiS).

Leer el caso completo

2. El error tiene dirección, y es tranquilizadora

CYP2C19 es el caso más claro. Los dos alelos de pérdida de función — rs4244285 (*2) y rs4986893 (*3) — están en los cinco arrays. rs12248560 (*17), que aumenta la función, falta en ambas revisiones de OmniExpress-24. Un metabolizador ultrarrápido no puede por tanto distinguirse de uno normal y se informa sistemáticamente como normal. En estos casos el marcador que desaparece es desproporcionadamente el que habría cambiado una decisión.

Leer el caso completo

3. Hay preguntas que ningún array de aquí puede responder

rs3892097 (CYP2D6*4) y rs1065852 (CYP2D6*10) — los alelos de pérdida de función más frecuentes en poblaciones europeas y del este asiático respectivamente — no están en ninguno de los cinco arrays. Además, asignar alelos estrella de CYP2D6 depende de deleciones y duplicaciones génicas, y un array de genotipado da una lectura por sonda y no puede representar número de copias.

Leer el caso completo

4. La ausencia también tiene una versión falsa

rs9923231 (VKORC1, el principal determinante de la dosis de warfarina en el algoritmo de CPIC) está en los cinco arrays — pero los manifiestos lo llaman rs9923231, seq-rs9923231 y chr16-31107689:rs9923231-CT. Cualquier cosa que decida la presencia comparando la cadena literal del rsID lo dará por ausente en tres de cinco, cuando está. Aquí la presencia se resuelve por coordenada genómica, registrando el nombre de la sonda para que el alias quede visible.

Leer el caso completo

5. Lo más nuevo no es un superconjunto

26 de los 70 marcadores se mueven en la dirección esperada: ausentes en OmniExpress-24, presentes en todas las revisiones de GSA. Pero rs601338 (FUT2) y rs1801198 (TCN2) están en OmniExpress-24 y en ninguna revisión de GSA, y la persistencia de lactasa rs4988235 está, luego falta en GSA v1.0, y vuelve a estar en v2.0. Las dos bases solo comparten el 24% de sus posiciones, así que la generación del array no sirve como indicador de la cobertura de un marcador concreto.

Leer el caso completo

De dónde sale cada dato

No todas las filas se apoyan en el mismo tipo de evidencia, y la columna evidence indica cuál. En orden descendente de lo que resuelve:

  • manifest — leído directamente de un manifiesto publicado. Definitivo para ese array.
  • public_file_observation — el marcador se vio, o no se vio, en archivos producidos por el propio producto. Definitivo para lo que el producto entrega, incluido el contenido propio que ningún manifiesto describe.
  • backbone_manifest_family — heredado de una familia de arrays cuyas revisiones coinciden todas.
  • no_public_manifest, family_revisions_disagree — nada público lo resuelve; el valor es unknown y las notas explican por qué.

Cómo citarlo

Cada versión se archiva en Zenodo con un DOI. El DOI de abajo resuelve siempre a la versión más reciente.

Cadena de atribución
dna-chip-coverage by Andrey Soloviev, CC BY 4.0 — https://github.com/AndreySoloviev/dna-chip-coverage
BibTeX
@dataset{dna_chip_coverage,
  title     = {dna-chip-coverage: SNP marker coverage across
               consumer DNA genotyping arrays},
  author    = {Soloviev, Andrey},
  year      = {2026},
  publisher = {Zenodo},
  doi       = {10.5281/zenodo.21708539},
  url       = {https://doi.org/10.5281/zenodo.21708539}
}

Los repositorios

dna-chip-coverage

El conjunto de datos en sí: coverage.csv, los marcadores y arrays de los que parte, el análisis notable-gaps, cada fuente con su fecha de consulta y el script que lo regenera.

Ver el conjunto de datos

dnafile

Biblioteca en Go y CLI para leer archivos de ADN brutos de consumo — detección de formato, censo de marcadores, comprobaciones de cobertura. La herramienta complementaria para hacerle la pregunta de cobertura a un archivo concreto.

Ver la biblioteca

Licencia

Los datos y la documentación son CC BY 4.0; el código de scripts/ es MIT. Se puede usar comercialmente, modificar y redistribuir — la atribución es la única condición.

Los manifiestos de los que deriva el conjunto de datos siguen siendo propiedad de quienes los publican y no se redistribuyen aquí; el script los descarga de la fuente original. La cobertura dice si una pregunta puede hacerse a un archivo, no qué significa la respuesta — para la interpretación clínica de cualquier marcador, consulta ClinVar, PharmGKB o CPIC, y a un profesional sanitario.

Ask My DNA mantiene este conjunto de datos porque la misma pregunta aparece en cada archivo que leemos: ¿se midió siquiera este marcador? Si tienes tu propio archivo de datos brutos, puedes hacérsela.

Comprobar tu archivo

Usamos cookies para analíticas. Más info