Pseudogenes: Entre fósiles genómicos y trampas de mapeo
¿Por qué es importante saberlo?
Aunque los pseudogenes se presentan a menudo como "copias de genes que han perdido su función", no constituyen un grupo homogéneo con un único origen o naturaleza. Algunos surgen cuando el ARNm se retrotranspone e inserta nuevamente en el genoma, mientras que otros se originan tras una duplicación génica, acumulando mutaciones que conducen a la pérdida de función en una de las copias. Además, existen casos en los que un pseudogén es funcional en otras especies pero ha perdido su función en linajes específicos.
Es fundamental comprenderlos por dos razones: algunos loci pueden estar asociados con la transcripción o la regulación, y simultáneamente, su alta similitud de secuencia con genes funcionales puede interferir con el análisis de secuenciación. Por lo tanto, es necesario separar las preguntas biológicas de los desafíos técnicos.
Conceptos clave
Los pseudogenes procesados suelen derivarse de ARN con intrones eliminados y frecuentemente carecen del promotor original. Los pseudogenes duplicados o no procesados se originan a partir de la duplicación génica y pueden conservar la estructura exón-íntron y parte de las secuencias reguladoras circundantes. Un pseudogén unitario se refiere al caso en el que la única copia funcional de un linaje ha perdido su función. Las bases de datos de anotación distinguen estos biotipos basándose en la filogenia de secuencia y la estructura.
El hecho de que pseudo no esté siempre transcrito o carezca de cualquier rol no es una regla absoluta. Existen estudios que sugieren que algunos transcritos de pseudogenes están relacionados con la competencia por miRNA, la regulación antisentido o la expresión del gen padre. Sin embargo, el simple hecho de detectar ARN no demuestra ni función fisiológica ni contribución a enfermedades. Se requieren perturbaciones específicas del locus y rescates experimentales, así como la reproducción adecuada en tejidos y condiciones específicos.
Por qué surgen los problemas de mapeo
Cuando las lecturas cortas (short reads) se alinean casi idénticamente tanto al gen padre como al pseudogén, el alineador tiene dificultades para determinar una única posición. Asignarlas aleatoriamente o descartar las lecturas con múltiples mapeos puede generar tanto falsos positivos como falsos negativos. Existe también el riesgo de que los llamadores de variantes (variant callers) interpreten erróneamente las diferencias del gen padre como variantes del pseudogén, o viceversa.
Este problema no se resuelve simplemente aumentando la profundidad de secuenciación, ya que esto podría generar más lecturas igualmente ambiguas. Podría ser necesario utilizar cebadores específicos del locus que incluyan secuencias flanqueantes únicas, alineaciones adaptadas, PCR a largo alcance, ensayos independientes o lecturas suficientemente largas.
Pequeño ejemplo de análisis
Supongamos que existe un pseudogén P muy similar al gen funcional G. Si una base frecuente en P coincide con la posición de una variante patogénica de G, una lectura procedente de P puede alinearse erróneamente contra G y crear una variante falsa. A la inversa, una lectura con una variante real de G puede descartarse por baja calidad de mapeo y pasar inadvertida.
El analista examina la mapeabilidad de la región, la disposición de los pares de lecturas, el equilibrio alélico y los artefactos poblacionales para diseñar una confirmación ortogonal. Informar únicamente de que «la cobertura es suficiente» no permite evaluar este riesgo.
Controles necesarios en estudios funcionales
Al medir ARN de un pseudogén deben comprobarse cebadores y secuencias únicas que lo distingan del gen parental. También es importante verificar que el reactivo de knockdown no dirija ambos loci. Como un experimento de sobreexpresión puede exceder los niveles fisiológicos, una perturbación endógena y un rescate independiente aportan evidencia más fuerte.
En estudios de asociación con enfermedad, la transcripción y la función del locus, el fenotipo del paciente y la variante causal deben registrarse como afirmaciones distintas.
Puntos que pueden generar confusión
- Los pseudogenes no son fósiles genómicos originados todos de la misma manera.
- Estar transcrito no equivale a ser funcional, y la posible función no equivale a causalidad de enfermedad.
- Una cobertura alta no implica una mapeabilidad alta.
- Incluso con lecturas largas deben validarse la biblioteca, la exactitud de lectura y el pipeline de análisis; no proporcionan automáticamente la respuesta correcta.
Limitaciones
La anotación varía según el ensamblaje de referencia y la versión de la base de datos, y pueden actualizarse los límites o el biotipo de un pseudogén. Una prueba clínica debe especificar el alcance de detección y el método de confirmación para loci difíciles, sin ocultar el riesgo residual de un resultado negativo.
Para obtener más información
La elección de puntos ciegos según la prueba continúa en WGS, WES y panel; las ventajas y condiciones de las lecturas largas, en PacBio SMRT y HiFi; y la dependencia de coordenadas de referencia, en el concepto Genoma de referencia.