Volver a la lista

BQSR: Derivación estadística y práctica de la recalibración de puntuaciones Phred

¿Por qué la calidad Phred reportada por el secuenciador no es precisa? Se deduce cómo BQSR utiliza dbSNP como valor de referencia para aprender la tasa real de errores, y por qué son importantes las cuatro covariables (ciclo·dinucleótido·calidad·contexto).

Intermedio
|
20min
|
Verificado (2026-07-22)
quality recalibrationBQSRsequencing error model
Progreso0/120 (0%)

¿Por qué son inexactos los puntajes Phred?

En la sección anterior, al identificar las duplicaciones de PCR, ahora se cumple en cierta medida el supuesto de que cada lectura es una observación independiente. El siguiente paso es reevaluar la precisión de cada observación: la Recalibración de Puntajes de Calidad de Base (BQSR).

Los puntajes Phred que el secuenciador asigna y emite para cada lectura son probabilidades a priori derivadas de señales ópticas y químicas. No son perfectos. Presentan sesgos sistemáticos frente a los siguientes tres factores:

  • Posición del ciclo de la lectura: La tasa de errores aumenta drásticamente en las partes posteriores en comparación con las iniciales, pero Phred no refleja esto adecuadamente.
  • Contexto de bases (contexto de dinucleótidos): Las tasas de errores difieren detrás de ciertas combinaciones de dos bases (por ejemplo, GG, CG). Bin de Phred existente: El mapeo entre el valor Q reportado por Phred y la tasa de errores real es incorrecto.

BQSR corrige estos sesgos mediante datos, tomando dbSNP como el valor verdadero. Veamos cómo se deriva estadísticamente.

Idea central — Aproximación de verdadero/falso

En cada posición de la lectura, se observa un evento donde "esta base difiere de la referencia". Este evento es de dos tipos:

  • Variante verdadera (variant): El SNP real de este individuo. Está en dbSNP o en catálogos de variantes conocidas.
  • Error de secuenciación (error): Ruido aleatorio.

El punto de partida de BQSR es la aproximación que considera las diferencias con la referencia en posiciones conocidas en dbSNP como variantes, y las diferencias con la referencia en posiciones no conocidas como errores. Aunque es una aproximación, dado que dbSNP es muy denso, esta aproximación suele ser bastante precisa.

empirical error rate=alt at unknown sitestotal bases\text{empirical error rate} = \frac{\text{alt at unknown sites}}{\text{total bases}}

A partir de esta tasa de errores empírica, se calcula inversamente el puntaje Q empírico.

Qempirical=10log10(error rate)Q_{\text{empirical}} = -10 \cdot \log_{10}(\text{error rate})

Estratificación multivariada

Si se calcula el Q empírico simplemente como un único valor, se pierde información. BQSR estratifica utilizando cuatro covariables:

  1. Bin de Phred original (Q reportado): Por separado para cada bin Q10, Q20, Q30.
  2. Posición del ciclo de la lectura: Por posición individual entre 1 y 150 pb.
  3. Contexto de bases: Combinación de la base anterior y la base actual (16 combinaciones).
  4. Grupo de máquina/celda de flujo (opcional).

Es decir, se calcula por separado la tasa de errores empírica en cada celda de la combinación (Q reportado, ciclo, contexto). Como resultado, el valor Q_empirical varía según la celda.

Función de recalibración

El nuevo Phred para cada posición de la lectura se determina de la siguiente manera:

undefined

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...