¿Por qué son inexactos los puntajes Phred?
En la sección anterior, al identificar las duplicaciones de PCR, ahora se cumple en cierta medida el supuesto de que cada lectura es una observación independiente. El siguiente paso es reevaluar la precisión de cada observación: la Recalibración de Puntajes de Calidad de Base (BQSR).
Los puntajes Phred que el secuenciador asigna y emite para cada lectura son probabilidades a priori derivadas de señales ópticas y químicas. No son perfectos. Presentan sesgos sistemáticos frente a los siguientes tres factores:
- Posición del ciclo de la lectura: La tasa de errores aumenta drásticamente en las partes posteriores en comparación con las iniciales, pero Phred no refleja esto adecuadamente.
- Contexto de bases (contexto de dinucleótidos): Las tasas de errores difieren detrás de ciertas combinaciones de dos bases (por ejemplo, GG, CG). Bin de Phred existente: El mapeo entre el valor Q reportado por Phred y la tasa de errores real es incorrecto.
BQSR corrige estos sesgos mediante datos, tomando dbSNP como el valor verdadero. Veamos cómo se deriva estadísticamente.
Idea central — Aproximación de verdadero/falso
En cada posición de la lectura, se observa un evento donde "esta base difiere de la referencia". Este evento es de dos tipos:
- Variante verdadera (variant): El SNP real de este individuo. Está en dbSNP o en catálogos de variantes conocidas.
- Error de secuenciación (error): Ruido aleatorio.
El punto de partida de BQSR es la aproximación que considera las diferencias con la referencia en posiciones conocidas en dbSNP como variantes, y las diferencias con la referencia en posiciones no conocidas como errores. Aunque es una aproximación, dado que dbSNP es muy denso, esta aproximación suele ser bastante precisa.
A partir de esta tasa de errores empírica, se calcula inversamente el puntaje Q empírico.
Estratificación multivariada
Si se calcula el Q empírico simplemente como un único valor, se pierde información. BQSR estratifica utilizando cuatro covariables:
- Bin de Phred original (Q reportado): Por separado para cada bin Q10, Q20, Q30.
- Posición del ciclo de la lectura: Por posición individual entre 1 y 150 pb.
- Contexto de bases: Combinación de la base anterior y la base actual (16 combinaciones).
- Grupo de máquina/celda de flujo (opcional).
Es decir, se calcula por separado la tasa de errores empírica en cada celda de la combinación (Q reportado, ciclo, contexto). Como resultado, el valor Q_empirical varía según la celda.
Función de recalibración
El nuevo Phred para cada posición de la lectura se determina de la siguiente manera:
undefined