count matrix·normalization·batch
Al finalizar este tema
Podrá identificar el significado de las filas, columnas y conteos en una matriz de conteo (count matrix), y distinguir entre raw counts y valores normalizados. Asimismo, aprenderá a verificar si el efecto de lote (batch) está confundido con las condiciones biológicas, evitando la interpretación errónea de que la normalización resuelve todos los problemas de lote.
¿Qué representa una celda de la matriz?
En las tablas ómicas, es común que las filas representen características (features) y las columnas muestras (samples), pero no debe asumir esta estructura basándose únicamente en el nombre del archivo. Verifique si el valor de cada celda es un raw read count, una abundancia ya transformada o si ha pasado por algún filtrado. La relación entre el ID de la muestra, las réplicas biológicas y las réplicas técnicas también debe registrarse en el esquema (schema).
raw count y normalized value
El raw count es el valor contabilizado directamente durante el proceso de generación y cuantificación de datos, mientras que el normalized value puede ser el resultado de una transformación que refleja el tamaño de la librería (library size) u otros criterios. No mezcle ambos valores en la misma columna y registre la fórmula de transformación, la herramienta, la versión y la entrada en la procedencia (provenance).
Los valores normalizados pueden ser útiles para la visualización o comparaciones específicas, pero no pueden utilizarse automáticamente como entrada para todos los modelos. En modelos basados en conteos, debe verificar la escala de entrada que el modelo espera.
Visualización del batch junto con el diseño experimental
Un lote (batch) es una unidad que comparte procesos comunes, como la fecha de medición, el equipo, la placa (plate) o el grupo de tratamiento. Si el lote y la condición biológica coinciden completamente, puede ser estadísticamente difícil separar ambos efectos. La aplicación de código de corrección a posteriori no elimina automáticamente la confusión (confounding) presente en el diseño experimental.
sample_id | biological_condition | batch_id | replicate_id | value_type
S01 | A | B01 | R01 | raw_countLo primero que se debe verificar en esta tabla no es la función del modelo, sino si cada condición se observó a través de varios lotes (batches).
Interpretación basada en la pregunta de investigación
La normalización es un paso computacional para convertir los valores en una representación comparable. Esto no significa que se eliminen el sesgo de medición, la confusión por lote (batch confounding), los errores de réplica o las diferencias biológicas. El documento de análisis debe registrar por separado la entrada bruta (raw input), la normalización, el procesamiento de lotes y el modelo final.
Errores comunes
- No se debe llamar "conteo bruto" (raw count) a un valor normalizado.
- No se deben utilizar automáticamente otras escalas, como TPM, como entrada para un modelo de conteo.
- No se debe afirmar que un diseño donde el lote y la condición se solapan se resuelve con una sola línea de código.
- No se debe confundir el número de muestras con el número de réplicas.
Resumen clave
- Primero, verifique el significado de las filas, columnas y cada celda de la matriz.
- Los conteos brutos y los valores normalizados tienen escalas de entrada distintas.
- El lote debe verificarse conjuntamente en el diseño y la procedencia (provenance).
- La normalización no es un procedimiento que elimine todos los sesgos.
Siguiente tema
Una vez resuelto el bloque de datos de supervivencia, se conectará con stat-022 y 023; el siguiente tema disponible para redactar es PCA y QC de alta dimensión.
Referencias
- NCBI GEO: https://www.ncbi.nlm.nih.gov/geo/info/
- Guía de citación de ENCODE: https://www.encodeproject.org/help/citing-encode/
- Diseño experimental OSTA de Bioconductor: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
El esquema de la matriz y la explicación de esta sección fueron redactados de forma independiente por BioStatPy.