PCA y control de calidad en datos de alta dimensión
Al finalizar este tema
Comprenderá la PCA como una transformación que resume los datos de alta dimensión en coordenadas de baja dimensión y podrá inspeccionar por separado el escalado, los lotes y los valores atípicos. Se explicará la limitación de que la proximidad entre puntos en un gráfico de componentes principales no implica automáticamente una similitud biológica.
Visualizar muchas columnas en pocos ejes
En matrices de alta dimensión, es difícil observar las diferencias entre muestras considerando todas las características simultáneamente. La PCA transforma las direcciones con mayor variación en nuevos ejes para expresarlas mediante unas pocas coordenadas. Dado que los componentes principales dependen del escalado y la selección de características utilizados, registre primero el acuerdo sobre el preprocesamiento antes de generar el gráfico.
Preguntas para el control de calidad
Antes de generar la PCA, verifique lo siguiente:
- ¿Qué representan las filas y las columnas: muestras o características?
- ¿Son recuentos brutos o valores transformados/normalizados?
- ¿Son comparables entre sí las escalas de las características?
- ¿En qué medida se superponen los lotes y las condiciones biológicas?
- ¿Cuáles son el ID de la muestra candidata a valor atípico y la estructura de réplica?
El hecho de que en la PCA los puntos se agrupen por lote no permite confirmar automáticamente que el lote sea la causa. Se deben considerar conjuntamente la calidad de la medición, el tamaño de la biblioteca, la composición de las muestras y el diseño experimental.
Preprocesamiento y PCA en Python
from sklearn.decomposition import PCAfrom sklearn.preprocessing import StandardScaler
X_scaled = StandardScaler().fit_transform(X)pca = PCA(n_components=2)coordinates = pca.fit_transform(X_scaled)print(pca.explained_variance_ratio_)Este código se ejecuta bajo la premisa de que las características son columnas de una matriz numérica. Registre el rango utilizado, el manejo de valores faltantes, la selección de características y los criterios de división (split) si se aplican al ajustar StandardScaler. La proporción de varianza explicada es un resumen basado en las entradas seleccionadas y no un ranking de importancia biológica.
Separar valores atípicos y lotes
Los puntos alejados pueden ser una combinación de errores de entrada, fallos técnicos, variación biológica real o diferencias entre lotes. No elimine puntos basándose únicamente en su posición; verifique los datos originales, los metadatos y las réplicas. Si repite la PCA con múltiples preprocesamientos, registre la sensibilidad para determinar en qué configuración se mantiene el patrón.
Volver a la pregunta de investigación para interpretar
La PCA es una representación de coordenadas útil para el control de calidad y la exploración. No interprete la dirección de los ejes de los componentes principales como un mecanismo biológico, ni traduzca directamente puntos cercanos en independencia, causalidad o estado de enfermedad. Vuelva a verificar las unidades de las características originales y el diseño del lote.
Errores comunes
- No oculte si se realizó o no la normalización (scaling).
- No llame a los ejes de la gráfica de PCA "tamaño del efecto" o "significancia".
- No elimine valores atípicos solo observando la gráfica.
- No escriba que la PCA resuelve el problema cuando el lote y la condición están confundidos.
Resumen clave
- La PCA es una herramienta de reducción de dimensionalidad y exploración que depende del preprocesamiento de las entradas.
- La normalización, los lotes y los valores atípicos son preguntas diferentes de control de calidad.
- La proximidad en las coordenadas no implica automáticamente una causa biológica o causalidad.
Siguiente tema
En la próxima entrega, abordaremos conjuntamente la multiplicidad y la regularización (shrinkage) en las pruebas por característica de alta dimensión.
Referencias
- Errores comunes de scikit-learn: https://scikit-learn.org/stable/common_pitfalls.html
- Métricas de scikit-learn: https://scikit-learn.org/stable/modules/model_evaluation.html
- NCBI GEO: https://www.ncbi.nlm.nih.gov/geo/info/
Los ejemplos de matriz y PCA de esta sección fueron escritos independientemente por BioStatPy.