SKAT — Por qué no se analizian las variantes raras una por una
Por qué agrupar las variantes raras
Para las variantes comunes, hay suficientes individuos en cada grupo de genotipos para realizar pruebas de asociación posición por posición. En el caso de las variantes raras, la mayoría de las personas poseen el alelo de referencia y los portadores de la variante son muy pocos; por lo tanto, la potencia estadística de las pruebas de variante única es insuficiente incluso cuando existe un efecto real. Por ello, se agrupan las variantes biológicamente relacionadas en conjuntos (sets) a nivel de gen, vía metabólica o región regulatoria para interrogar sobre su asociación global con el fenotipo.
Agrupar no mejora automáticamente la información. La hipótesis de prueba misma queda determinada por qué variantes se incluyen y cómo se establecen los criterios de anotación funcional y frecuencia del alelo menor (minor allele frequency). Mezclar muchas variantes no relacionadas diluye la señal, y seleccionar únicamente los conjuntos que resultan favorables tras observar los datos aumenta el error de tipo I.
La pregunta diferente entre la prueba de carga (Burden test) y SKAT
La prueba de carga suma las variantes raras dentro del conjunto en un solo puntaje. Es potente cuando los efectos de las variantes incluidas tienen direcciones similares y magnitudes relativamente consistentes. Por el contrario, si se mezclan efectos protectores y de riesgo, o hay muchas variantes no causales, estos pueden cancelarse mutuamente o aumentar el ruido.
SKAT está diseñado para combinar las puntuaciones por variante dentro de un kernel, permitiendo capturar señales incluso cuando la dirección y magnitud de los efectos difieren. Esta flexibilidad no implica superioridad en todas las situaciones. Cuando los efectos reales se agrupan en la misma dirección, la prueba de carga puede ser más potente.
SKAT-O explora el rango de combinación entre la prueba de carga y SKAT para encontrar el equilibrio adecuado para los datos. Aunque se corrige el proceso de selección, no es una solución automática que corrija conjuntos de variantes o modelos de fenotipo mal definidos.
Componentes clave del diseño analítico
Los pesos de las variantes suelen asignar valores mayores a los alelos más raros, pero la frecuencia por sí sola no garantiza la importancia funcional. Debe decidirse de antemano si incluir variantes de pérdida de función (loss-of-function), missense y regulatorias en el mismo conjunto, y se deben verificar errores de anotación y la selección de transcritos. El umbral de frecuencia del alelo menor (MAF) debe definirse de manera consistente tanto dentro de la cohorte como en las referencias externas.
El desequilibrio case-control afecta a los fenotipos binarios, mientras que la distribución y los valores atípicos afectan a los rasgos cuantitativos. Si no se ajustan por las componentes principales de ascendencia, la parentesco y el lote de secuenciación, la estructura poblacional o las diferencias técnicas pueden parecerse a señales genéticas. El problema de una persona que aparece en múltiples cohortes también rompe la independencia.
Ejemplo pequeño
Supongamos que las variantes codificantes raras de un gen de enzima afectan el riesgo de enfermedad. Si la mayoría reducen la función y actúan en la misma dirección, la prueba burden puede agrupar los efectos y encontrarlos mejor. Si algunas aumentan la función y otras la disminuyen, y se mezclan con missense no relacionadas, SKAT podría ser más adecuado.
Aunque el p-valor a nivel de conjunto sea significativo, no se sabe qué variante es causal ni cuántos fenotipos explica. Debe seguirse un análisis leave-one-out, datos a nivel de variante, replicación en cohortes independientes y ensayos funcionales.
Pruebas múltiples y replicación
Al examinar varios genes, máscaras de anotación, umbrales MAF y fenotipos, cada combinación constituye una oportunidad de análisis. Se debe definir el análisis primario por adelantado y corregir las pruebas múltiples en función del número total de exploraciones. Replicar la significancia en cohortes de descubrimiento con datos de ascendencia igual e independiente, y verificar la heterogeneidad del efecto.
Las variantes raras son sensibles a la plataforma de secuenciación y a la calidad de la llamada de variantes. Si case y control se generan con diferentes tecnologías, los artefactos de lote pueden acumularse dentro del conjunto, por lo que se necesitan QC conjunta y comparación de capacidad de llamada.
Puntos confusos
- Un gene set significativo no implica la confirmación de un gen diagnóstico ni la accionabilidad clínica.
- Aunque SKAT-O combina varios modelos, no abarca todas las arquitecturas genéticas.
- Incluso con muestras grandes, si la definición del fenotipo y la representación de ascendencia son deficientes, no se eliminan los sesgos.
- La máscara basada en anotación es una hipótesis biológica, no solo un elemento objetivo de preprocesamiento.
Límites de interpretación
La familia SKAT es una herramienta de asociación a nivel poblacional. Los resultados no determinan la patogenicidad de variantes individuales ni el diagnóstico de pacientes específicos. La definición del conjunto, los pesos, el modelo de fenotipo, la ascendencia y el parentesco, junto con el plan de análisis completo, deben publicarse para constituir una evidencia reproducible.
Lectura conectada
La evidencia funcional a nivel de variante continúa en Ensayos funcionales e interpretación de variantes; el diseño de estudios poblacionales a gran escala, en el concepto Broad Medical and Population Genetics.