A mayor concentración de metabolitos en el medio de cultivo, mayor fue la viabilidad celular. Si el coeficiente de correlación entre ambas variables es r=.78, ¿podemos concluir que aumentar los metabolitos incrementa la viabilidad? La correlación es un punto de partida, pero no una conclusión causal.
Esta unidad plantea una única pregunta.
¿Hasta dónde podemos inferir a partir del hecho de que dos variables se mueven juntas?
El coeficiente de correlación comprime la co-movilidad lineal en un rango de −1 a +1
El coeficiente de correlación de Pearson r estandariza y resume si las desviaciones de dos variables respecto a sus medias ocurren en la misma dirección.
- r>0: tendencia lineal donde, cuando X es grande, Y también tiende a ser grande
r < 0: tendencia lineal donde, cuando X es grande, Y tiende a ser pequeño- |r| cercano a 1: los puntos están cerca de una línea recta
- r≈0: la co-movilidad lineal es débil
Un valor de r=0 no significa que no exista relación. Una relación perfectamente en forma de U puede tener un r cercano a 0 porque las pendientes de ambos lados se cancelan. Debe graficarse el diagrama de dispersión antes de calcular un solo número.
El coeficiente de correlación elimina las unidades de X e Y, facilitando la comparación, pero no informa sobre la magnitud del cambio real. La pregunta de "cuánto cambia Y cuando X aumenta en 1" corresponde a la pendiente de regresión y se tratará en la siguiente unidad.
El mismo r puede ocultar datos completamente diferentes
Verifique los siguientes elementos en el diagrama de dispersión:
- Linealidad: ¿los puntos siguen una línea recta o hay curvas, umbrales o saturación?
- Valores atípicos: ¿uno o dos puntos dominan la dirección y magnitud?
- Restricción de rango: ¿se observó solo una parte estrecha de X?
- Agrupamientos: ¿hay agrupaciones por placa, donante o fecha?
- Heterocedasticidad: ¿la amplitud de Y aumenta a medida que X crece?
- Error de medición: ¿la precisión repetitiva de X e Y debilita la relación observada?
Limitar el rango solo a adultos sanos puede debilitar una relación fuerte entre edad e indicador que sería evidente en toda la población. Por el contrario, combinar dos grupos de lotes distintos puede hacer que r global sea alto, aunque no haya relación dentro de cada grupo.
Si se grafican 20 células de un mismo donante como 20 puntos independientes, el valor p puede ser excesivamente pequeño debido a la estructura de agrupamiento. Se requieren resúmenes por donante, correlaciones de mediciones repetidas o modelos jerárquicos. El número de puntos no equivale al volumen de información independiente.
La correlación es simétrica y no especifica causalidad
cor(X,Y)=cor(Y,X). La correlación no determina cuál variable es explicativa y cuál es respuesta. Un r alto puede tener múltiples explicaciones:
- X influye en Y.
- Y influye en X.
- Una tercera variable Z influye en ambas.
- La selección, la medición y la tendencia temporal crean relaciones artificiales.
- El azar y la búsqueda múltiple seleccionaron un r grande.
Para inferir causalidad se requieren orden temporal, diseño manipulable, aleatorización, control de confusión, mecanismos y reproducibilidad. Que el p-value de correlación sea pequeño no garantiza que se cumplan automáticamente estas condiciones.
El p-value y el IC dependen de n
La prueba H0: la correlación lineal poblacional ρ=0 utiliza r y n. Con n grande, un r pequeño puede ser significativo; con n pequeño, el IC de un r grande es amplio. Por lo tanto, se deben reportar conjuntamente r, IC, n independiente y el diagrama de dispersión.
Al probar miles de pares en una matriz de correlación entre múltiples genes y puntos finales, aparecen muchos p-values pequeños por azar. Antes del análisis, se debe limitar la lista de candidatos o planificar el control de la multiplicidad (como FDR) y la validación independiente.
Lab In-Silico: crea directamente la vulnerabilidad de r
- Cambia la pendiente a −2, 0 y +2 para observar la dirección de r.
- Aumenta la curvatura para crear una situación donde la relación es fuerte pero r es débil.
- Añade un punto atípico para ver cuánto se mueve r.
- Verifica si el r de la muestra cambia bajo las mismas condiciones de generación con una nueva semilla.
Change the scatterplot and see the fragility of r
Change the slope, noise, curvature, and outliers to see if different shapes are hidden behind the same coefficients.
If this is your first time: What should I press?
- 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
- 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
- 3. new composite specimen pressureNew synthetic data is created. The same conditions may vary depending on the sample.
- 4. Pictures and calculation results CompareWrite in one sentence what moves and what stays the same before and after the change.
If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.
Synthetic observations of the same settings
calculation result
r is a summary of the linear shape. Causality, reproducibility, and population independence are separate questions.
educational synthetic modelbjs-relationship-sequence-v1. Actual research judgments must separately reflect experimental units, missingness, distribution, multiplicity, pre-planning, and domain criteria.
En el lab, la línea es una recta de regresión simple que ayuda a explicar. Que aparezca la línea no implica causalidad ni posibilidad de extrapolación.
En JMP, cada diagrama de dispersión va antes que la matriz
Look at shape, range, clusters, and outliers before the correlation coefficient.
Read the sign and magnitude of r and the n and p values together.
Ellipses are linear relationship representations and do not guarantee causal structure.
La Matriz de Correlación comprime muchos pares, pero oculta la no linealidad y los valores atípicos. En la Matriz de Diagramas de Dispersión, se debe verificar la forma de cada par; la elipse de densidad se lee como una representación auxiliar que resume la estructura lineal normal. La inclinación de la elipse no indica la dirección causal.
Ejemplo de frase de resultados
En 42 lotes independientes, el Pearson r entre el metabolito X y la viabilidad fue .61 (IC 95% .38–.77). El diagrama de dispersión mostró una tendencia lineal positiva, pero hubo influencia de dos puntos de alta concentración; al colorear por fecha del lote, los clústeres explicaron parcialmente la observación. Esta correlación de estudio observacional no se interpretó como un efecto causal del aumento de X.
Cierre de la sección
- r es la dirección y la magnitud estandarizada de la asociación lineal.
- Incluso si r≈0, puede existir una relación no lineal.
- Los valores atípicos, la restricción de rango, los clústeres y la confusión alteran significativamente r.
- La correlación no determina la dirección causal entre X e Y.
- Se deben observar conjuntamente r, IC, n independiente y el diagrama de dispersión en lugar del p-value.
- En la exploración de correlaciones a gran escala se necesitan control de multiplicidad y validación.
En la siguiente sección, expresaremos la relación mediante Y=β₀+β₁X+ε y buscaremos lo que la línea recta pasó por alto en los residuos.
Material complementario de fórmulas
Los ejemplos y laboratorios de este texto son datos sintéticos con fines educativos.