Volver a la lista

Dos variables que se mueven juntas: observa el diagrama de dispersión antes del coeficiente de correlación

Cuando dos variables se mueven juntas, primero se observa el diagrama de dispersión para distinguir entre no linealidad, valores atípicos, restricción del rango, agrupamientos y confusión, en lugar de confiar únicamente en Pearson r.

Intermedio
|
27min
|
Verificado (2026-08-14)
correlacióncoeficiente de correlacióndiagrama de dispersiónlinealidadconfusiónrestricción del rangoJMP
Progreso0/28 (0%)

A mayor concentración de metabolitos en el medio de cultivo, mayor fue la viabilidad celular. Si el coeficiente de correlación entre ambas variables es r=.78, ¿podemos concluir que aumentar los metabolitos incrementa la viabilidad? La correlación es un punto de partida, pero no una conclusión causal.

Esta unidad plantea una única pregunta.


¿Hasta dónde podemos inferir a partir del hecho de que dos variables se mueven juntas?
correlation coefficient rDirection and normalized magnitude of linear coexistence
scatterplotActual shape of two continuous variables
Range restrictionsA phenomenon in which the relationship appears weak due to a narrow observation
derangementA variable that is entangled in both X and Y and distorts the relationship

El coeficiente de correlación comprime la co-movilidad lineal en un rango de −1 a +1

El coeficiente de correlación de Pearson r estandariza y resume si las desviaciones de dos variables respecto a sus medias ocurren en la misma dirección.

  • r>0: tendencia lineal donde, cuando X es grande, Y también tiende a ser grande
  • r < 0: tendencia lineal donde, cuando X es grande, Y tiende a ser pequeño
  • |r| cercano a 1: los puntos están cerca de una línea recta
  • r≈0: la co-movilidad lineal es débil

Un valor de r=0 no significa que no exista relación. Una relación perfectamente en forma de U puede tener un r cercano a 0 porque las pendientes de ambos lados se cancelan. Debe graficarse el diagrama de dispersión antes de calcular un solo número.

U14 · Figure 01
The shape of a scatter plot has more information than a single r of the same
Observations and fitted lineResidual = y − ŷ
One outlier, observation range and curvature can change r significantly. Look at the points first and read the coefficients.

El coeficiente de correlación elimina las unidades de X e Y, facilitando la comparación, pero no informa sobre la magnitud del cambio real. La pregunta de "cuánto cambia Y cuando X aumenta en 1" corresponde a la pendiente de regresión y se tratará en la siguiente unidad.

El mismo r puede ocultar datos completamente diferentes

Verifique los siguientes elementos en el diagrama de dispersión:

  1. Linealidad: ¿los puntos siguen una línea recta o hay curvas, umbrales o saturación?
  2. Valores atípicos: ¿uno o dos puntos dominan la dirección y magnitud?
  3. Restricción de rango: ¿se observó solo una parte estrecha de X?
  4. Agrupamientos: ¿hay agrupaciones por placa, donante o fecha?
  5. Heterocedasticidad: ¿la amplitud de Y aumenta a medida que X crece?
  6. Error de medición: ¿la precisión repetitiva de X e Y debilita la relación observada?

Limitar el rango solo a adultos sanos puede debilitar una relación fuerte entre edad e indicador que sería evidente en toda la población. Por el contrario, combinar dos grupos de lotes distintos puede hacer que r global sea alto, aunque no haya relación dentro de cada grupo.

Verifique nuevamente la independencia de las filas

Si se grafican 20 células de un mismo donante como 20 puntos independientes, el valor p puede ser excesivamente pequeño debido a la estructura de agrupamiento. Se requieren resúmenes por donante, correlaciones de mediciones repetidas o modelos jerárquicos. El número de puntos no equivale al volumen de información independiente.

La correlación es simétrica y no especifica causalidad

cor(X,Y)=cor(Y,X). La correlación no determina cuál variable es explicativa y cuál es respuesta. Un r alto puede tener múltiples explicaciones:

  • X influye en Y.
  • Y influye en X.
  • Una tercera variable Z influye en ambas.
  • La selección, la medición y la tendencia temporal crean relaciones artificiales.
  • El azar y la búsqueda múltiple seleccionaron un r grande.

Para inferir causalidad se requieren orden temporal, diseño manipulable, aleatorización, control de confusión, mecanismos y reproducibilidad. Que el p-value de correlación sea pequeño no garantiza que se cumplan automáticamente estas condiciones.

El p-value y el IC dependen de n

La prueba H0: la correlación lineal poblacional ρ=0 utiliza r y n. Con n grande, un r pequeño puede ser significativo; con n pequeño, el IC de un r grande es amplio. Por lo tanto, se deben reportar conjuntamente r, IC, n independiente y el diagrama de dispersión.

Al probar miles de pares en una matriz de correlación entre múltiples genes y puntos finales, aparecen muchos p-values pequeños por azar. Antes del análisis, se debe limitar la lista de candidatos o planificar el control de la multiplicidad (como FDR) y la validación independiente.

Lab In-Silico: crea directamente la vulnerabilidad de r

  1. Cambia la pendiente a −2, 0 y +2 para observar la dirección de r.
  2. Aumenta la curvatura para crear una situación donde la relación es fuerte pero r es débil.
  3. Añade un punto atípico para ver cuánto se mueve r.
  4. Verifica si el r de la muestra cambia bajo las mismas condiciones de generación con una nueva semilla.
In-Silico Lab · U14

Change the scatterplot and see the fragility of r

Change the slope, noise, curvature, and outliers to see if different shapes are hidden behind the same coefficients.

If this is your first time: What should I press?
  1. 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
  2. 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
  3. 3. new composite specimen pressureNew synthetic data is created. The same conditions may vary depending on the sample.
  4. 4. Pictures and calculation results CompareWrite in one sentence what moves and what stays the same before and after the change.

If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.

Synthetic observations of the same settings

calculation result

correlation r0.941
inclination1.726
0.886
SSE30.40

r is a summary of the linear shape. Causality, reproducibility, and population independence are separate questions.

educational synthetic modelbjs-relationship-sequence-v1. Actual research judgments must separately reflect experimental units, missingness, distribution, multiplicity, pre-planning, and domain criteria.

En el lab, la línea es una recta de regresión simple que ayuda a explicar. Que aparezca la línea no implica causalidad ni posibilidad de extrapolación.

En JMP, cada diagrama de dispersión va antes que la matriz

Scatterplot Matrix

Look at shape, range, clusters, and outliers before the correlation coefficient.

Correlation Matrix

Read the sign and magnitude of r and the n and p values ​​together.

Density Ellipse

Ellipses are linear relationship representations and do not guarantee causal structure.

La Matriz de Correlación comprime muchos pares, pero oculta la no linealidad y los valores atípicos. En la Matriz de Diagramas de Dispersión, se debe verificar la forma de cada par; la elipse de densidad se lee como una representación auxiliar que resume la estructura lineal normal. La inclinación de la elipse no indica la dirección causal.

Ejemplo de frase de resultados

En 42 lotes independientes, el Pearson r entre el metabolito X y la viabilidad fue .61 (IC 95% .38–.77). El diagrama de dispersión mostró una tendencia lineal positiva, pero hubo influencia de dos puntos de alta concentración; al colorear por fecha del lote, los clústeres explicaron parcialmente la observación. Esta correlación de estudio observacional no se interpretó como un efecto causal del aumento de X.

Cierre de la sección

  • r es la dirección y la magnitud estandarizada de la asociación lineal.
  • Incluso si r≈0, puede existir una relación no lineal.
  • Los valores atípicos, la restricción de rango, los clústeres y la confusión alteran significativamente r.
  • La correlación no determina la dirección causal entre X e Y.
  • Se deben observar conjuntamente r, IC, n independiente y el diagrama de dispersión en lugar del p-value.
  • En la exploración de correlaciones a gran escala se necesitan control de multiplicidad y validación.
A single correlation coefficient only compresses the shape of the scatterplot. Summarize only the linear motion in r, even after looking at nonlinearity, outliers, ranges, clusters, and disturbances.

En la siguiente sección, expresaremos la relación mediante Y=β₀+β₁X+ε y buscaremos lo que la línea recta pasó por alto en los residuos.

Material complementario de fórmulas

Los ejemplos y laboratorios de este texto son datos sintéticos con fines educativos.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...