Supongamos que los valores de respuesta promedio del Experimento A y del Experimento B son ambos 10. Si en el informe solo se anota la media, los dos resultados parecerían idénticos. Sin embargo, si los valores de A están agrupados densamente alrededor de 10, mientras que los valores de B se dispersan ampliamente desde 2 hasta 18, ¿podemos realmente afirmar que hemos obtenido el mismo resultado?
¿Si las medias son iguales, también lo son los dos conjuntos de datos?
La respuesta directa es que no. La media resume útilmente el centro de los datos, pero no indica cuán lejos están los valores de ese centro, si hay una cola larga hacia un lado o si se mezclaron dos grupos distintos. Esto tampoco significa que la media sea inútil. Se trata de distinguir entre lo que la media revela y lo que no revela.
Aunque hoy usaremos muchas palabras, no es necesario memorizarlas todas desde el principio. Memorice solo estas cinco palabras como una brújula, y añadiremos las demás a medida que surja la necesidad al observar los gráficos.
Lo que se debe verificar antes de calcular: ¿qué significa esta fila?
Antes de calcular la media o la desviación estándar, primero debemos confirmar qué representa una fila en la tabla. Medir tres pocillos (wells) de cultivo celular diferentes una vez cada uno y leer un mismo pocillo tres veces con el mismo equipo pueden resultar en tres filas en la tabla. Sin embargo, no constituyen la misma evidencia.
La unidad experimental es la unidad más pequeña a la que se aplica el tratamiento de forma independiente. Las repeticiones obtenidas de diferentes unidades experimentales son réplicas biológicas, mientras que leer repetidamente la misma unidad experimental son réplicas técnicas. En adelante, la tabla base que utilicemos para los cálculos organizará las réplicas técnicas según reglas acordadas, de modo que cada unidad experimental independiente corresponda a una sola fila.
Dos conjuntos con exactamente la misma media
Ahora supongamos que la unidad es el valor de respuesta relativa de una única unidad experimental biológica. A y B a continuación son valores sintéticos creados para fines explicativos, no datos reales de investigación.
| Conjunto | Valores observados | Media | Mediana | Varianza muestral | Desviación estándar muestral |
|---|---|---|---|---|---|
| A | 8, 9, 10, 11, 12 | 10 | 10 | 2.5 | 1.58 |
| B | 2, 6, 10, 14, 18 | 10 | 10 | 40 | 6.32 |
La media es el número obtenido al sumar todos los valores y dividirlos por la cantidad de elementos. Tanto A como B tienen una suma total de 50 y cinco valores, por lo que su media es 10. Este cálculo revela rápidamente el centro, pero a cambio elimina la información sobre las distancias entre los puntos dentro de un solo número. Por eso, junto al centro, se necesita la dispersión.
Convertir en números la distancia entre los puntos y la media
Si restamos la media de cada observación, obtenemos la desviación. Si el valor es menor que la media, es negativo; si es mayor, es positivo. Las desviaciones de A son -2, -1, 0, 1, 2 y las de B son -8, -4, 0, 4, 8. Solo con esto, es evidente que B es más amplia.
Sin embargo, si sumamos las desviaciones tal cual, ambas conjuntos resultan en 0. Esto se debe a que las distancias a la izquierda y a la derecha de la media se cancelan entre sí. Para preservar la distancia, elevamos las desviaciones al cuadrado para que los signos desaparezcan. Los valores más alejados reciben un mayor peso. Un punto alejado 2 de la media suma 4, mientras que uno alejado 8 suma 64.
¿Por qué dividimos por n−1 en lugar de n?
Si utilizamos la media de la muestra actual como el centro de esa misma muestra, la dispersión de los puntos tiende a calcularse de forma menor a como se haría si conociéramos el verdadero centro de la población. Esto ocurre porque la media muestral ya está ajustada al centro más cercano de su propia muestra. El uso de n−1 en la varianza muestral es un mecanismo para corregir esta tendencia a la subestimación.
La demostración de n−1 corresponde a una etapa posterior, donde se estudian los grados de libertad y el valor esperado. Por ahora basta con la intuición de que, como ya se ha estimado un centro a partir de la muestra, quedan n−1 distancias independientes.
La desviación estándar muestral de A es aproximadamente 1.58, y la de B es aproximadamente 6.32. Las medias son iguales, pero la dispersión típica de B es mucho mayor. No obstante, no se debe concluir aquí que "A es un experimento necesariamente mejor porque su desviación estándar es menor". Si los valores fueron recortados debido al límite de detección, si solo se recopilaron réplicas técnicas dependientes, o si se seleccionaron muestras de un rango muy estrecho, una dispersión pequeña también puede ser producto de un diseño erróneo.
La media y la desviación estándar no muestran toda la forma
Incluso observando juntos estos dos números, la centro y la dispersión, queda información sobre la forma total de los datos. Los valores pueden estar distribuidos de manera similar a ambos lados del centro, pueden formar una cola larga hacia la derecha o pueden parecer dos grupos distintos. A esta forma la llamamos distribución de los valores.
El hecho de observar dos picos no permite afirmar inmediatamente que "se mezclaron dos tipos de células". Existe la posibilidad de que se hayan mezclado diferentes lotes (batches), momentos de tratamiento, estados del equipo o subgrupos biológicos ocultos; sin embargo, también podría deberse a que el tamaño de la muestra es pequeño y pareció así por azar, o a la forma en que se dividieron los intervalos. Un gráfico no es una sentencia que confirma una causa, sino un mapa de preguntas que indica qué más debe verificarse.
Los dos grupos deben representarse con el mismo intervalo del eje x y los mismos límites de clase. Con muestras pequeñas, un ligero cambio de los intervalos puede alterar mucho la forma; por eso deben revisarse también los puntos de datos originales y no solo el histograma.
¿Qué muestran más la mediana y el diagrama de caja?
La mediana es el valor que se encuentra en el centro cuando los valores se ordenan de menor a mayor. Incluso si un valor extremo se desplaza lejos, la mediana se ve menos afectada que la media. Q1 y Q3 representan los puntos del 25% y 75% inferior, respectivamente, y su diferencia, el IQR, es el rango que ocupa el 50% central.
El diagrama de caja muestra esta información de orden de forma comprimida. Los extremos izquierdo y derecho de la caja son Q1 y Q3, y la línea dentro de la caja es la mediana. Los bigotes representan los límites del rango típico, y los puntos fuera de ellos pueden mostrarse por separado como posibles valores atípicos.
Compruebe primero el ID de la muestra, el registro original, la unidad, el registro del instrumento, el momento del procesamiento y las condiciones experimentales. Si se confirma un error, trátelo conforme a reglas y evidencia definidas de antemano; si la observación es válida, no la elimine arbitrariamente. Registre también cuánto cambia la conclusión antes y después de excluir el punto.
Ahora intentemos crear la misma media nosotros mismos
Hasta ahora, hemos visto los números determinados por el autor. Sin embargo, las muestras reales no resultan iguales cada vez. En el siguiente mini Lab, cambie la dispersión y la forma de B. Las medias de ambos grupos se han ajustado exactamente a 10 con fines educativos. Por lo tanto, esto no es una muestra aleatoria, sino datos comparativos configurados para fines educativos.
Fix the average at 10 and change the shape of B
Baseline comparisons fix the mean and focus on differences in spread and shape. The data below is not a research result, but rather synthetic data for educational purposes designed to observe statistical concepts.
If this is your first time: What should I press?
- 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
- 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
- 3. Change distribution shape or spread conditions pressureNew synthetic data is created. The same conditions may vary depending on the sample.
- 4. Point plots and summary values for two groups CompareWrite in one sentence what moves and what stays the same before and after the change.
If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.
Raw data points and average line
Summary of this comparison
Do not use for research, clinical trials, or quality judgment. The formal lab provides generation mode, seed, simulator version, units, single-row semantics, raw/analysis-ready tables, and data dictionary.
Aunque cambie la forma, la media de B permanecerá en 10. En su lugar, cambiarán el ancho de los puntos, las colas y la posición de concentración. En el modo de exploración libre del Lab oficial, incluso si se establece el objetivo central en 10, la media muestral real no será exactamente 10 cada vez. Esa diferencia es normal. Esto se debe a que el proceso de generación establecido como objetivo y el resumen de la muestra extraída accidentalmente esta vez son cosas distintas.
¿Cómo expresa JMP la teoría anterior?
Aquí es donde entra JMP. El objetivo no es aprender el orden de uso del programa, sino conectar lo que hemos verificado hasta ahora con nuestros ojos y cálculos con qué resultados de JMP lo representan. El resultado de Distribution de JMP para datos continuos muestra los siguientes tres grupos juntos.
View the overall shape of the values and the center, center width, and outlier candidates.
Check positions based on order: minimum, Q1, median, Q3, maximum.
Check the center and spread numerically, such as mean, standard deviation, and N.
Al observar A y B en los resultados de Distribution de JMP, compruebe primero que el N de cada grupo coincide con el número de unidades experimentales independientes. Después examine conjuntamente la media y la desviación estándar en Summary Statistics, y revise la anchura, las colas y las agrupaciones en el histograma y los puntos originales. En Quantiles y Outlier Box Plot, compruebe la mediana, el IQR y los posibles puntos fuera de los bigotes.
No debe detener la interpretación solo porque ambas medias sean 10. Si B presenta una desviación estándar mayor y un histograma más ancho, eso representa exactamente el «mismo centro, distintas distancias» descrito antes. Si hay un punto fuera de los bigotes, no lo elimine: revise su historial experimental. Si aparecen dos picos, formule la hipótesis de un lote o una condición oculta, pero no dé la causa por demostrada.
Puede seguir la lección con la teoría y los resultados representativos del texto. Si dispone de JMP o Minitab, utilice su propia tabla copiada del laboratorio para examinar las mismas preguntas sobre centro, dispersión y distribución. Aunque cambie la disposición de la interfaz, las relaciones estadísticas que deben leerse son las mismas.
A partir de hoy, cuatro preguntas que se deben plantear junto a la media
- ¿Cuántos valores independientes de n intervienen en esta media? Compruebe que las filas de réplicas técnicas no se hayan contado como muestras independientes.
- ¿Cuánto se dispersan los valores alrededor del centro? Observe conjuntamente la desviación estándar y la anchura de los puntos originales.
- ¿Qué forma tiene la distribución? Examine colas y agrupaciones en histogramas con el mismo eje y los mismos intervalos.
- ¿Qué exige un punto extraño? No su eliminación automática, sino volver a comprobar la muestra y el proceso de medición.
La media no es una cifra incorrecta, pero comprime demasiada información en un solo número. Un buen análisis no descarta la media: vuelve a colocar junto a ella la dispersión, la distribución, los datos originales y la estructura de réplicas.
En la siguiente unidad ampliaremos la pregunta: ¿hasta qué punto la media y la desviación estándar de la muestra disponible describen a toda la población? ¿Por qué cambian las cifras al repetir el mismo experimento y cómo puede expresarse esa variación?
Material complementario
- JMP Help · Distributions of Continuous Variables
- JMP Statistics Knowledge Portal · Box Plot
- NIST/SEMATECH e-Handbook · Measures of Scale
Los ejemplos y el mini Lab de este texto son datos sintéticos para explicar conceptos estadísticos. No pueden utilizarse como base para decisiones reales de investigación, clínicas, de calidad o regulatorias.