Volver a la lista

Misma media, diferente experimento: Por qué no se deben juzgar los datos solo por la media

Explica por qué dos experimentos biológicos con la misma media pueden diferir, utilizando conceptos como estructuras repetitivas, desviación estándar, distribución y valores atípicos junto con los puntos de datos originales, y compara directamente mediante datos sintéticos interactivos.

Principiante
|
38min
|
Verificado (2026-08-13)
réplica biológicaréplica técnicamediadesviación estándardistribuciónhistogramadiagrama de cajaJMP
Progreso0/28 (0%)

Supongamos que los valores de respuesta promedio del Experimento A y del Experimento B son ambos 10. Si en el informe solo se anota la media, los dos resultados parecerían idénticos. Sin embargo, si los valores de A están agrupados densamente alrededor de 10, mientras que los valores de B se dispersan ampliamente desde 2 hasta 18, ¿podemos realmente afirmar que hemos obtenido el mismo resultado?

La pregunta de esta unidad es una sola.
¿Si las medias son iguales, también lo son los dos conjuntos de datos?

La respuesta directa es que no. La media resume útilmente el centro de los datos, pero no indica cuán lejos están los valores de ese centro, si hay una cola larga hacia un lado o si se mezclaron dos grupos distintos. Esto tampoco significa que la media sea inútil. Se trata de distinguir entre lo que la media revela y lo que no revela.

Aunque hoy usaremos muchas palabras, no es necesario memorizarlas todas desde el principio. Memorice solo estas cinco palabras como una brújula, y añadiremos las demás a medida que surja la necesidad al observar los gráficos.

averageA compressed number that shows where the values ​​are gathered.
scatterhow spread out the values ​​are around the center
standard deviationThe size of the spread expressed in the same units as the mean
distributionAppearance where values ​​lie in full range
boxplotA map that compresses the median and the middle half width.

Lo que se debe verificar antes de calcular: ¿qué significa esta fila?

Antes de calcular la media o la desviación estándar, primero debemos confirmar qué representa una fila en la tabla. Medir tres pocillos (wells) de cultivo celular diferentes una vez cada uno y leer un mismo pocillo tres veces con el mismo equipo pueden resultar en tres filas en la tabla. Sin embargo, no constituyen la misma evidencia.

Figure 1 · repeat structure
There are three rows, but the number of independent experiments may vary
Comparison of biological repetition and technological repetitionOn the left, three different biological samples are measured once, so the independent n is 3, and on the right, one sample is read three times, and the independent n is 1.3 different samplesBiological repeats Independent n = 3Read one sample 3 timesTechnology repetition · Independent n = 1sampleAsampleBsampleCSample Ameasurement1measurement2measurement3Even if the number of rows of measurements is the same, the amount of independent biological information is not the same.
Technological iterations are important to check for wobble in equipment and measurements, but do not add new biological entities. If you miss this distinction, n itself will be wrong before the standard deviation.

La unidad experimental es la unidad más pequeña a la que se aplica el tratamiento de forma independiente. Las repeticiones obtenidas de diferentes unidades experimentales son réplicas biológicas, mientras que leer repetidamente la misma unidad experimental son réplicas técnicas. En adelante, la tabla base que utilicemos para los cálculos organizará las réplicas técnicas según reglas acordadas, de modo que cada unidad experimental independiente corresponda a una sola fila.

Dos conjuntos con exactamente la misma media

Ahora supongamos que la unidad es el valor de respuesta relativa de una única unidad experimental biológica. A y B a continuación son valores sintéticos creados para fines explicativos, no datos reales de investigación.

ConjuntoValores observadosMediaMedianaVarianza muestralDesviación estándar muestral
A8, 9, 10, 11, 1210102.51.58
B2, 6, 10, 14, 181010406.32
Figure 2 · center and distance
The average line is the same, but the width of the points is different.
Same mean and different spreadA narrowly averages around 10, while B spreads out widely from 2 to 18.ABaverage = 1005101520narrow widthwide width
The average is 10 for both bundles. However, each point in B is much further from the mean. ‘The center is the same’ and ‘the data is the same’ are completely different sentences.

La media es el número obtenido al sumar todos los valores y dividirlos por la cantidad de elementos. Tanto A como B tienen una suma total de 50 y cinco valores, por lo que su media es 10. Este cálculo revela rápidamente el centro, pero a cambio elimina la información sobre las distancias entre los puntos dentro de un solo número. Por eso, junto al centro, se necesita la dispersión.

Convertir en números la distancia entre los puntos y la media

Si restamos la media de cada observación, obtenemos la desviación. Si el valor es menor que la media, es negativo; si es mayor, es positivo. Las desviaciones de A son -2, -1, 0, 1, 2 y las de B son -8, -4, 0, 4, 8. Solo con esto, es evidente que B es más amplia.

Sin embargo, si sumamos las desviaciones tal cual, ambas conjuntos resultan en 0. Esto se debe a que las distancias a la izquierda y a la derecha de la media se cancelan entre sí. Para preservar la distancia, elevamos las desviaciones al cuadrado para que los signos desaparezcan. Los valores más alejados reciben un mayor peso. Un punto alejado 2 de la media suma 4, mientras que uno alejado 8 suma 64.

1 · Subtract from centerx − average
2 · Remove sign(x − mean)²
3 · Sample varianceSum ÷ (n−1)
4 · Revert units√Dispersion = SD
Figure 3 · From Deviation to SD
Square saves distance, square root returns units.
Conceptual flow of standard deviation calculationThe distance from the mean to the observations is squared to create the variance, and the square root returns it to the original units.218average 10Deviation −8Deviation +8square deviation64 + 64sample variancesquare unitstandard deviationoriginal unit
The variance has squared units. The standard deviation takes the square root of the variance, so it returns in the same units as the response.

¿Por qué dividimos por n−1 en lugar de n?

Si utilizamos la media de la muestra actual como el centro de esa misma muestra, la dispersión de los puntos tiende a calcularse de forma menor a como se haría si conociéramos el verdadero centro de la población. Esto ocurre porque la media muestral ya está ajustada al centro más cercano de su propia muestra. El uso de n−1 en la varianza muestral es un mecanismo para corregir esta tendencia a la subestimación.

Puede detenerse aquí

La demostración de n−1 corresponde a una etapa posterior, donde se estudian los grados de libertad y el valor esperado. Por ahora basta con la intuición de que, como ya se ha estimado un centro a partir de la muestra, quedan n−1 distancias independientes.

La desviación estándar muestral de A es aproximadamente 1.58, y la de B es aproximadamente 6.32. Las medias son iguales, pero la dispersión típica de B es mucho mayor. No obstante, no se debe concluir aquí que "A es un experimento necesariamente mejor porque su desviación estándar es menor". Si los valores fueron recortados debido al límite de detección, si solo se recopilaron réplicas técnicas dependientes, o si se seleccionaron muestras de un rango muy estrecho, una dispersión pequeña también puede ser producto de un diseño erróneo.

La media y la desviación estándar no muestran toda la forma

Incluso observando juntos estos dos números, la centro y la dispersión, queda información sobre la forma total de los datos. Los valores pueden estar distribuidos de manera similar a ambos lados del centro, pueden formar una cola larga hacia la derecha o pueden parecer dos grupos distintos. A esta forma la llamamos distribución de los valores.

Figure 4 · shape of the distribution
The difference in shape can be seen only when compared on the same axis and in the same section.
Symmetric, right-tailed, two-cluster histogram comparisonThree distribution shapes using the same axes and intervals.Close to symmetryBoth sides of the center are similarright taillong tail toward large valuesTwo Cluster CandidatesSignals to investigate hidden conditionsThe observed shape is the beginning of a question, not an automatic conclusion about the cause.
A histogram divides values ​​into intervals (bins) and shows how many are in each bin. When comparing, if the axis and section boundary are different, the shape will look different, so the same standard must be used.

El hecho de observar dos picos no permite afirmar inmediatamente que "se mezclaron dos tipos de células". Existe la posibilidad de que se hayan mezclado diferentes lotes (batches), momentos de tratamiento, estados del equipo o subgrupos biológicos ocultos; sin embargo, también podría deberse a que el tamaño de la muestra es pequeño y pareció así por azar, o a la forma en que se dividieron los intervalos. Un gráfico no es una sentencia que confirma una causa, sino un mapa de preguntas que indica qué más debe verificarse.

Al comparar histogramas

Los dos grupos deben representarse con el mismo intervalo del eje x y los mismos límites de clase. Con muestras pequeñas, un ligero cambio de los intervalos puede alterar mucho la forma; por eso deben revisarse también los puntos de datos originales y no solo el histograma.

¿Qué muestran más la mediana y el diagrama de caja?

La mediana es el valor que se encuentra en el centro cuando los valores se ordenan de menor a mayor. Incluso si un valor extremo se desplaza lejos, la mediana se ve menos afectada que la media. Q1 y Q3 representan los puntos del 25% y 75% inferior, respectivamente, y su diferencia, el IQR, es el rango que ocupa el 50% central.

El diagrama de caja muestra esta información de orden de forma comprimida. Los extremos izquierdo y derecho de la caja son Q1 y Q3, y la línea dentro de la caja es la mediana. Los bigotes representan los límites del rango típico, y los puntos fuera de ellos pueden mostrarse por separado como posibles valores atípicos.

Figure 5 · Reading boxplots
The box is in the middle half, and the dots outside the whiskers are candidates that need to be checked.
Raw data points and boxplotsThe relationships between raw data points, quartiles, medians, whiskers, and outlier candidates are displayed together.IQR = Q3 − Q1 · Middle 50%Q1medianQ3Outlier candidateNot a tombstoneFor small n, do not just look at the box, but also look at the raw data points.
Points that are less than Q1−1.5×IQR or greater than Q3+1.5×IQR are often flagged as potential outliers. This sign does not indicate the cause or command removal.
Un punto fuera de los bigotes no es una orden de borrado

Compruebe primero el ID de la muestra, el registro original, la unidad, el registro del instrumento, el momento del procesamiento y las condiciones experimentales. Si se confirma un error, trátelo conforme a reglas y evidencia definidas de antemano; si la observación es válida, no la elimine arbitrariamente. Registre también cuánto cambia la conclusión antes y después de excluir el punto.

Ahora intentemos crear la misma media nosotros mismos

Hasta ahora, hemos visto los números determinados por el autor. Sin embargo, las muestras reales no resultan iguales cada vez. En el siguiente mini Lab, cambie la dispersión y la forma de B. Las medias de ambos grupos se han ajustado exactamente a 10 con fines educativos. Por lo tanto, esto no es una muestra aleatoria, sino datos comparativos configurados para fines educativos.

In-Silico Lab · Guided Comparison

Fix the average at 10 and change the shape of B

Baseline comparisons fix the mean and focus on differences in spread and shape. The data below is not a research result, but rather synthetic data for educational purposes designed to observe statistical concepts.

If this is your first time: What should I press?
  1. 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
  2. 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
  3. 3. Change distribution shape or spread conditions pressureNew synthetic data is created. The same conditions may vary depending on the sample.
  4. 4. Point plots and summary values ​​for two groups CompareWrite in one sentence what moves and what stays the same before and after the change.

If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.

Raw data points and average line

average 10AB05101520

Summary of this comparison

A average10.00
A Sample SD1.58
B average10.00
B Sample SD6.00
independent n5 each

Do not use for research, clinical trials, or quality judgment. The formal lab provides generation mode, seed, simulator version, units, single-row semantics, raw/analysis-ready tables, and data dictionary.

Aunque cambie la forma, la media de B permanecerá en 10. En su lugar, cambiarán el ancho de los puntos, las colas y la posición de concentración. En el modo de exploración libre del Lab oficial, incluso si se establece el objetivo central en 10, la media muestral real no será exactamente 10 cada vez. Esa diferencia es normal. Esto se debe a que el proceso de generación establecido como objetivo y el resumen de la muestra extraída accidentalmente esta vez son cosas distintas.

¿Cómo expresa JMP la teoría anterior?

Aquí es donde entra JMP. El objetivo no es aprender el orden de uso del programa, sino conectar lo que hemos verificado hasta ahora con nuestros ojos y cálculos con qué resultados de JMP lo representan. El resultado de Distribution de JMP para datos continuos muestra los siguientes tres grupos juntos.

Histogram + Outlier Box Plot

View the overall shape of the values ​​and the center, center width, and outlier candidates.

Quantiles

Check positions based on order: minimum, Q1, median, Q3, maximum.

Summary Statistics

Check the center and spread numerically, such as mean, standard deviation, and N.

Figure 6 · Link between theory and results
JMP doesn't create new truth; it just shows the same data in a different window.
Flow of theory, synthetic data, and JMP result interpretationWe move from a statistical question to synthetic data, to a presentation of the results in JMP, and then back to the interpretation of the initial question.THEORYjust the averageIs it enough?Center · Spread · Shape · RepetitionIN-SILICO LABsynthetic dataanalysis-ready tablesettings · seed · version · row meaningJMP EXPRESSIONHistogram · Box PlotQuantiles · SummaryInterpret the results using the previous theoryRead the results and return to the first question
The program is not the end point of the analysis. You need to know what the data you generate means and determine what the graphs and summary tables reveal and what they hide from the concepts you learned earlier.

Al observar A y B en los resultados de Distribution de JMP, compruebe primero que el N de cada grupo coincide con el número de unidades experimentales independientes. Después examine conjuntamente la media y la desviación estándar en Summary Statistics, y revise la anchura, las colas y las agrupaciones en el histograma y los puntos originales. En Quantiles y Outlier Box Plot, compruebe la mediana, el IQR y los posibles puntos fuera de los bigotes.

No debe detener la interpretación solo porque ambas medias sean 10. Si B presenta una desviación estándar mayor y un histograma más ancho, eso representa exactamente el «mismo centro, distintas distancias» descrito antes. Si hay un punto fuera de los bigotes, no lo elimine: revise su historial experimental. Si aparecen dos picos, formule la hipótesis de un lote o una condición oculta, pero no dé la causa por demostrada.

¿Y si no puede utilizar JMP?

Puede seguir la lección con la teoría y los resultados representativos del texto. Si dispone de JMP o Minitab, utilice su propia tabla copiada del laboratorio para examinar las mismas preguntas sobre centro, dispersión y distribución. Aunque cambie la disposición de la interfaz, las relaciones estadísticas que deben leerse son las mismas.

A partir de hoy, cuatro preguntas que se deben plantear junto a la media

  1. ¿Cuántos valores independientes de n intervienen en esta media? Compruebe que las filas de réplicas técnicas no se hayan contado como muestras independientes.
  2. ¿Cuánto se dispersan los valores alrededor del centro? Observe conjuntamente la desviación estándar y la anchura de los puntos originales.
  3. ¿Qué forma tiene la distribución? Examine colas y agrupaciones en histogramas con el mismo eje y los mismos intervalos.
  4. ¿Qué exige un punto extraño? No su eliminación automática, sino volver a comprobar la muestra y el proceso de medición.

La media no es una cifra incorrecta, pero comprime demasiada información en un solo número. Un buen análisis no descarta la media: vuelve a colocar junto a ella la dispersión, la distribución, los datos originales y la estructura de réplicas.

Even if the mean is the same, no two experiments are the same if the spread of the values, shape of the distribution, extreme observations, and repetition structure are different. Look at the mean, standard deviation, histogram, boxplot, and raw data points together.

En la siguiente unidad ampliaremos la pregunta: ¿hasta qué punto la media y la desviación estándar de la muestra disponible describen a toda la población? ¿Por qué cambian las cifras al repetir el mismo experimento y cómo puede expresarse esa variación?

Material complementario

Los ejemplos y el mini Lab de este texto son datos sintéticos para explicar conceptos estadísticos. No pueden utilizarse como base para decisiones reales de investigación, clínicas, de calidad o regulatorias.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...