Volver a la lista

¿Por qué cambia la muestra cada vez: de una media única al muestreo repetido

Explica por qué las medias muestrales extraídas de la misma población varían en cada ocasión, utilizando gráficos y datos sintéticos interactivos para ilustrar los conceptos de población-muestra, parámetro-estadístico, muestreo repetido y distribución de muestreo.

Principiante
|
42min
|
Verificado (2026-08-13)
poblaciónmuestraréplica biológicaréplica técnicavariación muestraldistribución muestralJMP
Progreso0/28 (0%)

El valor promedio de las respuestas de las ocho muestras preparadas ayer fue de 9.6. Hoy, al preparar ocho nuevas muestras con el mismo objetivo de condiciones, el promedio fue de 10.7. El protocolo y los parámetros medidos son los mismos, pero los números han cambiado. ¿Cuál de los experimentos de esos días fue incorrecto?

No se puede llegar a esa conclusión. No observamos la misma muestra ayer y hoy; más bien, vimos dos muestras compuestas por unidades independientes distintas. Incluso con el mismo objetivo de condiciones, si los sujetos incluidos en la muestra cambian, los valores observados y sus promedios pueden variar.

Esta unidad tiene una sola pregunta.
Si se extraen de la misma población, ¿por qué los resultados de las muestras varían cada vez?

En la unidad anterior, no solo observamos la media dentro de una muestra, sino que también leímos la desviación estándar, la distribución, los puntos de datos originales y la estructura de repetición. Ahora, desplazamos la mirada un paso atrás para observar el hecho de que la propia muestra puede variar si se repite el experimento.

Aunque los términos pueden parecer numerosos, nos guiaremos por cuatro pares. En lugar de memorizarlos todos a la vez, compare sus roles en las figuras.

Population ↔ SampleEverything you want to know and some things you actually observed
Parameter ↔ StatisticCharacteristics of the population and calculated values ​​of the current sample
Repeated sampling ↔ Sampling variationA phenomenon in which calculated values ​​change when a new sample is drawn.
Raw data distribution ↔ Sampling distributionShape of observations and shapes of statistics

Delimitemos primero la pregunta

La pregunta "¿Cuál es el promedio de nuestro experimento?" es más incompleta de lo que parece. Primero debemos definir a qué se refiere exactamente: qué células, qué donante, qué franja horaria y condiciones de cultivo. Este objetivo total al que finalmente apunta la pregunta de investigación es la población.

La población no tiene que ser necesariamente una lista enorme acumulada frente a nosotros. Puede ser un conjunto contable, como el conjunto completo de muestras específicas almacenadas en un congelador, o incluso el proceso generador de resultados que podrían surgir al preparar independientemente las mismas condiciones en el futuro. Lo importante es definir con una oración hasta dónde se agrupa todo bajo la misma pregunta.

La muestra es el subconjunto de valores de unidades independientes observadas realmente para conocer esa población. Si las ocho culturas independientes preparadas hoy constituyen una muestra, las ocho nuevas preparadas mañana podrían ser otra muestra dirigida a la misma población.

Figure 1 · scope of question
The population is the whole thing you want to know about, and the sample is the portion that you actually observed.
Relationship between population and sampleSelect five sample points from the large population point cloud and move them to a separate sample table.population of interestWhat the research question refers to as a wholethis sampleIndependent units actually observedThe boundaries of the sample limit the extent to which we can generalize.
A sample is a selected portion of a population, but it is not automatically a perfect miniature. Which units are obtained and by what rules is as important as the number of samples.

La muestra es parte de la población, pero no se convierte automáticamente en una réplica perfecta. Si se seleccionaron solo muestras fáciles o hubo sesgo hacia un donante específico, fecha o equipo, incluso con muchos datos, estos podrían no reflejar adecuadamente el total de la pregunta. El número de muestras es importante, pero no sustituye a dónde y cómo se obtuvieron.

No confunda la población objetivo con la población accesible

El conjunto de muestras al que puede acceder realmente puede ser más estrecho que la población definida por la pregunta de investigación. En ese caso, el programa estadístico calculará correctamente los números introducidos, pero no decidirá si los resultados pueden generalizarse a una población más amplia.

El número de la población y el número de la muestra son diferentes incluso en su nombre

La expresión numérica de las características de toda la población se denomina parámetro. Representaremos la media poblacional con la letra griega μ (mu) y la desviación estándar poblacional con σ (sigma). Por otro lado, el valor calculado a partir de la muestra que tenemos en la mano es el estadístico. La media muestral se representa como x̄ (x-barra) y la desviación estándar muestral como s.

population meanμ

average of a defined population

sample mean

Average calculated from this sample

population standard deviationσ

Spread of population values

sample standard deviations

Spread of this sample values

Estos símbolos no son una simple preferencia de notación. Son una salvaguarda para distinguir qué es lo que queremos saber de lo que realmente hemos calculado. En la realidad, a menudo no podemos observar toda la población, por lo que no podemos conocer μ y σ directamente. Intentamos conocer las características de esa población a través de x̄ y s de la muestra.

Figure 2 · Division of roles
Parameters are characteristics of the population, and statistics vary from sample to sample.
Comparing parameters and statisticsOn the left are fixed population parameters, and on the right are statistics that vary for each of the three samples.POPULATION · Populationμ · σCharacteristics of the whole in the questionSAMPLES · Different samplesSample Ax̄ = 9.1s = 2.7Sample Bx̄ = 10.4s = 3.2Sample Cx̄ = 11.0s = 2.5Having more decimal points does not change the sample statistic to a parameter.
μ and σ represent the characteristics of the defined population. x̄ and s are calculated from the sample you have in hand, so they may change when you draw a new sample.

Incluso si un programa estadístico lo indica con precisión como Mean = 10.274, se trata del x̄ de la muestra ingresada. El hecho de que haya muchos decimales no significa que se haya observado μ directamente. Si entra una nueva muestra, x̄ y s también pueden cambiar.

Si es la misma población, ¿por qué cambia la media?

Creemos una intuición utilizando una población finita muy pequeña. Estos son cinco valores para fines explicativos, no son datos biológicos reales.

6, 8, 10, 12, 14

La media de estos cinco valores es 10. Ahora, supongamos que extraemos dos de ellos.

MuestraValores extraídosMedia muestral x̄Interpretación
A6, 87Menor que μ, pero una muestra posible
B8, 1210Una muestra que casualmente es igual a μ
C12, 1413Mayor que μ, pero una muestra posible

Las tres muestras provienen de la misma población, pero sus medias son 7, 10 y 13, respectivamente. No es que solo la B sea un éxito y la A y la C sean fracasos. La media muestral difiere porque las unidades incluidas en la muestra son distintas.

El experimento mental de reconfigurar muestras con nuevas unidades independientes, manteniendo la misma población y las mismas reglas de extracción, se denomina muestreo repetido. El fenómeno en el que la composición de la muestra y los estadísticos varían en cada muestra se denomina variación de muestreo.

Figure 3 · repeated sampling
If you draw from the same population again, the composition and mean of the sample will be different.
Five replicate samples and sample meanThe raw data points of the five samples and the different sample averages are displayed on the same axis.68101214Population mean μ = 10specimen19.35specimen210.40specimen310.32specimen49.53specimen510.93
Each line is a fresh, independent sample from the same generation process. Even if the average score is different, it does not automatically mean that one line is a failed experiment.

La variabilidad del muestreo no significa que “nada sea fiable”. Más bien, es una declaración de que el objeto de estudio es hasta qué punto un único resultado puede fluctuar. En lugar de considerar el valor de una muestra como una verdad absoluta, observamos el movimiento posible de las estadísticas cuando se repite el mismo procedimiento.

Separe la observación de una diferencia de la atribución de su causa

Que dos medias muestrales sean distintas no confirma por sí solo un cambio de proceso, un error instrumental o una diferencia biológica. La variación muestral también puede producir diferencias. Para investigar la causa deben examinarse conjuntamente el diseño experimental, los registros de lote, día, donante e instrumento, y el tamaño de la diferencia.

Aparece una distribución adicional

En el histograma que vimos en la sección anterior, cada punto representaba el valor observado de una unidad experimental individual. Esta es la distribución de los datos originales. Ahora, extraigamos varias muestras del mismo tamaño y tracemos un punto por cada media muestral (x̄) calculada. La distribución formada por estas medias muestrales se denomina distribución de muestreo de la media muestral.

Figure 4 · two types of distribution
The distribution of observations and the sampling distribution of sample means paint different pictures.
Sampling distribution of raw data and sample meanAbove is a broad distribution of individual observations, and below is a narrower distribution of repeated sample means.Raw data distributionOne point = observation xSampling distributionOne point = mean x̄ of one sampleNear the same center μ, but the identities of different points
One dot in the figure above is the observed value of the experimental unit, and one dot in the figure below is the average calculated across the entire sample. Even if the same x-axis is used, the meaning of the points is different.

Aunque ambas gráficas pueden compartir el mismo eje numérico, el significado de cada punto es diferente.

  • Punto en la distribución de los datos originales: un único valor observado obtenido de una unidad experimental independiente.
  • Punto en la distribución de muestreo: un único estadístico x̄ calculado a partir de toda una muestra.

No se debe confundir la “distribución” mencionada en el término “distribución de muestreo” con el histograma de los datos originales. Siempre se debe especificar completamente de qué es la distribución. Dependiendo del estadístico elegido, como la media muestral o la mediana muestral, se generan distribuciones diferentes. En esta lección, seguiremos únicamente la media muestral.

¿Qué cambia cuando aumenta el número de muestras independientes?

Comparemos el caso en que extraemos cuatro elementos para calcular la media con el caso en que extraemos veinticinco elementos. Con muestras pequeñas, la media puede variar significativamente si se incluyen algunos valores extremadamente bajos o altos por casualidad. En muestras grandes, al incluirse múltiples valores en el cálculo de la media, tienden a compensarse mutuamente los efectos aleatorios de las observaciones individuales.

Figure 5 · sample size
As independence n increases, the swing of possible sample means generally narrows.
Comparison of average traces of small and large samplesWhen n is 4, the mean point lies broadly, and when n is 25, the mean point lies narrowly around the population mean.μ = 10n = 4n = 2568101214Each point is x̄ from a different sample.
A large n helps reduce random sampling variation, but it does not correct for biased sampling, dependent technical replicates, or poorly defined populations.

Por lo tanto, asumiendo el mismo proceso generador y un muestreo independiente correcto, las medias obtenidas de muestras grandes con un n mayor se agrupan generalmente en un rango más estrecho alrededor de μ. Sin embargo, existen tres límites importantes:

  1. Una única media muestral (x̄) de una muestra grande no necesariamente coincide exactamente con μ.
  2. Acumular muchas muestras sesgadas hacia ciertas condiciones no hace que dicho sesgo desaparezca por sí solo.
  3. Las réplicas técnicas, que consisten en leer varias veces la misma muestra biológica, no aumentan el n independiente.
Todavía no utilizaremos la fórmula del error estándar

En la siguiente unidad trataremos el error estándar, que expresa numéricamente la variación entre medias muestrales, y el intervalo de confianza, que la representa como un intervalo. Por ahora basta con leer en la gráfica cómo cambia la anchura de la nube de medias cuando cambia n.

Primero debe ser preciso con la frase ‘se repitió’

Leer cuatro pocillos técnicos en el mismo cultivo y preparar cuatro cultivos independientes pueden generar cuatro filas en la tabla. Sin embargo, lo primero es una réplica técnica dentro de una misma unidad biológica, mientras que lo segundo representa nuevas unidades independientes dirigidas a la población.

Figure 6 · independence
Reading the same sample multiple times is different from drawing a new sample.
Biological repeated sampling and technical repetitionOn the left are four new independent culture samples and on the right are four technical wells from one culture sample.4 new independent unitsConstruct a new sample from the population Independent n = 4C1C2C3C4Read one unit 4 times4 rows of technical repetitions independent n = 1W1W2W3W4Before determining the number of repetitions, check ‘what has been newly independently prepared’.
Technical iterations increase the information of the measurement process but do not add new independent units in the population. If you incorrectly count the number of rows as independent n, the meaning of repeated sampling is lost.

La réplica técnica no es un dato inútil. Es crucial para observar la variabilidad en el proceso de medición, incluyendo la distribución y la lectura. No obstante, aumentar las mediciones de la misma muestra no significa que se haya obtenido nueva información biológica de la población cuatro veces. Para hablar de remuestreo, debe ser capaz de explicar cuál es la nueva unidad experimental independiente que ha entrado en la muestra.

Ahora, probemos a extraer la muestra directamente

El siguiente mini Lab utiliza un proceso de generación continuo y simétrico con una media poblacional μ=10 y una desviación estándar poblacional σ=3. Este no es un dato experimental real, sino un modelo sintético para observar el remuestreo.

Primero, con n=8, pulse varias veces Extraer una muestra nueva. μ seguirá siendo 10, pero cambiarán x̄ y s. Después cambie n a 4 y 25 para comparar la amplitud de la trayectoria de la media muestral.

If this is your first time: What should I press?
  1. 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
  2. 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
  3. 3. Extraer una muestra nueva pressureNew synthetic data is created. The same conditions may vary depending on the sample.
  4. 4. Muestra actual y trayectoria de medias repetidas CompareWrite in one sentence what moves and what stays the same before and after the change.

If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.

In-Silico Lab · Sampling & Mean Trail

Take a new sample from the same population

Fix the training generation process with a population mean of 10 and a population standard deviation of 3. Only the seed and independent n are changed and the traces of the average of this sample and the repeated averages are compared.

Raw data points for the current sample

μ = 10x̄ = 11.0505101520

Average of 24 samples created with the same settings

11.0510.709.0810.797.8911.2810.5911.359.7510.6610.6710.909.029.1411.098.2410.779.649.2511.658.4111.389.7810.22

Division of this run

population mean μ10.00
Sample mean x̄11.05
Population SD σ3.00
Sample SD s4.48
independent n8
seed42017
Average of 24 x̄10.14

It is normal even if x̄ this time is different from 10. The set μ is the center of the generation process, and x̄ is the calculated value of the sample selected this time.

Same 40 repetitions: sample mean traces for n=4 and n=25

n=4n=2505101520

Model: Symmetric continuous normal generation process, μ=10, σ=3 · PRNG: mulberry32 · Transformation: Box–Muller · simulator_version: u04-guided-v1. This lab is for concept learning purposes only and cannot be used for actual research, quality, or clinical judgment.

El seed del Lab es el valor inicial que permite regenerar números aleatorios. Si se utiliza la misma versión del simulador, la configuración de la población, n y la semilla (seed), se reproducirá la misma muestra sintética. Sin embargo, esto es reproducibilidad computacional. Que la misma semilla se utilice no garantiza la reproducibilidad biológica de un experimento celular real.

Si copia la tabla generada, cada fila representa una nueva unidad experimental independiente extraída. Es normal que sus resultados difieran de los números del texto. No intente igualar los números; en su lugar, verifique las siguientes tres frases:

  • El x̄ actual puede no ser exactamente igual a μ.
  • Si la semilla cambia, la muestra y los estadísticos cambian.
  • Para el mismo número de repeticiones, los puntos promedio de un n mayor tienden a agruparse de forma más estrecha.

¿Cómo expresa JMP este fenómeno?

JMP no decide por usted el diseño experimental para generar las muestras. JMP resume con precisión las muestras ingresadas y representa gráficamente las columnas de estadísticos que hemos recopilado en las ejecuciones repetidas.

Distribution + Summary Statistics

It shows the raw data shape and Mean·Std Dev·N of the current sample.

Compare results by sample ID

Compare how x̄ and s change when you add a new sample.

Distribution of sample mean column

Expresses the position and shaking of x̄ values ​​collected from repeated execution.

Al observar la muestra actual con los resultados de Distribution de JMP, la Media (Mean) en las Estadísticas de Resumen (Summary Statistics) representa x̄, la Desviación Estándar (Std Dev) representa s, y N representa el número de filas de observación ingresadas. En este punto, el investigador debe verificar primero si N coincide con el número real de unidades experimentales independientes. JMP no corregirá automáticamente diciendo "n independiente es 1" al observar filas de réplicas técnicas de un mismo cultivo.

Al comparar las Estadísticas de Resumen de cada nueva muestra, se puede observar que x̄ y s cambian. Además, si se dispone de una tabla que reúna sample_id, seed, n, sample_mean, como si fuera el director de un laboratorio, se puede representar la ubicación y la fluctuación de las medias muestrales mediante la Distribución de la columna sample_mean. Eso es lo que se conoce como la distribución muestral de la media.

Figure 7 · From theory to expression
We draw a sample from the population, collect traces of statistics, and return to the first question.
Population, sampling, statistics, flow of sampling distributionIndependent units are selected from the population, statistics are calculated, and multiple averages are collected to observe the sampling distribution.POPULATIONμ·σ and the generation processDRAWn independent unitsSTATISTICCalculate x̄·sMEAN TRAILObservation of sampling distributionRe-select with a new seed and read the structure of the shake, not just a single number.
Lab knows how the samples were created, and JMP summarizes the tables it receives. When we look at the two roles together, we can connect the current statistics with the waviness of repeated sampling.

Aquí también, el orden de uso en JMP no es lo importante. Las relaciones que deben leerse son las siguientes:

  1. La Media de la muestra actual no es el parámetro μ, sino el estadístico x̄.
  2. En una nueva muestra, la Media y la Desviación Estándar pueden cambiar.
  3. Cada fila de la columna de medias muestrales es un valor que resume una muestra completa diferente.
  4. La salida del programa no garantiza la definición de la población, ni la ausencia de sesgo de extracción o la independencia.
No pasa nada si no dispone de JMP o Minitab

Las figuras y el laboratorio del texto bastan para aprender los conceptos centrales. Si dispone de JMP o Minitab, importe la muestra actual copiada y el registro de medias muestrales para examinar las mismas preguntas. Aunque cambie la interfaz, el principio de distinguir el resumen de la muestra actual de la distribución de estadísticos repetidos es el mismo.

Cinco preguntas para no detenerse tras ver una sola media

  1. ¿Hasta dónde llega la población que quiero conocer? Defina el sujeto, las condiciones, el tiempo y las unidades independientes en una oración.
  2. ¿Lo que tengo ahora es la población completa o una muestra? Distinga el alcance de la observación del total de su pregunta.
  3. ¿Los números en pantalla son parámetros o estadísticos? Si se calcularon a partir de una muestra, son x̄ y s.
  4. ¿Cuál es la nueva unidad independiente extraída? No cuente las filas de réplicas técnicas como nuevas muestras biológicas.
  5. ¿Cómo fluctúa el estadístico al volver a extraer? No convierta un único resultado en un valor definitivo.

La variabilidad de muestreo no es una excepción molesta que interfiere con el experimento. Es una estructura con la que inevitablemente se encuentra en el momento en que se intenta aprender sobre la población a través de muestras. Solo reconociendo esta estructura podrá iniciar adecuadamente la siguiente pregunta: "¿Entonces, cómo expreso el rango donde probablemente se encuentre μ, centrado en el x̄ obtenido?".

Even if a sample is drawn from the same population in the same way, the results and sample average may vary. Rather than confirming a single statistic as the true value, look at what was selected and how much it fluctuates in repeated sampling.

En la siguiente unidad añadiremos un intervalo de incertidumbre junto a una media muestral. Desde la perspectiva del muestreo repetido, relacionaremos qué mide el error estándar, por qué el intervalo de confianza cambia entre muestras y cómo debe interpretarse el conocido 95 %.

Recursos complementarios

Las pequeñas cifras, figuras y datos del laboratorio in silico de este artículo son sintéticos y explican conceptos estadísticos. No deben utilizarse como evidencia para decisiones reales de investigación, clínicas, de calidad o regulatorias.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...