El valor promedio de las respuestas de las ocho muestras preparadas ayer fue de 9.6. Hoy, al preparar ocho nuevas muestras con el mismo objetivo de condiciones, el promedio fue de 10.7. El protocolo y los parámetros medidos son los mismos, pero los números han cambiado. ¿Cuál de los experimentos de esos días fue incorrecto?
No se puede llegar a esa conclusión. No observamos la misma muestra ayer y hoy; más bien, vimos dos muestras compuestas por unidades independientes distintas. Incluso con el mismo objetivo de condiciones, si los sujetos incluidos en la muestra cambian, los valores observados y sus promedios pueden variar.
Si se extraen de la misma población, ¿por qué los resultados de las muestras varían cada vez?
En la unidad anterior, no solo observamos la media dentro de una muestra, sino que también leímos la desviación estándar, la distribución, los puntos de datos originales y la estructura de repetición. Ahora, desplazamos la mirada un paso atrás para observar el hecho de que la propia muestra puede variar si se repite el experimento.
Aunque los términos pueden parecer numerosos, nos guiaremos por cuatro pares. En lugar de memorizarlos todos a la vez, compare sus roles en las figuras.
Delimitemos primero la pregunta
La pregunta "¿Cuál es el promedio de nuestro experimento?" es más incompleta de lo que parece. Primero debemos definir a qué se refiere exactamente: qué células, qué donante, qué franja horaria y condiciones de cultivo. Este objetivo total al que finalmente apunta la pregunta de investigación es la población.
La población no tiene que ser necesariamente una lista enorme acumulada frente a nosotros. Puede ser un conjunto contable, como el conjunto completo de muestras específicas almacenadas en un congelador, o incluso el proceso generador de resultados que podrían surgir al preparar independientemente las mismas condiciones en el futuro. Lo importante es definir con una oración hasta dónde se agrupa todo bajo la misma pregunta.
La muestra es el subconjunto de valores de unidades independientes observadas realmente para conocer esa población. Si las ocho culturas independientes preparadas hoy constituyen una muestra, las ocho nuevas preparadas mañana podrían ser otra muestra dirigida a la misma población.
La muestra es parte de la población, pero no se convierte automáticamente en una réplica perfecta. Si se seleccionaron solo muestras fáciles o hubo sesgo hacia un donante específico, fecha o equipo, incluso con muchos datos, estos podrían no reflejar adecuadamente el total de la pregunta. El número de muestras es importante, pero no sustituye a dónde y cómo se obtuvieron.
El conjunto de muestras al que puede acceder realmente puede ser más estrecho que la población definida por la pregunta de investigación. En ese caso, el programa estadístico calculará correctamente los números introducidos, pero no decidirá si los resultados pueden generalizarse a una población más amplia.
El número de la población y el número de la muestra son diferentes incluso en su nombre
La expresión numérica de las características de toda la población se denomina parámetro. Representaremos la media poblacional con la letra griega μ (mu) y la desviación estándar poblacional con σ (sigma). Por otro lado, el valor calculado a partir de la muestra que tenemos en la mano es el estadístico. La media muestral se representa como x̄ (x-barra) y la desviación estándar muestral como s.
average of a defined population
Average calculated from this sample
Spread of population values
Spread of this sample values
Estos símbolos no son una simple preferencia de notación. Son una salvaguarda para distinguir qué es lo que queremos saber de lo que realmente hemos calculado. En la realidad, a menudo no podemos observar toda la población, por lo que no podemos conocer μ y σ directamente. Intentamos conocer las características de esa población a través de x̄ y s de la muestra.
Incluso si un programa estadístico lo indica con precisión como Mean = 10.274, se trata del x̄ de la muestra ingresada. El hecho de que haya muchos decimales no significa que se haya observado μ directamente. Si entra una nueva muestra, x̄ y s también pueden cambiar.
Si es la misma población, ¿por qué cambia la media?
Creemos una intuición utilizando una población finita muy pequeña. Estos son cinco valores para fines explicativos, no son datos biológicos reales.
6, 8, 10, 12, 14
La media de estos cinco valores es 10. Ahora, supongamos que extraemos dos de ellos.
| Muestra | Valores extraídos | Media muestral x̄ | Interpretación |
|---|---|---|---|
| A | 6, 8 | 7 | Menor que μ, pero una muestra posible |
| B | 8, 12 | 10 | Una muestra que casualmente es igual a μ |
| C | 12, 14 | 13 | Mayor que μ, pero una muestra posible |
Las tres muestras provienen de la misma población, pero sus medias son 7, 10 y 13, respectivamente. No es que solo la B sea un éxito y la A y la C sean fracasos. La media muestral difiere porque las unidades incluidas en la muestra son distintas.
El experimento mental de reconfigurar muestras con nuevas unidades independientes, manteniendo la misma población y las mismas reglas de extracción, se denomina muestreo repetido. El fenómeno en el que la composición de la muestra y los estadísticos varían en cada muestra se denomina variación de muestreo.
La variabilidad del muestreo no significa que “nada sea fiable”. Más bien, es una declaración de que el objeto de estudio es hasta qué punto un único resultado puede fluctuar. En lugar de considerar el valor de una muestra como una verdad absoluta, observamos el movimiento posible de las estadísticas cuando se repite el mismo procedimiento.
Que dos medias muestrales sean distintas no confirma por sí solo un cambio de proceso, un error instrumental o una diferencia biológica. La variación muestral también puede producir diferencias. Para investigar la causa deben examinarse conjuntamente el diseño experimental, los registros de lote, día, donante e instrumento, y el tamaño de la diferencia.
Aparece una distribución adicional
En el histograma que vimos en la sección anterior, cada punto representaba el valor observado de una unidad experimental individual. Esta es la distribución de los datos originales. Ahora, extraigamos varias muestras del mismo tamaño y tracemos un punto por cada media muestral (x̄) calculada. La distribución formada por estas medias muestrales se denomina distribución de muestreo de la media muestral.
Aunque ambas gráficas pueden compartir el mismo eje numérico, el significado de cada punto es diferente.
- Punto en la distribución de los datos originales: un único valor observado obtenido de una unidad experimental independiente.
- Punto en la distribución de muestreo: un único estadístico x̄ calculado a partir de toda una muestra.
No se debe confundir la “distribución” mencionada en el término “distribución de muestreo” con el histograma de los datos originales. Siempre se debe especificar completamente de qué es la distribución. Dependiendo del estadístico elegido, como la media muestral o la mediana muestral, se generan distribuciones diferentes. En esta lección, seguiremos únicamente la media muestral.
¿Qué cambia cuando aumenta el número de muestras independientes?
Comparemos el caso en que extraemos cuatro elementos para calcular la media con el caso en que extraemos veinticinco elementos. Con muestras pequeñas, la media puede variar significativamente si se incluyen algunos valores extremadamente bajos o altos por casualidad. En muestras grandes, al incluirse múltiples valores en el cálculo de la media, tienden a compensarse mutuamente los efectos aleatorios de las observaciones individuales.
Por lo tanto, asumiendo el mismo proceso generador y un muestreo independiente correcto, las medias obtenidas de muestras grandes con un n mayor se agrupan generalmente en un rango más estrecho alrededor de μ. Sin embargo, existen tres límites importantes:
- Una única media muestral (x̄) de una muestra grande no necesariamente coincide exactamente con μ.
- Acumular muchas muestras sesgadas hacia ciertas condiciones no hace que dicho sesgo desaparezca por sí solo.
- Las réplicas técnicas, que consisten en leer varias veces la misma muestra biológica, no aumentan el n independiente.
En la siguiente unidad trataremos el error estándar, que expresa numéricamente la variación entre medias muestrales, y el intervalo de confianza, que la representa como un intervalo. Por ahora basta con leer en la gráfica cómo cambia la anchura de la nube de medias cuando cambia n.
Primero debe ser preciso con la frase ‘se repitió’
Leer cuatro pocillos técnicos en el mismo cultivo y preparar cuatro cultivos independientes pueden generar cuatro filas en la tabla. Sin embargo, lo primero es una réplica técnica dentro de una misma unidad biológica, mientras que lo segundo representa nuevas unidades independientes dirigidas a la población.
La réplica técnica no es un dato inútil. Es crucial para observar la variabilidad en el proceso de medición, incluyendo la distribución y la lectura. No obstante, aumentar las mediciones de la misma muestra no significa que se haya obtenido nueva información biológica de la población cuatro veces. Para hablar de remuestreo, debe ser capaz de explicar cuál es la nueva unidad experimental independiente que ha entrado en la muestra.
Ahora, probemos a extraer la muestra directamente
El siguiente mini Lab utiliza un proceso de generación continuo y simétrico con una media poblacional μ=10 y una desviación estándar poblacional σ=3. Este no es un dato experimental real, sino un modelo sintético para observar el remuestreo.
Primero, con n=8, pulse varias veces Extraer una muestra nueva. μ seguirá siendo 10, pero cambiarán x̄ y s. Después cambie n a 4 y 25 para comparar la amplitud de la trayectoria de la media muestral.
If this is your first time: What should I press?
- 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
- 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
- 3. Extraer una muestra nueva pressureNew synthetic data is created. The same conditions may vary depending on the sample.
- 4. Muestra actual y trayectoria de medias repetidas CompareWrite in one sentence what moves and what stays the same before and after the change.
If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.
Take a new sample from the same population
Fix the training generation process with a population mean of 10 and a population standard deviation of 3. Only the seed and independent n are changed and the traces of the average of this sample and the repeated averages are compared.
Raw data points for the current sample
Average of 24 samples created with the same settings
Division of this run
It is normal even if x̄ this time is different from 10. The set μ is the center of the generation process, and x̄ is the calculated value of the sample selected this time.
Same 40 repetitions: sample mean traces for n=4 and n=25
Model: Symmetric continuous normal generation process, μ=10, σ=3 · PRNG: mulberry32 · Transformation: Box–Muller · simulator_version: u04-guided-v1. This lab is for concept learning purposes only and cannot be used for actual research, quality, or clinical judgment.
El seed del Lab es el valor inicial que permite regenerar números aleatorios. Si se utiliza la misma versión del simulador, la configuración de la población, n y la semilla (seed), se reproducirá la misma muestra sintética. Sin embargo, esto es reproducibilidad computacional. Que la misma semilla se utilice no garantiza la reproducibilidad biológica de un experimento celular real.
Si copia la tabla generada, cada fila representa una nueva unidad experimental independiente extraída. Es normal que sus resultados difieran de los números del texto. No intente igualar los números; en su lugar, verifique las siguientes tres frases:
- El x̄ actual puede no ser exactamente igual a μ.
- Si la semilla cambia, la muestra y los estadísticos cambian.
- Para el mismo número de repeticiones, los puntos promedio de un n mayor tienden a agruparse de forma más estrecha.
¿Cómo expresa JMP este fenómeno?
JMP no decide por usted el diseño experimental para generar las muestras. JMP resume con precisión las muestras ingresadas y representa gráficamente las columnas de estadísticos que hemos recopilado en las ejecuciones repetidas.
It shows the raw data shape and Mean·Std Dev·N of the current sample.
Compare how x̄ and s change when you add a new sample.
Expresses the position and shaking of x̄ values collected from repeated execution.
Al observar la muestra actual con los resultados de Distribution de JMP, la Media (Mean) en las Estadísticas de Resumen (Summary Statistics) representa x̄, la Desviación Estándar (Std Dev) representa s, y N representa el número de filas de observación ingresadas. En este punto, el investigador debe verificar primero si N coincide con el número real de unidades experimentales independientes. JMP no corregirá automáticamente diciendo "n independiente es 1" al observar filas de réplicas técnicas de un mismo cultivo.
Al comparar las Estadísticas de Resumen de cada nueva muestra, se puede observar que x̄ y s cambian. Además, si se dispone de una tabla que reúna sample_id, seed, n, sample_mean, como si fuera el director de un laboratorio, se puede representar la ubicación y la fluctuación de las medias muestrales mediante la Distribución de la columna sample_mean. Eso es lo que se conoce como la distribución muestral de la media.
Aquí también, el orden de uso en JMP no es lo importante. Las relaciones que deben leerse son las siguientes:
- La Media de la muestra actual no es el parámetro μ, sino el estadístico x̄.
- En una nueva muestra, la Media y la Desviación Estándar pueden cambiar.
- Cada fila de la columna de medias muestrales es un valor que resume una muestra completa diferente.
- La salida del programa no garantiza la definición de la población, ni la ausencia de sesgo de extracción o la independencia.
Las figuras y el laboratorio del texto bastan para aprender los conceptos centrales. Si dispone de JMP o Minitab, importe la muestra actual copiada y el registro de medias muestrales para examinar las mismas preguntas. Aunque cambie la interfaz, el principio de distinguir el resumen de la muestra actual de la distribución de estadísticos repetidos es el mismo.
Cinco preguntas para no detenerse tras ver una sola media
- ¿Hasta dónde llega la población que quiero conocer? Defina el sujeto, las condiciones, el tiempo y las unidades independientes en una oración.
- ¿Lo que tengo ahora es la población completa o una muestra? Distinga el alcance de la observación del total de su pregunta.
- ¿Los números en pantalla son parámetros o estadísticos? Si se calcularon a partir de una muestra, son x̄ y s.
- ¿Cuál es la nueva unidad independiente extraída? No cuente las filas de réplicas técnicas como nuevas muestras biológicas.
- ¿Cómo fluctúa el estadístico al volver a extraer? No convierta un único resultado en un valor definitivo.
La variabilidad de muestreo no es una excepción molesta que interfiere con el experimento. Es una estructura con la que inevitablemente se encuentra en el momento en que se intenta aprender sobre la población a través de muestras. Solo reconociendo esta estructura podrá iniciar adecuadamente la siguiente pregunta: "¿Entonces, cómo expreso el rango donde probablemente se encuentre μ, centrado en el x̄ obtenido?".
En la siguiente unidad añadiremos un intervalo de incertidumbre junto a una media muestral. Desde la perspectiva del muestreo repetido, relacionaremos qué mide el error estándar, por qué el intervalo de confianza cambia entre muestras y cómo debe interpretarse el conocido 95 %.
Recursos complementarios
- JMP Statistics Knowledge Portal · Descriptive Statistics
- JMP Statistics Knowledge Portal · Inferential Statistics
- JMP Academic · Probability and Sampling Distributions
- JMP Help · Distributions of Continuous Variables
Las pequeñas cifras, figuras y datos del laboratorio in silico de este artículo son sintéticos y explican conceptos estadísticos. No deben utilizarse como evidencia para decisiones reales de investigación, clínicas, de calidad o regulatorias.