Supongamos que los rendimientos medios de los procesos A y B son ambos 82. A se concentra mayoritariamente entre 80 y 84, mientras que B oscila ampliamente entre 70 y 94. Aunque a simple vista los dos procesos parecen iguales al observar solo la media, la predictibilidad del siguiente lote y el error estándar de la diferencia de medias no son en absoluto iguales.
La pregunta de esta sección es una sola.
¿Cómo cambia la incertidumbre al comparar medias cuando la dispersión de las dos poblaciones difiere?
La dispersión es el ruido de fondo para la comparación de medias
La diferencia observada entre dos medias debe compararse con la variación natural dentro de cada población. Si los valores están agrupados, una pequeña diferencia de medias puede ser clara; si están ampliamente dispersos, la misma diferencia puede quedar enmascarada por la variabilidad muestral. La condición que asume que las varianzas poblacionales de dos grupos son iguales se denomina homocedasticidad, mientras que la condición que asume que son diferentes se denomina heterocedasticidad.
Homocedasticidad no significa que las dos desviaciones estándar (SD) muestrales deban ser idénticas. Incluso al extraer de una misma varianza poblacional, la SD muestral varía en cada muestra. Por el contrario, aunque dos SDs sean similares por casualidad, no se puede garantizar que la incertidumbre en la comparación de medias sea igual debido a diferencias en la forma de la distribución o en el tamaño de la muestra.
En primer lugar, observe junto a lado los diagramas de puntos (dot plots), los diagramas de caja y bigotes (box plots) y las SD de cada grupo. Debe distinguir si el ensanchamiento se debe a un cambio general en la escala, a uno o dos valores atípicos, a una cola derecha o a la mezcla de subgrupos diferentes. La prueba de varianza no sustituye este análisis visual.
Las pruebas de dispersión no formulan la misma pregunta de la misma manera
La hipótesis nula común es generalmente H0: σ₁²=σ₂²=…=σk². Sin embargo, difieren en cómo miden la dispersión y en los supuestos de distribución.
- La prueba F para dos grupos compara la razón de las varianzas muestrales con la distribución F. Es sensible al modelo normal.
- La prueba de Bartlett puede ser eficiente para múltiples grupos, pero es sensible a la no normalidad y a los valores atípicos.
- La prueba de Levene compara las distancias absolutas de cada observación al centro del grupo como una nueva variable de respuesta.
- A la variante de Levene que utiliza la mediana en lugar de la media como centro, se la conoce comúnmente como el método Brown–Forsythe, lo cual puede ser una opción más robusta frente a las colas y los valores atípicos.
En lugar de memorizar los nombres de las pruebas, pregúntese qué centro y distancia utiliza y cuán sensible es a las desviaciones de la normalidad.
Que una prueba de dispersión no sea significativa significa que hay evidencia insuficiente para detectar diferencias de varianza en la muestra actual. Con muestras pequeñas (n), pueden pasarse por alto razones de varianza grandes. No utilice esto como señal para aceptar 'igualdad' o para autorizar automáticamente el uso de la t-test agrupada (pooled t-test).
No se debe dividir la prueba de medias basándose en una sola prueba previa
El procedimiento común en el pasado consistía en realizar primero una prueba de homogeneidad de varianzas (igualdad de varianzas) y, si era significativa, elegir la prueba t de Welch; si no lo era, seleccionar la prueba t agrupada (pooled). Esta bifurcación automática en dos etapas complica la tasa de error final y la incertidumbre, e es inestable con muestras pequeñas.
Es preferible decidir la selección del análisis basándose en el diseño y las suposiciones científicas antes de observar los datos. En la comparación de medias de dos grupos independientes, el método de Welch refleja por separado las varianzas y los tamaños muestrales de cada grupo, lo que lo convierte en una alternativa robusta útil cuando no se está seguro de la igualdad de varianzas. Esto no significa que sea el único método para todos los diseños. Para datos apareados, agrupados, de medidas repetidas o censurados, se necesitan modelos adecuados a su estructura.
Laboratorio In-Silico: Mantener la media constante y variar solo la dispersión
En el siguiente laboratorio, las medias verdaderas de ambos grupos son iguales. Cambie únicamente la proporción de la DE del grupo B, el tamaño muestral (n) y la semilla (seed).
- Aumente la proporción de la DE de 1 a 3 para observar que la proporción de la DE muestral no coincide exactamente con el valor establecido en cada ocasión.
- Repita la generación de nuevas muestras con n=8 y n=40 para comparar la fluctuación en la estimación de la dispersión.
- Busque una muestra donde la DE y la desviación absoluta mediana (MAD) no se muevan en la misma dirección.
- Vuelva a responder si el hecho de que las medias sean iguales implica que la estabilidad sea igual.
Fix the mean and just change the spread.
We vary the SD ratio of B in two groups with the same mean and see how the sample SD and robust distance change.
If this is your first time: What should I press?
- 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
- 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
- 3. new composite specimen pressureNew synthetic data is created. The same conditions may vary depending on the sample.
- 4. Pictures and calculation results CompareWrite in one sentence what moves and what stays the same before and after the change.
If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.
Synthetic observations of the same settings
calculation result
Differences in sample spread are evidence created by the data. A single p value cannot prove that the variances of two populations are equal.
educational synthetic modelbjs-comparison-sequence-v1. Actual research judgments must separately reflect experimental units, missingness, distribution, multiplicity, pre-planning, and domain criteria.
El laboratorio no compite mediante los valores p de las pruebas de dispersión. Primero, permite observar qué condiciones de generación de datos modifican qué resúmenes de dispersión. En datos reales, se deben examinar conjuntamente la gráfica de los datos originales, el tamaño muestral, la causa de los valores atípicos y los límites superior e inferior de medición junto con la independencia.
La salida de JMP sirve para mostrar varias sensibilidades lado a lado
F·Levene·Brown-Forsythe-type results look at the same spread question with different sensitivities.
First check the size and uncertainty of the sample SD graphically.
It is judged based on distribution shape, n, and outlier values rather than just the p value.
El objetivo no es seguir la ruta del menú antiguo de JMP. Interprete cómo cada prueba investiga el mismo H0, y qué tan bien Std Dev y los intervalos de confianza reflejan el tamaño real. No se debe seleccionar el valor p más favorable entre varios para sacar una conclusión.
Las frases de informe deben separar las preguntas sobre dispersión y media
Frase incorrecta:
Dado que Levene p=.31, las dos varianzas son iguales y se utilizó la prueba t agrupada (pooled t-test).
Frase mejorada:
La DE muestral de los lotes independientes fue 1.8 para A y 3.1 para B. Se observó una dispersión más amplia y una cola derecha en B. La diferencia de medias se estimó mediante el método de Welch predefinido, y la comparación de dispersión se presentó junto con la gráfica de los datos originales y resultados de Levene basados en la mediana como información de sensibilidad.
Si la diferencia de varianzas es en sí misma la pregunta de investigación, informe el cociente de varianzas o el IC de la diferencia de escalas. Si la verificación de supuestos para la comparación de medias es el objetivo, el efecto de la media y su IC son centrales, mientras que la prueba de dispersión es un diagnóstico auxiliar.
Cierre del capítulo
- La igualdad de varianzas es un supuesto del modelo poblacional, no la coincidencia de dos desviaciones estándar muestrales.
- Las diferencias de dispersión modifican el error estándar de una diferencia de medias y su capacidad predictiva.
- Las pruebas F y de Bartlett son sensibles a desviaciones de la normalidad; la familia de Levene aumenta la robustez mediante distancias al centro.
- Una prueba de dispersión no significativa no demuestra que las varianzas sean iguales.
- No cambie mecánicamente el método de análisis después de una prueba de dispersión.
- La gráfica de los datos originales y la unidad experimental preceden a cualquier prueba.
En la siguiente unidad compararemos la media de un grupo con un valor de referencia externo y reuniremos efecto, error estándar, IC y valor p en una sola frase de resultados.
Material complementario
Las cifras, figuras y datos del laboratorio de este artículo son sintéticos y educativos. No deben utilizarse como única evidencia para decisiones reales de investigación, clínicas, de calidad o regulatorias.