Resumen de tendencia central, dispersión y distribución
Al finalizar este tema
Podrás distinguir entre la media y la mediana, que describen la tendencia central, y la desviación estándar y el rango intercuartílico (RIC), que describen la dispersión. Utilizarás Python para observar cómo pueden diferir las distribuciones de dos conjuntos de datos con la misma tendencia central, y aprenderás a evitar interpretar la estructura de los datos basándote únicamente en un valor resumen.
Punto de partida: ¿una media igual implica datos iguales?
Supongamos que el promedio del resultado medido bajo dos condiciones es el mismo. ¿Podemos afirmar solo por esto que los datos de ambas condiciones son similares?
No necesariamente. Es posible que los valores de una condición se agrupen alrededor de la media, mientras que en la otra condición algunos valores estén muy alejados. Por el contrario, aunque las medias sean diferentes, la mayoría de las observaciones pueden superponerse. La tendencia central resume la ubicación, la dispersión explica hasta qué punto se extienden los valores y la distribución muestra formas que no quedan capturadas solo con esta información.
El objetivo de esta sección no es concluir cuál condición de tratamiento es superior. En su lugar, al utilizar dos grupos sintetizados internamente en lugar de datos externos aprobados, verificamos que las estadísticas resumidas representan solo una perspectiva de la estructura de los datos.
Verificación de la unidad de análisis y la forma de los datos
Como se confirmó en la sección anterior, primero debemos verificar el significado de cada fila. En el siguiente ejemplo, asumimos que cada fila representa un único resultado obtenido desde una unidad de análisis independiente. Esto requiere asumir que no se han añadido réplicas técnicas como muestras independientes.
El contrato de datos a utilizar es el siguiente:
| Columna | Significado | Tipo de dato | Unidad |
|---|---|---|---|
condition | Condición a comparar | Cadena de texto | A o B |
outcome | Valor medido objeto de análisis | Número real | Unidad arbitraria definida internamente |
En investigaciones reales, deben registrarse adicionalmente la unidad, el momento de la medición, los valores faltantes y la estructura de las réplicas. Aquí se ha reducido el número de variables para mostrar la estructura de cálculo de la tendencia central y la dispersión.
Dos perspectivas para resumir la tendencia central
Media
La media es el valor obtenido al sumar todos los valores observados y dividirlo por el número de observaciones. Dado que la media refleja el tamaño de todos los valores en el cálculo, puede verse influenciada por valores extremadamente alejados. Esta característica no es un error, sino parte de la forma en que la media resume los datos.
Mediana
Es el valor que se encuentra en el centro cuando los valores se ordenan de menor a mayor. Proporciona información sobre la posición donde la mitad de las observaciones son menores o iguales a este valor, y la otra mitad es mayor o igual. Si hay un número par de observaciones, se utiliza la regla definida por los dos valores centrales.
La mediana no siempre es mejor que la media. Si la pregunta requiere el valor promedio o el nivel esperado, la media puede ser un resumen importante; si se desea observar la posición central de la distribución, la mediana puede ser útil. La elección debe justificarse en función de la relación entre los datos y la pregunta.
Dos perspectivas para resumir la dispersión
Desviación estándar
La desviación estándar resume en una sola unidad qué tan dispersos están los valores observados alrededor de la media. Dado que se calcula con respecto a la media, puede verse influenciada por valores extremadamente altos o bajos. Una desviación estándar pequeña indica que los valores de estos datos están más agrupados alrededor de la media, pero no garantiza automáticamente conclusiones sobre la precisión de las mediciones o una baja variabilidad biológica.
Rango intercuartílico (IQR)
El IQR es la diferencia entre el percentil 75 y el percentil 25. Representa el rango que abarca el 50% central, por lo que su sensibilidad a los valores atípicos puede ser menor en comparación con la desviación estándar. Sin embargo, el IQR tampoco es un valor que muestre toda la distribución; se requieren visualizaciones adicionales para observar características como las colas y las múltiples modas.
Verificación de datos sintéticos con Python
El siguiente código es un ejemplo diseñado para crear dos condiciones con centros similares pero diferente dispersión y valores extremos, sin replicar un conjunto de datos específico. El generador de números aleatorios en numpy y las API de DataFrame, groupby y describe en pandas deben validarse según la versión indicada en requirements-lock.txt.
import numpy as npimport pandas as pd
rng = np.random.default_rng(20260806)group_a = rng.normal(loc=10.0, scale=0.8, size=20)group_b = np.concatenate([ rng.normal(loc=10.0, scale=0.8, size=18), np.array([6.0, 14.0]),])
data = pd.DataFrame({ "condition": ["A"] * len(group_a) + ["B"] * len(group_b), "outcome": np.concatenate([group_a, group_b]),})
summary = data.groupby("condition")["outcome"].agg( mean="mean", median="median", sd="std", q1=lambda s: s.quantile(0.25), q3=lambda s: s.quantile(0.75),)summary["iqr"] = summary["q3"] - summary["q1"]print(summary.round(2))Este código crea un DataFrame con dos columnas a partir de los datos de entrada y calcula las medidas de tendencia central y dispersión según las condiciones. std utiliza la regla estándar para el cálculo de la desviación estándar proporcionada por pandas, por lo que se deben verificar la API y los valores predeterminados del entorno de ejecución antes de registrar los resultados. summary es un objeto de resultado en forma de tabla, que por sí solo no representa todas las características de la distribución.
Cómo interpretar los resultados
En los resultados de la ejecución, primero verifique la relación entre la media y la mediana para cada condición. Si estos valores difieren, se puede examinar la posibilidad de asimetría en la distribución o la influencia de algunos valores atípicos. A continuación, compare la magnitud de la desviación estándar (SD) y el rango intercuartílico (IQR). El hecho de que una medida de resumen sea mayor o menor no justifica por sí solo la eliminación de valores atípicos o la conclusión de que se trata de un error de medición.
Dado que estos datos incluyen dos valores extremos en B, las medidas de dispersión de B pueden diferir de las de A. Lo importante es reconocer que esta diferencia se debe a las reglas utilizadas para generar los datos sintéticos. No se puede interpretar que alguna condición biológica real sea superior basándose únicamente en esta salida.
Interpretar los resultados junto con la distribución
La media y la desviación estándar (SD) son una medida de resumen que describe la ubicación y la dispersión de los datos alrededor de la media. La mediana y el rango intercuartílico (IQR) son otra medida de resumen que describe la ubicación y la dispersión en la región central de los datos. No se debe automatizar la elección de una u otra medida basándose únicamente en la apariencia superficial de los datos.
Registre al menos las siguientes preguntas:
- ¿Cuál es la unidad de análisis de cada fila?
- ¿Cuáles son la unidad y el momento de medición del resultado (outcome)?
- ¿Hay valores faltantes?
- ¿En qué medida difieren la media y la mediana?
- ¿En qué medida difieren la SD y el IQR?
- ¿Se agrupan las observaciones en un solo grupo o hay múltiples picos o colas en la distribución?
Es difícil responder a la última pregunta solo con una tabla. Se deben utilizar visualizaciones que muestren la distribución de los datos, como histogramas, diagramas de dispersión o diagramas de caja. Las visualizaciones deben incluir etiquetas en los ejes, unidades y una descripción de la unidad de observación.
Volver a la pregunta de investigación para la interpretación
En esta sección, podemos concluir que "las medidas de tendencia central y dispersión por condición en los datos sintéticos se calculan según ciertas reglas, y las medidas de resumen reflejan información diferente". Para hablar sobre el efecto del tratamiento en investigaciones reales, la importancia biológica y la causalidad, se debe revisar adicionalmente el diseño de la investigación, el proceso de medición, la incertidumbre y el propósito de la comparación.
Además, no se debe asumir que un sistema biológico es estable solo porque la desviación estándar o el rango intercuartílico son pequeños. Se deben considerar las posibilidades de que el rango de medición haya sido estrecho, que se haya seleccionado una unidad específica o que la estructura de repetición se haya resumido incorrectamente. Las medidas de resumen estadístico son herramientas para formular preguntas más claras, no dispositivos que determinen el significado de los datos.
Errores comunes y métodos de verificación
Usar la notación media ± SD como la representación básica para todos los datos
Aunque la media y la desviación estándar son útiles, no todas las distribuciones se describen adecuadamente con esta combinación. Se recomienda examinar conjuntamente la mediana, el rango intercuartílico y la distribución de los datos originales.
Eliminación automática de valores atípicos
Los valores atípicos pueden deberse a errores de entrada, problemas de medición o variabilidad real. No elimine un valor solo porque resulte llamativo; verifique los registros de medición y los objetivos del estudio, y documente la razón del tratamiento aplicado.
Acumulación de repeticiones técnicas como observaciones
Primero aplique la unidad de análisis y la estructura de repetición definidas en secciones anteriores. Aunque el cálculo de las estadísticas descriptivas sea correcto, definir incorrectamente la unidad independiente alterará la interpretación.
Confundir los valores resumidos con la distribución misma
La media, la mediana, la desviación estándar y el rango intercuartílico condensan parte de la información de los datos. Diferentes distribuciones pueden tener valores resumidos similares; por lo tanto, si es necesario, examine los datos originales junto con las visualizaciones.
Resumen clave
- La media y la mediana resumen el centro utilizando enfoques distintos.
- La desviación estándar y el rango intercuartílico expresan la dispersión desde perspectivas diferentes.
- La elección de las estadísticas resumidas debe justificarse junto con la pregunta, la unidad y la distribución.
- Los resultados obtenidos con datos sintéticos pueden usarse para verificar los cálculos, pero no constituyen conclusiones biológicas reales.
- Un único valor resumido no puede sustituir a la distribución completa ni a la estructura de independencia.
Siguiente tema
En la siguiente sección se visualizarán las distribuciones y se inspeccionarán los valores atípicos. Tras calcular el centro y la dispersión, se avanzará hacia la verificación gráfica de la forma y la calidad de los datos.
Referencias
- Referencia de NumPy: https://numpy.org/doc/stable/reference/
- Guía del usuario de pandas: https://pandas.pydata.org/docs/user_guide/index.html
- Informes GAISE de la ASA: https://www.amstat.org/education/guidelines-for-assessment-and-instruction-in-statistics-education-%28gaise%29-reports
Las explicaciones, tablas y reglas de generación de datos sintéticos de esta sección son componentes educativos creados independientemente por BioStatPy. No reproducen frases, expresiones ni disposiciones de ejemplos de materiales externos.