Volver a la lista

Visualización de distribuciones y detección de valores atípicos.

Se aprenderán los conceptos clave de la visualización de distribuciones y la detección de valores atípicos, así como las consideraciones importantes en el diseño de la investigación, en el contexto de la bioestadística basada en Python.

Principiante
|
25min
|
Verificado (2026-08-07)
BioStatPyestadística biomédicaPythondiseño de investigación
Progreso0/33 (0%)

Visualización de distribuciones y valores atípicos

Al finalizar este tema

Podrá explicar qué información muestran un histograma, un gráfico de puntos y un diagrama de caja. Podrá evitar clasificar inmediatamente las observaciones destacadas como errores o candidatos para su eliminación, conectándolas en su lugar con la verificación de la calidad de los datos y la revisión de las preguntas de investigación.

Punto de partida: lo que no muestra la tabla de resumen

En stat-004 calculamos la tendencia central y la dispersión. Sin embargo, las tablas de resumen comprimen el orden y la densidad de los valores. Incluso si la media y el rango intercuartílico (IQR) son similares en ambas condiciones, una de ellas puede presentar múltiples picos o colas largas.

El propósito de la visualización no es crear "imágenes bonitas". Se trata de inspeccionar a simple vista la distribución de los valores, las diferencias entre grupos, los datos faltantes y los rangos inusitados, manteniendo el significado de cada fila y las unidades de medición.

Preguntas que abordan tres tipos de gráficos

Gráfico de puntos

Al marcar cada observación con un punto, se puede verificar el número real de datos y su ubicación. Es útil cuando la muestra no es muy grande para distinguir si un punto representa una unidad analítica o una repetición técnica. Si los puntos se superponen, se puede utilizar un desplazamiento aleatorio (jitter) para dispersarlos, pero es necesario aclarar que las posiciones desplazadas no representan nuevos valores medidos.

Histograma

Muestra la frecuencia por intervalos de valores. La forma puede variar según el ancho del intervalo, por lo que no se debe interpretar una forma específica como una estructura fija e inherente a la naturaleza. Se utiliza como punto de partida para explorar la posibilidad de colas largas, intervalos vacíos o múltiples picos.

Diagrama de caja

Resume la mediana, los cuartiles, el rango y los puntos extremadamente alejados. Los puntos exteriores al diagrama de caja no implican un juicio de que son "errores que deben eliminarse". Son una señal visual de que la observación se encuentra lejos de las reglas establecidas.

Visualización de distribuciones con Python

El siguiente código utiliza una estructura sintética propia similar a stat-004. Antes de proceder con la visualización, es necesario verificar los tipos de datos, los valores faltantes y la unidad de análisis en condition y outcome.

python
import matplotlib.pyplot as plt
import seaborn as sns
fig, axes = plt.subplots(1, 2, figsize=(9, 3.5))
sns.stripplot(data=data, x="condition", y="outcome", ax=axes[0])
sns.boxplot(data=data, x="condition", y="outcome", ax=axes[1])
axes[0].set_title("individual observations")
axes[1].set_title("distribution summary")
fig.tight_layout()

Este código se ejecuta asumiendo que data es el DataFrame creado en la sección anterior. El gráfico de dispersión muestra la posición de cada valor, mientras que el diagrama de caja resume la distribución y señala los valores atípicos. Los nombres de los ejes y las unidades deben ajustarse al formato real de los datos. Si se genera un archivo de imagen, registre el código de generación, el entorno y el hash de entrada en el manifiesto.

Al agregar un histograma, se aplican los mismos principios.

python
fig, ax = plt.subplots(figsize=(5, 3.5))
sns.histplot(
data=data,
x="outcome",
hue="condition",
bins=8,
element="step",
stat="count",
common_norm=False,
ax=ax,
)
ax.set_xlabel("outcome (arbitrary unit)")
ax.set_ylabel("number of observations")
fig.tight_layout()

La selección de bins influye en la apariencia visual. Por lo tanto, verifique si el patrón se mantiene al cambiar el ancho del intervalo y no declare la esencia de la distribución basándose únicamente en un histograma. Al superponer grupos con hue, proporcione simultáneamente la leyenda y el número de observaciones para evitar ocultar la unidad de análisis o el tamaño de la muestra mediante el color únicamente.

Los resultados de la visualización dependen más de las condiciones de generación que de la imagen en sí. Debe registrar el título del gráfico, las unidades de los ejes, el subconjunto utilizado, las reglas de exclusión de valores faltantes y el número de observaciones por grupo para que otras personas puedan regenerar el mismo gráfico.

Orden a seguir tras detectar valores atípicos

Al encontrar un valor llamativo, primero registre la información sin eliminar los datos.

  1. Verifique el ID de fila del valor y la unidad de análisis.
  2. Consulte si existe dicho valor en los registros de entrada, transformación y medición.
  3. Compruebe que las unidades, decimales, fechas y etiquetas de grupo sean correctas.
  4. Si es un error de medición, conserve la justificación de la corrección y el original.
  5. Si es una variación real, registre los criterios de inclusión y el análisis de sensibilidad en lugar de eliminarlo arbitrariamente.

Este proceso conecta el juicio visual sobre si un valor es atípico con la documentación de la investigación. La regla de "eliminar lo que está fuera de la caja" no explica las causas de las observaciones.

Separar los juicios mediante un análisis de sensibilidad

En algunos casos, incluso al revisar los registros de medición, no se decide cómo tratar el valor. En tales situaciones, puede comparar los resultados obtenidos aplicando reglas predefinidas con aquellos aplicando reglas distintas, conservando los datos originales. Esta comparación no es un mecanismo para elegir automáticamente cuál resultado es el "verdadero", sino un método para revelar hasta qué punto la conclusión depende de observaciones específicas.

Sin embargo, si al realizar el análisis de sensibilidad selecciona solo las reglas que producen resultados más favorables, cambiará el propósito del análisis. Debe registrar los criterios de exclusión, las razones de su aplicación y las diferencias en los resultados, explicando también qué criterio se ajusta mejor a la pregunta de investigación.

Representar la estructura repetida en los gráficos

Si hay múltiples réplicas técnicas derivadas de una misma réplica biológica, no represente todos los puntos como muestras independientes. Puede utilizar líneas de conexión, colores, facetas o indicadores resumidos por unidad superior, pero los adornos visuales no sustituyen la estructura de independencia. Lo primero es especificar en la descripción del gráfico "qué representa cada punto".

Volver a la pregunta de investigación para interpretar

La visualización de distribuciones ayuda a formular preguntas más específicas sobre cómo se observaron los datos por condición. Permite verificar si las diferencias centrales aparecen en todos los intervalos, si algunos valores están sesgando los resultados o si hay mezclas en las unidades de medición.

Sin embargo, un solo gráfico no confirma el efecto causal de la condición ni la importancia biológica. La visualización es una etapa para verificar la calidad y las hipótesis, pero no sustituye la independencia, la incertidumbre ni el diseño de la investigación.

Orden para leer los gráficos

No afirme diferencias inmediatamente después de crear un gráfico. Léalo siguiendo este orden:

  1. Verifique las unidades y transformaciones de los ejes.
  2. Verifique qué unidad de análisis representa cada punto.
  3. Compruebe el número de observaciones y los valores faltantes por condición.
  4. Analice la posibilidad de tendencia central, dispersión, asimetría y múltiples modas.
  5. Verifique en los datos originales y el registro el impacto de puntos específicos en los resultados.

Este orden conecta las impresiones visuales con el contrato de datos. Por ejemplo, aunque el diagrama de caja del grupo B parezca más ancho, si el número de observaciones de B es menor o faltan algunas unidades, se debe registrar este hecho antes de interpretarlo como una comparación entre condiciones iguales. El contraste de color entre grupos ayuda a la interpretación, pero no transmite por sí solo el significado, orden o superioridad de las condiciones mediante el color únicamente.

Accesibilidad e informe

Distinguir grupos solo por color puede hacer que la información se pierda en casos de daltonismo o en impresiones en blanco y negro. Utilice junto con ello el texto de la leyenda, las etiquetas de los ejes, la forma de los puntos o la distinción de paneles. En la descripción de la imagen, indique qué significa el dato, cuál es la unidad de un solo punto y si se incluyen observaciones no procesadas.

Al incluir gráficos en un informe, no copie solo el archivo de imagen, sino vincule el código de generación y la versión de los datos. Registre figure_id, el hash de entrada, la versión del código y el momento de creación para evitar dibujar diferentes subconjuntos con el mismo nombre de archivo. La visualización es también un producto del análisis, por lo que forma parte de la procedencia.

Lo que no se puede decir desde el gráfico

La observación de que una distribución está sesgada hacia un lado no proporciona el mecanismo de "por qué está sesgada". La observación de que los valores de una condición están más dispersos tampoco indica si la causa de la variabilidad es biológica, del proceso de medición o de la composición del lote. No escriba en la misma oración la observación del gráfico y la explicación de las causas.

Además, no concluya que las condiciones son iguales solo porque dos diagramas de caja se superponen. La superposición muestra únicamente la relación de los rangos visuales; el tamaño del efecto, la incertidumbre y la evaluación del diseño necesarios para la pregunta de investigación requieren un análisis separado. Del mismo modo, que los diagramas de caja parezcan separados no confirma un efecto causal.

Al guardar el gráfico, registre también los siguientes metadatos:

ÍtemEjemplo de registro
figure_idstat-005-eda-01
inputDataFrame sintético, versión de la regla de generación
unitUnidad de análisis de una fila
missing_ruleExclusión de valores faltantes o ninguno
group_ruleValores permitidos de condition
code_versioncommit o hash del manuscrito ejecutado

Este registro sirve para revisar posteriormente los resultados visuales y verificar bajo qué supuestos se crearon.

Fallos frecuentes y métodos de verificación

  • No recorte los ejes ni oculte las unidades para exagerar las diferencias.
  • No interprete la posición simulada del jitter como un valor medido real.
  • No elimine automáticamente los puntos fuera del diagrama de caja.
  • Las repeticiones técnicas y los replicados biológicos no se representan como puntos independientes del mismo color.
  • En la descripción de la figura, no se oculta el número de observaciones por grupo ni el número de valores faltantes.

Resumen clave

  • El gráfico de dispersión muestra las observaciones individuales, el histograma muestra la frecuencia por intervalo y el diagrama de caja resume la distribución.
  • Los valores atípicos no son una señal para eliminarlos mediante un comando, sino una indicación para verificar los registros, las mediciones y las transformaciones.
  • Las visualizaciones requieren ejes, unidades, unidad de observación y el significado de los valores faltantes y las repeticiones.
  • Las figuras permiten revisar la calidad de los datos y las preguntas planteadas, pero no generan automáticamente conclusiones causales.

Próximo tema

En el próximo capítulo se tratarán los valores faltantes, los duplicados y las transformaciones. Se relacionan los espacios vacíos y los rangos anómalos detectados en las figuras con los supuestos y registros utilizados para su tratamiento.

Referencias

El escenario y el código de visualización de esta edición son una configuración educativa creada de forma independiente por BioStatPy.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...