Volver a la lista

Mediciones repetidas, agrupación y pseudorreplicación.

Se aprenderán los conceptos clave de mediciones repetidas, agrupación y pseudorreplicación, así como las consideraciones importantes en el diseño de la investigación, en el contexto de la bioestadística basada en Python.

Intermedio
|
30min
|
Verificado (2026-08-07)
BioStatPyestadística biomédicaPythondiseño de investigación
Progreso0/33 (0%)

Mediciones repetidas, datos agrupados y pseudorreplicación

Al finalizar este tema

Podrá identificar las conexiones entre observaciones en datos de mediciones repetidas y agrupados. Identificará la pseudorreplicación, que sobreestima el tamaño de la muestra al considerar filas de nivel inferior como unidades independientes, y formulará las preguntas necesarias antes de elegir entre resumir los datos, utilizar modelos jerárquicos o corregir el diseño experimental.

Tener muchas filas no implica tener mucha información independiente

Una misma unidad independiente puede generar múltiples observaciones en distintos momentos, en diferentes pocillos o en varias imágenes. Aunque el marco de datos tenga muchas filas, al compartir valores dentro de la misma unidad superior, estas observaciones no pueden considerarse independientes entre sí. La clave de las mediciones repetidas radica en la estructura de conexión, no en el número de filas.

Esquema jerárquico

text
study_id → subject_id → timepoint → measurement_id

Verifique que cada nivel corresponda a la unidad de investigación real. Si el tratamiento se asignó a subject_id, considerar las réplicas como measurement_id independientes implica el riesgo de pseudorreplicación. Los puntos temporales del mismo sujeto comparten el orden temporal y un estado común.

La agrupación es similar. Si existen unidades que comparten un entorno o proceso de tratamiento común, como lote, placa o sitio, las observaciones dentro del mismo grupo pueden ser más similares entre sí. Registrar el ID de grupo simplemente como una columna categórica y reflejar su estructura de correlación en el análisis son dos cosas distintas.

Tres enfoques posibles

Si el propósito de la réplica es reducir el error de medición, se puede resumir a nivel de unidad independiente. Para modelar cambios a lo largo del tiempo o entre grupos, se debe considerar el uso de métodos que reflejen la estructura jerárquica. Si el diseño no está claro, primero complemente los registros de investigación y el linaje de los datos.

Ningún enfoque es una regla aplicable automáticamente a todos los datos repetidos. Seleccione según la forma del resultado, el número de puntos temporales, los valores faltantes, el nivel de asignación y la pregunta, y registre la razón.

Verificación de la estructura en formato largo

Los datos repetidos pueden expresarse en formato largo registrando subject_id, time, measurement_id y outcome en una sola fila. Que el mismo subject_id aparezca en varias filas puede indicar una estructura repetida, no un error de duplicación. Contar primero el número de puntos temporales y la ubicación de los valores faltantes por subject_id permite verificar qué unidad superior está incompleta.

Por el contrario, si solo existe measurement_id sin un ID de unidad superior, es difícil reconstruir la estructura de independencia. Antes del análisis, complemente el ID superior en los datos originales, las notas experimentales y el mapa de placas; si no se puede verificar, no asuma arbitrariamente la independencia.

Mostrar en paralelo el número único de subject_id por grupo y el número total de filas revela la diferencia entre el número de observaciones y el número de unidades independientes. Especifique en cada tabla e imagen a qué nivel corresponde el conteo de n en la tabla de resultados.

Volver a la pregunta de investigación para la interpretación

La pregunta de los datos de medición repetida no es "¿son diferentes las medias de todas las filas?", sino más bien "¿cómo distinguimos el cambio dentro de las unidades independientes de la diferencia entre las unidades independientes?". Si no se distingue, se puede subestimar la incertidumbre.

Errores comunes

  • No considerar los múltiples puntos temporales de un sujeto como muestras independientes.
  • No tratar automáticamente los pocillos de la misma placa como independientes.
  • Promediar arbitrariamente los valores repetidos y perder la información temporal.
  • Especificar automáticamente un modelo mixto sin verificar su estructura.

Resumen clave

  • La clave de los datos de medición repetida y agrupados es la unidad superior y la estructura de conexión.
  • El número de filas puede no ser igual a la cantidad de información independiente.
  • El resumen, el modelo jerárquico y las mejoras en el diseño se determinan en función de las preguntas y la estructura del estudio.

Próximo tema

A partir de la siguiente entrega, abordaremos OLS, covariables y el análisis de diagnóstico.

Referencias

El esquema jerárquico y las explicaciones de esta edición fueron elaborados de forma independiente por BioStatPy.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...