Diferenciación entre unidad de observación, unidad experimental y repetición
Al finalizar este tema
Podrá distinguir la unidad de las filas donde se almacenan los valores medidos de la unidad experimental a la que se asignan las condiciones del tratamiento. Podrá separar las réplicas biológicas de las técnicas y formular preguntas para determinar si las mediciones repetidas aumentan el número de muestras independientes.
Punto de partida: ¿12 valores medidos equivalen a 12 muestras?
Supongamos que en un estudio se prepararon cuatro unidades de cultivo independientes y se realizaron tres mediciones por cada unidad. La tabla final contendrá 12 valores. ¿Es el número de muestras igual a 12?
A esta pregunta no se puede responder solo con números. Es necesario saber a qué unidad se asignó la condición del tratamiento, si las tres mediciones provienen de unidades biológicas diferentes o si son mediciones repetidas de la misma unidad. El número de valores observados es el recuento de registros, mientras que el número de información independiente depende del diseño del estudio y de la estructura de asignación.
Separar las cuatro unidades
Unidad de observación
La unidad de observación es el objeto o nivel de medición en el que se registra un valor. Puede manifestarse como una sola imagen, un solo pocillo (well) o un valor medido en un momento determinado. Aunque la unidad de observación está estrechamente relacionada con las filas de la tabla de datos, no siempre son lo mismo, ya que es posible almacenar múltiples valores de medición en una sola fila utilizando un formato ancho.
Unidad experimental
La unidad experimental es la unidad más pequeña a la que se asigna el tratamiento o la condición. Si se asignaron condiciones a unidades de cultivo independientes, esas unidades de cultivo constituyen la unidad experimental. Incluso si se aplicó la misma condición a varios pocillos, si la asignación real se realizó en una unidad superior a los pocillos, no se deben contar los pocillos individuales como unidades de tratamiento independientes.
Esta es la razón por la cual es importante anotar "a dónde se asignó el tratamiento" antes del análisis. Debe priorizar el nivel de asignación sobre el nombre del método de análisis.
Réplica biológica
La réplica biológica son repeticiones obtenidas de unidades biológicas independientes entre sí. Qué constituye una unidad independiente debe determinarse según la pregunta de investigación y el diseño, no simplemente porque los identificadores sean diferentes. También debe verificar los registros del diseño para determinar si las mediciones derivadas de una misma fuente constituyen réplicas biológicas independientes.
Réplica técnica
La réplica técnica es una medición repetida realizada en la misma unidad biológica o en la misma unidad experimental para evaluar la variabilidad del proceso de medición. Aunque las réplicas técnicas son útiles para verificar la estabilidad de la medición, esto no elimina el hecho de que provengan de la misma unidad independiente. Por lo tanto, no se debe cambiar directamente el número de réplicas técnicas por el número de réplicas biológicas.
Leer la estructura jerárquica en la tabla
A continuación, se muestra un ejemplo en formato largo, donde cada fila registra una única medición.
| condition | culture_id | well_id | measurement_id | value |
|---|---|---|---|---|
| A | C01 | W01 | M01 | 0.82 |
| A | C01 | W01 | M02 | 0.79 |
| A | C01 | W02 | M03 | 0.81 |
| B | C02 | W03 | M04 | 0.91 |
| B | C02 | W03 | M05 | 0.94 |
Los identificadores de la tabla indican diferentes niveles. measurement_id distingue los registros, well_id distingue las unidades subyacentes donde se realizó la medición y culture_id indica posibles unidades independientes de nivel superior. Sin embargo, no se puede concluir automáticamente la independencia basándose únicamente en esta columna. Es necesario examinar conjuntamente la asignación del tratamiento y el proceso de generación de las muestras.
Por ejemplo, si las tres filas de la condición A pertenecen todas a culture_id=C01, entonces las tres observaciones no constituyen réplicas biológicas independientes. Por el contrario, si C01, C02 y C03 se asignaron de forma independiente a la condición, se puede revisar junto con los registros del diseño si cada cultivo constituye una unidad independiente.
Dónde surge la pseudorreplicación
La pseudorreplicación se refiere al problema de sobreestimar la cantidad de información al tratar repeticiones no independientes como muestras independientes. El punto de partida más común es contar múltiples mediciones técnicas como si fueran réplicas biológicas diferentes.
Este problema no es simplemente un "error en el conteo de filas". Se trata de mezclar los niveles a los que se cuenta el número de muestras, los niveles a los que se estima la variabilidad y las unidades en las que se observaron las diferencias entre condiciones. Las mediciones repetidas de la misma unidad independiente pueden mostrar variabilidad en la medición, pero no generan nuevas unidades independientes.
Esto no implica que deban descartarse siempre las réplicas técnicas. El manejo depende de si el objetivo de las mediciones repetidas es verificar el error de medición o determinar si cada unidad subyacente tiene una muestra independiente del tratamiento. La decisión sobre si resumir mediante promedios, incorporar la estructura jerárquica en el modelo o revisar el diseño se toma considerando conjuntamente la pregunta de investigación y la estructura de los datos.
Orden de evaluación para el manejo de las repeticiones
Se registra el siguiente orden:
- ¿A qué unidad se asignó la condición o el tratamiento?
- ¿A qué unidad corresponde la medición de un valor del resultado?
- ¿Cuántos valores provienen de la misma unidad superior?
- ¿Las repeticiones representan variabilidad biológica o variabilidad del proceso de medición?
- ¿Cómo se define la unidad independiente del análisis y el número de muestras que se van a incluir en el informe?
Al responder a esta pregunta, no se debe empezar contando el número de filas en la tabla de datos. Puede ser necesario consultar el cuaderno de investigación, los registros de asignación, el árbol genealógico de las muestras y el esquema de datos. Si no está seguro, es más seguro dejarlo como design_unknown sin asumir la independencia de forma arbitraria.
Verificar con un esquema reducido
La estructura repetitiva se puede expresar en el contrato de datos de la siguiente manera:
analysis_unit: culture_id
observation_unit: measurement_id
condition_assigned_at: culture_id
technical_repeat_key: well_id
outcome: valueEste esquema no impone un método de análisis específico. En cambio, indica en qué nivel de ID se verificó la independencia. Si condition_assigned_at está vacío, es necesario completar el registro del diseño antes de comenzar a comparar las condiciones de tratamiento.
Volvamos a la pregunta de investigación para interpretarlo
Al responder a la pregunta "¿el resultado en la condición A difiere del de la condición B?", lo fundamental no es el número de filas que pertenecen a A y B, sino la estructura de las unidades de asignación independientes. Si bien tener muchas repeticiones técnicas permite observar con mayor detalle la estabilidad de las mediciones de cada unidad, esto por sí solo no aumenta la base para una comparación independiente entre condiciones.
Además, la expresión "replicado biológico" tampoco es un indicador que garantice por sí solo la independencia total del estudio. Es necesario registrar en qué unidad se generaron, asignaron y midieron los datos de forma independiente, y seleccionar resúmenes y modelos adecuados para ese nivel. La razón por la que aún no se elige entre comparar medias o realizar pruebas de significancia es que primero debe definirse la unidad de análisis.
Errores comunes y cómo verificarlos
Escribir "como hay 12 filas, n=12"
Las filas pueden ser simplemente el número de registros de observación. Si no se define en el documento de análisis qué cuenta n, se confundirá el número de observaciones con el número de repeticiones independientes.
Eliminar automáticamente las repeticiones técnicas
Las mediciones repetidas pueden utilizarse para evaluar la calidad y la variabilidad del proceso de medición. El problema no radica en eliminar las repeticiones, sino en no distinguir su función de la de los replicados biológicos.
Elegir la prueba estadística sin verificar el nivel de ID
Si se deben comparar las medias por grupo o modelar una estructura jerárquica depende de la pregunta y del diseño. Primero se deben registrar la unidad de asignación y la estructura de repetición, y luego elegir el método.
Resumen clave
- La unidad de observación es el nivel en el que se registran los valores, mientras que la unidad experimental es el nivel al que se asigna la condición.
- Los replicados biológicos y los técnicos tienen significados diferentes en relación con la independencia.
- Las mediciones repetidas provenientes de la misma unidad independiente aumentan el número de filas, pero no incrementan automáticamente el número de muestras independientes.
- La pseudoreplicación ocurre cuando se confunden las filas de datos, la información independiente y la unidad de análisis.
- Antes de elegir un método de análisis, es necesario registrar el nivel de asignación y la estructura de repetición en el esquema.
Próximo tema
En la siguiente entrega, organizaremos el tipo de dato, el esquema y el origen de las variables. Posteriormente, en stat-004, resumiremos los datos cuya unidad de análisis ha sido definida mediante medidas de tendencia central, dispersión y distribución.
Referencias
- Bioconductor OSTA, diseño experimental: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
- Informes ASA GAISE: https://www.amstat.org/education/guidelines-for-assessment-and-instruction-in-statistics-education-%28gaise%29-reports
Las explicaciones, tablas, esquemas y escenarios de este documento son materiales educativos elaborados de forma independiente por BioStatPy. No se reproduce la redacción, las expresiones ni la disposición de los ejemplos de materiales externos.