Traducir la pregunta de investigación en variables
Al finalizar este tema
Podrás descomponer una pregunta de investigación en el valor que se medirá como resultado (outcome), las condiciones que se compararán o describirán (exposure), las covariables que se registrarán junto con ellas y el identificador que distingue cada fila. Además, podrás decidir primero qué significa una fila en la tabla y, a partir de ahí, redactar un borrador del contrato de datos adecuado para esa pregunta.
Punto de partida: la pregunta aún no tiene nombres de columna
Considera la siguiente pregunta:
¿Cómo difieren las mediciones obtenidas bajo distintas condiciones de tratamiento?
Esta oración indica la dirección de la investigación, pero no constituye una tabla lista para analizar. No se sabe qué constituye la “medición”, en qué unidad se asignó la condición de tratamiento ni cuántas unidades independientes hay por condición. El primer paso para trasladar la pregunta a datos no consiste en elegir técnicas estadísticas, sino en separar los roles dentro de la oración.
En este punto, no debes presuponer el efecto biológico de un tratamiento específico. Primero debes definir el alcance de las preguntas que el diseño de datos permite; así evitarás exagerar lo que significan los valores calculados más adelante.
Determinar primero qué significa una fila
Antes de crear la tabla, debes responder a “¿qué es una fila?”. Una fila puede corresponder a una unidad de cultivo independiente o a una única medición repetida dentro de la misma unidad. Ambas representaciones son válidas, pero si el significado de la fila cambia, también lo hace la unidad de análisis, aunque se usen los mismos nombres de columna.
Por ejemplo, si se realizaron tres mediciones técnicas sobre una misma unidad independiente, podrían presentarse las siguientes dos representaciones:
| culture_id | treatment | measurement_id | value |
|---|---|---|---|
| C01 | A | M01 | 0.82 |
| C01 | A | M02 | 0.79 |
| C01 | A | M03 | 0.81 |
Las tres filas de esta tabla registran tres observaciones, pero si culture_id la condición de tratamiento se asignó al mismo nivel, no hay tres unidades de tratamiento independientes. El número de observaciones y el número de informaciones independientes deben registrarse por separado. La distinción entre réplica biológica, réplica técnica y unidad experimental afecta directamente al resumen y la inferencia posteriores. Este tema se abordará con mayor detalle en el siguiente apartado.
Traducir la pregunta en cuatro tipos de columnas
outcome: qué medir para responder
outcome es el valor observado como resultado de una pregunta de investigación. Puede ser una medida continua o indicar la ocurrencia o frecuencia de un evento. Lo importante no es el nombre, sino la regla de medición. Se debe registrar junto con el valor: la unidad, el momento de la medición, el rango permitido y la representación de los datos faltantes.
Escribir simplemente “crecimiento” no es suficiente. El significado del resultado varía según si se trata del número de células en un momento específico, el cambio con respecto a un tiempo base o un indicador de área obtenido de una imagen. Incluso con el mismo nombre de columna value, si la definición de la medición difiere, no se deben mezclar en un único análisis.
exposición: qué comparar o explicar
exposure es la condición para comparar los resultados observados o la variable explicativa. En experimentos, puede expresarse como condiciones de tratamiento o dosis; en estudios observacionales, como nivel de exposición o clasificación de grupos. Se debe verificar si es categórica o numérica, si se definió antes del inicio del estudio y si el valor se calculó después de la medición.
Sin embargo, indicar la exposición no define automáticamente un efecto causal sobre el resultado. Se deben revisar conjuntamente el método de asignación del tratamiento, la secuencia temporal, la posibilidad de confusión y la unidad de análisis. En este tema, solo se aborda la traducción de la pregunta a variables; no se establecen conclusiones causales.
covariable: contexto a registrar junto con
covariate es una variable que se puede considerar al interpretar el resultado y la exposición. Puede reflejar el contexto del diseño del estudio y del proceso de medición, como el bloque, el momento de la medición o el estado inicial. No todos los valores registrados se convierten automáticamente en covariables. Si no coinciden con la pregunta y la secuencia temporal, o si son valores creados después de observar el resultado, pueden alterar la interpretación.
Por lo tanto, no se considera que “más columnas significan mejores datos”. Para cada columna, se debe poder explicar por qué se registró, a qué unidad pertenece y qué papel puede desempeñar en el análisis.
identificador: nombre para distinguir filas y unidades
identifier es el valor utilizado para distinguir las observaciones o las unidades de estudio. Pueden existir identificadores de múltiples niveles, como culture_id, batch_id y measurement_id. Los identificadores son importantes para detectar duplicados y verificar la estructura de grupos, pero no se deben interpretar como magnitudes biológicas o efectos por sí mismos.
Tenga cuidado de no introducir identificadores numéricos en el modelo como variables continuas. Si culture_id=10 no significa un estado cinco veces mayor que culture_id=5, entonces ese número es un nombre con orden y tamaño, no una medición.
Redactar un pequeño contrato de datos
Una vez definidas las variables, redacte primero el siguiente contrato:
| Columna | Rol | Tipo de dato | Unidad o valores permitidos | Significado en una fila |
|---|---|---|---|---|
unit_id | identificador | cadena de caracteres | ID único | Unidad de investigación independiente |
treatment | exposición | categórica | A, B | Condición asignada a la unidad |
batch | posible covariable | categórica | ID de bloque predefinido | Contexto de medición y tratamiento |
outcome | resultado | numérica | Unidad predefinida | Valor medido en un momento dado |
Esta tabla no representa los resultados del análisis, sino un acuerdo establecido antes del análisis. Si no se conoce la unidad de medición y el momento de outcome, el nivel de asignación de treatment y la existencia de mediciones repetidas, el acuerdo aún está incompleto. La información faltante debe dejarse como una lista de verificación en lugar de completarla.
Volver a interpretar a partir de la pregunta de investigación
Después de traducir a variables, vuelva a leer la pregunta.
- ¿La condición que quiero comparar está expresada mediante
exposure? - ¿La definición de medición del resultado y su unidad están definidas y especificadas en
outcome? - ¿La unidad de cada fila y la unidad de asignación del tratamiento están diferenciadas?
- ¿Las mediciones repetidas y la información del bloque son identificables?
- ¿Cuáles son las preguntas que esta tabla responde y cuáles son las que no puede responder?
Aprobar esta verificación no demuestra el efecto de las condiciones de tratamiento. Aún no se han examinado los métodos de cálculo, la incertidumbre ni las limitaciones del diseño de investigación. El logro aquí es haber traducido la pregunta a un lenguaje analizable, no haber obtenido una conclusión anticipada.
Fallos frecuentes y método de verificación
En primer lugar, asignar a todas las columnas el nombre de "variable" sin distinguir sus roles. Si no se distingue entre resultado e identificador, se puede atribuir significado al tamaño numérico del ID.
En segundo lugar, definir una fila como una única medición y luego contar todas esas filas como repeticiones independientes. Dado que la unidad de asignación del tratamiento y la unidad de medición pueden diferir, la estructura de repetición debe conservarse en una columna separada.
En tercer lugar, cambiar retrospectivamente la pregunta para ajustarla a los datos. Antes del análisis, se debe registrar la pregunta y el rol de las variables; si es necesario realizar cambios, se debe dejar constancia de qué cambió y por qué.
Resumen clave
- La pregunta de investigación puede traducirse en roles de resultado, exposición, covariable e identificador.
- Primero se debe definir el significado de cada fila y la unidad de asignación del tratamiento.
- El ID es un nombre para distinguir unidades y no se convierte automáticamente en una variable de análisis ni en un efecto.
- El acuerdo de variables debe incluir tipo de dato, unidad, valores permitidos y estructura de repetición.
- Crear una tabla de variables no confirma causalidad ni importancia biológica.
Siguiente tema
En la siguiente sección, se distinguen las observaciones, las unidades experimentales, los replicados biológicos y los replicados técnicos dentro de una misma tabla. En particular, se aborda el problema de la pseudoreplicación, que consiste en contar erróneamente las mediciones repetidas de una misma unidad independiente como si fueran muestras independientes.
Referencias
- Bioconductor OSTA, diseño experimental: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
- Informes ASA GAISE: https://www.amstat.org/education/guidelines-for-assessment-and-instruction-in-statistics-education-%28gaise%29-reports
La explicación, las tablas y los escenarios de esta sección son componentes educativos creados de forma independiente por BioStatPy. No reproducen frases, expresiones ni la disposición de ejemplos de materiales externos.