Volver a la lista

Tipos de datos · Esquema · Origen

En el contexto de la bioestadística basada en Python, se aprenderán los conceptos clave de tipos de datos, esquemas y procedencia, así como las consideraciones importantes en el diseño de la investigación.

Principiante
|
18min
|
Verificado (2026-08-07)
BioStatPyestadística biomédicaPythondiseño de investigación
Progreso0/33 (0%)

Tipos de datos, esquema y procedencia

Al finalizar este tema

Antes de leer los datos, compruebe el tipo de dato y la unidad de cada columna, y registre el significado de cada fila mediante un esquema. Para los datos externos, registre en la sección de procedencia el identificador de acceso, la ruta de descarga, la versión y las condiciones de uso, diferenciando entre el acceso abierto y la redistribución libre.

Punto de partida: ¿se puede analizar solo con abrir un archivo?

Que se haya abierto un archivo CSV y se muestre la primera fila no significa que el análisis esté listo. Es necesario verificar qué significan los nombres de las columnas, si los números son valores medidos reales o códigos, y si cada fila representa una unidad independiente o mediciones repetidas. Los archivos de datos son entradas para los cálculos, pero el archivo en sí mismo no explica ni la pregunta de investigación ni el proceso de medición.

Por ejemplo, considere una tabla con sample_id, condition, value y date. Si no se conoce la unidad de value, si date es una fecha de medición o de procesamiento, o si sample_id es una unidad biológica o simplemente un número de fila del archivo, no se pueden iniciar los cálculos estadísticos.

Esquema: el contrato de los datos

El esquema es un contrato que registra la estructura de los datos y el significado de cada campo.

CampoTipo de datoSignificadoUnidad/Valores permitidosRegla para valores faltantes
sample_idcadenaIdentificador de la unidad de análisisID predefinidoInterrumpir si está vacío
conditioncategoríaCondición de comparaciónA, BSin código especial
valueflotanteResultado de la mediciónUnidad especificada en el documentoNA
measured_atfecha y horaMomento de la mediciónISO 8601Registrar zona horaria

El tipo de dato no es un mero adorno. Si se trata un identificador que parece numérico como una variable continua, se comete el error de atribuirle magnitud y orden. Si las fechas se limitan a ser cadenas de texto, se pueden cometer errores en el cálculo del orden temporal o de los intervalos. El tipo de dato, la unidad, los valores permitidos y la representación de valores faltantes deben definirse junto con los datos.

Procedencia: ¿de dónde provienen los valores?

La procedencia es el registro que rastrea la trayectoria de generación, recopilación, transformación y almacenamiento de los valores. Si se recibieron datos de un repositorio externo, registre al menos el identificador de acceso, la página original, la fecha y hora de descarga, el hash del archivo, las etapas de transformación y la información de citación. Las guías oficiales de GEO y ENCODE consideran el identificador de acceso y la citación de la fuente como parte de un registro identificable.

Este registro no garantiza automáticamente que los datos sean "reales". En cambio, permite que otros revisen qué entradas se utilizaron y qué transformaciones se aplicaron. Si raw count se convirtió en un valor normalizado, registre el código de transformación junto con los archivos de entrada y salida.

Separar derechos y condiciones de acceso

El hecho de que un recurso esté disponible para descargar desde una página web pública no significa que sea de dominio público ni que se pueda redistribuir libremente. El identificador de acceso es el identificador del dato, mientras que la licencia define las condiciones de uso; no deben considerarse lo mismo.

Al incluir datos en contenido educativo, registre por separado los siguientes aspectos:

  • access: Dónde se puede verificar
  • license: Bajo qué condiciones se puede utilizar
  • redistribution: Si se puede redistribuir el archivo
  • attribution: A quién y en qué proyectos debe atribuirse
  • privacy/ethics: Si existen restricciones adicionales para la reutilización con fines educativos

Si no es posible verificar el estado de los derechos, no incluya el archivo original en el contenido; en su lugar, proporcione únicamente el identificador de acceso y los procedimientos oficiales de acceso. La distinción entre ideas/hechos y la expresión en el derecho de autor puede ayudar a redactar contenidos de forma independiente, pero no sustituye el juicio legal sobre cada uso individual.

Redacte el esquema y la información de procedencia conjuntamente

El manifiesto mínimo de un conjunto de datos puede estructurarse de la siguiente manera:

text
dataset_id: example-001
source_type: synthetic | repository
accession: none | verified accession
source_url: canonical page
downloaded_at: ISO 8601
file_sha256: verified hash
schema_version: 1.0.0
transformations: []
license_status: verified | pending | restricted
redistribution_status: allowed | link_only | prohibited | unknown

Para los datos sintéticos, también se registra la ausencia de un identificador de acceso. No es que carezcan de origen, sino que las reglas de generación propias, la semilla, el código generador y el esquema de salida constituyen la procedencia. Para los datos externos, no basta con indicar solo la URL de origen; se debe especificar qué archivo y versión se utilizaron.

Volvamos a la pregunta de investigación para interpretar

Al documentar el esquema y la procedencia, podemos rastrear el significado de los resultados del análisis. Esto se debe a que podemos conocer la unidad de los valores, el momento de la medición y las transformaciones aplicadas. Sin embargo, que la procedencia sea completa no demuestra automáticamente la calidad de la medición ni la validez de la pregunta de investigación.

Por el contrario, los números sin origen ni unidad tienen un rango de interpretación limitado, aunque se puedan calcular. Rechazar los datos antes del análisis no es un procedimiento engorroso, sino una forma de aclarar de qué entradas dependen los resultados.

Lista de verificación para realizar antes del análisis

Antes de comenzar el análisis real, se comparan el esquema y la procedencia sin leerlos por separado.

  1. ¿analysis_unit coincide con la unidad de la pregunta de investigación y el plan de estudios?
  2. ¿El tipo de dato, la unidad y el momento de la medición del resultado coinciden con los documentos y las tablas?
  3. ¿Todos los identificadores explican las reglas de unicidad o la estructura de grupos?
  4. ¿No existen diferencias en la notación de los valores categóricos (A, a, condition_A)?
  5. ¿El código de valores faltantes y las reglas de exclusión se conservan en el manifiesto original?
  6. ¿Se pueden recuperar los archivos antes y después de la transformación, así como el entorno de ejecución?

Esta verificación no es un procedimiento para juzgar si los datos son perfectos. Es un procedimiento para dejar constancia de qué supuestos se han verificado y cuáles no. Los elementos no verificados se dejan como pending, y no se utilizan expresiones que aumenten la confianza en los resultados del análisis.

Conectar la procedencia con las frases del análisis

En el informe final, la procedencia no se limita a un apéndice administrativo separado. Debe poder responder a la pregunta: "¿De qué datos se calcularon estos resultados?". Por ejemplo, al vincular dataset_id, schema_version, transformations y file_sha256 al manifiesto de resultados, se puede distinguir entre los resultados anteriores y los nuevos cuando cambian los archivos con el mismo nombre.

Por el contrario, si solo se registra la fecha de descarga del archivo y se omiten el hash o las etapas de transformación, será difícil verificar si se recibió un archivo diferente desde la misma URL. La reproducibilidad no se logra con una sola semilla, sino que se acerca cuando es posible rastrear conjuntamente la entrada, el entorno, la transformación y la salida.

Fallos comunes y cómo verificarlos

  • No confundir los nombres de archivo con el identificador de acceso o la licencia.
  • No utilizar identificadores que parecen números como valores de medición.
  • NA no agrupa las representaciones de valores faltantes, como cadenas vacías o ceros, en un solo grupo.
  • No reemplaza el archivo original ni impide el seguimiento de los cambios antes y después de la transformación.
  • No utiliza la posibilidad de acceso abierto como permiso para la redistribución.

Resumen clave

  • El esquema es un contrato de datos que describe filas, columnas, tipos de datos, unidades y valores faltantes.
  • La procedencia es el registro que rastrea el origen y la ruta de transformación de los datos.
  • accession, license, redistribution y attribution son campos distintos.
  • Los datos sintéticos también deben registrar las reglas de generación y la versión.
  • Si los derechos o el origen son inciertos, se puede omitir el archivo original y dejar solo la vía de acceso oficial.

Próximo tema

En la siguiente entrega, visualizaremos con más detalle la centralidad, dispersión y distribución de los datos. Solo después de confirmar el esquema y las unidades es posible interpretar correctamente las verificaciones de calidad.

Referencias

Los ejemplos de esquema y manifiesto de esta sección son configuraciones educativas creadas de forma independiente por BioStatPy.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...