Volver a la lista

Cómo leer los datos médicos masivos: el contexto de generación es más importante que el volumen de datos

Se explican conjuntamente el contexto de generación y la calidad de los datos médicos, el preprocesamiento, la fuga de datos, la validación externa, la protección de la privacidad y la gobernanza.

Intermedio
|
14min
|
Verificado (2026-08-22)
clinical datahealth dataclinical prediction model
Progreso0/29 (0%)

Cómo leer los big data médicos

¿Por qué el contexto de generación es más importante que el volumen de datos?

Los datos médicos no son simplemente tablas con muchas filas. Las historias clínicas, los códigos de diagnóstico y tratamiento, los resultados de laboratorio, las imágenes, las notas clínicas y las señales biológicas se generan en procesos distintos. Incluso un mismo número puede tener significados diferentes dependiendo del hospital, el equipo utilizado, la unidad de medida, el paciente específico y el momento exacto dentro del proceso de atención en que se midió.

Una buena investigación con datos médicos pregunta primero qué se pretende predecir o explicar, cómo se generaron esos valores y si estaban realmente disponibles en el momento del análisis, antes que preguntarse "cuántos datos se han reunido". Los conjuntos de datos grandes pueden aumentar las oportunidades estadísticas, pero no eliminan automáticamente los códigos erróneos, los sesgos de selección, la contaminación por información temporal ni las diferencias entre instituciones.

Las múltiples capas de los datos médicos

Capa de datosEjemplosContexto a verificar primero
Registros estructuradosCódigos de diagnóstico, prescripciones, signos vitalesSistema de codificación, propósito de la entrada, momento del registro
Datos de laboratorioHemograma, pruebas de coagulación, bioquímicaUnidades, rangos de referencia, cambios en equipos y reactivos
ImágenesRayos X, TC, RMN, láminas de patologíaProtocolo, equipo, proceso de generación de lectura y etiquetas
Registros no estructuradosNotas clínicas, informes de lectura, documentos escaneadosAutor, momento del documento, abreviaturas y expresiones negativas
Registros longitudinalesVisitas, hospitalizaciones, tratamientos y desenlacesTiempo índice, ventana de observación, período de seguimiento

Esta distinción no es solo un problema de formatos de archivo. El hecho de que se haya realizado una prueba refleja no solo el estado del paciente, sino también el juicio del médico y el flujo de trabajo del hospital. La falta de datos (missingness) tampoco siempre es aleatoria. El hecho de que no se haya realizado una prueba puede ser en sí mismo un rastro de la toma de decisiones clínicas.

El preprocesamiento no es una limpieza neutral

Los criterios para agrupar o excluir códigos de diagnóstico, el manejo de visitas duplicadas, la unificación de unidades de laboratorio y la eliminación de valores anormales o la imputación de valores faltantes pueden alterar el significado de las cohortes y las características. Si cambian la institución o el período, pueden variar los equipos, reactivos y rangos de referencia; las prácticas de codificación y facturación; los protocolos clínicos; la composición de los pacientes y la interpretación de las etiquetas.

El analista no debe dejar solo la tabla final, sino registrar el sistema fuente, la fecha de extracción, la definición de la cohorte, la conversión de unidades, las reglas de exclusión y los procedimientos de evaluación manual. La procedencia de los datos (provenance) no es un apéndice, sino información clave que permite reinterpretar los resultados.

Un pequeño ejemplo — el camino equivocado hacia un alto rendimiento

Al predecir complicaciones utilizando la información del momento de hospitalización, si se mezclan en las entradas prescripciones o resultados de laboratorio registrados después del desenlace (outcome), el modelo no está prediciendo el futuro, sino leyendo rastros de resultados ya revelados. Esta es una forma de filtración temporal o de etiquetas (label leakage).

Al dividir aleatoriamente las visitas de un paciente en unidades de fila, los registros del mismo paciente pueden terminar simultáneamente tanto en el conjunto de entrenamiento como en el de prueba. Para evaluar la generalización a nuevos pacientes, se debe realizar la división por unidad de paciente para evitar esta duplicación. Si se pregunta por el rendimiento a lo largo del tiempo, podría ser más apropiado desarrollar con datos pasados y evaluar con datos de períodos posteriores.

text
Definir la pregunta de investigación y el momento de predicción
          ↓
Fijar la cohorte, el tiempo índice y la ventana de observación
          ↓
Dividir teniendo en cuenta las dependencias entre pacientes, centros y tiempo
          ↓
Preprocesamiento y desarrollo del modelo
          ↓
Validación interna + validación externa en otros centros y periodos

El método de división no tiene una única respuesta correcta; debe definirse y reportarse en función de la población objetivo y el escenario de uso.

La validación externa no se trata de replicar un solo número

No se puede asumir que un modelo que obtiene un alto AUC en un hospital tenga el mismo significado en otro. Esto se debe a que la composición de los pacientes, el equipo de pruebas, las variables medidas y los flujos de trabajo, junto con la definición de las etiquetas, pueden variar. En estudios reales de predicción de DIC, los equipos de pruebas y los perfiles difirieron entre la institución de desarrollo y la de validación externa, y los investigadores especificaron estas diferencias para evaluarlas.

En la validación externa, además de las métricas de rendimiento, se deben considerar el paciente objetivo, los criterios de exclusión, el momento de medición de los predictores, el manejo de datos faltantes, la calibración y las diferencias entre instituciones. El hecho de que el rendimiento predictivo sea bueno no garantiza por sí mismo que beneficie al paciente o que pueda integrarse de forma segura en el flujo de trabajo; esto es un asunto de evaluación prospectiva independiente.

La protección de datos personales y la gobernanza son parte del diseño de la investigación

La desidentificación es una medida de protección importante, pero por sí sola no elimina todos los riesgos. Se requieren también permisos de acceso, propósito de uso, período de retención, auditabilidad, seguridad, consentimiento o base legal, la representatividad y la estructura de responsabilidad de las poblaciones afectadas por los resultados.

La OMS recomienda abordar la autonomía, la seguridad y el interés público, la transparencia, la responsabilidad, la inclusión y la equidad, y la sostenibilidad en todas las etapas del diseño, desarrollo y uso de la IA médica. Esto no sustituye el asesoramiento legal específico de ningún país. Las investigaciones reales deben verificar por separado las jurisdicciones aplicables, las políticas institucionales y los requisitos de revisión del IRB o equivalentes.

Puntos confusos comunes

¿Se reduce el sesgo cuando los datos son grandes?

No necesariamente. Si se recopilan más datos generados bajo el mismo flujo de trabajo y criterios de selección, el sesgo existente puede aumentar junto con ellos.

¿Es suficiente imputar todos los valores faltantes?

No. Primero se debe comprender por qué faltan los valores y si estaban disponibles en el momento de la predicción; además, deben reportarse el método de tratamiento y las razones de exclusión.

¿Se pueden utilizar libremente los datos anonimizados?

No. Se deben verificar conjuntamente el riesgo de reidentificación, el control de acceso, los propósitos aprobados, los contratos y las leyes de jurisdicción aplicables.

¿Un AUC alto implica utilidad clínica?

No. Deben evaluarse por separado la calibración, la generalización externa, los grupos comparadores, los resultados para los pacientes, la seguridad y el impacto real en el flujo de trabajo.

Evidencia actual y limitaciones

  • Este texto es un Concepto destinado al diseño e interpretación de investigaciones con datos médicos.
  • No presenta diagnósticos de enfermedades específicas, elecciones de tratamiento individual ni procedimientos legales o de seguridad institucionales concretos.
  • Las estrategias específicas de filtración (leakage) y división dependen de la pregunta de investigación y la estructura de los datos; por lo tanto, deben especificarse en el protocolo y el plan de análisis.

Concepto / Historia relacionada

  • Concept: cohort, missing data, data leakage, external validation, clinical prediction model
  • Historia candidata: rastrear el proceso de generación de datos cuando el mismo modelo muestra un rendimiento diferente en dos hospitales

Referencias

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...