Cómo leer los big data médicos
¿Por qué el contexto de generación es más importante que el volumen de datos?
Los datos médicos no son simplemente tablas con muchas filas. Las historias clínicas, los códigos de diagnóstico y tratamiento, los resultados de laboratorio, las imágenes, las notas clínicas y las señales biológicas se generan en procesos distintos. Incluso un mismo número puede tener significados diferentes dependiendo del hospital, el equipo utilizado, la unidad de medida, el paciente específico y el momento exacto dentro del proceso de atención en que se midió.
Una buena investigación con datos médicos pregunta primero qué se pretende predecir o explicar, cómo se generaron esos valores y si estaban realmente disponibles en el momento del análisis, antes que preguntarse "cuántos datos se han reunido". Los conjuntos de datos grandes pueden aumentar las oportunidades estadísticas, pero no eliminan automáticamente los códigos erróneos, los sesgos de selección, la contaminación por información temporal ni las diferencias entre instituciones.
Las múltiples capas de los datos médicos
| Capa de datos | Ejemplos | Contexto a verificar primero |
|---|---|---|
| Registros estructurados | Códigos de diagnóstico, prescripciones, signos vitales | Sistema de codificación, propósito de la entrada, momento del registro |
| Datos de laboratorio | Hemograma, pruebas de coagulación, bioquímica | Unidades, rangos de referencia, cambios en equipos y reactivos |
| Imágenes | Rayos X, TC, RMN, láminas de patología | Protocolo, equipo, proceso de generación de lectura y etiquetas |
| Registros no estructurados | Notas clínicas, informes de lectura, documentos escaneados | Autor, momento del documento, abreviaturas y expresiones negativas |
| Registros longitudinales | Visitas, hospitalizaciones, tratamientos y desenlaces | Tiempo índice, ventana de observación, período de seguimiento |
Esta distinción no es solo un problema de formatos de archivo. El hecho de que se haya realizado una prueba refleja no solo el estado del paciente, sino también el juicio del médico y el flujo de trabajo del hospital. La falta de datos (missingness) tampoco siempre es aleatoria. El hecho de que no se haya realizado una prueba puede ser en sí mismo un rastro de la toma de decisiones clínicas.
El preprocesamiento no es una limpieza neutral
Los criterios para agrupar o excluir códigos de diagnóstico, el manejo de visitas duplicadas, la unificación de unidades de laboratorio y la eliminación de valores anormales o la imputación de valores faltantes pueden alterar el significado de las cohortes y las características. Si cambian la institución o el período, pueden variar los equipos, reactivos y rangos de referencia; las prácticas de codificación y facturación; los protocolos clínicos; la composición de los pacientes y la interpretación de las etiquetas.
El analista no debe dejar solo la tabla final, sino registrar el sistema fuente, la fecha de extracción, la definición de la cohorte, la conversión de unidades, las reglas de exclusión y los procedimientos de evaluación manual. La procedencia de los datos (provenance) no es un apéndice, sino información clave que permite reinterpretar los resultados.
Un pequeño ejemplo — el camino equivocado hacia un alto rendimiento
Al predecir complicaciones utilizando la información del momento de hospitalización, si se mezclan en las entradas prescripciones o resultados de laboratorio registrados después del desenlace (outcome), el modelo no está prediciendo el futuro, sino leyendo rastros de resultados ya revelados. Esta es una forma de filtración temporal o de etiquetas (label leakage).
Al dividir aleatoriamente las visitas de un paciente en unidades de fila, los registros del mismo paciente pueden terminar simultáneamente tanto en el conjunto de entrenamiento como en el de prueba. Para evaluar la generalización a nuevos pacientes, se debe realizar la división por unidad de paciente para evitar esta duplicación. Si se pregunta por el rendimiento a lo largo del tiempo, podría ser más apropiado desarrollar con datos pasados y evaluar con datos de períodos posteriores.
Definir la pregunta de investigación y el momento de predicción
↓
Fijar la cohorte, el tiempo índice y la ventana de observación
↓
Dividir teniendo en cuenta las dependencias entre pacientes, centros y tiempo
↓
Preprocesamiento y desarrollo del modelo
↓
Validación interna + validación externa en otros centros y periodosEl método de división no tiene una única respuesta correcta; debe definirse y reportarse en función de la población objetivo y el escenario de uso.
La validación externa no se trata de replicar un solo número
No se puede asumir que un modelo que obtiene un alto AUC en un hospital tenga el mismo significado en otro. Esto se debe a que la composición de los pacientes, el equipo de pruebas, las variables medidas y los flujos de trabajo, junto con la definición de las etiquetas, pueden variar. En estudios reales de predicción de DIC, los equipos de pruebas y los perfiles difirieron entre la institución de desarrollo y la de validación externa, y los investigadores especificaron estas diferencias para evaluarlas.
En la validación externa, además de las métricas de rendimiento, se deben considerar el paciente objetivo, los criterios de exclusión, el momento de medición de los predictores, el manejo de datos faltantes, la calibración y las diferencias entre instituciones. El hecho de que el rendimiento predictivo sea bueno no garantiza por sí mismo que beneficie al paciente o que pueda integrarse de forma segura en el flujo de trabajo; esto es un asunto de evaluación prospectiva independiente.
La protección de datos personales y la gobernanza son parte del diseño de la investigación
La desidentificación es una medida de protección importante, pero por sí sola no elimina todos los riesgos. Se requieren también permisos de acceso, propósito de uso, período de retención, auditabilidad, seguridad, consentimiento o base legal, la representatividad y la estructura de responsabilidad de las poblaciones afectadas por los resultados.
La OMS recomienda abordar la autonomía, la seguridad y el interés público, la transparencia, la responsabilidad, la inclusión y la equidad, y la sostenibilidad en todas las etapas del diseño, desarrollo y uso de la IA médica. Esto no sustituye el asesoramiento legal específico de ningún país. Las investigaciones reales deben verificar por separado las jurisdicciones aplicables, las políticas institucionales y los requisitos de revisión del IRB o equivalentes.
Puntos confusos comunes
¿Se reduce el sesgo cuando los datos son grandes?
No necesariamente. Si se recopilan más datos generados bajo el mismo flujo de trabajo y criterios de selección, el sesgo existente puede aumentar junto con ellos.
¿Es suficiente imputar todos los valores faltantes?
No. Primero se debe comprender por qué faltan los valores y si estaban disponibles en el momento de la predicción; además, deben reportarse el método de tratamiento y las razones de exclusión.
¿Se pueden utilizar libremente los datos anonimizados?
No. Se deben verificar conjuntamente el riesgo de reidentificación, el control de acceso, los propósitos aprobados, los contratos y las leyes de jurisdicción aplicables.
¿Un AUC alto implica utilidad clínica?
No. Deben evaluarse por separado la calibración, la generalización externa, los grupos comparadores, los resultados para los pacientes, la seguridad y el impacto real en el flujo de trabajo.
Evidencia actual y limitaciones
- Este texto es un Concepto destinado al diseño e interpretación de investigaciones con datos médicos.
- No presenta diagnósticos de enfermedades específicas, elecciones de tratamiento individual ni procedimientos legales o de seguridad institucionales concretos.
- Las estrategias específicas de filtración (leakage) y división dependen de la pregunta de investigación y la estructura de los datos; por lo tanto, deben especificarse en el protocolo y el plan de análisis.
Concepto / Historia relacionada
- Concept: cohort, missing data, data leakage, external validation, clinical prediction model
- Historia candidata: rastrear el proceso de generación de datos cuando el mismo modelo muestra un rendimiento diferente en dos hospitales
Referencias
- Yoon et al. Machine learning-based diagnosis for disseminated intravascular coagulation, PLOS ONE (2018)
- TRIPOD+AI statement, BMJ (2024)
- A framework for understanding label leakage in machine learning for health care, JAMIA Open (2023)
- WHO Ethics and governance of artificial intelligence for health (2021)