La estadística y las matemáticas suelen resultar dolorosas de cabeza y complejas. Para quienes trabajan en el ámbito bio, son especialmente desconocidas y difíciles. Sin embargo, es imprescindible comprenderlas para explicar qué tan confiables son nuestros propios datos. Esta clase no afirmará que esta dificultad sea ligera. En su lugar, explicaremos paso a paso por qué se llega a esas conclusiones, utilizando palabras e imágenes lo más sencillas posible. Les pedimos comenzar con curiosidad en lugar de miedo.
Razón para crear esta clase
En el laboratorio nos encontramos constantemente con números. La viabilidad celular cambia, el rendimiento del cultivo fluctúa y la media entre el grupo tratado y el control se separa. A veces los gráficos parecen convincentes; otras veces se mueven en dirección opuesta a lo esperado. Hemos cultivado nuestra intuición durante mucho tiempo observando estos resultados.
Sin embargo, solo con la intuición resulta difícil responder suficientemente a las siguientes preguntas:
- ¿Es la diferencia que vemos ahora el efecto de las condiciones experimentales o una fluctuación casual?
- Si las medias son similares, ¿son realmente iguales las dos condiciones?
- Si hay muchas mediciones repetidas, ¿podemos afirmar que hay suficientes experimentos independientes?
- ¿Es la condición que obtuvo el resultado más alto una condición óptima reproducible?
- ¿Hasta qué punto podemos confiar en este gráfico y estos números, y desde dónde debemos empezar a dudar?
La bioestadística no es una disciplina que elimine la intuición. Es aquella que verifica hasta qué punto es válida la intuición y transforma la base de ese juicio en un lenguaje que pueda explicarse a otros. Un objetivo importante de esta clase es cambiar la 'precisión' de los datos, que expresábamos subjetivamente, en criterios observables y comparables como variación, sesgo, repetibilidad, incertidumbre, estimación y prueba.
Desde la teoría hasta volver al resultado del programa
Esta clase no es un curso de programación que memorice paso a paso el uso de JMP. Primero explicamos la teoría y los términos esenciales, verificando las relaciones con números e imágenes pequeños. Luego cambiamos la pregunta:
¿Entonces, con qué probaremos este problema en datos reales y cómo podemos expresarlo mediante gráficos y resultados?
Es aquí donde aparece JMP. Explicaremos qué análisis corresponde a esta pregunta, qué gráficos y salidas muestran la teoría aprendida anteriormente, y cómo debemos interpretar esos resultados. Nos centraremos en por qué debemos ver estos resultados y qué conclusiones podemos extraer, más que en cómo presionar menús y botones.
Aunque la clase se centra en JMP, los principios estadísticos no pertenecen a un producto específico. Si puede usar Minitab, también es un buen método. Aunque el nombre del análisis o la disposición de la pantalla de resultados puedan variar ligeramente, las preguntas centrales de definir muestras y variación, verificar supuestos e interpretar resultados son las mismas. Aquellos familiarizados con R o Python también pueden trasladar la misma teoría a sus propias herramientas.
Un lugar donde dos campos comprenden los problemas del otro
Para quienes estudian o investigan en biotecnología, este curso no es simplemente una colección de fórmulas estadísticas. Es un entrenamiento para distinguir entre réplicas biológicas y técnicas, verificar la dispersión de los datos y la unidad experimental, y aprender a interpretar conjuntamente la significancia, el tamaño del efecto y la incertidumbre. Además, le permitirá abordar objetivamente problemas difíciles de manejar solo con intuición, como experimentos donde múltiples condiciones actúan simultáneamente, la búsqueda de condiciones óptimas y la robustez de los procesos.
Para quienes se especializan en inteligencia artificial o informática, queremos mostrar que los datos biológicos no son simplemente valores de entrada en forma de tabla. Examinaremos juntos qué significa una fila, por qué son importantes las estructuras de lote y réplica, cómo se mezclan el error de medición y la heterogeneidad biológica, y por qué la correlación no implica inmediatamente causalidad. Esperamos que las reflexiones descubiertas aquí sirvan como punto de partida para diseñar mejores estructuras de datos, motores de simulación, herramientas de análisis, visualizaciones y modelos de IA.
Lo necesario para ambos campos no es más cantidad de números, sino la capacidad de comprender el proceso mediante el cual se generan los números.
Utilizamos un laboratorio In-Silico en lugar de datos reales
Este curso no contiene datos de investigación reales disponibles para prácticas públicas. Incluso si hubiera datos reales, no se deben publicar directamente en un curso abierto los datos originales que contienen información de empresas, investigaciones, individuos o regulaciones. Tampoco se puede aprender estadística observando solo unos pocos números con respuestas ya establecidas.
Por lo tanto, en cada capítulo construiremos conjuntamente un laboratorio In-Silico que genera resultados aleatorios según reglas de generación estadística. Los estudiantes podrán ejecutar experimentos virtuales modificando condiciones, tamaño de la muestra, variabilidad, efecto y semilla, obteniendo así sus propias tablas de datos sintéticos. Estos datos no son evidencia biológica real, sino datos educativos diseñados para estudiar fenómenos estadísticos.
Ver las herramientas de práctica en Bio-Toolkit
Conectaremos directamente el laboratorio In-Silico dedicado durante la clase a medida que los capítulos estén completos en cuanto a implementación y validación estadística. No presentaremos generadores aún no validados como herramientas terminadas. En los capítulos donde el enlace esté activo, solo debe generar datos siguiendo las instrucciones de la pantalla del laboratorio.
Cómo seguir el curso
- Lea primero la teoría y los gráficos. No abra el programa desde el principio para crear tablas de resultados; comprenda primero qué se está comparando y por qué.
- Diríjase al enlace del laboratorio In-Silico en medio de la clase. Lea las explicaciones dentro del laboratorio, seleccione las condiciones y ejecute el experimento virtual.
- Guarde la tabla generada. Utilice la función Copiar o exporte en formato CSV/Excel para guardarla en Excel, Bloc de notas o su entorno de análisis preferido.
- Si es posible, compruébelo directamente con un programa estadístico. Si no dispone de JMP, puede solicitar la prueba gratuita oficial de JMP para practicar durante el curso. Los usuarios de Minitab pueden buscar el análisis correspondiente a la misma pregunta estadística en la página oficial de Minitab Statistical Software.
- Compare sus resultados con los resultados de referencia del curso. El texto presenta ejemplos con una semilla fija y resultados representativos de JMP para facilitar la explicación. Es normal que los números generados por usted sean diferentes.
- No intente reproducir exactamente los números; interprete los patrones. Observe en qué condiciones aumenta la dispersión, qué gráfico muestra la relación descrita por la teoría y por qué podría cambiar la conclusión.
El curso está diseñado para que pueda seguir la teoría y la interpretación de resultados representativos incluso sin acceso al programa. Sin embargo, al generar y analizar sus propios datos comprenderá con mucha más claridad cómo funciona una misma fórmula entre números que cambian ligeramente en cada ejecución.
Principios que debemos respetar juntos
Los datos sintéticos no son resultados experimentales reales y no pueden fundamentar decisiones de investigación, clínicas, de calidad o regulatorias. Los valores p, las condiciones óptimas y las predicciones producidas por un programa tampoco se convierten automáticamente en verdad. Deben revisarse conjuntamente la unidad experimental, el proceso de generación de datos, los supuestos, los errores, la información ausente y el ámbito de aplicación.
Este curso no ocultará la teoría compleja, pero tampoco trasladará toda esa complejidad al lector sin explicación. Cuando sea necesaria una fórmula explicaremos por qué; cuando haga falta una figura indicaremos qué debe observarse; y cuando aparezcan resultados del programa volveremos a conectarlos con la teoría anterior.
La estadística no es una técnica para presentar los datos de forma más convincente. Es una manera de distinguir lo que sabemos de lo que aún desconocemos y de expresar honestamente hasta qué punto podemos confiar en las diferencias observadas. Al terminar este recorrido, esperamos que no solo tema menos a los números, sino que también formule mejores preguntas sobre sus propios experimentos y datos.