Tamaño del efecto, incertidumbre y valor p
Al finalizar este tema
Podrá explicar que el tamaño del efecto y su dirección, la incertidumbre de la estimación y el valor p proporcionan información distinta. Podrá estructurar la presentación de los resultados junto con la pregunta de investigación, evitando interpretar el valor p como la probabilidad de que la hipótesis nula sea verdadera o como una medida de importancia biológica.
Tres preguntas en una comparación
Supongamos que comparamos el outcome entre dos condiciones. Es necesario separar al menos las siguientes tres preguntas:
- ¿Cuál es la dirección y la magnitud de la diferencia observada?
- ¿Cuál es el grado de incertidumbre de esa diferencia considerando la variabilidad muestral?
- ¿Qué tan inusuales son los datos actuales o más extremos bajo un modelo nulo específico?
La primera se relaciona con el tamaño del efecto, la segunda con los intervalos y el error estándar, y la tercera con el valor p. Aunque todos pueden ser necesarios en un mismo estudio, ninguno sustituye a los otros dos.
Tamaño del efecto: expresar la diferencia en las unidades de la pregunta
El tamaño del efecto expresa la magnitud y la dirección de la diferencia observada. Si se trata de una diferencia de medias, puede interpretarse en las unidades originales del outcome; también pueden elegirse otras escalas como razones, cocientes de probabilidades (odds ratios) o diferencias estandarizadas. La elección de la escala adecuada depende de la pregunta de investigación y de las unidades de medición.
El hecho de que el tamaño del efecto sea grande no implica por sí solo que el resultado sea importante. Es necesario considerar también la diferencia mínima necesaria para la toma de decisiones biológicas, el error de medición, los costos y riesgos, y la validez del diseño del estudio.
Incertidumbre: cuánto fluctúa el efecto
Si se obtuviera una nueva muestra utilizando el mismo procedimiento, la estimación del tamaño del efecto podría variar. El error estándar, los intervalos de confianza y los intervalos bootstrap son métodos para expresar esta variabilidad. Un intervalo amplio puede indicar que los datos no logran precisar la magnitud del efecto, pero esto no debe explicarse únicamente por el tamaño de la muestra.
Al reportar un intervalo, se deben especificar conjuntamente la escala del efecto, la unidad de análisis y el procedimiento utilizado para construirlo. No se deben mezclar ni comparar diferencias en unidades originales con diferencias estandarizadas.
Valor p: la extremidad de los datos bajo el modelo nulo
El valor p indica la probabilidad de obtener un resultado igual o más extremo que el observado, bajo la condición de que la hipótesis nula y el procedimiento de análisis sean correctos. No es la probabilidad de que la hipótesis nula sea verdadera, ni la probabilidad de que la hipótesis alternativa sea verdadera.
El hecho de que el valor p sea pequeño proporciona información sobre la relación entre el modelo nulo y los datos. No debe traducirse automáticamente en que el efecto sea grande, que sea reproducible, que tenga importancia biológica o que se haya demostrado causalidad. Por el contrario, tampoco se puede confirmar la ausencia de efecto solo porque el valor p sea grande.
Agrupar los resultados en una oración
La estructura básica para reportar los resultados es la siguiente:
El efecto estimado entre las condiciones B y A fue [escala y dirección].
La incertidumbre se expresó como [intervalo o error estándar].
Bajo el modelo nulo predefinido, el valor p fue [valor].
Este resultado solo debe interpretarse dentro del ámbito de [diseño·medición·extrapolación].Al ingresar valores numéricos reales, verifique los resultados y las unidades de análisis. Si solo se presenta el valor p, el lector no podrá determinar la magnitud del efecto ni su precisión.
Pueden coexistir resultados diferentes
Incluso si el tamaño del efecto es pequeño, una baja variabilidad de la muestra puede generar un valor p pequeño. Por otro lado, aunque el efecto parezca considerable, una alta variabilidad en los datos puede resultar en intervalos amplios y valores p grandes. Esta combinación no es contradictoria, ya que responden a preguntas diferentes.
Por ejemplo, la diferencia media puede ser pequeña en las unidades originales, pero superar la diferencia mínima clínicamente relevante para los objetivos del estudio; a la inversa, aunque sea estadísticamente distinguible, puede tener poca relevancia práctica debido al error de medición o a las decisiones posteriores. Para realizar estas valoraciones, es necesario establecer criterios de importancia y unidades de medida antes del estudio.
La tabla de resultados debe diseñarse con al menos las columnas estimate, uncertainty, p_value, analysis_unit, method y interpretation_limit. No se debe crear una jerarquía de resultados basándose únicamente en los asteriscos o colores de una sola columna.
Hipótesis previas y alcance del análisis
La interpretación del valor p depende de la hipótesis nula, la dirección y el procedimiento de análisis que se hayan definido previamente. No se deben modificar el outcome, el subconjunto o la dirección de la comparación después de observar los datos para presentar el mismo valor p como un resultado confirmatorio. Si la comparación se descubrió de forma exploratoria, debe registrarse como una etapa exploratoria y plantearse como una pregunta que requiera verificación posterior.
Volver a la pregunta de investigación para interpretar
Lo que generalmente interesa al investigador no es tanto "¿la diferencia es cero?" sino "¿cuánto difiere y si esa diferencia es relevante para los objetivos del estudio?". El tamaño del efecto y la incertidumbre se relacionan más directamente con esta pregunta. El valor p proporciona información adicional sobre la relación con el modelo nulo, pero no establece criterios de importancia para los objetivos del estudio.
Elementos que el investigador debe verificar en la tabla de resultados
Cada comparación se analiza en cuatro niveles. Primero, se verifica la dirección y la unidad de estimate. Luego, se observa la magnitud del intervalo o del error estándar. Después, se confirma bajo qué hipótesis nula y procedimiento se calculó el valor p. Finalmente, se leen la unidad de observación y el rango de extrapolación.
Seguir este orden evita que una sola palabra como "significativo" resuma todo el resultado. Por ejemplo, aunque el valor p sea pequeño, si el intervalo es mayoritariamente menor que la diferencia mínima importante del estudio, la valoración práctica podría cambiar. Inversamente, si el intervalo es amplio, puede ser necesario observar más detenidamente la dirección y magnitud del efecto.
Los criterios de tamaño del efecto varían según el campo y las unidades de medición. No se deben aplicar umbrales externos como estándares universales de importancia biológica; en su lugar, se debe documentar la base de la pregunta de investigación y el plan previo.
Errores frecuentes y métodos de verificación
- No utilice el valor p como la probabilidad de que la hipótesis sea verdadera.
- No se debe omitir el tamaño del efecto y los intervalos de confianza basándose únicamente en la significación estadística.
- No se debe confundir un valor p pequeño con la importancia biológica o la causalidad.
- No se debe utilizar un valor p grande como prueba de la ausencia de efecto.
- No se deben tratar los umbrales definidos a posteriori como si fueran hipótesis previas.
Resumen clave
- El tamaño del efecto indica la magnitud y la dirección de la diferencia.
- La incertidumbre expresa la variabilidad de la muestra.
- El valor p indica la extremidad de los datos bajo un modelo nulo específico.
- Estas tres informaciones no son intercambiables.
- La interpretación debe limitarse al diseño del estudio y al alcance de la importancia biológica.
Próximo tema
En la siguiente entrega, seleccionaremos comparaciones de dos grupos, datos pareados y pruebas no paramétricas según la unidad de diseño y análisis.
Referencias
- ASA p-value statement: https://www.amstat.org/asa/files/pdfs/p-valuestatement.pdf
- SciPy statistics reference: https://docs.scipy.org/doc/scipy/reference/stats.html
Las frases de reporte y los ejemplos de esta sección son componentes educativos creados de forma independiente por BioStatPy.