El rendimiento promedio del proceso A original era 84.2 y el promedio del proceso B mejorado era 85.5. La diferencia observada es 1.3. Dado que el número de B es mayor, ¿podemos concluir inmediatamente que se logró la mejora?
Todavía no. Aunque las medias de las poblaciones de ambos procesos sean iguales, si se extraen muestras diferentes, las medias muestrales pueden variar. Lo primero que debe preguntarse es con qué facilidad aparece una diferencia como 1.3 incluso en un mundo de referencia donde no hay ningún efecto.
¿Puede la diferencia observada surgir únicamente debido a la variabilidad del muestreo?
La prueba de hipótesis no es una máquina que determina automáticamente si "hay una causa/no hay una causa" al observar los datos. Establece un modelo estadístico de referencia y mide la extremidad del resultado actual bajo ese modelo para proporcionar una parte de la evidencia.
Detrás de la diferencia ante nuestros ojos, existen al menos dos explicaciones
Cuando se observa una diferencia de 1.3 en la muestra, se pueden considerar dos posibilidades:
- No hay diferencia en las medias reales de la población, pero se observó 1.3 debido a la variabilidad del muestreo.
- Hay una diferencia en las medias reales de la población, por lo que se observó 1.3.
La prueba de hipótesis formaliza la primera explicación como un mundo de referencia llamado hipótesis nula H0. Por ejemplo, la frase "la diferencia entre las medias de las poblaciones de los dos procesos es 0" es H0: μB−μA=0.
La otra explicación que apunta la pregunta de investigación es la hipótesis alternativa H1. Si se busca una diferencia sin importar la dirección, se escribe como H1: μB−μA≠0; si se pregunta de antemano solo por la dirección en la que aumenta como mejora, se escribe como H1: μB−μA>0.
H0 y H1 no son enuncios que se asignan a conveniencia después de ver los datos. Se debe conectar en la pregunta de investigación qué se considerará como efecto, qué dirección es importante y qué diseño y modelo de análisis se utilizarán.
No comenzamos porque creamos que H0 sea completamente cierta en la realidad. Es el punto de partida para establecer un modelo de referencia sin diferencia y estudiar hasta qué punto es compatible con los datos actuales.
El estadístico de prueba convierte la diferencia en una escala común
Es difícil juzgar si una diferencia observada de 1.3 es grande basándose solo en ese valor. La fuerza de la evidencia de un 1.3 en un experimento donde los valores individuales casi no fluctúan es distinta a la de un 1.3 en un experimento con una dispersión muy grande.
El estadístico de prueba generalmente posee la siguiente intuición:
estadístico de prueba = diferencia entre el efecto observado y el esperado bajo H0 / error estándar del efecto
Es decir, traslada qué tan lejos se encuentra el efecto con respecto a la escala de referencia de H0 en comparación con la variabilidad del muestreo. La estadística específica varía según la pregunta y la estructura de los datos, pudiendo ser t, F, χ², estadísticas de rango, etc. En esta unidad, no memorizaremos tablas de selección. Aprenderemos las estructuras de un grupo, dos grupos, múltiples grupos, continuos, categóricos, independientes y pareados, para seleccionarlas nuevamente en capítulos posteriores.
El p-value es la probabilidad de la cola bajo H0
Si se omiten las condiciones iniciales precisas del p-value, surgen casi todos los malentendidos.
Asumiendo que las hipótesis de H0 y del modelo de prueba son correctas, la probabilidad de obtener un estadístico de prueba igual o más extremo en la dirección de H1 que el resultado observado.
Por ejemplo, si un p-valor bilateral es p=0.03, significa que, bajo H0 y las hipótesis del modelo, la proporción a largo plazo de obtener estadísticos de prueba tan extremos o más en ambas direcciones que el resultado actual es de aproximadamente el 3%.
p=0.03 no significa lo siguiente:
- La probabilidad de que H0 sea verdadera es del 3%.
- La probabilidad de que el resultado se deba al azar es del 3%.
- La probabilidad de que H1 sea verdadera es del 97%.
- Si se repite el mismo experimento, el 97% se reproducirá.
- El efecto es grande o biológicamente importante.
Incluso con la misma tabla numérica, el valor p puede cambiar según la dirección de la prueba, la estructura independiente o pareada, el modelo de distribución, el tratamiento de datos ausentes y el estadístico utilizado. Un valor p aislado pierde su significado si no se indica qué se probó.
El nivel de significancia α se determina antes de ver los datos
El nivel de significancia α es el criterio establecido para determinar cuánto error de tipo 1 (rechazar H0 siendo H0 verdadera) estamos dispuestos a tolerar a largo plazo. Seleccionar α=0.05 significa que estamos utilizando una regla de prueba que permite aproximadamente un 5% de falsos positivos en situaciones repetitivas donde todas las hipótesis y procedimientos son correctos y H0 es verdadera.
La regla de decisión es simple, pero la expresión debe ser precisa.
Evidence that this is a rare result in the H0 standard world.
Lack of evidence, not proof of ineffectiveness
Practical questions separate from statistical significance
Express the scope and direction of the estimate together
Si p<α, rechazamos H0 porque el resultado actual es suficientemente extremo bajo la referencia de H0. Si p≥α, no hay evidencia suficiente para rechazar H0. Esto no significa que se haya adoptado H0 o que se haya demostrado que es verdadera.
Si la muestra es pequeña y la dispersión es grande, puede obtenerse p≥α incluso si existe un efecto importante. Por lo tanto, "no significativo = no hay diferencia = equivalencia" no es una conclusión válida. Para demostrar equivalencia, se requiere un análisis separado que se ajuste a un límite de equivalencia predefinido y a su propósito.
Un umbral crea una regla de decisión, pero la fuerza de la evidencia no se invierte bruscamente en la frontera. Comunique conjuntamente el valor p exacto, el tamaño del efecto, el intervalo de confianza, la calidad del diseño y la importancia práctica.
Unilateral y bilateral son la dirección de la pregunta
Ambas hipótesis alternativas H1 bilaterales consideran la diferencia en ambas direcciones (mayor o menor) respecto a la referencia. La H1 unilateral derecha considera solo la dirección de aumento, mientras que la H1 unilateral izquierda considera solo la dirección de disminución como pregunta de investigación.
La prueba unilateral concentra todo el nivel en una sola cola, lo que permite detectar más fácilmente un efecto en la dirección preestablecida. Sin embargo, no cuenta los cambios grandes en la dirección opuesta como evidencia para H1. Por ello, se requieren las siguientes condiciones:
- La dirección se establece junto con la pregunta de investigación antes de ver los datos.
- Existe justificación científica de que un cambio en la dirección opuesta no es importante o debe manejarse mediante una evaluación de seguridad separada.
- Los resultados que van en contra de la hipótesis también se reportan sin ocultarlos.
Cambiar una prueba bilateral a unilateral derecha después de ver los datos, solo porque la media aumentó, puede hacer que la tasa real de error Tipo I supere el acordado.
Los dos tipos de errores son fallos diferentes
La decisión de la prueba tiene cuatro posibilidades:
- Error Tipo I: Rechazar H0 cuando es verdadera. Falso positivo: concluir que hay un efecto cuando no lo hay.
- Error Tipo II: No rechazar H0 cuando una H1 específica es verdadera. Falso negativo: pasar por alto un efecto real.
- Potencia de la prueba
1−β: Probabilidad de rechazar correctamente H0 cuando una H1 específica es verdadera.
se fija antes del análisis, pero no es un número fijo. Depende del tamaño del efecto real, la dispersión, el tamaño de muestra , la dirección de la prueba y el método analítico. Es más fácil detectar efectos cuando son más grandes, la dispersión es menor y el tamaño de muestra independiente es mayor. La relación completa entre el tamaño de muestra y la potencia se aborda en U13.
El valor p cambia al repetir
El siguiente laboratorio repite una prueba z de una muestra en un modelo normal simple con media de referencia y desviación estándar conocida . No pretende sustituir el método analítico real, sino servir como modelo educativo para visualizar claramente la variabilidad de muestreo, los valores p y los errores.
- Con en una prueba bilateral, observan 80 valores p. Aunque H0 es verdadera, ocasionalmente aparece
p<.05. - Pulse
Nuevo conjunto de 80para comprobar si el número de falsos positivos varía entre lotes. - Aumenten a 0.5, 1.0 y 1.5, y comparen con y .
- Cuando sea positivo, seleccione la H1 unilateral
menorpara observar cómo entran en conflicto los datos y la pregunta.
If this is your first time: What should I press?
- 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
- 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
- 3. Nuevo conjunto de 80 pressureNew synthetic data is created. The same conditions may vary depending on the sample.
- 4. Distribución de valores p y número de rechazos CompareWrite in one sentence what moves and what stays the same before and after the change.
If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.
See how the p-value changes even in the same world
It is a normal model for education with a reference mean of μ0=10 and a known σ=3. Observe the true mean difference, independent n, and p-value for 80 replicates while changing the direction of the test.
80 p-values repeated with the same settings
First sample and repeat results
Even if H0 is true, some samples will produce false positives at α=.05.
Educational one-sample z test: μ0=10 · known σ=3 · α=.05 · normal independent sampling · simulator_version:u07-ztest-guided-v1. In actual research, a method must be selected that reflects the unknown σ, design structure, test assumptions, multiplicity, etc.
No es necesario que exactamente 4 de las 80 repeticiones resulten en p<.05. Un no es una cuota que exige que el 5% salga en cada lote, sino la tasa de error a largo plazo si se repite el mismo procedimiento muchas veces.
Distingan las tres vías por las cuales el valor p disminuye
El valor p no refleja únicamente el tamaño del efecto.
- A medida que el efecto de la observación aumenta, la estadística de prueba puede volverse mayor.
- Una menor dispersión hace que un mismo efecto se manifieste con mayor claridad.
- Un n independiente grande reduce el error estándar, lo que permite que efectos muy pequeños generen valores p bajos.
Por lo tanto, en muestras grandes, incluso si hay p<.001, el efecto puede ser experimentalmente trivial; y en un experimento exploratorio pequeño, un valor p de .08 no implica que se haya descartado la posibilidad de un efecto importante. En ambos casos, deben examinarse conjuntamente la magnitud del efecto y los intervalos de confianza (IC).
La salida de JMP muestra por separado los fundamentos para la toma de decisiones
Los informes de prueba de JMP varían en nombre según la estructura del análisis, pero el núcleo radica en la relación entre la estadística de prueba, el valor p, la hipótesis alternativa y la magnitud del efecto junto con sus intervalos de confianza.
This is the value converted to the H0 standard scale by comparing the effect with the standard error.
Read the tail probability corresponding to the selected two-sided or one-sided H1.
View the direction and size of the difference and the compatible range along with the p-value.
En salidas como las de la Prob > |t| de dos colas, el nombre de la salida misma puede indicar a qué cola se calculó. Al leer un valor p unilateral, debe verificarse que el signo y la dirección de H1 predefinida coincidan. No se deben seleccionar los valores p más pequeños después de observar los datos (post hoc).
Los programas estadísticos calculan el valor p, pero no garantizan lo siguiente:
- Que una fila corresponda a la unidad experimental independiente correcta.
- Que las suposiciones de la prueba y la selección de la muestra sean válidas.
- Que no se haya reportado solo el análisis favorable entre múltiples resultados.
- Que el efecto sea biológicamente, clínicamente o de calidad relevante.
- Que los resultados sean reproducibles en nuevos experimentos.
Los resultados deben escribirse con mayor riqueza que la mera decisión de rechazo
Frase incorrecta:
p<.05por lo tanto el proceso de mejora es efectivo.
Frase mejorada:
En un análisis bilateral preespecificado que comparó lotes independientes, la diferencia media en rendimiento entre B y A fue de 1.3 puntos porcentuales, con un IC del 95% de −1.8 a 4.4 y p=.39. En esta muestra, no se rechazó H0; esto no constituye evidencia para concluir que no hay efecto de mejora o que los dos procesos son equivalentes.
Registre conjuntamente el método analítico, el n independiente, la unidad del efecto, el IC, el valor p exacto, la dirección de la prueba y si fue preespecificado. El valor p es una parte de la frase de evidencia, no la única palabra de la conclusión.
Siete frases a verificar al cerrar el capítulo
- H0 es el modelo base de ausencia de efecto e H1 contiene la dirección de la pregunta de investigación.
- La estadística de prueba transforma el efecto observado en la escala de H0 dividiéndolo por el error estándar.
- El valor p es la probabilidad de obtener un resultado tan o más extremo que el observado, bajo H0 y el modelo.
- El valor p no es la probabilidad de que H0 sea verdadera ni la magnitud del efecto.
- Si p≥α, no se acepta H0, sino que no se puede rechazar.
- α es el criterio de error de Tipo I cuando H0 es verdadera y debe definirse antes de los datos.
- La decisión de rechazo no sustituye a la magnitud del efecto, el IC, el diseño ni el significado práctico.
En la siguiente unidad, antes de comparar las medias de dos grupos, examinaremos la pregunta ¿es igual la dispersión?. Veremos qué significa el supuesto de igualdad de varianzas y por qué no debe elegirse mecánicamente el método de análisis a partir de una única prueba de dispersión.
Material complementario
- NIST/SEMATECH · Critical values and p-values
- NIST/SEMATECH · Statistical tests
- ASA · Statement on Statistical Significance and P-Values
- JMP Statistics Knowledge Portal · Hypothesis Testing
Las cifras, figuras y datos del laboratorio in silico de este artículo son sintéticos y explican conceptos estadísticos. No deben utilizarse como evidencia para decisiones reales de investigación, clínicas, de calidad o regulatorias.