Volver a la lista

Lo que realmente pregunta la prueba de hipótesis: ¿puede la diferencia deberse únicamente al azar?

Se explica la hipótesis nula, la hipótesis alternativa, el valor-p, el nivel de significancia y su relación con los dos tipos de error en el contexto de si las diferencias observadas podrían haber surgido únicamente debido a la variabilidad muestral.

Principiante
|
48min
|
Verificado (2026-08-14)
hipótesis nulahipótesis alternativavalor pnivel de significaciónerror de tipo Ierror de tipo IIpotenciaJMP
Progreso0/28 (0%)

El rendimiento promedio del proceso A original era 84.2 y el promedio del proceso B mejorado era 85.5. La diferencia observada es 1.3. Dado que el número de B es mayor, ¿podemos concluir inmediatamente que se logró la mejora?

Todavía no. Aunque las medias de las poblaciones de ambos procesos sean iguales, si se extraen muestras diferentes, las medias muestrales pueden variar. Lo primero que debe preguntarse es con qué facilidad aparece una diferencia como 1.3 incluso en un mundo de referencia donde no hay ningún efecto.

La pregunta de esta unidad es una sola.
¿Puede la diferencia observada surgir únicamente debido a la variabilidad del muestreo?

La prueba de hipótesis no es una máquina que determina automáticamente si "hay una causa/no hay una causa" al observar los datos. Establece un modelo estadístico de referencia y mide la extremidad del resultado actual bajo ese modelo para proporcionar una parte de la evidencia.

Null hypothesis H0Starting model for testing for baseline difference or no effect
Alternative hypothesis H1The direction and form of difference targeted by the research question
p-valueProbability of an extreme outcome above the observed value below H0
Significance level αPrior criterion for type 1 error to be tolerated when H0 is true

Detrás de la diferencia ante nuestros ojos, existen al menos dos explicaciones

Cuando se observa una diferencia de 1.3 en la muestra, se pueden considerar dos posibilidades:

  • No hay diferencia en las medias reales de la población, pero se observó 1.3 debido a la variabilidad del muestreo.
  • Hay una diferencia en las medias reales de la población, por lo que se observó 1.3.

La prueba de hipótesis formaliza la primera explicación como un mundo de referencia llamado hipótesis nula H0. Por ejemplo, la frase "la diferencia entre las medias de las poblaciones de los dos procesos es 0" es H0: μB−μA=0.

La otra explicación que apunta la pregunta de investigación es la hipótesis alternativa H1. Si se busca una diferencia sin importar la dirección, se escribe como H1: μB−μA≠0; si se pregunta de antemano solo por la dirección en la que aumenta como mejora, se escribe como H1: μB−μA>0.

Figure 01 · Two competing explanations
Observation differences can occur in H0 worlds as well as in H1 worlds.
H0 · Reference difference 0H1 · There is a real differenceobserved test statistic
Hypothesis testing does not directly calculate the probability that a world is true. First, we evaluate how unusual the current result is from the sampling distribution created by H0.

H0 y H1 no son enuncios que se asignan a conveniencia después de ver los datos. Se debe conectar en la pregunta de investigación qué se considerará como efecto, qué dirección es importante y qué diseño y modelo de análisis se utilizarán.

H0 es una referencia de cálculo, no una verdad que deseamos creer

No comenzamos porque creamos que H0 sea completamente cierta en la realidad. Es el punto de partida para establecer un modelo de referencia sin diferencia y estudiar hasta qué punto es compatible con los datos actuales.

El estadístico de prueba convierte la diferencia en una escala común

Es difícil juzgar si una diferencia observada de 1.3 es grande basándose solo en ese valor. La fuerza de la evidencia de un 1.3 en un experimento donde los valores individuales casi no fluctúan es distinta a la de un 1.3 en un experimento con una dispersión muy grande.

El estadístico de prueba generalmente posee la siguiente intuición:

estadístico de prueba = diferencia entre el efecto observado y el esperado bajo H0 / error estándar del efecto

Es decir, traslada qué tan lejos se encuentra el efecto con respecto a la escala de referencia de H0 en comparación con la variabilidad del muestreo. La estadística específica varía según la pregunta y la estructura de los datos, pudiendo ser t, F, χ², estadísticas de rango, etc. En esta unidad, no memorizaremos tablas de selección. Aprenderemos las estructuras de un grupo, dos grupos, múltiples grupos, continuos, categóricos, independientes y pareados, para seleccionarlas nuevamente en capítulos posteriores.

El p-value es la probabilidad de la cola bajo H0

Si se omiten las condiciones iniciales precisas del p-value, surgen casi todos los malentendidos.

Asumiendo que las hipótesis de H0 y del modelo de prueba son correctas, la probabilidad de obtener un estadístico de prueba igual o más extremo en la dirección de H1 que el resultado observado.

Figure 02 · Place of p-value
p-value is the area of ​​the extreme tails above the observation in the H0 distribution
Test statistic distribution under H0p/2p/2
A two-tailed test combines extremes in both directions. The p-value is not the probability that H0 is true, the probability that the result is a coincidence, or the size of the effect.

Por ejemplo, si un p-valor bilateral es p=0.03, significa que, bajo H0 y las hipótesis del modelo, la proporción a largo plazo de obtener estadísticos de prueba tan extremos o más en ambas direcciones que el resultado actual es de aproximadamente el 3%.

p=0.03 no significa lo siguiente:

  • La probabilidad de que H0 sea verdadera es del 3%.
  • La probabilidad de que el resultado se deba al azar es del 3%.
  • La probabilidad de que H1 sea verdadera es del 97%.
  • Si se repite el mismo experimento, el 97% se reproducirá.
  • El efecto es grande o biológicamente importante.
El valor p no es una propiedad exclusiva de los datos

Incluso con la misma tabla numérica, el valor p puede cambiar según la dirección de la prueba, la estructura independiente o pareada, el modelo de distribución, el tratamiento de datos ausentes y el estadístico utilizado. Un valor p aislado pierde su significado si no se indica qué se probó.

El nivel de significancia α se determina antes de ver los datos

El nivel de significancia α es el criterio establecido para determinar cuánto error de tipo 1 (rechazar H0 siendo H0 verdadera) estamos dispuestos a tolerar a largo plazo. Seleccionar α=0.05 significa que estamos utilizando una regla de prueba que permite aproximadamente un 5% de falsos positivos en situaciones repetitivas donde todas las hipótesis y procedimientos son correctos y H0 es verdadera.

La regla de decisión es simple, pero la expresión debe ser precisa.

p < αReject H0

Evidence that this is a rare result in the H0 standard world.

p ≥ αFailed to reject H0

Lack of evidence, not proof of ineffectiveness

effect sizeHow big is the difference?

Practical questions separate from statistical significance

confidence intervalWhich effects are compatible with the data?

Express the scope and direction of the estimate together

Si p<α, rechazamos H0 porque el resultado actual es suficientemente extremo bajo la referencia de H0. Si p≥α, no hay evidencia suficiente para rechazar H0. Esto no significa que se haya adoptado H0 o que se haya demostrado que es verdadera.

Si la muestra es pequeña y la dispersión es grande, puede obtenerse p≥α incluso si existe un efecto importante. Por lo tanto, "no significativo = no hay diferencia = equivalencia" no es una conclusión válida. Para demostrar equivalencia, se requiere un análisis separado que se ajuste a un límite de equivalencia predefinido y a su propósito.

0,049 y 0,051 no pertenecen a universos distintos

Un umbral crea una regla de decisión, pero la fuerza de la evidencia no se invierte bruscamente en la frontera. Comunique conjuntamente el valor p exacto, el tamaño del efecto, el intervalo de confianza, la calidad del diseño y la importancia práctica.

Unilateral y bilateral son la dirección de la pregunta

Ambas hipótesis alternativas H1 bilaterales consideran la diferencia en ambas direcciones (mayor o menor) respecto a la referencia. La H1 unilateral derecha considera solo la dirección de aumento, mientras que la H1 unilateral izquierda considera solo la dirección de disminución como pregunta de investigación.

Figure 04 · Direction in advance
Two-sided tests two directions, and one-sided tests one direction determined by the study.
Two-sided H1: There is a differenceα/2α/2One-sided H1: largerα
If you look at the data and change it to a one-sided test in the favorable direction, the Type 1 error standard breaks down. When it comes to questions that cannot be overlooked, even significant changes in the opposite direction are natural for both sides.

La prueba unilateral concentra todo el nivel α\alpha en una sola cola, lo que permite detectar más fácilmente un efecto en la dirección preestablecida. Sin embargo, no cuenta los cambios grandes en la dirección opuesta como evidencia para H1. Por ello, se requieren las siguientes condiciones:

  1. La dirección se establece junto con la pregunta de investigación antes de ver los datos.
  2. Existe justificación científica de que un cambio en la dirección opuesta no es importante o debe manejarse mediante una evaluación de seguridad separada.
  3. Los resultados que van en contra de la hipótesis también se reportan sin ocultarlos.

Cambiar una prueba bilateral a unilateral derecha después de ver los datos, solo porque la media aumentó, puede hacer que la tasa real de error Tipo I supere el α\alpha acordado.

Los dos tipos de errores son fallos diferentes

La decisión de la prueba tiene cuatro posibilidades:

Figure 03 · Four lines of judgment
There are always two types of error possibilities in test results:
judgmentDo not reject H0Reject H0real worldH0 trueright decisionH0 trueType 1 error αH1 trueType 2 error βH1 truePower 1−β
α is the long-run ratio in which H0 is rejected when it is true. β and power can be calculated only after determining the specific real effect and are covered in detail in U13.
  • Error Tipo I: Rechazar H0 cuando es verdadera. Falso positivo: concluir que hay un efecto cuando no lo hay.
  • Error Tipo II: No rechazar H0 cuando una H1 específica es verdadera. Falso negativo: pasar por alto un efecto real.
  • Potencia de la prueba 1−β: Probabilidad de rechazar correctamente H0 cuando una H1 específica es verdadera.

α\alpha se fija antes del análisis, pero β\beta no es un número fijo. Depende del tamaño del efecto real, la dispersión, el tamaño de muestra nn, la dirección de la prueba y el método analítico. Es más fácil detectar efectos cuando son más grandes, la dispersión es menor y el tamaño de muestra independiente nn es mayor. La relación completa entre el tamaño de muestra y la potencia se aborda en U13.

El valor p cambia al repetir

El siguiente laboratorio repite una prueba z de una muestra en un modelo normal simple con media de referencia μ0=10\mu_0=10 y desviación estándar conocida σ=3\sigma=3. No pretende sustituir el método analítico real, sino servir como modelo educativo para visualizar claramente la variabilidad de muestreo, los valores p y los errores.

  1. Con δ=0\delta=0 en una prueba bilateral, observan 80 valores p. Aunque H0 es verdadera, ocasionalmente aparece p<.05.
  2. Pulse Nuevo conjunto de 80 para comprobar si el número de falsos positivos varía entre lotes.
  3. Aumenten δ\delta a 0.5, 1.0 y 1.5, y comparen con n=8n=8 y n=32n=32.
  4. Cuando δ\delta sea positivo, seleccione la H1 unilateral menor para observar cómo entran en conflicto los datos y la pregunta.
If this is your first time: What should I press?
  1. 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
  2. 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
  3. 3. Nuevo conjunto de 80 pressureNew synthetic data is created. The same conditions may vary depending on the sample.
  4. 4. Distribución de valores p y número de rechazos CompareWrite in one sentence what moves and what stays the same before and after the change.

If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.

In-Silico Lab · Hypothesis Testing

See how the p-value changes even in the same world

It is a normal model for education with a reference mean of μ0=10 and a known σ=3. Observe the true mean difference, independent n, and p-value for 80 replicates while changing the direction of the test.

80 p-values ​​repeated with the same settings

α=.05
p<.05 p≥.05

First sample and repeat results

first x̄9.857
first z-0.213
first p0.8312
first judgmentH0 cannot be rejected
80 times p<.055/80

Even if H0 is true, some samples will produce false positives at α=.05.

Educational one-sample z test: μ0=10 · known σ=3 · α=.05 · normal independent sampling · simulator_version:u07-ztest-guided-v1. In actual research, a method must be selected that reflects the unknown σ, design structure, test assumptions, multiplicity, etc.

No es necesario que exactamente 4 de las 80 repeticiones resulten en p<.05. Un α=.05\alpha=.05 no es una cuota que exige que el 5% salga en cada lote, sino la tasa de error a largo plazo si se repite el mismo procedimiento muchas veces.

Distingan las tres vías por las cuales el valor p disminuye

El valor p no refleja únicamente el tamaño del efecto.

  • A medida que el efecto de la observación aumenta, la estadística de prueba puede volverse mayor.
  • Una menor dispersión hace que un mismo efecto se manifieste con mayor claridad.
  • Un n independiente grande reduce el error estándar, lo que permite que efectos muy pequeños generen valores p bajos.

Por lo tanto, en muestras grandes, incluso si hay p<.001, el efecto puede ser experimentalmente trivial; y en un experimento exploratorio pequeño, un valor p de .08 no implica que se haya descartado la posibilidad de un efecto importante. En ambos casos, deben examinarse conjuntamente la magnitud del efecto y los intervalos de confianza (IC).

La salida de JMP muestra por separado los fundamentos para la toma de decisiones

Los informes de prueba de JMP varían en nombre según la estructura del análisis, pero el núcleo radica en la relación entre la estadística de prueba, el valor p, la hipótesis alternativa y la magnitud del efecto junto con sus intervalos de confianza.

Test Statistic

This is the value converted to the H0 standard scale by comparing the effect with the standard error.

Prob > |t| or p-value

Read the tail probability corresponding to the selected two-sided or one-sided H1.

Difference + Confidence Interval

View the direction and size of the difference and the compatible range along with the p-value.

En salidas como las de la Prob > |t| de dos colas, el nombre de la salida misma puede indicar a qué cola se calculó. Al leer un valor p unilateral, debe verificarse que el signo y la dirección de H1 predefinida coincidan. No se deben seleccionar los valores p más pequeños después de observar los datos (post hoc).

Figure 05 · black flow
α and hypothesis are determined before looking at the data, and the interpretation is determined along with the effect size.
questionEffect/DirectionhypothesisH0 · H1standardα·ModeldataStatistic pconclusionEffect · With CIDon't just leave p<α, but reconnect with questions, assumptions, and size of effect.
The p-value is one element of the overall judgment flow. Test selection, assumptions, missingness, multiplicity, and sample structure also affect conclusions.

Los programas estadísticos calculan el valor p, pero no garantizan lo siguiente:

  1. Que una fila corresponda a la unidad experimental independiente correcta.
  2. Que las suposiciones de la prueba y la selección de la muestra sean válidas.
  3. Que no se haya reportado solo el análisis favorable entre múltiples resultados.
  4. Que el efecto sea biológicamente, clínicamente o de calidad relevante.
  5. Que los resultados sean reproducibles en nuevos experimentos.

Los resultados deben escribirse con mayor riqueza que la mera decisión de rechazo

Frase incorrecta:

p<.05 por lo tanto el proceso de mejora es efectivo.

Frase mejorada:

En un análisis bilateral preespecificado que comparó lotes independientes, la diferencia media en rendimiento entre B y A fue de 1.3 puntos porcentuales, con un IC del 95% de −1.8 a 4.4 y p=.39. En esta muestra, no se rechazó H0; esto no constituye evidencia para concluir que no hay efecto de mejora o que los dos procesos son equivalentes.

Registre conjuntamente el método analítico, el n independiente, la unidad del efecto, el IC, el valor p exacto, la dirección de la prueba y si fue preespecificado. El valor p es una parte de la frase de evidencia, no la única palabra de la conclusión.

Siete frases a verificar al cerrar el capítulo

  • H0 es el modelo base de ausencia de efecto e H1 contiene la dirección de la pregunta de investigación.
  • La estadística de prueba transforma el efecto observado en la escala de H0 dividiéndolo por el error estándar.
  • El valor p es la probabilidad de obtener un resultado tan o más extremo que el observado, bajo H0 y el modelo.
  • El valor p no es la probabilidad de que H0 sea verdadera ni la magnitud del efecto.
  • Si p≥α, no se acepta H0, sino que no se puede rechazar.
  • α es el criterio de error de Tipo I cuando H0 es verdadera y debe definirse antes de los datos.
  • La decisión de rechazo no sustituye a la magnitud del efecto, el IC, el diseño ni el significado práctico.
The p-value is not the probability that an effect exists.How extreme are the current results in the baseline world created by H0 and the model?It shows and should be read along with effect size, CI, design, and biological significance.

En la siguiente unidad, antes de comparar las medias de dos grupos, examinaremos la pregunta ¿es igual la dispersión?. Veremos qué significa el supuesto de igualdad de varianzas y por qué no debe elegirse mecánicamente el método de análisis a partir de una única prueba de dispersión.

Material complementario

Las cifras, figuras y datos del laboratorio in silico de este artículo son sintéticos y explican conceptos estadísticos. No deben utilizarse como evidencia para decisiones reales de investigación, clínicas, de calidad o regulatorias.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...