Se llenó la tabla CCD con los valores de respuesta y se ajustó un modelo cuadrático completo. Si el R² es 0.98, ¿ya se pueden buscar las condiciones óptimas? Un alto coeficiente de determinación es solo el punto de partida; no verifica por sí mismo la curvatura omitida, el orden de ejecución, la extrapolación ni el proceso de selección.
La pregunta de esta sección es única.
¿Cómo determinar que un modelo cuadrático describe los datos según el objetivo?
Vincule primero el modelo candidato con el diseño
El modelo cuadrático completo para dos factores tiene seis términos.
ŷ = β₀ + β₁x + β₂y + β₁₁x² + β₂₂y² + β₁₂xy
La lista de términos no se inventa después de ver los resultados eligiendo la combinación de valores p más favorable. Se deben especificar de antemano según el propósito del diseño y la pregunta científica, y verificar que el diseño pueda estimar dichos términos. Lo primero es comprobar que las filas con los valores de respuesta no se hayan desalineado respecto a las filas originales del diseño.
Respete la jerarquía cuadrática
x² debe permanecer en el modelo junto con x, y si xy permanece, deben incluirse los efectos principales de x e y. Eliminar términos de menor orden solo porque tienen un valor p alto puede alterar el significado de los términos de mayor orden dependiendo del origen de coordenadas y la codificación.
Compare tres modelos candidatos con los mismos datos
Supongamos que se construyó una respuesta compuesta de la siguiente manera:
Y = 82 + 5x − 3y − 6x² − 4.2y² + 3xy + error
| Modelo candidato | Términos incluidos | Problemas esperados |
|---|---|---|
| lineal | 1, x, y | La curvatura y xy permanecen en los residuos |
| cuadrático sin interacción | 1, x, y, x², y² | Puede quedar estructura de xy |
| cuadrático completo | todos los seis términos | Coincide con la fórmula generadora actual, pero requiere verificar sobreajuste y rango en datos reales |
En un entorno de enseñanza con ruido cero, el modelo cuadrático completo recupera los coeficientes originales. Sin embargo, en datos reales, cada estimación de coeficiente tiene su EE y IC, y la información dentro del área del diseño no es uniforme.
El ANOVA descompone la variabilidad pero no aprueba automáticamente el modelo
El F del Modelo y el valor p del ANOVA evalúan si "este modelo candidato explica mejor la señal que un modelo con solo intersección". Cada Estimación del Parámetro representa el efecto codificado manteniendo fijos los demás términos. Quedan las siguientes preguntas pendientes:
- ¿Existe sesgo de selección al elegir términos ajustados a los datos?
- ¿Se estimó el error puro mediante puntos repetidos?
- ¿Se incorporaron bloque, orden de ejecución y lote de medición en el modelo?
- ¿Varían la dispersión y la forma de los residuos según las condiciones?
- ¿La posición que se intenta predecir está dentro del área de diseño real?
R² y R² ajustado resumen la proporción de varianza explicada, pero no son la respuesta a estas preguntas.
Lack of fit y los residuos brindan advertencias diferentes
Si hay condiciones repetidas, la suma de cuadrados de los residuos (residual SS) puede dividirse en error puro (pure error) y suma de cuadrados de falta de ajuste (lack-of-fit SS). Si LOF es mayor que el error puro, existe la posibilidad de que el modelo actual haya pasado por alto una estructura más allá de la variabilidad repetida. Por otro lado, un p-valor grande para LOF no demuestra que el modelo sea correcto. En muestras pequeñas, la potencia de detección puede ser baja.
En los gráficos de residuos se buscan los siguientes patrones:
- ¿Queda una forma de U o S dependiendo del valor predicho?
- ¿Se ensancha la dispersión en forma de abanillo a medida que aumenta la respuesta?
- ¿Hay deriva siguiendo el orden de ejecución (run order)?
- ¿Un punto tira excesivamente del modelo?
Si se eliminan iterativamente comenzando por el p-valor más alto, el p-valor final y la incertidumbre predictiva no reflejarán el proceso de selección. Mantenga el modelo inicial, la jerarquía y la importancia del dominio; revise los modelos reducidos comparándolos con sensibilidad con el modelo completo y con nuevos datos de verificación.
Actual by Predicted lee la diagonal de identidad
Que los puntos estén cerca de la diagonal significa que las observaciones están cerca de las predicciones ajustadas. Sin embargo, ajustar bien en los puntos del diseño no es lo mismo que predecir bien en nuevas condiciones. Si los puntos centrales repetidos se desplazan en la misma dirección o solo los puntos de frontera se desvían significativamente, se debe examinar la estructura por separado.
In-Silico Lab: devuelve los términos omitidos a los residuos
- En el modelo cuadrático completo, observe el número de coeficientes, R², RMSE y LOF SS.
- Cambie a lineal y verifique cómo cambian los residuos y SSE al aumentar la curvatura.
- En
quadratic-no-interaction, aumente los coeficientes verdaderos de xy. - Cambie el ruido y la semilla para observar cuán inestable es el diagnóstico con muestras pequeñas.
Change the candidate model and look at the structure of the residuals.
Compare SSE, LOF, and residuals by fitting linear, square term, and full quadratic models to the same CCD synthetic data.
If this is your first time: What should I press?
- 1. Read the question firstIn the Lab title, check the one thing you will compare this time.
- 2. Change just one conditionInitially, change only one of the inputs: n, effect, or spread.
- 3. new composite specimen pressureNew synthetic data is created. The same conditions may vary depending on the sample.
- 4. Pictures and calculation results CompareWrite in one sentence what moves and what stays the same before and after the change.
If it gets stuckresetGo back to see the default results and change just one condition. This Lab is not a correct answer tester but a pattern observation tool.
Synthetic observations of the same settings
calculation result
Even if R² is high, check the residual curve/order pattern and lack of fit. Without loop points, pure error and LOF cannot be separated.
educational synthetic modelbjs-response-surface-sequence-v1. One row is one independent simulation or design run unless otherwise indicated. It cannot be used for actual research, quality, or regulatory decisions.
La fila 13 del laboratorio es una combinación de ejecuciones que suma 8 coordenadas CCF y 5 puntos centrales. El ajuste del modelo se calcula mediante mínimos cuadrados; no es un sustituto del uso del menú ni de los valores reales de JMP.
Lea la salida de JMP como un conjunto integrado
The terms of the prior quadratic model and the overall uncertainty are viewed together.
The remaining structure is checked based on the repetition point pure error.
Missing curvature, heteroscedasticity, order, and outliers are not compressed into one screen.
ANOVA y Estimaciones de Parámetros muestran la señal y los coeficientes; Lack of Fit muestra las discrepancias frente a los puntos repetidos; Residual y Actual by Predicted muestran la forma. Ninguno por sí solo constituye un criterio de aceptación único (Gate). Si se modificó el modelo, registre en el recibo el modelo original, la razón del cambio y los diagnósticos antes y después.
Ejemplo de frase de resultado
Se ajustó un modelo cuadrático completo, especificado de antemano, a los datos CCF de 13 ejecuciones. Se mantuvo la jerarquía y se estimó el error puro mediante puntos centrales replicados. Los gráficos de valores observados frente a predichos y de residuos frente a predichos no mostraron una curvatura clara ni un patrón en abanico, y la falta de ajuste no fue evidente en la muestra actual. Esto respalda la adecuación del modelo candidato dentro del dominio estudiado, pero no sustituye un experimento de confirmación en condiciones nuevas.
Conclusión del capítulo
- El modelo cuadrático debe vincularse con el diseño y la pregunta planteada de antemano.
- Debe mantenerse la jerarquía cuadrática.
- Ni R², ni el valor p ni la falta de ajuste constituyen por sí solos un criterio de aprobación.
- Los residuos permiten localizar curvatura, heterocedasticidad, efectos de orden y puntos influyentes.
- Deben registrarse el proceso de reducción o selección y los datos de confirmación.
En la siguiente unidad interpretaremos el modelo candidato que superó el diagnóstico mediante contornos, Profiler y funciones de deseabilidad, y lo conectaremos con un experimento de confirmación.
Material complementario oficial
- NIST/SEMATECH · Assessing the Model
- NIST/SEMATECH · Response Surface Model Example
- JMP Help · Fitting Linear Models
Este artículo y el laboratorio utilizan datos sintéticos con fines educativos; no constituyen evidencia para decisiones reales de investigación, proceso, calidad o regulación.