0% encontró este documento útil (0 votos)
6 vistas19 páginas

Análisis de Regresión: Predicciones y Métodos

El análisis de regresión, introducido por Sir Francis Galton, se utiliza para predecir una variable dependiente (Y) a partir de una variable independiente (X). Los métodos de regresión, especialmente la regresión lineal simple, buscan establecer la mejor relación funcional entre las variables mediante el método de mínimos cuadrados. El objetivo principal es realizar predicciones y determinar la relación entre las variables, lo que se puede aplicar en diversos campos como la meteorología y la genética.

Cargado por

Wilber Hussain
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
6 vistas19 páginas

Análisis de Regresión: Predicciones y Métodos

El análisis de regresión, introducido por Sir Francis Galton, se utiliza para predecir una variable dependiente (Y) a partir de una variable independiente (X). Los métodos de regresión, especialmente la regresión lineal simple, buscan establecer la mejor relación funcional entre las variables mediante el método de mínimos cuadrados. El objetivo principal es realizar predicciones y determinar la relación entre las variables, lo que se puede aplicar en diversos campos como la meteorología y la genética.

Cargado por

Wilber Hussain
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Análisis y Diseño de Experimentos - 1 -

1
ANÁLISIS DE REGRESIÓN
El término regresión viene del Latín regresio: que significa regreso, vuelta, retro-
ceso y fue usado por primera vez como concepto estadístico en 1877 por Sir Francis
Galtón, quién efectuó un estudio demostrando que la altura de los hijos de padres
altos tendía a retroceder o «regresar», hacia la talla media de la población; regresión
fue el nombre que le dió al proceso general de predecir una variable (la talla de los
niños) a partir e otra (la talla de los padres). Más tarde, los estadísticos acunaron la
expresión regresión múltiple para describir el proceso en virtud del cual se emplean
algunas variables para predecir otra.

Los métodos de regresión, se utiliza para analizar datos que provienen de experi-
mentos que no fueron diseñados, este es el caso del estudio de fenómenos no contro-
lados o de registros históricos. Los métodos de regresion se usan para determinar la
«mejor» relación funcional entre las variables, mientras que los métodos de correla-
ción se utilizan para medir el grado de asociación de las distintas variables. En pocas
palabras, regresión es la cantidad de cambio de una variable asociado a un cambio
único de otra variable.

El principal objetivo del análisis de la regresión es realizar predicciones. La re-


gresión permite determinar si existe relación entre las variables en estudio (X e Y),
para lo cual se utiliza el comportamiento de una variable (X = independiente), para
predecir el comportamiento de otra variable (Y = dependiente). Las dos característi-
cas son medibles.
-2- V. Ibañez Q. - Docente FINESI - UNA - Puno
Usos de la Regresión:
- Para hacer predicciones futuras de Y, teniendo como base la X.
- Para ver si la variable (Y) depende de otra (X), estimando por consiguiente la
medida de dicha relación o asociación.
- Para determinar la forma de la curva de la regresión.
- Para conocer el error real implicado en un experimento, después que haya sido
descontado el efecto de una variable relacionada.
- Sirve de base para el análisis estadístico.

Como se manifestó el objeto principal de la regresión es realizar predicciones


como:
- Predecir el tiempo meteorológico basado en los datos del pasado.
- Predecir la performance de un toro basado en sus antepasados.
- Predecir la producción de lana/año, basado en los años anteriores.
- Predecir la calidad genética de una vaca, basado en sus antepasados.
- Predecir la producción de semen en carneros basado en el tamaño testicular.
- etc..

1.1. REGRESIÓN LINEAL SIMPLE (RLS).

Consideremos una variable dependiente Y con una sola variable independiente


X. Representemos una muestra aleatoria de tamaño “n” de (X,Y) por el conjunto de
pares de datos: {(xi,yi)/i = 1,2,...,n}. La relación entre variables es aquel que se con-
sidera únicamente dos variables, a estas designamos por «Y» y «X», donde «Y» es la
variable dependiente ó variable de respuesta y «X» la variable independiente ó
predictor. El modelo de regresión lineal consiste en especificar la forma de la rela-
ción lineal, es decir:

Yi = β 0 + β1X i + ε i , i = 1,2,..., n

Donde:
Yi = Variable dependiente.
Xi = Variable independiente.
β 0 = Parámetro desconocido que indica la ordenada donde la línea de
regresión lo intersecta.
β 1 = Parámetro desconocido que indica la pendiente de la línea de mejor
ajuste, llamada también coeficiente de regresión poblacional.
ε i = Error de perturbación que puede tomar valores positivos o negativos.
Análisis y Diseño de Experimentos - 3 -
Propiedades del modelo:
a) Toda perturbación aleatoria tiene de media cero, es decir:
Ε( ε i ) = 0 , i = 1,2,...,n.
b) Todas las perturbaciones aleatorias tienen la misma varianza
(homoscedasticidad).
V(ε i ) = σ 2i i = 1,2,...,n.
c) Las perturbaciones son independientes entre sí:
cov( ε i , ε j ) = 0, i ≠ j

Yi

E(Y) = β0 + β1Xi
Yj

UVε
W j

UV ε
.

W i

Yi

X1 X2 X3 X4 Xi

Suposiciones en regresión

Diagrama de dispersión.

Una vez recopilada la serie de «n» observaciones bidimensionales, cada par


de valores (X,Y) en el plano cartesiano o rectángular está representado por un punto,
y habra tantos puntos como parejas de observaciones que tenga. Esta representación
da origen a una nube de puntos que se denomina diagrama de dispersión ó esparci-
miento; este diagrama puede tener diferentes formas. Esta es la forma más usual para
detectar si la función es lineal, exponencial, potencial, cuadrática, cúbica, etc. al cual
el experimentador ajustará su información recopilada, de tal forma que describa ade-
cuadamente la relación entre las variables en estudio.
-4-
Eje Y
V. Ibañez Q. - Docente FINESI - UNA - Puno

Eje Y

Eje Y

Eje Y
Eje X Eje X Eje X Eje X
Lineal positiva Lineal negativa No Lineal Ninguna relación

Estimación de la ecuación de regresión.

En el análisis de regresión lineal simple, se busca una línea de tal forma que la
sumatoria de los errores de todas las observaciones con respecto a la línea sea míni-
ma, para lograr la estimación de los parámetros desconocidos ( β 0 y β 1 ), se utiliza
el método de «Mínimos Cuadrados». Este método consiste en encontrar los valores
β 0 y β 1 de la ecuación de regresión muestral, de manera que la suma de los cuadra-
dos de todos los residuos ε i (suma de cuadrados del error: SCE) alrededor de la
línea de regresión sea mínima. Para estimar los parámetros se partirá del modelo
original, que está expresada en la siguiente ecuación:

Yi = β 0 + β1X i + ε i , i = 1,2,..., n
ε i = Yi − β 0 − β1X i
b g
ε 2i = Yi − β 0 − β1X i elevando al cuadrado.
2

∑ ε = ∑ bY − β g aplicando sumatoria.
n n
− β1 X i
2 2
i i 0
i =1 i =1

Para encontrar las Ecuaciones Normales se usan las derivadas parciales con
respecto a los parámetros desconocidos β 0 y β 1 , entonces tenemos:
n n
∂∑ ε 2i ∂ ∑ ε 2i
a) i=1
=0 y b) i=1
=0
∂β 0 ∂β1
Análisis y Diseño de Experimentos - 5 -


LM∑ bY − β
n
− β1X i g OPQ
2

De a) N
i =1
i 0

= 0 , entonces se tiene que:


∂ β0

b g
n
2 ∑ Yi − β 0 − β1X i ( −1) = 0 , haciendo operaciones elementales se tiene la pri-
i =1

mera ecuación normal, pero por la propiedad de la sumatoria de una constantes es:
n

∑ β$
i =1
0 = nβ$ 0

n n
nβ$ 0 + β$ 1 ∑ X i = ∑ Yi L i)
i =1 i =1


LM∑ bY − β
n
− β1X i g OPQ
2

De b) N
i =1
i 0 n
b g
= 0 , 2∑ Yi − β 0 − β1X i ( − X i ) = 0 , igual que la
∂ β1 i =1

primera ecuación, se encuentra, la segunda ecuación normal.


n n n
β$ 0 ∑ Xi +β$ 1 ∑ X2i = ∑ Xi Yi L ii)
i =1 i =1 i =1

En resumen de a) y b) se tiene las Ecuaciones Normales:


n n
nβ$ 0 + β$ 1 ∑ X i = ∑ Yi
i =1 i =1

n n n
β$ 0 ∑ X i +β$ 1 ∑ X i2 = ∑ X i Yi
i =1 i =1 i =1

El objetivo de estas ecuaciones normales es despejar los parámetros β 0 y β 1 ,


esto se consigue de la siguiente forma:
n n n n
De a) nβ$ 0 + β$ 1 ∑ X = ∑ Y , despejando
i i
nβ$ 0 = ∑ Yi − β$ 1 ∑ X i y
i =1 i =1 i =1 i =1

n n

∑Y i ∑X i
dividiendo entre «n» a ambos miembros tenemos: β$ 0 = i =1
− β$ 1 i =1
n n
-6- V. Ibañez Q. - Docente FINESI - UNA - Puno

β$ 0 = Y − β$ 1X

Reemplazando β$ 0 = Y − β$ 1X en la segunda Ecuación Normal se tiene:

e j∑
n n n
Y − β$ 1 X X i +β$ 1 ∑ X 2i = ∑XY i i , y haciendo ope-
i =1 i =1 i =1

raciones elementales de álgebra, se llega a encontrar β$ 1 en dos formas siguientes


para facilitar el cálculo.

n n

n n n ∑X ∑Y i i

∑ X Y − Y∑ X i i i ∑X Y − i i
i =1 i =1

, ó β$ 1 =
n
β$ 1 = i =1

F I
i =1 i =1 ,ó
2

− G∑ X J
n n n n

∑X i =1
2
i − X∑ Xi
i =1
∑X
i =1
2
i
H K i =1
i n

∑ cX hc h
n n

i − X Yi − Y ∑ X Y − nXY i i
β$ 1 = i =1
= i =1

∑ cX h
n n

∑X
2
i −X 2
i − nX 2
i =1 i =1

Otra forma de encontrar β$ 1 es usando la Regla de Cramer.

n
n ∑Y i

U|
i =1
n n n n n
nβ$ 0 + β$ 1 ∑ X i = ∑ Yi ∑X ∑X Y n∑ X i Yi −
V| ⇒
i i i

n
i =1
n
i =1
n β$ 1 = i =1 i =1
= i =1

β$ 0 ∑ X i +β$ 1 ∑ X
n
= ∑X Y
|W ∑X
n
n∑ X 2i −
2
i i i n i
i =1 i =1 i =1 i =1 i =1
n n

∑ Xi
i =1
∑ X2i
i =1
Análisis y Diseño de Experimentos - 7 -

n n

n ∑ X ∑Y i i

∑ X iYi − i =1 i =1

β$ 1 = i =1 n
n

∑ X i2 −
FG ∑ X IJ
n 2

i =1 H K
i =1
i n

Algunas veces, se expresa en términos de desviaciones β$ 1 , utilizando letras


minúsculas para diferenciar de las observaciones que se denotan con letras mayúscu-
las, entonces en términos de desviaciones se expresa:
n

∑x y i i
Cov( X, Y) S XY
β$ 1 = i =1
n
= = 2
∑x 2 V ( X) SX
i
i =1

La recta de regresión estimada es: $ = β$ + β$ X


Yi 0 1 i

Donde $ es el estimador para la media de la observación Yi, la cual corres-


Yi
ponde al valor Xi de la variable de predicción.

$ = ( Y − β$ X) + β$ X = Y + β$ X − β$ X = Y + β$ ( X − X)
Yi 1 1 i 1 i 1 1 i

$ − Y = β$ (X − X)
Yi 1 i

Esta es otra forma expresar la recta de regresión. Observar que la recta de


regresión contiene al punto ( x , y ) cuyos componentes son las medias X y de Y,
respectivamente.

Interpretación del coeficiente de regresión β$ 1

El valor constante β$ 0 de la ecuación de regresión muestral, es la ordenada

con el origen. El valor de la pendiente β$ 1 es el cambio en $ cuando Xi cambia


Yi
una unidad de medición.
-8- V. Ibañez Q. - Docente FINESI - UNA - Puno

Si β$ 1 >0, entonces, la tendencia lineal es creciente, es decir, a mayores valo-


res de X corresponden mayores valores de Y. También, a menores valores de X co-
rresponden menores valores de Y.
Si β$ 1 <0, entonces, la tendencia lineal es decreciente, es decir, a mayores
valores de X corresponden menores valores de Y. También, a menores valores de X
corresponden mayores valores de Y.
Si β$ 1 =0, entonces, Y$ i = β$ 0 , luego, Y permanece estacionario para cualquier
valor de X. Es decir, no hay regresión. Esta misma interpretación es válida para la
pendiente β$ 1 en la ecuación de regresión poblacional.

Gráficamente se puede representar de la siguiente maner

Yi $
ε i = Yi − Y i

Y (X,Y)

U
U|
V|ε U| $ = β$ + β$ X
E(Y) 0 1 i

U| |V|ε
U| ||
W
i

β$ 1 $
U| $ tg(θ) = = β1

V|ε W
11
1
V| β
W θ
|| |V Y U|
9
UV ε W
1

$ − Y = β$ X
Y W S cX, Yh
8
R Y
UV ε T 14243
i 1 i
UVε ε 10

W UVε W
V| Y$ || ||
5
7 i

W
1
Y2 UV ε 6

|| || V||
i
UV ε UV ε W 4
Y
Y1 W 1

W 2

β$0
RS
T W W |W
X1 X2 X3 X4 X X5 X Xi

Esta gráfica es una representación que permite visualizar mejor la interpreta-


ción de los parámetros estimados, la variable dependiente (Y) y la variable indepen-
diente (X), los errores o perturbación, los valores de los errores se deben compensar
con los puntos que están encima de la recta de regresión y los puntos que están
debajo de la recta de regresión, el promedio de la variable (X) con el promedio de la
variable (Y) coinciden en un punto por donde pasa la línea de regresión estimada.
Análisis y Diseño de Experimentos - 9 -

Fórmulas de trabajo:.

n n n

∑ Xi
i =1
= ∑ Yi
i =1
= ∑XY i=1
i i =

X = Y =

FG ∑ X IJ
n 2
FG ∑ Y IJ
n 2
FG ∑ X IJ FG ∑ Y IJ
n n

H K i =1
i n =
H K
i =1
i n =
H KH K
i =1
i
i =1
i n =

FG∑X IJFG∑Y IJ n n

∑X
n
2
i = ∑Y
n

i
2
=
n

∑x y = ∑XY −
H KH K =
i i
n

i i
i =1
i
i=1
i

i =1 i =1 i=1 i=1 n

FG ∑ X IJ 2
FG ∑ Y IJ
n 2

H K
n

∑x 2
i
n
= ∑ X 2i −
H K i =1
i

=
n

∑y = ∑Y 2
n
2
− i =1
i

=
i i
i =1 i =1 n i =1 i =1 n

TABLA DE ANALISIS DE VARIANZA PARA REGRESION LINEAL SIMPLE


(en términos de observaciones y desviaciones).

F. De V. G.L. Suma de Cuadrados (S.C.) C.M. Fobs.


LM FG∑X IJFG∑YIJ OP n n

β$ M∑XY −
H KH K P = β$ ∑x y
n i i n
SCR CMR
MM PP
i=1 i=1
Regresión 1 1 i i 1 i i
ni=1 i=1 1 CME
N Q
LM F Y I OP L FG∑X IJFG∑YIJ OP
2

G ∑ JK M
n n n

M n
H P−β$ M∑XY − H KH K P = ∑y −β$ ∑x y
i n i i n n SCE
n P M
n - 2 M∑Y −
PP
2 i=1 i=1 i=1 2
Error
MM PP MN n−2
i 1 i i i 1 i i
i=1 n i=1 i=1 i=1

N Q Q
FG∑Y IJ n 2

Total n- 1 H K n

∑Y − i
2 i=1
i
= ∑y2i
n

i=1 n i=1
- 10 - V. Ibañez Q. - Docente FINESI - UNA - Puno

Prueba de Hipótesis para ( β 1 ).

1. Hipótesis Estadística: H 0 : β1 = 0
H a : β1 ≠ 0

2. Elegir el nivel de significación: α , ( α =0.01, α = 0.05, α = 0.10).


3. Estadígrafo de Contraste, elegida para este caso, la prueba t-Student y cuya
función pivotal.

β$ 1 − β1
t= ~ t ( n−2)
s. e(β$ ) 1

4. Establecer la Región de decisión, determinando la región crítica de la prueba.

α2 α2
1- α

− t α 2 ,( n − 2 ) 0 t α 2 ,( n −2 ) t

RR/Ho: β1 RR/Ho:
RA/Ha:
Valor Valor
crítico crítico

RA H o : - t α 2 ,( n − 2 ) ≤ t c ≤ t α 2,(n-2)
RR H o : t c < -t α 2,(n-2) ó t c > t α 2,(n-2)

5. Valor experimental. Se obtiene reemplazando valores en la función pivotal.

β$ 1 − β1 s.e.(β$ ) = s2
tc =
s. e(β$ )
, 1
FG∑X IJ n 2
1
n

∑X −−
H K
2
i
i=1
i

i=1 n
Análisis y Diseño de Experimentos - 11 -

6. Si tc pertenece a RA H 0 : , aceptamos H0: y rechazamos la Ha:


Si tc pertenece a RR H 0 : , rechazamos H0: y aceptamos Ha:

7. Conclusión. Realizar la interpretación en base al paso 4) y concluir de acuerdo


al tenor del problema.

Intervalo Confidencial (IC) para ( β 1 ).

Pr β$ 1 − t α ,( n −2 ) s. e.(β$ 1 ) ≤ β1 ≤ β$ 1 + t α ,( n−2 ) s. e.(β$ 1 ) = 1 − α


2 2

β1 ∈ β$ 1 ± t α ,( n − 2 ) s. e.(β$ 1 )
2

Intervalos de Confianza (IC) para la predicción.

Una vez que se ha encontrado que existe regresión lineal simple poblacional ó
que la línea de regresión muestral es válida para realizar predicciones; entonces
podemos realizar las predicciones.

i) Intervalo de confianza para la respuesta media E ( Yh ) .

Sea µY Xh el valor de la media cuando X = X h ó X = X 0 y sea Y$h el valor

de Y$h = β$ 0 + β$ 1 X , cuando X = X h entonces Y$h = β$ 0 + β$ 1 X h .

E ( Y$h ) = E ( β$ 0 + β$ 1 X h ) = β$ 0 + β$ 1 X h = µ Y Xh

LM
1 ( X h − X )2
S 2 ( Y$h ) = MSE +
OP
MN PQ
n ∑ X i2 − nX 2 , la distribución muestral es:

Y$h − Yh LM
$ ) = MSE 1 + ( X h − X )
2 OP
tc =
s( Y$h )
~ t( n − 2 ) ; S ( Yh
n ∑ X i2 − nX 2MN PQ
- 12 - V. Ibañez Q. - Docente FINESI - UNA - Puno
Luego el intervalo confidencial del (1- α )x100% para la respuesta media
E ( Yh ) ,
se obtiene de la siguiente forma:

Pr Y$h − tα 2 ,n − 2 S ( Y$h ) ≤ E ( Yh ) ≤ Y$h + tα 2 ,n − 2 S ( Y$h ) = 1 − α

ii) Intervalo de Confianza para la predicción o futura Yh ( New ) .

Para obtener un intervalo confidencial de un sólo valor Yh ( New ) de la variable


Yh = β 0 + β 1 X h , se considera a la diferencia y$h( New ) − yh( New ) como un valor de
la variable aleatoria Y$h( New ) − Yh( New ) . Primeramente se debe calcular: Y$h = β$ 0 + β$ 1 X h

LM
S 2 ( Y$h( New ) ) = MSE 1 +
1 ( X h − X )2
+
OP LM
1 ( X h − X )2
= S 2 1+ +
OP
MN n ∑ X i − nX
2 2
PQ MN
n ∑ X i2 − nX 2 , la PQ
distribución muestral es:

Y$h( New ) − Yh( New ) LM 1 ( X h − X )2


S ( Y$h( New ) ) = S 2 1 + +
OP
tc =
S ( Y$ )
h ( New )
~ t( n − 2 ) ;
MN n ∑ X i2 − nX 2 PQ
Luego el intervalo confidencial del (1- α )x100% para una sola respuesta o futura
Yh ( New ) , se obtiene de la siguiente forma:

Pr Y$h − tα 2 ,n − 2 S ( Y$h ( New ) ) ≤ Yh ( New ) ≤ Y$h + tα 2 ,n − 2 S ( Y$h( New ) ) = 1 − α

EJEMPLO:
En la tabla siguiente se presenta los resultados promedio de la evaluación senso-
rial de la naranja Valencia «control» a través del tiempo de almacenamiento,
para este caso se establece el límite de aceptabilidad del producto, considerando
un puntaje de 3.5 en la escala de: 6 (Excelente), 5 (Muy buena), 4 (buena), 3
(regular), 2 (mala) y 1 (inaceptable). Se presentan datos para el análisis sensorial
de la naranja Washington Navel «Hipobárico» en s apariencia general externa.
Análisis y Diseño de Experimentos - 13 -

Tiempo (días) 0 13 25 35 50 61 68 86 93
AGE (Puntaje) 5.50 4.25 4.00 3.75 3.40 2.25 1.75 1.25 1.00
AGE: Apariencia General Externa.

a) Trace el diagrama de dispersión, b) Obtener la ecuación normal, c) Calcule la


ecuación de regresión de Y sobre X, d) Grafique en el diagrama de dispersión la
ecuación ajustada, e) Realice el ANVA, f) Pruebe la hipótesis para β1 ≠ 0 , g) En-
cuentre los intervalos confidenciales e intreprete en cada uno de las preguntas.

SOLUCIÓN:

∑X i = 431, ∑ Yi = 27 .15, ∑ X i Yi = 913.25, ∑ X i2 = 28909 , ∑ Yi 2 = 10


X = 47 .89; Y = 3.017

a) Diagrama de dispersión.

6.00
Apariencia general (puntaje)

5.00

4.00

3.00

2.00

1.00

0.00
0 20 40 60 80 100
Tiempo (días)

b) Obtener la ecuación normal.

9β$ 0 + 431β$ 1 = 27.15


431β$ + 28909β$ = 913.25
0 1
- 14 - V. Ibañez Q. - Docente FINESI - UNA - Puno
c) Encuentre la ecuación de regresión.
9 9 9

∑ X Y − ∑ X ∑Y i i i i n
913.25 − ( 431 )( 27.15 ) 9
β$ 1 = i =1 i =1 i =1
= = −0.046793
∑X
9
FG ∑ X IJ
9 2
28909 − ( 431 )2 9

H K
2
i i n
i =1 i =1

β$ 0 = Y − β$ 1 X = 27 .15
9 − 0.046793872 b g = 5.257958559
431
9

Entonces, el modelo de regresión estimado es: $ = β$ + β$ X , reemplazando


Yi 0 1 i
se tiene:

Y$i = 5.25796 − 0.04679 X i

De acuerdo a la ecuación estimada, se puede interpretar que por cada un día de


incremento en el tiempo, deberá esperarse una reducción en la apariencia general
externa en puntaje de 0.04679.

d) Obtener la gráfica de la ecuación de regresión ajustada.

6.00

5.00 Y$i = 525796


. − 0.04679 Xi
Apariencia gral (puntaje)

4.00

3.00

2.00

1.00

0.00
0 20 40 60 80 100
Tiempo (días)
Análisis y Diseño de Experimentos - 15 -

e) Procedimiento para efectuar el análisis de varianza (ANOVA).

Grados de libertad (G.L.)


GLreg. = p - 1 = 2 - 1 = 1
GLerror = n - 2 = 9 - 2 = 7
GLtotal = n - 1 = 9 - 1 = 8

Sumas de Cuadrados (S.C. = S.S).

∑ X Y − d∑ X id∑ Y i
2
913.25 − (431)(27.15) 9
2
i i i i n
SSRm = =
∑ X − d∑ X i n
i
2
i
2
b g
28909 − 431
2
9

= 18.10610911
n=9

n =9
( ∑ Yi )2
( 27.15 )2
SSTm = ∑ Yi 2 − i =1
= 100.6225 − = 18.72
i =1 n 14

SSE = SSTm − SSRm = 18.72 − 18.10610911 = 0.613890894

Tabla de Análisis de Varianza.


F. de V. G.L. S.S. M.S. Fc. Signif
Debido a Regresión 1 18.106109 18.10611 206.46 **
Error residual 7 0.613891 0.08770
Total 8 18.720000 2.34000000

En el ANOVA precedente, podemos afirmar que existe diferencia estadística


altamente significativa (P ≤ 0.01), esto implica que la variable independiente X
(tiempo) influye sobre la variable dependiente Y (apariencia general), es decir las
dos variables en estudio son dependientes, esto afirma que el modelo es bueno y para
ratificar ésta aseveración se calcula el coeficiente de determinación (R2).

SSRm 18.10610911
R2 = x100 = x100 = 96.72%
SSTm 18.72
~2 MSE 0.087698699
Rajust . = 1− x100 = 1- x100 = 96.25%
MSTm 2.34
- 16 - V. Ibañez Q. - Docente FINESI - UNA - Puno
~2
El coeficiente de determinación ajustado Rajust . es alto por lo que existe una bondad
de ajuste bueno, es decir el modelo es confiable para realizar las predicciones hacia el
futuro, recomendar que el modelo se puede usar en diferentes lugares para este tipo
de evaluación sensorial de la naranja, tal como afirma Gutierrez, H. y De la Vara, R.
(2004), para fines de predicción se recomienda el coeficiente de determinación ajustado
al menos de 0.7 para que el modelo sea aceptable y confiable.

Es importante indicar, si el modelo ajustado es confiable o no, para esto se realiza


la validación del modelo ajustado y existen varias formas: i) la primera es realizar el
ANOVA en la cual debe ser significativo F(Regresión), ii) Se prueba a través de la
prueba de hipótesis, y iii) se calcula el intervalo confidencial (IC).

f) Prueba de hipótesis para ( β 1 ).


1. Hipótesis Estadística: H 0 : β1 = 0
H a : β1 ≠ 0
2. Elegir el nivel de significación: α = 0.05
3. Estadígrafo de Contraste, elegida para este caso, la prueba t-Student y cuya
función pivotal.

β$ 1 − β1
t= ~ t ( n−2)
s. e(β$ )
1

4. Establecer la Región de aceptación y rechazo. Se determina la región crítica


de la prueba.
α2 α2
RA Ho : - 2.365 ≤ t c ≤ 2.365 1- α

RR Ho : t c < -2.365 ó t c > 2.365 -2.365 0 t0.025,7 = 2.365 t

RR/Ho: β1 RR/Ho:
RA/Ha:
Valor Valor
crítico crítico
5. Valor experimental. Se obtiene
reemplazando valores en la función pivotal.

β$ 1 − β 1 −0.046793872 − 0
tc = = = −14.36865 ,
s. e( β$ 1 ) 0.003256664

s 2 = CME = MSE = 0.087698699


Análisis y Diseño de Experimentos - 17 -

s2
V ( β$ 1 ) =
0.087698699
= = 0.000010605
∑X i
2
− d∑ X i
i
2
n 8268.888889

s.e( β$ 1 ) = 0.003256664

6. Estadística de decisión: Si tc =14.37 > t0.025,7 =2.365, entonces cae en la región


de rechazo, y se rechaza H0: y se acepta la Ha:

7. Conclusión. Se puede interpretar que β 1 es diferente de cero, es decir el


modelo tiene pendiente positiva.

g) Intervalo Confidencial (IC) para ( β 1 ).

Pr β$ 1 − t α ,( n −2 ) s. e.(β$ 1 ) ≤ β1 ≤ β$ 1 + t α ,( n − 2 ) s. e.(β$ 1 ) = 1 − α
2 2

Pr −0.046793872 − ( 2.365 )( 0.003256664 ) ≤ β 1 ≤ −0.046793872 + ( 2 .365 )( 0.00325666

Pr −0.054495883 ≤ β 1 ≤ −0.03909186 = 0.95

Se puede interpretar; de 100 muestras que se toma en el 95% el parámetro estimado


β$ 1 estará comprendido entre el intervalo (-0.05449, -0.03909) y tan sólo el 5%
de las muestras estará fuera del intervalo o no contendrá en el intervalo.

h) Estime la respuesta media E ( Yh ) .

Con el ejemplo anterior, encuentre el intervalo confidencial para la respuesta


media, cuando X = 35 ó X h = 35, entonces:

i) Y$35 = β$ 0 + β$ 1 X h = 5.257958559 − 0.046793872( 35 ) = 3.61978769 .

LM OP LM
ii) S 2 ( Y$35 ) = MSE 1 + ( X 352− X ) 2 = 0.087698699 1 + ( 35 − 47.89 ) = 0.011506486
2 2
OP
MNn ∑ Xi − nX PQ N9 .
8268888889 Q
S ( Y$35 ) = 0.10726829
- 18 - V. Ibañez Q. - Docente FINESI - UNA - Puno
iii) Encuentre el Intervalo confidencial del 95% para la respuesta media E ( Yh ) ,
cuando Xh = 35 .

Pr Y$h − tα 2 ,n − 2 S ( Y$h ) ≤ E ( Y35 ) ≤ Y$h + tα 2 ,n − 2 S ( Y$h ) = 1 − α


Pr 3.61978769 − ( 2.365 )( 0.10726829 ) ≤ E ( Y35 ) ≤ 3.61978769 + ( 2.365 )( 010726829
.

Pr 3.366098 ≤ E ( Y35 ) ≤ 3.877477 = 0.95

i) Intervalo Confidencial para observaciones futuras o individuales Yh ( New ) .

Se desea calcular el intervalo confidencial del 95% cuando X h = 100 .

i) Y$35 = β$ 0 + β$ 1 X h = 5.257958559 − 0.046793872( 100 ) = 0.57818597

LM 1
ii) S 2 ( Y$h( New ) ) = MSE 1 + +
( X h − X )2OP LM1 (100 − 47.89 )2
= 0.087698699 1 + +
OP
MN n ∑ Xi − nX
2
PQ
2
N .
9 8268888889 Q
= 0.12624271
S ( Y$h( New ) ) = 0.355306502

iii) El intervalo confidencial para la predicción futura Yh ( New ) es:

Pr Y$h − tα 2 ,n −2 S ( Y$h( New ) ) ≤ Yh( New ) ≤ Y$h + tα 2 ,n− 2 S ( Y$h( New ) ) = 1 − α

Pr 0.57818597 − ( 2.365 )( 0.355306502 ) ≤ Y100( New ) ≤ 0.57818597 + ( 2.365 )( 0.355306502

Pr −0.262113906 ≤ Y100( New ) ≤ 1.41848585 = 0.95


Análisis y Diseño de Experimentos - 19 -

PROGRAMA EN SAS.

DATA AGROI;
OPTIONS NODATE NOCENTER NONUMBER;
INPUT X Y;
DATALINES;
0 5.50
13 4.25
25 4.00
35 3.75
50 3.40
61 2.25
68 1.75
86 1.25
93 1.00
;
PROC PRINT; RUN;
PROC REG;
MODEL Y = X/XPX I COVB CLB CLI CLM P;
RUN;
/* CALCULA EL COEFICIENTE DE CORRELACIÓN */
PROC CORR;
VAR X Y;
RUN;

También podría gustarte