UNIVERSIDAD MARIANO GÁLVEZ DE GUATEMALA
FACULTAD CIENCIAS DE LA ADMINISTRACION
CENTRO UNIVERSITARIO SANTA LUCIA COZTUMALGUAPA
Licenciatura en Administración de Empresas
Curso: Estadística II
Sección: A
Docente: Selvyn Aroldo Ancheita Ibarra
Investigación
Estudiante:
Keren Madaí Pereira Najarro
2922-24-271
Santa Lucia Cotzumalguapa Escuintla, 16 de Febrero 2026
Introducción
En la siguiente investigación se analizaron diferentes modelos estadísticos
utilizados para estudiar la relación entre variables cuantitativas,
específicamente la regresión lineal simple, la regresión lineal múltiple, la
regresión cuadrática y el análisis de correlación simple y múltiple. Estos
métodos permiten comprender, explicar y predecir el comportamiento de una
variable dependiente en función de una o más variables independientes.
En esta investigación se determinó la importancia de aplicar herramientas
estadísticas adecuadas para identificar el tipo de relación existente entre las
variables, ya sea lineal o no lineal, así como el grado de asociación entre ellas.
El estudio de estos modelos facilita la toma de decisiones fundamentadas en
datos y contribuye a un mejor análisis dentro del ámbito académico y
profesional.
Objetivos
Objetivo General
Analizar y aplicar los modelos de regresión lineal simple, regresión lineal
múltiple, regresión cuadrática y el análisis de correlación simple y
múltiple para interpretar la relación entre variables en un estudio
estadístico.
Objetivos Específicos
Explicar el concepto y la aplicación de la regresión lineal simple.
Describir la regresión lineal múltiple y su utilidad cuando intervienen
varias variables independientes.
Analizar la regresión cuadrática como modelo para relaciones no
lineales.
Determinar el grado de relación entre variables mediante el análisis de
correlación simple y múltiple.
Interpretar los resultados obtenidos a partir de los modelos aplicados.
Regresión Lineal Simple
¿Qué es la regresión lineal?
La regresión lineal es un modelo matemático que describe la relación entre
varias variables. Los modelos de regresión lineal son un procedimiento
estadístico que ayuda a predecir el futuro. Se utiliza en los campos científicos y
en los negocios, y en las últimas décadas se ha utilizado en el aprendizaje
automático.
La tarea de la regresión en el aprendizaje automático consiste en predecir un
parámetro (Y) a partir de un parámetro conocido X.
Simple
En una regresión lineal, se trata de establecer una relación entre una variable
independiente y su correspondiente variable dependiente. Esta relación se
expresa como una línea recta. No es posible trazar una línea recta que pase
por todos los puntos de un gráfico si estos se encuentran ordenados de manera
caótica. Por lo tanto, sólo se determina la ubicación óptima de esta línea
mediante una regresión lineal. Algunos puntos seguirán distanciados de la
recta, pero esta distancia debe ser mínima. El cálculo de la distancia mínima de
la recta a cada punto se denomina función de pérdida.
La ecuación de una línea recta tiene la siguiente forma:
Y = β₀ + β₁X + ε,
Dónde:
Y es la variable independiente.
β₀ y β₁ son dos constantes desconocidas que representan el punto de
intersección y la pendiente respectivamente.
ε (epsilon) es la función de pérdida.
A continuación se muestra un ejemplo gráfico de un modelo de una regresión
lineal simple:
Aplicación de la regresión lineal simple:
Para predecir la cosecha en función de la precipitación, con la precipitación
como variable independiente y la cosecha como variable dependiente.
Para saber qué calificación obtendrán los alumnos en función del número de
horas que estudien: aquí la cantidad de horas de estudio representa la variable
independiente y las calificaciones, la dependiente.
Para prever el salario basado en la experiencia: la experiencia se convierte en
la variable independiente y el salario en la variable dependiente.
Limitaciones de la regresión lineal simple:
La regresión lineal simple establece que existe una relación entre las variables,
pero no revela una relación causal: Y depende de, pero no implica que genere
a Y.
Si necesitas establecer algo más que la existencia de una relación, tendrás que
hacer análisis adicionales.
Ejemplo regresión lineal simple
Una empresa requiere saber si existe una relación confiable entre las
inversiones en publicidad y las ventas que se obtienen, a fin de calcular estimar
las ventas que recibirían si hicieran una inversión en publicidad de S/ 8000,
para el onceavo periodo de producción. Aproximar con el modelo de regresión
lineal.
Datos
Solución:
Para estimar el modelo de regresión lineal, hay que reconocer la variable
independiente y la variable dependiente:
Variable Independiente X: Inversión en publicidad.
Variable dependiente Y: Ventas
Resolviendo para β1ˆ:
β1ˆ=10∑10i=1XiYi−∑10i=1Xi∗∑10i=1Yi10∑10i=1X21−
(∑10i=1Xi)2β1ˆ=10(X1Y1+...+X10Y10)−(X1+...+X10)(Y1+...+Y10)10(X21+...
+X210)−(X1+...
+X10)2β1ˆ=10∗10893520600−55800∗186248010∗326625800−558002=5008
822000152618000=32.8193
Resolviendo para β0ˆ:
β0ˆ=∑10i=1Yi∗∑10i=1X2i−∑10i=1Xi∗∑10i=1XiYi10∑10i=1X2i−
(∑10i=1Xi)2β0ˆ=(Y1+...+Y10)∗(X21+...+X210)−(X1+...+X10)(X1Y1+...
+X10Y10)10(X21+...+X210)−(X1+...
+X10)2β0ˆ=1862480∗326625800−55800∗1089352060010∗326625800−5580
02=475570504000152618000=3116.0839
Hallado el B1 y el B0, la ecuación de la regresión quedaría de la siguiente
forma:
yˆ=3116.0840+32.8193X
Se quiere evaluar cuando la inversión sea S/ 8000.00
3116.0840+32.8193(8000)=265670.4840
Entonces, para una inversión de S/ 8000.00 en el onceavo período, se tendrá
una venta aproximada de S/ 265,670.4840.
En R, el ejemplo sería:
Inversion<-c(5000,5570,4350,7900,6800,5400,6900,3900,4200,5780)
Venta<-
c(160000,189380,139200,260700,217600,183600,234600,136500,138600,202
300)
Data<-[Link](Inversion,Venta)
Data
## Inversion Venta
## 1 5000 160000
## 2 5570 189380
## 3 4350 139200
## 4 7900 260700
## 5 6800 217600
## 6 5400 183600
## 7 6900 234600
## 8 3900 136500
## 9 4200 138600
## 10 5780 202300
Hacemos uso de la función “lm”:
[Link]<-lm(Venta~Inversion,data=Data)
print([Link])
##
## Call:
## lm(formula = Venta ~ Inversion, data = Data)
##
## Coefficients:
## (Intercept) Inversion
## 3116.08 32.82
De una forma más detallada:
summary([Link])
##
## Call:
## lm(formula = Venta ~ Inversion, data = Data)
##
## Residuals:
## Min 1Q Median 3Q Max
## -8687.6 -5599.5 785.3 4637.9 9488.1
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 3116.084 9641.674 0.323 0.755
## Inversion 32.819 1.687 19.454 5.06e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 6591 on 8 degrees of freedom
## Multiple R-squared: 0.9793, Adjusted R-squared: 0.9767
## F-statistic: 378.4 on 1 and 8 DF, p-value: 5.064e-08
Con la inversión de 8000:
beta0<-[Link]$coefficients[1]
beta1<-[Link]$coefficients[2]
paste('El valor de B0 es:', beta0)
## [1] "El valor de B0 es: 3116.08397436736"
paste('El valor de B1 es:', beta1)
## [1] "El valor de B1 es: 32.8193397895399"
X<-8000
paste('Se espera que la venta para una inversión de S/',X,"sea de S/",
format(beta0+X*beta1,digits = 10))
## [1] "Se espera que la venta para una inversión de S/ 8000 sea de S/
265670.8023"
Para ver la gráfica de dicha regresión:
plot(Inversion, Venta, pch=22, bg="red",
main="Venta VS Inversión",xlab="Inversión en publicación
(S/.)",ylab="Venta (S/.)")
abline(reg=[Link], col="blue", lwd="1.5")
recta<-[Link]$coefficients
text(6800, 250000, bquote(paste('y=', .(format(recta[1],digits=6)),
'+',.(format(recta[2],digits=4)),'x')))
grid(10,10,lwd=2)
Para ver los residuos de esta regresión de manera gráfica:
plot(predict([Link]),residuals([Link]), pch= 21, bg="green",
main = "Gráfico de Residuos", xlab="Predicción (S/.)", ylab="Residuo del
Modelo (S/.)")
grid(10, 10, lwd=15)
lines(predict([Link]), residuals([Link]),type = "h", col="green", lwd=2)
abline(h=0, col="red", lty=3, lwd=1.5)
Regresión lineal múltiple
¿Qué es la regresión lineal múltiple (MLR)?
La regresión lineal múltiple (RLM), también conocida simplemente como
regresión múltiple, es una técnica estadística que utiliza varias variables
explicativas para predecir el resultado de una variable de respuesta. El
objetivo de la RLM es modelar la relación lineal entre las variables explicativas
(independientes) y las variables de respuesta (dependientes). En esencia, la
regresión múltiple es una extensión de la regresión por mínimos cuadrados
ordinarios (MCO), ya que involucra más de una variable explicativa.
Múltiple
La regresión lineal múltiple encuentra la relación entre dos o más variables
independientes y su correspondiente variable dependiente.
La ecuación de regresión lineal múltiple tiene la siguiente forma:
Y = β₀ + β₁X₁ + β₂X₂ +… + βₐXₐ + ε
Dónde:
Y es la variable dependiente.
X es una variable independiente.
β son coeficientes.
ε (epsilon) es la función de pérdida.
A continuación se muestra un ejemplo de gráfico de un modelo de regresión
lineal múltiple:
Aplicaciones de la regresión lineal múltiple:
Este tipo de regresión permite predecir tendencias y valores futuros. El análisis
de regresión lineal múltiple ayuda a determinar el grado de influencia de las
variables independientes sobre la variable dependiente, es decir, cuánto
cambiará la variable dependiente cuando cambiemos las variables
independientes.
Ejemplo:
Un estudio analiza la relación entre la composición de un cemento tipo Portland
por 13 cementos. Aproximar una función 𝒚 que dependa de las variables 𝒙𝟏,
y el calor desprendido durante la fase de fraguado. La muestra está formada
𝒙𝟐, 𝒙𝟑, 𝒙𝟒.
Prueba de hipótesis:
𝐻0: 𝛽𝑖 = 0, 𝑖 = 0,1,2,3,4
𝐻1: 𝛽𝑖 ≠ 0, para al menos un 𝑖
La matriz X serí:
Dicha matriz inversa es:
Mientras tanto, la matriz “y” es:
Para hallar [X′X]−1, debe demostrarse que X’X es inversible, hallando la
determinante.
det(X′X)=27717211679.97≠0
Por lo tanto X’X sería:
Y la inversa de esa matriz, es decir, de [X′X]−1:
Mientras que el cálculo del Beta se hace de la siguiente forma:
Dando como resultado:
En R sería así:
x1<-c(7,1,11,11,7,11,3,1,2,21,1,11,10)
x2<-c(26,29,56,31,52,55,71,31,54,47,40,66,68)
x3<-c(6,15,8,8,6,9,17,22,18,4,23,9,8)
x4<-c(60,52,20,47,33,22,6,44,22,26,34,12,12)
y<-c(78.5,74.3,104.3,87.6,95.9,109.2,102.7,72.5,93.1,115.9,83.8,113.3,109.4)
Data<-[Link](x1,x2,x3,x4,y)
Data
## x1 x2 x3 x4 y
## 1 7 26 6 60 78.5
## 2 1 29 15 52 74.3
## 3 11 56 8 20 104.3
## 4 11 31 8 47 87.6
## 5 7 52 6 33 95.9
## 6 11 55 9 22 109.2
## 7 3 71 17 6 102.7
## 8 1 31 22 44 72.5
## 9 2 54 18 22 93.1
## 10 21 47 4 26 115.9
## 11 1 40 23 34 83.8
## 12 11 66 9 12 113.3
## 13 10 68 8 12 109.4
Hacemos la regresión:
[Link]<-lm(y~x1+x2+x3+x4,data=Data)
summary([Link])
##
## Call:
## lm(formula = y ~ x1 + x2 + x3 + x4, data = Data)
##
## Residuals:
## Min 1Q Median 3Q Max
## -3.1750 -1.6709 0.2508 1.3783 3.9254
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 62.4054 70.0710 0.891 0.3991
## x1 1.5511 0.7448 2.083 0.0708 .
## x2 0.5102 0.7238 0.705 0.5009
## x3 0.1019 0.7547 0.135 0.8959
## x4 -0.1441 0.7091 -0.203 0.8441
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 2.446 on 8 degrees of freedom
## Multiple R-squared: 0.9824, Adjusted R-squared: 0.9736
## F-statistic: 111.5 on 4 and 8 DF, p-value: 4.756e-07
Vemos los residuos:
plot(predict([Link]),residuals([Link]),pch=21, bg="red",
main="Gráfica de Residuos", xlab="Predicción", ylab="Residuo del Modelo")
grid(10, 10, lwd=1.5)
lines(predict([Link]),residuals([Link]), type="h", col="red", lwd=2)
abline( h=0, col="blue", lty=3, lwd=1.5)
Regresión cuadrática
¿Qué es la regresión lineal cuadrática?
El modelo de regresión cuadrática es una alternativa cuando el modelo lineal
no logra un coeficiente de determinación apropiado, o cuando el fenómeno en
estudio tiene un comportamiento que puede considerarse como parabólico. La
forma más simple de tratar de establecer la tendencia es a través de un
diagrama de dispersión o nube de puntos, tal como la siguiente:
Este modelo también es conocido como parabólico, y es el caso más simple de
modelos de regresión polinomiales, siendo su grado igual a 2.
2. Ecuación característica
La función que define el modelo es la siguiente:
Yi=A+Bxi+Cxi2+E
En la cual:
Yi : Variable dependiente, iésima observación
A, B, C: Parámetros de la ecuación, que generalmente son
desconocidos
E: Error asociado al modelo
Xi : Valor de la í-esima observación de la variable independiente
Al sustituir los parámetros por estimadores, el modelo adopta la siguiente
forma:
yi=a+bxi+cxi2
3. Tabla de datos
Para el ajuste de un conjunto de datos al modelo cuadrático de regresión, se
construye la siguiente tabla de datos:
X y X2 X3 X4 X* y X2*y y2
.. .. .. .. .. .. .. ..
Σx Σy Σx2 Σx3 Σx4 Σ x*y Σx2y Σy2
4. Estimadores del modelo
los estimadores para el ajuste del modelo se calculan de la siguiente manera:
5. Análisis de varianza para la regresión
Con el objeto de determinar si el modelo explica o no el fenómeno en estudio,
se realiza el análisis de varianza, que se calcula de la siguiente manera
Fuente de Grado Suma de Cuadrad F calculada F
Variación s de cuadrados o medio tabulad
liberta a
d
Regresió 2 b* (Σxy-Σx*Σy/n) S.C. [Link]/
n +c*( Σx2y- Σx2* Reg/2 [Link]
Σy/n)
Error n-3 S.C. Total- S.C. S.C.
Regresión Error/(n-
3)
Total n-1 Σ(y)2-(Σy)2 /n
Ho: El modelo no explica el fenómeno en estudio
Ha: El modelo sí explica el fenómeno en estudio
Para buscar en la tabla la F tabulada, se usan el el numerador los
grados de libertad de regresión y en el denominador, de acuerdo al nivel de
significancia escogido (los más usuales son al 5% y al 1%)
Si el valor de F calculada es mayor que el de F tabulada, se rechaza Ho,
en caso contrario se acepta
6. Grado de ajuste del modelo
Para determinar el grado de ajuste del modelo, se calcula el coeficiente de
determinación, de la siguiente manera:
7. Càlculo de estimadores, coeficiente de determinaciòn y anàlisis de varianza
mediante el uso de matrices
Un mètodo alternativo para realizar los càlculos, es el uso de matrices. En este
caso, el procedimiento es el siguiente:
i) formar la matriz x: (matriz de variable independiente), agregando la primera
columna formada por unos y una tercera columna formada por los valores de x
elevados al cuadrado:
1 x1 X12
1 x2 X22
... ..... .....
1 xn Xn2
ii) Formar el vector de valores de y
y1
y2
.....
yn
iii) Formar la matriz x transpuesta ( x´)
1 1 ... 1
x1 x2 ... xn
X12 X22 ... Xn2
iv) Calcular el producto matricial x´x
v) Calcular la inversa del producto x´x (o sea [x´x]-1
vi) Calcular el producto x´y
vii) Calcular el producto (x´x)-1*(x´y)=D
El resultado de esta operaciòn es el vector de coeficientes de regresiòn en el
orden a,b,c
viii) Para el càlculo del anàlisis de varianza, se tienen las siguientes
operaciones
matriciales:
Fuente de Grados Suma de Cuadrado F calculada F
Variación de cuadrados medio tabulada
libertad
Regresión 2 D´( x´ )(y)-nym2 S.C. Reg/2 [Link]/[Link] *
Error n-3 y´y-D´( x´ )(y) S.C.
Error/(n-3)
2
Total n-1 y´y- nym
El valor de ym que se usa en los cálculos es el promedio de valores de y (Σy/n)
ix) Finalmente, el coeficiente de determinaciòn por matrices se obtiene de la
siguiente manera:
r2= [D´(x´)(y)- nym2]/[(y´y)- nym2 ]
8. Pruebas de Hipótesis para el modelo
Para el planteo y prueba de hipótesis, es necesario definir el término
“multiplicadores de Gauss”
Los multiplicadores de Gauss son los elementos de la matriz inversa x´x:
7.1 Para el coeficiente b
Para probar la hipótesis de que el coeficiente b es igual a un valor b´, se
procede de la siguiente manera:
i) Se plantea la hipótesis Ho: b= b´ y la alternativa Ha: b≠ b´
ii) Se calcula el estadístico:
Sb es conocido como el error standard de b y se calcula de la siguiente manera:
El cuadrado medio del error se obtiene del anàlisis de varianza.
iii) Se busca en la tabla de t de student el valor tabulado para los siguientes
datos:
n-3 grados de libertad y un nivel α/2
iv) Si el valor de t calculado es mayor que el tabulado, se rechaza el Ho, en
caso
Contrario, se acepta.
7.2 Para el coeficiente c
Para probar la hipótesis de que el coeficiente c es igual a un valor c´, se
procede de la siguiente manera:
i) Se plantea la hipótesis Ho: c= c´ y la alternativa Ha: c≠ c´
ii) Se calcula el estadístico:
Sb es conocido como el error estándar de b y se calcula de la siguiente manera:
El cuadrado medio del error se obtiene del análisis de varianza.
iii) Se busca en la tabla de t de student el valor tabulado para los siguientes
datos:
n-3 grados de libertad y un nivel α/2
iv) Si el valor de t calculado es mayor que el tabulado, se rechaza el Ho, en
caso
Contrario, se acepta .
7.3 Para el coeficiente a
Se puede probar la hipótesis de que el coeficiente a es igual a un valor a´,
para lo
Cual se sigue el siguiente procedimiento:
i) Se define la hipótesis: Ho: a=a´ y la alternativa Ha: ala´
ii) Se calcula el error estándar para a con la siguiente fórmula:
iii) Se calcula el estadístico de prueba:
iv) Se obtiene en la tabla de t de student el estadístico comparador, con los
siguientes datos: n-3 grados de libertad y nivel α/2
v) Si el valor de t calculado es mayor que el tabulado, se rechaza la Ho, en
caso contrario, la hipótesis se acepta
8. Intervalos de confianza
8.1 Para el coeficiente b
El intervalo de confianza para el coeficiente b se calcula así:
El cuadrado medio del error se obtiene del análisis de varianza
El valor de t se obtiene de la tabla de t de student con n-3 grados de
libertad y un
nivel α/2
8.2 Para el coeficiente c
El intervalo de confianza para el coeficiente b se calcula así:
El cuadrado medio del error se obtiene del análisis de varianza
El valor de t se obtiene de la tabla de t de student con n-3 grados de
libertad y un
nivel α/2
8.3 Para el coeficiente a
El intervalo de confianza para el coeficiente a se calcula así:
El cuadrado medio del error se obtiene del análisis de varianza
El valor de t se obtiene de la tabla de t de student con n-3 grados de
libertad y un
nivel α/2
8.5 para la respuesta media de y, con valores de x fijos
Un intervalo de confianza para la respuesta media de y, dado x0 sería:
El cuadrado medio del error se obtiene del análisis de varianza
El valor de t se obtiene de la tabla de t de student con n-3 grados de
libertad y un
nivel α/2
El vector x0 contiene los valores de x para los que se calcula el valor de y.
Para obtener el valor de y que se usa en ésta fórmula, se sustituye en la
ecuación de regresión obtenida los valores de x y x al cuadrado.
8.4 para la estimación de y
El intervalo de confianza para la estimación de y, dado un valor de x 0 se obtiene
de la siguiente manera:
El cuadrado medio del error se obtiene del análisis de varianza
El valor de t se obtiene de la tabla de t de student con n-3 grados de
libertad y un
nivel α/2
10. Por fin un ejemplo!
Se realiza una prueba de frenado de un automóvil nuevo, midiendo la distancia
de parada de acuerdo a la rapidez del vehículo al momento de aplicar los
frenos, obteniéndose los siguientes resultados:
RAPIDEZ DISTANCIA
Km/h Metros
35 16
50 26
65 41
80 62
95 88
110 119
En base a los datos anteriores:
a) Construya un diagrama de dispersión
b) Efectúe la estimaciòn del modelo cuadrático
c) Determine el grado de ajuste e interprételo
d) Elabore el análisis de varianza y discútalo
e) Si el vehículo viaja a 100 km/h, en qué distancia se detiene?
f) Pruebe la hipòtesis que b=1 con un 99% de confianza
g) Calcule intervalo de confianza al 95% para a y b
h) Efectùe la estimaciòn del modelo, el andeva y obtenga el coeficiente de
determinaciòn por medio de matrices.
a) Diagrama de Dispersión
b) Estimadores del modelo
i) Tabla de Datos:
x y x2 x3 x4 xy x2y y2
35 16 1,225 42,875 1,500,625 560 19,600 256
50 26 2,500 125,000 6,250,000 1,300 65,000 676
65 41 4,225 274,625 17,850,625 2,665 173,225 1,681
80 62 6,400 512,000 40,960,000 4,960 396,800 3,844
95 88 9,025 857,375 81,450,625 8,360 794,200 7,744
110 119 12,100 1,331,000 146,410,000 13,090 1,439,900 14,161
Σ=294,421,87
Σ=435 Σ=352 Σ=35,475 Σ=3,142,875 5 Σ=30,935 Σ=2,888,725 Σ=28,362
ii) Estimadores del modelo
Ecuación Final:
Yi=13.3587-.3394xi+0.01182xi2
c) Grado de ajuste del modelo
El coeficiente de determinación se calcula así:
Se puede concluir que el grado de ajuste del modelo es alto (casi perfecto!),
por lo que el modelo es confiable para hacer predicciones.
d) Análisis de varianza del modelo
i) Suma de cuadrados de regresión:
ii) Suma de cuadrados Total
=7711.3333
iii) Suma de cuadrados del error : 7711.3333-7711.2119=0.12143
iv) Grados de libertad de regresion=2
v) Grados de libertad totales= 6-1=5
vi) Grados de libertad del error=6-3=3
vii) Cuadrado medio de regresión= 7711.2119/2=3855.5069
viii) Cuadrado medio del error= 0.1243/3=0.04048
ix) F Calculada=3855.5069/0.04048=95256.147
x) F Tabulada (2,3,0.01)=30.82
xi) Tabla de Andeva:
Fuente de Grados Suma de Cuadrado F F
Variación de cuadrados medio calculada tabulada
libertad
Regresión 2 7711.2119 3855.60595 95256.14 30.82**
Error 3 0.12143 0.04048
Total 5 7711.33333
Debido a que F calculada es mayor que F tabulada, se rechaza la Ho y se
acepta la Ha, con lo cual se concluye que el modelo sì explica el fenòmeno en
estudio y que los resultados obtenidos no se deben a la casualidad.
e) Si el vehículo viaja a 100 km/h, en qué distancia se detiene?
Para esto, simplemente se utiliza la ecuaciòn anteriormente encontrada por
estimaciòn, sustituyendo el valor de x por 100
y= 13.3587-.3394(100)+0.01182(100)2=97.618 m
f) Pruebe la hipòtesis de que b=1 con un 99% de confianza
Inicialmente se plantea Ho: b=1 y su alterna Ha: b≠1
A continuaciòn se obtiene el error standard de b:
El valor de t de student de calcula de la siguiente manera:
El valor de t se obtiene en la tabla de t de student, con 6-3 grados de libertad y
(1-.99)/2=0.005 de α, siendo el valor igual a 5.840
Finalmente, dado que t calculada es mayor que la tabulada, se concluye al 99%
que el coeficiente b no es igual a 1.
g) Calcule intervalos de confianza al 95% para a y b
El valor de t de student al 95% (α/2=0.05/2=0.025) con 3 grados de libertad
es= 3.182
Intervalo de confianza para b:
El intervalo final será entonces el siguiente: -0.40766<B<-0.27114
Intervalo de confianza para a:
El intervalo final para a sería: 11.0775<A<15.6399
i) Ajuste del modelo y análisis de varianza mediante matrices:
Matriz x:
1 35 1225
1 50 2500
1 65 4225
1 80 6400
1 95 9025
1 110 12100
Matriz x transpuesta ( x´ )
1 1 1 1 1 1
35 50 65 80 95 110
1225 2500 4225 6400 9025 12100
Vector y:
16
26
41
62
88
119
Producto x´x:
6 435 35475
435 35475 3142875
35475 3142875 294421875
Matriz inversa de x´x:
12.6973 -0.3713 0.002433
-0.3713 0.01137 -0.00007671
0.002433 -0.00007671 0.0000005291
Producto x ´ y
352
30935
2888725
Producto Final b=(x´x)-1* (x ´ y)
13.3587
-0.3394
0.01182
Análisis de varianza
ym=352/6=58.666
Suma de cuadrados de regresión= b´x´y-nym2=
Suma de cuadrados total= y´y- nym2=
Suma de cuadrados del error : 7711.3333-7711.2119=0.12143
Grados de libertad de regresion=2
Grados de libertad totales= 6-1=5
Grados de libertad del error=6-3=3
Cuadrado medio de regresión= 7711.2119/2=3855.5069
Cuadrado medio del error= 0.1243/3=0.04048
F Calculada=3855.5069/0.04048=95256.147
F Tabulada (2,3,0.01)=30.82
Análisis de Varianza Final:
Fuente de Grados Suma de Cuadrado F F
Variación de cuadrados medio calculada tabulada
libertad
Regresión 2 7711.2119 3855.60595 95256.14 30.82**
Error 3 0.12143 0.04048
Total 5 7711.33333
Análisis de correlación simple y múltiple
Correlación simple
La correlación simple es un procedimiento estadístico que mide la relación
entre dos variables cuantitativas. Permite determinar:
La dirección de la relación (positiva o negativa)
La fuerza de la relación (débil, moderada o fuerte)
El coeficiente más utilizado es el coeficiente de correlación de Pearson,
propuesto por Karl Pearson.
Interpretación del coeficiente de Pearson (r)
El valor de r oscila entre -1 y +1:
r = +1 → correlación positiva perfecta
r = -1 → correlación negativa perfecta
r = 0 → no existe relación lineal
Escala práctica de interpretación
Valor absoluto de r Interpretación
0.00 – 0.29 Débil
0.30 – 0.59 Moderada
0.60 – 0.89 Fuerte
0.90 – 1.00 Muy fuerte
Ejemplo claro paso a paso (Correlación Simple)
Problema:
Se quiere analizar si existe relación entre las horas de estudio y la calificación
obtenida.
Datos:
Estudiant Horas (X) Nota (Y)
e
1 2 50
2 4 60
3 6 65
4 8 80
5 10 90
Paso 1: Calcular medias
Paso 2: Aplicar fórmula de Pearson
Después de realizar los cálculos:
Correlación múltiple
La correlación múltiple analiza la relación entre:
Una variable dependiente (Y)
Dos o más variables independientes (X₁, X₂, X₃…)
Se representa por R.
Se basa en el modelo de regresión lineal múltiple, derivado de los estudios
de Francis Galton y formalizado estadísticamente por Karl Pearson.
Modelo matemático
Donde:
Y = variable dependiente
X₁, X₂ = variables independientes
β = coeficientes
ε = error
Ejemplo claro paso a paso (Correlación Múltiple)
Problema:
Determinar cómo influyen:
Horas de estudio (X₁)
Asistencia (%) (X₂)
Sobre:
Calificación final (Y)
Datos:
Estudiante Horas (X₁) Asistencia (X₂) Nota (Y)
1 4 70 65
2 6 75 75
3 8 85 88
4 10 95 95
Paso 1: Ajustar modelo
Se obtiene (con software estadístico):
Paso 2: Interpretar coeficientes
Por cada hora adicional de estudio, la nota aumenta 4 puntos.
Por cada 1% adicional de asistencia, la nota aumenta 0.3 puntos.
Paso 3: Interpretar R y R²
Supongamos que:
R = 0.94
R² = 0.88
Interpretación:
El 88% de la variación en las calificaciones se explica por horas y asistencia.
Esto indica una relación conjunta fuerte.
Diferencias entre correlación simple y múltiple
Característica Simple Múltiple
Número de 2 3 o más
variables
Coeficiente r R
Predicción No Sí
Modelo matemático No siempre Sí
Conclusiones
En esta investigación se determinó que la regresión lineal simple permite
analizar la relación directa entre dos variables, facilitando la predicción de una
variable dependiente a partir de una independiente. Asimismo, la regresión
lineal múltiple amplía el análisis al considerar varias variables explicativas, lo
que proporciona un modelo más completo y preciso.
También se concluye que la regresión cuadrática es útil cuando la relación
entre las variables no sigue un comportamiento estrictamente lineal,
permitiendo un mejor ajuste de los datos. Finalmente, el análisis de correlación
simple y múltiple permitió medir el grado de asociación entre las variables
estudiadas, identificando la fuerza y dirección de la relación.
En esta investigación se determinó que la correcta aplicación e interpretación
de estos modelos estadísticos es fundamental para obtener conclusiones
confiables y apoyar la toma de decisiones basada en datos.
E-grafía
[Link]
[Link]
[Link]
[Link]
[Link]
#:~:text=Correlaci%C3%B3n%20m%C3%BAltiple:%20Cuando%20una
%20variable,variables%20independientes%20de%20forma%20simult
%C3%A1nea.
[Link]
[Link]
[Link]
[Link]