0% encontró este documento útil (0 votos)
133 vistas42 páginas

Regresión de Ventas en Pizzerías Armand

Este documento presenta el modelo de regresión lineal simple utilizado para analizar la relación entre las ventas trimestrales (variable dependiente y) y el tamaño de la población estudiantil (variable independiente x) en 10 restaurantes de la cadena Pizzerías Armand. Se estima una ecuación de regresión y = 5x + 30 que predice que las ventas aumentarán en $5,000 por cada aumento de 1,000 estudiantes. El coeficiente de determinación r2 = 0.9027 indica que el 90.27% de la variación en las ventas se

Cargado por

Kolya Mayo
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
133 vistas42 páginas

Regresión de Ventas en Pizzerías Armand

Este documento presenta el modelo de regresión lineal simple utilizado para analizar la relación entre las ventas trimestrales (variable dependiente y) y el tamaño de la población estudiantil (variable independiente x) en 10 restaurantes de la cadena Pizzerías Armand. Se estima una ecuación de regresión y = 5x + 30 que predice que las ventas aumentarán en $5,000 por cada aumento de 1,000 estudiantes. El coeficiente de determinación r2 = 0.9027 indica que el 90.27% de la variación en las ventas se

Cargado por

Kolya Mayo
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Modelo de regresión Lineal Simple

Caso: Pizzerías Armand

Cadena de restaurantes de comida italiana que abarca cinco


estados. Los lugares donde sus establecimientos han tenido
más éxito están cercanos a establecimientos de educación
superior. Los administradores creen que las ventas en esos
restaurantes (representada por y), se relacionan en forma
positiva con la población estudiantil (representada por x).
Esto es, que los restaurantes cercanos a centros escolares con
gran población tienden a generar más ventas que los que están
cerca de centros con población pequeña. Aplicando el análisis
de regresión podremos plantear una ecuación que muestre
cómo se relaciona la variable dependiente y con la variable
independiente x.
Modelo de regresión y ecuación de regresión
En el ejemplo de Pezzerías Armand, cada restaurante está asociado con un
valor de x (población estudiantil) y un valor correspondiente de y (ventas
trimestrales). La ecuación que describe cómo se relaciona y con x y con un
término de error se llama modelo de regresión.

Modelo de regresión lineal simple

(1)

En este modelo, y es una función lineal de x (la parte


) más . son los parámetros del modelo, y (letra
griega épsilon) es una variable aleatoria. El término de error
explica la variabilidad en y que no se puede explicar con la
relación lineal entre x y y.
Ecuación de regresión lineal simple

(2)

En la regresión lineal simple, la gráfica de la ecuación de


regresión es una línea recta; es la ordenada al origen de
esa recta, es su pendiente y es la media o valor
esperado de y para determinado valor de x.
Ecuación de regresión estimada

Si se conocieran los valores de los parámetros


podríamos usar la ecuación (2) para calcular el valor medio
de y para determinado valor de x. Desafortunadamente, los
valores de los parámetros no se conocen, en la práctica, y se
deben estimar usando datos de la muestra. Se calculan
estadísticos de la muestra (denotados b0 y b1) como
estimados de los parámetros , respectivamente. Al
sustituir los valores de los parámetros por los
estadísticos b0 y b1 en la ecuación de regresión, obtenemos la
ecuación de regresión estimada, o simplemente ecuación
de regresión
En la regresión lineal simple, la ecuación de regresión se
escribe en la siguiente forma:

En la regresión lineal simple, la gráfica de la ecuación de


regresión se llama línea de regresión estimada; b0 es la
ordenada al origen, b1 es la pendiente y es el valor
estimado de y para determinado valor de x.
Método de cuadrados mínimos

El método de cuadrados mínimos es un procedimiento para


encontrar la ecuación de regresión estimada usando datos de
una muestra. Para ilustrarlo en el ejemplo de Pizzerías
Armand, suponga que se reunieron datos de una muestra de
10 restaurantes ubicados cerca de centros educativos. Para la
i-ésima observación o restaurante de la muestra, xi es el
tamaño de la población estudiantil, en miles, y yi son las
ventas trimestrales (en miles de dólares). Los valores de xi y
yi para los 10 restaurantes de la muestra se resumen en la
siguiente tabla:
Restaurante Población de Ventas trimestrales
i estudiantes (miles) xi (miles de dólares) yi
1 2 58
2 6 105
3 8 88
4 8 118
5 12 117
6 16 137
7 20 157
8 20 169
9 22 149
10 26 202
En la tabla, vemos que el restaurante 1, con x1 = 2 y y1 =
58 está cerca de un centro con 2000 estudiantes y sus
ventas trimestrales son de 58 000 dólares. El restaurante 2,
con x2 = 6 y y2 = 105 está cerca de un centro con 6 000
estudiantes y sus ventas trimestrales son de 105 000
dólares. El valor máximo de ventas es para el restaurante
10, que está cerca de un centro con 26 000 estudiantes y
sus ventas trimestrales son de 202 000 dólares.
Diagrama de dispersión

El diagrama de dispersión permite observar gráficamente los


datos y hacer conclusiones preliminares acerca de la relación
posible entre las variables. El tamaño de la población de
estudiantes se representa en el eje horizontal y el valor de las
ventas trimestrales en el eje vertical.
Los diagramas de dispersión, para el análisis de
regresión, se forman con valores de la variable
independiente x en el eje horizontal, y los de la
variable dependiente y en el eje vertical.
La siguiente figura muestra el diagrama de dispersión de los datos
de Pizzerías Armand.

Diagrama de dispersión de Pizzerías Armand

200

175

150
Ventas

125

100

75

50
0 5 10 15 20 25
Estudiantes
¿Qué conclusiones preliminares se pueden obtener de la
figura? Parece que las ventas trimestrales son mayores en los
centros con más población de estudiantes. Además, para esos
datos, la relación entre el tamaño de la población de
estudiantes y las ventas trimestrales al parecer se aproximan
con una línea recta; de hecho, se indica una relación lineal
positiva entre x y y.
En consecuencia, elegimos el modelo de regresión lineal para
representar la relación entre las ventas trimestrales y la
población de estudiantes. Dada esta opción, nuestra siguiente
tarea será emplear los datos de la muestra para determinar los
valores de b0 y b1 en la ecuación de regresión lineal simple.
Para el i-ésimo restaurante, la ecuación de regresión estimada es:
En el método de los cuadrados mínimos se
emplean los datos de la muestra para determinar
los valores de b0 y b1 que minimizan la suma de
los cuadrados de las desviaciones entre los valores
observados de la variable dependiente, yi, y los
valores estimados de la variable dependiente, .
El criterio del método de los cuadrados mínimos
se expresa en la ecuación:
Pendiente e intercepción y para la ecuación de
regresión estimada

o
La ecuación de regresión estimada, deducida con el método de
los cuadrados mínimos es:

La pendiente de la ecuación de regresión (b1 = 5) es positiva,


lo cual implica que al aumentar la población de estudiantes,
las ventas también aumentan. De hecho, podemos llegar a la
conclusión (ya que las ventas se miden en miles de dólares y
la población en miles de estudiantes) que un aumento de 1 000
estudiantes en la población está asociado con un aumento de 5
000 dólares en las ventas esperadas; esto es, se espera que las
ventas aumenten en 5.00 dólares por estudiante.
Si creemos que la ecuación de regresión estimada con
cuadrados mínimos describe en forma adecuada la relación
entre x y y, parece razonable usarla para predecir el valor de y
para determinado valor de x
Por ejemplo, si quisiéramos predecir las ventas en un restaurante
ubicado cerca de un centro con 16 000 estudiantes, el resultado
sería,

En consecuencia, predeciríamos ventas trimestrales de 140


000 dólares para este restaurante.
Coeficiente de determinación

En el ejemplo de las Pizzerías Armand obtuvimos la ecuación de regresión


para aproximar la relación lineal entre el tamaño de la
población de estudiantes, x, y las ventas trimestrales, y. Ahora la pregunta
es: ¿qué tan bien se ajusta a los datos la ecuación de regresión? La relación
SSR/SST, (SSR = suma de cuadrados debida a la regresión; SST = suma de
cuadrados del total) que asume valores entre cero y uno, se usa para evaluar
la bondad de ajuste para la ecuación de regresión. A esta relación se le
llama coeficiente de determinación y se representa por r2.
En el ejemplo de Pezzerías Armand, el valor del coeficiente de
determinación es:
Si lo expresamos como porcentaje, se puede interpretar a r2
como el porcentaje de la suma total de cuadrados que se
puede explicar aplicando la ecuación de regresión. En el
ejemplo de las pezzerías podemos concluir que se puede
explicar 90.27% de la suma de cuadrados del total con la
ecuación de regresión para predecir las ventas.
En otras palabras, 90.27% de la variación en las ventas se
puede explicar con la relación lineal entre el tamaño de la
población de estudiantes y las ventas. Debemos estar
satisfechos de ver tan buen ajuste entre la ecuación de
regresión y los datos.
Coeficiente de correlación

El coeficiente de correlación es una medida descriptiva de la


intensidad de la asociación lineal entre dos variables, x y y.
Los valores del coeficiente de correlación siempre están entre
-1 y +1.
Un valor de +1 indica que las dos variables, x y y, tienen una
relación lineal positiva perfecta. Esto es, todos los puntos de
datos están en una línea recta con pendiente positiva. Un valor
de -1 indica que x y y tienen una relación lineal negativa
perfecta, y que todos los puntos de datos están en una recta con
pendiente negativa. Los valores del coeficiente de correlación
cercanos a cero indican que x y y no tienen relación lineal.
Si ya se ha hecho un análisis de regresión y se ha
calculado el coeficiente de determinación r2, el
coeficiente de correlación de la muestra se puede calcular
como sigue:
El signo del coeficiente de correlación es positivo si la
ecuación de regresión tiene pendiente positiva (b1 >0) y
negativo si la ecuación de regresión tiene pendiente
negativa (b1 < 0). Para nuestro ejemplo, como la pendiente
de la ecuación de regresión es positiva, el coeficiente de
correlación es:
Concluimos que, con un coeficiente de correlación
de la muestra rxy =+0.9501, hay una fuerte
asociación lineal positiva entre x y y.
Aunque el coeficiente de correlación se restringe a
una relación lineal entre dos variables, el
coeficiente de determinación se puede emplear en
relaciones no lineales y en relaciones que tengan
dos o más variables independientes. En este
sentido, el coeficiente de determinación tiene una
aplicabilidad más amplia
Supuestos del modelo
Al efectuar un análisis de regresión se comienza haciendo una
suposición acerca del modelo adecuado de la relación entre las
variables dependiente e independiente(s). Para el caso de la
regresión lineal simple, el modelo de regresión supuesto es:
A continuación se aplica el método de los
cuadrados mínimos para determinar los valores de
b0 y b1, que son las estimaciones de , los
parámetros del modelo. La ecuación estimada de
regresión que resulta es:
Ya vimos que el valor del coeficiente de determinación (r2) es una medida
de la bondad de ajuste de esta ecuación. Sin embargo, aún con un valor
2
grande de r no se debería usar la ecuación de regresión sin antes efectuar
un análisis de la adecuación del modelo supuesto. Un paso importante en la
determinación de si es adecuado el modelo supuesto implica determinar la
significancia (o importancia estadística) de la relación. Las pruebas de
significancias en el análisis de regresión se basan en los siguientes
supuestos acerca del término de error .
Supuestos acerca del término de error

1.- El término de error es una variable


aleatoria con media, o valor esperado, igual
a cero; esto es,
Implicación: son constantes, por lo
tanto, y . Así, para
determinado valor de x, el valor esperado
de y es
2.- La varianza de , representada por , es igual para todos los valores de
x.
Implicación: la varianza de y es igual a y es la misma para todos los
valores de x.

3.- Los valores de son independientes.


Implicación: el valor de para un determinado valor de x no se relaciona
con el valor de para cualquier otro valor de x; así, el valor de y para
determinado valor de x no se relaciona con el valor de y para cualquier otro
valor de x.

4.- El término de error, , es una variable aleatoria con distribución normal.


Implicación: como y es una función lineal de , y también es una variable
aleatoria distribuida normalmente.
Pruebas de significancia

Para probar si hay alguna relación importante de regresión debemos


efectuar una prueba de hipótesis para determinar si el valor de es cero.
Existen dos pruebas que se usan con más frecuencia. En ambas se requiere
una estimación de , la varianza de en el modelo de regresión.
A partir del modelo de regresión y sus supuestos podemos concluir que ,
la varianza de , también representa la varianza de los valores de y respecto
a la línea de regresión. Recordemos que las desviaciones de los valores de y
respecto a la línea de regresión estimada se llaman residuales. Así, la suma
de los residuales al cuadrado, SSE, es una medida de la variabilidad de las
observaciones reales respecto a la línea de regresión. El error cuadrado
medio (MSE, por sus siglas en inglés) es la estimación de ; es igual a la
SSE dividida entre sus grados de libertad.
Si , la SSE se puede escribir en la forma
Cada suma de cuadrados tiene asociado un número, que llamamos sus
grados de libertad. Se ha demostrado que la SSE tiene n -2 grados de
libertad, porque se deben estimar dos parámetros, , para calcular la
SSE. Así, el cuadrado medio se calcula dividiendo SSE entre n – 2. El MSE
da un estimador insesgado de . Debido a esto, también se usa la notación
2
s en vez de MSE.
Error cuadrado medio (estimación de )

Para el ejemplo de Pizzerías Armand, se tiene:

es una estimación insesgada de .


2
Para estimar sacamos la raíz cuadrada de s . El valor que resulta, s, se
llama error estándar de la estimación.
.

Error estándar de la estimación

Para el ejemplo de las Pizzerías Armand, .


Prueba t de significancia en la regresión lineal simple

Estadístico de prueba

Regla de rechazo

Con el estadístico de prueba: Rechace o bien, si


Con el valor p: Rechace
donde se basa en una distribución t con n – 2 grados de libertad.
Desviación estándar estimada de b1

Para nuestro ejemplo, se tiene:

como desviación estándar estimada de b1.


Haremos esta prueba de significancia para nuestro ejemplo a un
nivel de significancia = 0.01. El estadístico de prueba es:
De acuerdo con la tabla, vemos que el valor bilateral de t que corresponde a
= 0.01 y n – 2 =10 – 2 = 8 grados de libertad es . Como 8.62 >
3.355, rechazamos H0 y llegamos a la conclusión de que, con un nivel de
significancia de 0.01, no es igual a cero. La evidencia estadística es
suficiente para concluir que tenemos una relación importante entre la
población de estudiantes y las ventas.
El criterio del valor p también se utiliza para probar una relación
significativa. Se aplica la regla de rechazo común: Rechace H0 si el valor p
< .No obstante, debido a que es difícil determinar el valor p a partir de las
tablas de la distribución de probabilidad t, se emplea un programa de
computadora como Minitab. Para nuestro ejemplo, el valor p asociado con
el estadístico de prueba t = 8.62 es 0.000. Con un valor p = 0.000 < =
0.01, se rechaza H0 y se concluye que tenemos una relación significativa
entre la población de estudiantes y las ventas.

También podría gustarte