0% encontró este documento útil (0 votos)
11 vistas12 páginas

Prueba de Hipótesis y Varianza Amalgamada

Estadística p/ad

Cargado por

gyc1c2021
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
11 vistas12 páginas

Prueba de Hipótesis y Varianza Amalgamada

Estadística p/ad

Cargado por

gyc1c2021
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

TEST DE HIPÓTESIS DE DOS MUESTRAS

PRUEBA DE HIPÓTESIS DE LA MEDIA PARA DOS MUESTRAS (µ)


● Muestras independientes:
Diferencia entre dos medias → el objetivo es probar que la media de población 1 es igual a
la media de la población 2, es lo mismo que decir que la diferencia entre ambas medias
poblacionales es cero (µ1 − µ2 = 0 // µ1 = µ2)
La estimación puntual para las diferencias es la diferencia de las medias muestrales.
(𝑥1 − 𝑥2)

𝐻0 = µ1 = µ2 𝐻0 = µ1 ≤ µ2 𝐻0 = µ1 ≥ µ2
𝐻1 = µ1 ≠ µ2 𝐻1 = µ1 > µ2 𝐻1 = µ1 < µ2

Se pueden presentar 3 situaciones.


- Desvíos poblacionales conocidos:
Usamos el estadístico de la prueba Z-value. Supuestos:
Muestras aleatorias e independientes. La Distribución poblacional es normal y si no lo es las
dos muestras son de tamaño mayor de 30. La desviación poblacional son conocidas.

Además podemos hacer un intervalo de confianza para ambas medias poblacionales


2 2
σ 1
σ 2
(𝑥1 − 𝑥2) ± 𝑍 𝑛1
+ 𝑛2

- Desvíos poblacionales desconocidos, pero supuestamente iguales.


Usamos la desviación muestral amalgamada para estimar el desvío poblacional. Usamos el
estadístico T de Student y la desviación estándar amalgamada. SUPUESTOS:
Muestras aleatorias e independientes. La Distribución poblacional es normal y si no lo es las
dos muestras son de tamaño mayor de 30. Las desviaciones poblacionales no son
conocidas, pero se suponen iguales. (no podemos usar Z)

Al no tener el desvío poblacional debemos trabajar con los desvíos de las muestras y
debemos calcular una desviación común entre las dos muestras (varianza amalgamado)
Al no tener el desvío poblacional conocido trabajamos con t de student con (𝑛1 + 𝑛2 − 2)
grados de libertad.

- Desvíos poblacionales desconocidos, pero distintos (o eso suponemos)


Usamos la desviación de cada muestra en forma separada para estimar la desviación de
cada población. Usamos el estadístico T de student. Supuestos:
Muestras aleatorias e independientes. La Distribución poblacional es normal y si no lo es las
dos muestras son de tamaño mayor de 30. Las desviaciones poblacionales no son
conocidas, pero se suponen distintas. (no podemos usar Z)
Al no poder calcular la varianza amalgamada debemos incluir las dos varianzas de las
muestras para calcular el estadístico t. Tendrá v grados de libertad.

1
● Muestras dependientes / relacionadas:
Es la prueba de dos medias poblacionales relacionadas. Tiene que ver con un antes y un
después de un determinado proceso, es la misma muestra pero en dos momentos distintos.
Se usa mucho en tratamientos donde en una misma población tomamos dos muestras en
distintos períodos de tiempo.
SUPUESTOS: Las poblaciones están normalmente distribuidas o utilizan muestras grandes.
Debemos calcular la diferencia de cada elemento antes y después.
Si no conocemos el desvío estándar de las diferencias podemos calcular el desvío estándar
apareado y usamos el estadístico T
Utiliza el estadístico T de student

PRUEBA DE HIPÓTESIS PARA LAS VARIANZAS:


Usamos el estadístico F (fisher) para conocer la igualdad o diferencia de las varianzas o si
una es mayor que otra y viceversa
2
σ
Se denomina cociente de varianzas ya que 2
1

σ 2
2 2 2 2 2 2
𝐻0 = σ 1
=σ2
𝐻0 = σ 1
≤ σ 2
𝐻0 = σ1
≥ σ 2
2 2 2 2 2 2
𝐻1 = σ 1
≠σ 2
𝐻1 = σ 1
> σ 2
𝐻1 = σ 1
< σ 2

2
σ
O es lo mismo decir 2
1
=0
σ 2

Prueba de dos colas


Casi siempre el rechazo de 𝐻0 en una prueba de dos colas se da
en la cola superior.

En el caso de querer estimar µ y no conozcamos los desvíos debemos primero hacer una
2 2
prueba de hipótesis para saber si estos son iguales o no, es decir 𝐻0 = σ 1
=σ 2
2 2
𝐻1 = σ 1
≠σ 2
Esto es lo que nos ayuda a decidir si usamos T - student con varianza amalgamada o con
varianzas separadas.
Si bien la diferencia no es muy significativa, si sabemos que los desvíos son iguales
entonces la prueba será más potente que si no lo sabemos.

PRUEBA DE HIPÓTESIS PARA PROPORCIONES (π)


Utilizamos el estadístico Z

P - VALUE
Es la probabilidad de obtener un valor mayor al estadístico calculado.
Ejemplo:

2
Es una regla de decisión muy importante ya que siempre que 𝑝 < α rechazo H0 y si
𝑝 > α no rechazo H0
En el ejemplo anterior, se ve claramente que la probabilidad de que salga un número mayor
a 2.5 es menor que la de 1.95 que es α y la probabilidad de que salga un número mayor a
1.5 es mayor a α
1. Es muy fácil ver si rechazo o no H0 (permite hacer una prueba de hipótesis
mentalmente)
2. Nos permite ver hasta que valor de α podemos rechazar la hipótesis.

ANOVA
(análisis de la varianza)
Busca analizar el efecto de un factor sobre una variable.
Tenemos solo una variable independiente que va a tener 3 o + niveles de tratamiento
(grupos)
Supuestos:
- La población está normalmente distribuida
- Las poblaciones tienen igual varianzas
- Las muestras son extraídos alatoriamentes

El objetivo es probar la igualdad de muchas


medias poblacionales, es decir
𝐻0 = µ1 = µ2 = µ3 .... = µ𝑛
𝐻1 Al menos una media es distinta
Es un error plantear
𝐻1 = µ1 ≠ µ2 ≠ µ3 .... ≠ µ𝑛

Esto sirve solo para medias poblacionales

- Gran media 𝑋 → es la media entre todos los elementos de cada grupo


- Diferencia entre los grupos: Es la diferencia de la media de cada grupo con la gran
media
- Diferencia dentro de cada grupo: Cuanto difiere cada valor de cada grupo de su
propia media

Variación total = SST = SSA + SSW

3
● SSA: sumatoria de diferencias cuadradas entre grupos
● SSW: sumatoria de diferencias cuadradas dentro de cada grupo
● Grados de libertad:
○ Entre los grupos: C - 1 (Cantidad de grupos - 1)
○ Dentro de cada grupo: n - C (cantidad de observaciones de todos los grupos
menos la cantidad de grupos)
○ Variación total: n - 1

SST → es la diferencia de cada uno de los elementos


(ⵔ) con la gran media elevado al cuadrado

SSA → variación entre los grupos. la sumatoria entre la


cantidad de elementos de cada grupo por la diferencia
al cuadrado entre la media de cada grupo y la gran
media

SSW → variación dentro de los grupos. Es la sumatoria de la diferencia al cuadrado de


cada valor dentro de los grupos y su respectiva media. Es decir la sumatoria de cada valor
contra su propia media elevado al cuadrado.

IMPORTANTE:

SS grados de SCM F
libertad (media cuadrática) (estadístico)

diferencia entre SSA C-1 𝑆𝑆𝐴


=MSA F=
𝑀𝑆𝐴
𝐶−1 𝑀𝑆𝑊
los grupos

diferencia SSW n-C 𝑆𝑆𝑊


= MSW
𝑛−𝐶
dentro de los
grupos

variación total SST n-1 𝑆𝑆𝑇


𝑛 −1

F es el estadístico de la prueba es lo que analizamos a ver si cae en zona de rechazo o no


rechazo

Utilizamos estadístico fisher

La prueba de hipótesis es SIEMPRE una prueba de cola superior.


Si el estadístico cae en zona de no rechazo, es decir es menor
que el valor crítico, no rechazamos H0. No hay evidencia
suficiente para decir que alguna es distinta
Si el estadístico F cae en la zona de rechazo, es decir al menos
una de las medias poblacionales es distinta. Para saber cual o
cuales son las medias distintas entre sí debemos hacer TUKEY
KRAMER

4
TUKEY KRAMER

Una vez rechazado H0 con la prueba de ANOVA, utilizamos esta para saber cual o cuales
son las medias distintas entre sí, es decir quien o quienes produjeron el rechazo.

Compara las diferencias absolutas de los grupos contra el rango crítico.

Rango crítico → 𝑄𝑢
𝑀𝑆𝐴
2 ( 1
𝑛1
+
1
𝑛2 )
Debemos calcular un rango crítico para cad grupo para luego compararlo con cada
diferencia absoluta de media
𝑄𝑢 →es el rango estudentizado, lo obtenemos de una tabla y los grados de libertad serán
C-n
Si todos los grupos tienen el mismo tamaño, entonces el rango crítico será el mismo para
todos los grupos.

También debemos calcular la diferencia de cada media absoluta con cada grupo
||𝑋 − 𝑋 || ||𝑋 − 𝑋 || ||𝑋 − 𝑋 ||
| 1 2| | 1 3| | 3 2|

El resultado de esas diferencias lo comparamos con el rango crítico, si:


||𝑋 − 𝑋 || > 𝑅𝐶 → µ ≠ µ (estas son las distintas)
| 1 2| 1 2
||𝑋 − 𝑋 || ≤ 𝑅𝐶 → µ = µ
| 1 3| 1 3
Debemos hacer esta comparación con cada grupo.

EJEMPLO:

[Link] diferencia de medias absolutas:


A B C

254 234 200 ||𝑋 − 𝑋 || = |249. 2 − 226| = 23. 2


| 1 2|
263 218 222 ||𝑋 − 𝑋 || = |249. 2 − 205. 8| = 43. 4
| 1 3|
241 235 197 ||𝑋 − 𝑋 || = |226 − 205. 8| = 20. 2
| 3 2|
237 227 206
2. Buscamos el rango estudentizado ( 𝑄𝑢 ) con C - n
251 216 204
grados de libertad → 3 - 15=12
249.2 226 205.8 Esto en la tabla da 3.77

3. Se calcula el rango crítico que en este caso es el mismo para todos porque todos los
grupos son de igual tamaño.
En el caso de que no sean del mismo tamaño tenemos que calcular un rango crítico
para cada comparación de grupos, es decir debemos hacer uno comparando A;B
/A;C /B;C.

5
4. Comparamos cada RC con la diferencia de media absoluta correspondiente. si
diferencia absoluta > RC la media de estos grupos son distintas.
En este ejemplo:
||𝑋 − 𝑋 || = |249. 2 − 226| = 23. 2 > 16.285
| 1 2|
||𝑋 − 𝑋 || = |249. 2 − 205. 8| = 43. 4 >16.285
| 1 3|
||𝑋 − 𝑋 || = |226 − 205. 8| = 20. 2 > 16.285
| 3 2|

Por ende todas las medias son distintas entre sí.

PRUEBA DE LEVENE

Los supuestos que debemos cumplir para trabajar con ANOVA son:
- Muestras independientes
- Distribución normal
- Homostanicidad (las varianzas de todas las poblaciones son iguales)
Esto último no siempre lo sabemos por lo que debemos hacer una prueba de hipótesis de
+2 varianzas antes de empezar a trabajar con ANOVA.

2 2 2 2
Prueba Levene: 𝐻0 σ1 = σ2 = σ3 =... = σ𝑛
𝐻1 Al menos una media es distinta

Debemos calcular la mediana de cada grupo y realizamos una diferencia absoluta de cada
valor con su respectiva mediana.
Con esos valores armamos una nueva tabla que es a la que aplicamos ANOVA.
Si el resultado es rechazar H0 al menos una varianza es distinta y por ende no podemos
usar ANOVA
Si el resultado no rechaza H0 quiere decir que todas las varianzas son iguales, es decir
cumple con el principio de Homostanicidad y por ende usamos ANOVA

DATO:
2 - -
1. calculamos la diferencia entre cada valor con su respectiva
3 - - media. En el ejemplo la media del primer grupo es 4 por ende
|2 − 4| = 2
4 - - 2 - -
|3 − 4| = 1
5 - - |4 − 4| = 0 1 - -
|5 − 4| = 1
6 - - 0 - -
|6 − 4| = 2
1 - -

APLICAMOS ANOVA EN ESTA NUEVA TABLA → 2 - -

6
MODELO DE REGRESIÓN LINEAL SIMPLE

Objetivo → buscamos saber si con el conocimiento del valor de una variable podemos
predecir el valor de otra variable.

Diagrama de dispersión
Los círculos son observaciones.
Podemos tener correlaciones positivas o
negativas.
Lo que analizamos es como actúa Y en
función de X.

Pero por otro lado también puede no existir


relación.
En este caso Y es independiente de X, puede
ser que Y valga más o menos lo mismo
siempre a medida que X se mueve o que no
hay relación porque en algunos momentos Y
es alta pero X baja y en otros Y es alta y X
también es alta.

Que haya una relación y que podamos


encontrar la fórmula que une a las variables
nos permite en algún momento hacer una predicción. Igualmente hay que tener cuidado
porque excel puede darme una función pero esta puede no ser buena.

Correlación ≠ Regresión
● Correlación: dos variables relacionadas ya sea de forma ↑↓ (directa) ; ↑↑(inversa).
Pero no hay una causalidad, es decir subió A entonces sube en consecuencia B
● Regresión: habla de una causalidad, al moverse una variable mueve la otra. Hay una
relación directa donde el movimiento de una causa el movimiento de la otra.
Hay momentos en los que dos variables están relacionadas pero una no es causa de la
otra, sino que están correlacionadas con una tercera variable con la cual si tienen una
regresión . y muchas veces se genera un fenómeno conocido como confusión.

Análisis regresional:
Vamos a buscar las variables que influyen en otras para poder:
- Predecir el valor de la variable dependiente basado en el valor de la independiente
- Para poder explicar el impacto de los cambios en una variable independiente sobre
la dependiente
Variable Dependiente: es la variable que queremos predecir o explicar.
Variable Independiente: la variable usada para explicar a la variabilidad dependiente. Es la
variable explicativa.

MODELO DE REGRESIÓN LINEAL SIMPLE:


Es un modelo ya que es una simplificación de la realidad.
Es lineal porque vamos a trabajar con rectas

7
Es simple porque solo vamos a trabajar con una variable explicativa / Independiente.
𝑌𝑖 = β0 + β1𝑋𝑖 + ε𝑖 → recta de regresión poblacional
ε𝑖 → es la suma de todas las diferencias de distancia entre la recta y las observaciones. Es
la diferencia entre cada observación y la recta estimada, es decir diferencia entre lo real y lo
estimado.
Ecuación para poder estimar la recta de regresión poblacional
𝑌𝑖 = 𝑏0 + 𝑏1𝑋𝑖 → recta de estimación en función de la muestra
En la ecuación muestral el error (ε𝑖desaparece, tiende a cero.
Es la recta que minimiza las distancias de las observaciones, sirve para estimar datos que
no tenemos.
Genéricamente 𝑏0 es el valor promedio estimado de Y cuando X es cero (ordenada al
origen) y 𝑏1 es el cambio promedio de Y cuando hay un cambio unitario en X (pendiente)
● es importante interpretar la unidad en torno del problema
● La recta que vamos a inferir será segura/buena dentro del rango de valores de los
datos.

SST= SSR + SSE


- SSE → es la suma de cuadrados del error. Mide la variación
atribuible a otros factores que se relacionan entre X e Y.
Depende de otros factores que no sean la relación entre X;Y
- SSR → (explicada, de la regresión) suma de cuadrados de la
regresión. Mide la variación atribuible a la regresión entre X e Y.
Depende de la propia relación entre X;Y

2
Coeficiente de determinación: (𝑟 )
Muestra el porcentaje/la parte de Y que es explicado por X
2 𝑆𝑆𝑅 2
𝑟: 𝑆𝑆𝑇
0≤ 𝑟 ≤ 1
Si la recta de predicción pasa justo sobre el punto que representa al dato
2
observado, entonces Y va a depender en un 100% de X y 𝑟 será igual a 1

2
A medida que baje el valor de 𝑟 nos muestra una mayor dispersión de los
puntos respecto de la recta, es decir que la variable independiente esta explicando poco a la
dependiente.
2
Ejemplo: 𝑟 = 0.5808 → El 58.08% de la variación de los reciso de las casas (Y) son
explicadas por la variación en pies cuadrados (X)

Error estándar de estimación (𝑆𝑦𝑥)


Es una medida de la variación de los valores observados de Y
desde la recta de regresión.
A medida que 𝑆𝑦𝑥 sea + grande, los datos están + dispersos.
Si sumamos y restamos valores estándares podemos averiguar
entre que valores se encuentra el 68%, 95% y 99% de Y en la
función de X. Media ± 1 error estándar comprende el 68% de las

8
observaciones, ± 2 errores estándares corresponde al 95% de las observaciones.

Prueba de significación:
Sirve para saber si la variable que elegí es significativa, es decir que la variable que elegí es
buena para explicar Y.
𝐻0: β1 = 0 → no hay relación lineal (es decir que pendiente es 0 y por ende variable 0)
𝐻1: β1 ≠ 0 → hay relación lineal
*Esto lo resolvemos con p-value. siempre que 𝑝 < α rechazo H0 y si 𝑝 > α no rechazo H0

MODELO DE REGRESIÓN LINEAL MÚLTIPLE:


Tenemos más de una variable explicativa/independiente. Ya no será una recta, será un
plano.
Se va a estimar con 𝑌: 𝑏0 + 𝑏1𝑋1 + 𝑏2𝑋2 + 𝑏3𝑋3 +... + 𝑏𝑛𝑋𝑛
Vamos a tener una pendiente para cada variable (X)

No podemos hacer ninguna predicción hasta que no sepamos que el modelo es bueno,
porque cualquier número que yo ponga en el excel, el software me va a dar una función
donde se minimicen las distancias de cada observación. Es por eso que debemos analizar
si la recta que nos devuelve post cargar los datos es buena o no.

¿Cómo sabemos si el modelo es bueno?


1. Debemos analizar si las variables que elegimos para explicar son buenas o no. Este
análisis lo debemos hacer de manera individual y conjunta.
2. Debemos saber que proporción me explica.

1a Son las variables significativas individualmente?


Es decir, las variables que elegimos, independiente de la otra, son buenas para explicar Y
Hacemos prueba de Hipótesis T → esto nos muestra si hay una relación lineal entre X;Y
Debemos hacer una prueba con cada variable independiente que tengamos.
𝐻0: β1 = 0 → no es una buena variable, no hay relación lineal
𝐻1: β1 ≠ 0 → es una buena variable
Nuestro objetivo para saber que la variable es cool es rechazar 𝐻0.
Este test de hipótesis lo vamos a constatar con p-value (en excel lo encontramos con el
título de “probabilidad”)
En el caso de que alguna variable no sea significativa no debemos usarla porque no me va
a dar una buena predicción.

1b Son las variables significativas en forma conjunta?


Utilizando F (ANOVA)
𝐻0: β1 = β2 = β3 = 0 → no son buenas variables en forma conjunta, no hay relación lineal
𝐻1 Al menos una β ≠ 0→ el modelo es significante en forma conjunta, las variables son
buenas para trabajar en forma conjunta
Aca tambien comparamos α con p-value (significance F/valor crítico de F)

9
A veces puede ocurrir que las variables pasan la primera prueba pero luego no pasan la
significación conjunta. Esto se puede deber a que no se cumplió alguno de los supuestos:
- Linealidad
- Independencia de los errores. Muchas veces puede ocurrir que cada error es influido
por el anterior (autocorrelación)
- Moralidad de los errores. Los errores deben seguir una distribución normal
- Igualdad de los desvíos

2 Coeficiente de determinación múltiple:


Este coeficiente nos muestra que % de Y es explicado por todas las variables
independientes a la vez. El resto es la parte de Y que es explicado por otras variables. Se
analiza luego de que analizamos las variables y estas resultaron buenas.
2 𝑆𝑆𝑅
𝑟: 𝑆𝑆𝑇

Coeficiente de correlación múltiple: (es más importante analizarlo en regresión simple)


2
𝑟: 𝑟 → esto dará valores entre -1 y 1
Cuanto más cerca de cero las variables son más independientes. Y cuanto más cerca de 1
hay una relación positiva fuerte (⇈)

COMPARACIÓN DE MODELOS:
2 2
En si, si 𝑟 es mayor, el modelo será mayor, pero 𝑟 aumenta a la vez que tengo más
variables por lo que debemos ajustarlo por el tamaño de muestra y por cantidad de
2
variables. Cada vez que le agregó una nueva variable al modelo 𝑟 va a crecer o
mantenerse pero nunca va a decrecer. Por ende, será mejor el modelo que tenga mayor
2
𝑟 𝑎𝑗𝑢𝑠𝑡𝑎𝑑𝑜
2
Esto es porque 𝑟 𝑎𝑗𝑢𝑠𝑡𝑎𝑑𝑜 es “castigado” por el tamaño de la muestra y la cantidad de
variables.
2 2
𝑟 > 𝑟 𝑎𝑗𝑢𝑠𝑡𝑎𝑑𝑜
Para que un modelo con más cantidad de X sea mejor que otro con menos X, la fuerza de
las variables debe vencer la pérdida de grados de libertad.

ANÁLISIS DE VARIABLES EN FUNCIÓN DEL PROBLEMA: (importante)


siguiendo el ejemplo del video:
𝑌: 𝑏0 + 𝑏1𝑋1 + 𝑏2𝑋2

𝑌: 306. 52 − 24. 97𝑋1 + 79. 14𝑋2


● X1: al aumentar un peso el precio de las tortas, la venta de tortas(Y) disminuye en
promedio 24.97 unidades sin tener en cuenta la inversión en publicidad (X2)
● X2: a aumentar $100 (porque trabajamos con centenas) la inversión en publicidad, la
venta de tortas semanales (Y) aumenta en promedio 79.14 unidades sin tener en
cuenta el precio (X1)
● 𝑏0: por lo general no es posible analizarla. Pero podríamos decir (si es que tenemos
datos para predecirlo) que son las tortas que vendemos por razón de otras variables.
Pero esto solo si hicimos observaciones donde X1 y X2 hayan sido cero

10
El modelo de regresión lineal es bueno solo dentro del rango de las observaciones, es decir
no sería una buena predicción si tomamos números por fuera de ese rango. Es por eso que
si en ninguna observación tuvimos 0;0 no vamos a poder analizar 𝑏0.

VARIABLE DUMMY
Es una variable categórica que se agrega al modelo. Sirve para analizar si una variable
categórica está influyendo en el modelo.
Esta variable además de categórica es dicotómica ya que solamente acepta valores de 0;1,
es decir es un código binario (mujer/hombre - Si/No)

Ejemplo:
𝑌: 𝑏0 +𝑏1𝑋1 + 𝑏2𝑋2
donde
𝑌: venta de tortas
𝑋1: precio
𝑋2: feriado→ Si hay algún feriado (1) si no hay feriados (0)
No importa a qué variable le ponemos cada número ya que excel nos va a dar una recta
donde los resultados sean los mismos.

Si no hay feriados: 𝑌: 𝑏0 +𝑏1𝑋1 + 𝑏202 = 𝑌: 𝑏0 +𝑏1𝑋1

Si hay feriados: 𝑌: 𝑏0 +𝑏1𝑋1 + 𝑏21 = 𝑌: ( 𝑏0 + 𝑏2) +𝑏1𝑋1

Debemos hacer el mismo análisis que para la regresión


múltiple.

Interpretación de variables dummy

𝑌: salario (miles)
𝑋1: años de antigüedad 𝑌: 40 + 10𝑋1 + 2𝑋2
𝑋2: género (F1 ; M0)

𝑋1: por cada año de antigüedad su salario aumenta en promedio $10 mil sin tener en cuenta
el género
𝑋2: Si el trabajador es de género femenino, gana $2mil más en promedio que el género
masculino sin tener en cuenta los años de antigüedad.
La variable dummy la interpretamos la que varía en función de la que no.

Si cambiamos los números y F pasa a ser 0 y M 1, los cálculos cambian y la recta final
cambia pero la interpretación es la misma. 𝑌: 40 + 12𝑋1 − 2𝑋2

11
En este caso la interpretación de 𝑋2sería: si el trabajador es de género masculino, gana
$2mil menos en promedio que el género femenino sin tener en cuenta los años de
antigüedad.

Variable dummy con +2 niveles:


Tenemos que poner más variables dummy, y la cantidad de variables será una menos que
la cantidad de niveles.
Ejemplo: si tengo 3 niveles ponemos 2 variables dummy.
Femenino; masculino; otro → vamos a usar dos variables
𝑌: 𝑏0 +𝑏1𝑋1 + 𝑏2𝑋2 + 𝑏3𝑋3 + ε F1; M0

𝑌: 40 + 10𝑋1 + 2𝑋2 − 3𝑋3

Interpretación: “comparamos todos los géneros con respecto a “otro””


𝑋2: Las mujeres ganan en promedio $2 mil más que los de otro género (este otro no incluye
a los hombres, es solo otro)
𝑋3: Los hombres ganan en promedio $3mil menos que los de otro género

MODELO NO LINEAL

2
𝑌: 𝑏0 +𝑏1𝑋1 + 𝑏2𝑋1 + ε → las 2 variables son la misma, la armamos elevando la variable al
cuadrado. Las pendientes su pueden ser distintas
2
Si tenemos 𝑋 vamos a tener si o si X
1. Con los modelos no lineales, para analizar la significación de las variables solo
analizamos la significación conjunta, es decir la buscamos con la prueba F en la
tabla de ANOVA
𝐻0 =β1 = β2 = 0
𝐻1 = Al menos una β ≠ 0

2. Con la prueba T analizamos si el efecto cuadrático mejora o no el modelo.


𝐻0 =β2 = 0 → el efecto cuadrático NO mejora el modelo
𝐻1 = β2 ≠ 0 → el efecto cuadrático MEJORA el modelo
Lo hacemos solo con la pendiente de la variable cuadrática

2
3. Miramos el 𝑟 común para comparar los modelos (el cuadrático vs el simple)
Esto siempre y cuando ambos modelos sean buenos.
2
No compramos con 𝑟 ajustado porque ambos modelos tienen el mismo tamaño y la misma
variable

12

También podría gustarte