0% encontró este documento útil (0 votos)
36 vistas14 páginas

Variables Instrumentales y Causalidad

1. El documento describe el uso de variables instrumentales para estimar relaciones causales cuando hay variables omitidas o endógenas. 2. Las variables instrumentales deben predecir la variable causal de interés pero no estar correlacionadas con otros determinantes del resultado. 3. El método estima una "primera etapa" y una "forma reducida" para calcular el efecto causal de interés de manera consistente.

Cargado por

Belen
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
36 vistas14 páginas

Variables Instrumentales y Causalidad

1. El documento describe el uso de variables instrumentales para estimar relaciones causales cuando hay variables omitidas o endógenas. 2. Las variables instrumentales deben predecir la variable causal de interés pero no estar correlacionadas con otros determinantes del resultado. 3. El método estima una "primera etapa" y una "forma reducida" para calcular el efecto causal de interés de manera consistente.

Cargado por

Belen
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

VARIABLES INSTRUMENTALES

1. Si queremos ver causalidad se debe trabajar con la estructura de resultados potenciales.


2. Variable de tratamiento sea independiente de resultados potenciales.
Supuesto de Independencia Condicional: Con una serie de características observadas, Xi, nuestra
variable de tratamiento será independiente de los resultados potenciales (potencial outcome).
Selección en observables: conocemos los observables y por ello los colocamos en el modelo y al
condicionar por estos observables, alcanzamos independencia.
Los experimentos aseguran que la variable causal de interés sea independiente de los resultados
potenciales para que los grupos que se comparan sean verdaderamente comparables.
El supuesto de independencia condicional (CIA) es un supuesto básico que proporciona la
justificación para la interpretación causal de las estimaciones de regresión.
La CIA afirma que, condicional a las características observadas, Xi, el sesgo de selección
desaparece. Esto significa:

• {Y0i, Y1i} ⊥ Di | Xi
Por lo tanto, la suposición también se llama selección en observables porque se supone que las
covariables que deben mantenerse fijas son conocidas y observadas.
En muchos experimentos aleatorios, la CIA surge porque Di se asigna aleatoriamente condicional a
Xi.
Ejemplo:

Y i=α + ρ s i +ηi

Y i=log ingreso

ρ=Noes exógeno , tengo problema de endogeneidad


si=escolaridad

ηi =Errores
Asumimos el supuesto de independencia condicional

ηi Descomponemos la parte aleatoria de ganancias potenciales, en una función lineal de Xi y un


término de error vi:

ηi =X 'i γ +υ i

X 'i =vector de variables xi observables . Algo que conozco . Ej : Habilidad innata


υ i=error aleatorio
γ =es un vector de mi regresión Xi ,dado el supuesto de que alincluir Xi , tengoindepende nciacondicional

Donde 𝛾 es un vector de coeficientes de regresión poblacional que se supone satisface:

• E [ ηi|X i ] =X 'i γ .

Como 𝛾 está definido por la regresión de 𝜂_𝑖 en Xi, los residuos 𝜐_𝑖 y Xi no están correlacionados
por la construcción.
Además, en virtud de la CIA, tenemos:

Y i=α + ρ s i + X 'i γ +υi


Donde 𝜐 no está correlacionado con los regresores, (Si) y (Xi), y el coeficiente de regresión 𝜌 es el
efecto causal de interés.
Lo que haría que el ρ sea el efecto causal de un año adicional de escolaridad en los ingresos.

Estos pasos hacen que mi variable (Si) se vuelva exógena, es decir, que alcanzaría independencia
condicional. Esto significa que usando (Xi) se puede controlar el problema de endogeneidad.
La suposición clave aquí es que las características observables Xi son la única razón por la cual 𝜂_𝑖
y 𝑠_𝑖 están correlacionadas. Este es el supuesto de selección en observables para los modelos de
regresión.
VARIABLES OMITIDAS
El OVB describe la relación entre las estimaciones de regresión en modelos con diferentes
conjuntos de variables de control.
Está motivado por la noción de que una regresión más larga tiene una interpretación causal,
mientras que una regresión más corta no. Por lo tanto, los coeficientes de la regresión más corta
están sesgados.
Ejemplo: En el ingreso y la regresión escolar se incluye la "habilidad" A.
1. Regresión corta: donde se tiene los ingresos en función de la escolaridad (omite habilidad
innata).
2. Regresión larga: donde se tiene los ingresos, la escolaridad y la habilidad innata (Ai)

Y i=α + ρ s i + A'i γ + ei
En la práctica, la habilidad es difícil de medir. Por lo que debería medirse antes de que inicie la
escolaridad.

 La idea sería seguir introduciendo variables hasta que ya no haya correlación entre
escolaridad y error. Con ello, la escolaridad sería exógena.
Regresión Corta: sesgo por variable omitida (omite una variable que genera sesgo).
Es el coeficiente de la escolaridad en la regresión larga, más la relación entre la variable omitida y
la variable de interés (la escolaridad).
El sesgo está dado básicamente por:
1. La relación entre la variable omitida (es decir, la habilidad) y la variable de resultado (Yi).
2. Por otro lado, por la relación entre la variable omitida y la variable de interés (Si).
Ejemplo:
La variable omitida (habilidad) está correlacionada con los ingresos, también, está correlacionada
con la escolaridad.
El coeficiente ( ρ ) de la variable corta, va a estar sesgado hacia arriba, por lo que se debe analizar la
dirección del sesgo.
¿Cuáles son las consecuencias de dejar la habilidad fuera de la regresión? El coeficiente de
regresión corta resultante está relacionado con la regresión larga de la siguiente manera:

Cov(Y i , S i)
OVB formula =ρ+ γ ' δ As
V (S i)

Donde 𝛿_𝐴𝑠 es el vector de coeficientes de las regresiones de los elementos de (Ai) en (Si).
En el ejemplo, la capacidad tiene un efecto positivo en los salarios, y también se correlaciona
positivamente con la escolarización. Por lo tanto, el coeficiente de regresión corto puede ser
"demasiado grande" en relación con lo que queremos. Esto significa que: la relación entre la
variable omitida y (Yi), es decir, entre habilidad e ingresos es positivo. Además, la relación entre la
variable de interés (escolaridad) y la variable omitida también es positiva. Por lo que se tendría un
sesgo positivo.
VARIABLES INSTRUMENTALES
Una de las técnicas que permite resolver el problema del sesgo de variables omitidas (OBV), es la
introducción de variables instrumentales, las cuales se presentan en dos iteraciones, primero con un
modelo restringido con efectos constantes y luego con efectos heterogéneos.
Ejemplo: continuando con el efecto causal entre escolaridad y los salarios
Y i=α + ρ s i +ηi
Escolaridad es endógena, por tanto, está correlacionada con los errores de la regresión. Si solo se
saca la parte observable y coloca en la regresión, ya se tendría exogeneidad y por ende causalidad.
Hay un vector de variables de control (Ai) llamado "habilidad", que da una historia de selección
en observables:

ηi =A 'i γ + ν i
Ejemplo: habilidad incluida en la ecuación de ingresos.
Al incluir el vector de variables (Ai) se lograría que el (Si) ya no sea correlacionado con los errores
(vi), por tanto se tendría causalidad

• E [ s i ν i ]=0
Se incluye (Ai) en la ecuación principal: Y i=α + ρ S i + A'i γ + υi

El término de error es la parte aleatoria de los resultados potenciales, 𝜐_𝑖, que queda después de
controlar por (Ai). Este término de error no está correlacionado con la escolaridad por suposición.

USANDO UN INSTRUMENTO
Usando el supuesto de independencia condicionada. El cual, indica que al incluir el vector (Xi) o
vector (Ai), se logra corregir la endogeneidad, es decir, que no existen “no observables”
correlacionados con el error.
Pero, a veces sucede que (Ai) o (Xi) pueden tener componentes no observables y esto es lo
complicado del supuesto de independencia condicionada, por lo que se usarían variables
instrumentales.
Necesitamos un instrumento (Zi), que esté correlacionado con la variable causal de interés (Si), pero
que no esté correlacionado con ningún otro determinante de la variable dependiente.
En el ejemplo dado:
Instrumento (Zi): su fin sería que reemplace a la variable (Si) “variable endógena” (escolaridad), es
decir, que sea un buen predictor de la variable endógena, pero, que no esté correlacionada con los
errores (es decir, que sea exógena).

• Cov ( ηi Zi ) =0.

En otras palabras, que (Zi) no está correlacionado con (Ai) y 𝜐_𝑖. Esta declaración se denomina
restricción de exclusión, ya que se puede decir que (Zi) está excluido del modelo causal de interés.
El coeficiente de interés, (𝜌), es la relación entre la regresión de la población de (Yi) en (Zi)
(llamada forma reducida) y la regresión de la población de (Si) en (Zi) (llamada primera etapa).
SUPUESTOS
Dada la Restricción de Exclusión

Cov ( Y i , Z i ) Forma Reducida

Cov ( Y i , Zi ) V ( Zi)
ρ= = Primera Etapa
Cov ( S i , Zi ) Cov ( S i , Z i )
V ( Zi)

 La primera etapa no debe ser cero.


Supuestos:
1. El instrumento debe tener un efecto sobre (Si) (correlación). Esto es primera etapa.
2. La única razón de la relación entre (Yi) y (Zi) es la primera etapa (Restricción de
Exclusión)
En el modelo con efectos heterogéneos, esta suposición tiene dos partes: la primera es la
declaración de que el instrumento es tan bueno como asignado aleatoriamente (CIA), y la segunda
es que el instrumento no tiene ningún efecto en los resultados que no sean a través de la primera
etapa.
FIRST STAGE AND REDUCED FORM (Primera Etapa y Forma Reducida)

1. Regresión de Primera Etapa: Si= X 'i π 10 + π 11 Z i +ξ 1 i


Aquí el π 11 me da el nivel de correlación o asociación entre (Zi) “instrumento” y la variable
de interés “endógena”.
2. Forma Reducida: Y i= X 'i π 20 + π 21 Zi +ξ 2 i
Aquí solo reemplazo la (Zi) por la (Si), por tanto π 21 va a dar la relación entre (Zi) y los
ingresos (Yi). Si (Si) y (Yi) son variables dependientes.

En el lenguaje del Modelo de Ecuaciones Simultáneas, se dice que las variables


dependientes en estas dos ecuaciones son variables endógenas, mientras que las
variables del lado derecho, se dice que son variables exógenas (determinadas fuera del
sistema).

π 21
• El estimador VI ajustado a las covariables, es el análogo de la muestra de la razón .
π 11
~
π 21 Cov (Y i , Z i)
ρ= =
π 11 Cov (S i , ~
Z i)
ESTIMACIÓN EN DOS ETAPAS (2SLS)

Y i=α ' X i+ ρ S i+ ηi
Es correr la regresión original (es decir, la (Yi) original), pero, se incluye la (Si) estimada que
proviene de la primera etapa.

Donde (ni) es el término de error compuesto: A'i γ +ν i.

Los cuadrados mínimos de dos etapas son calculados por:

Y i=α ' X i+ ρ [ X 'i π 10 + π 11 Z i ] +ξ 2 i (8)

Si= X 'i π 10 + π 11 Z i

Donde X 'i π 10+ π 11 Z i es el valor ajustado de la población de la primera etapa de regresión de (Si) en
(Xi) y (Z)
Cuando los valores ajustados de la primera etapa son consistentemente estimados por:

^si= X 'i π^ 10 + ^π 11 Z i Esta regresión se corre en la primera etapa


^si se calcula e incluye en la regresión principal ( ρ dará el impacto en la intervención).
Lo que se está haciendo aquí, es que a (Si) que es endógeno, le quita toda la parte endógena a través
de instrumentos, para quedarse solo con la parte exógena (que no está correlacionado con los
errores). Esto sería lo que se realiza en la primera etapa. Esa parte exógena que queda, se introduce
en la regresión y da el valor de ρ que es el impacto de la regresión.
EL ESTIMADOR DE WALD
Sin covariables, el modelo de regresión causal es:
Y i=α + ρ S i +ηi
Donde (ni) y (Si) pueden estar correlacionados.
Si (Zi) es una variable dummy que es igual a una con probabilidad (p), se puede mostrar fácilmente
que:

Cov ( Y i , Z i ) ={ E [ Y i|Z i=1 ] −E [ Y i|Z i=0 ] } p (1− p)

Con una fórmula análoga para Cov(Si, Zi).


Por tanto se deduce que el estimador de Wald será:

E [ Y i|Zi =1 ]−E [ Y i|Z i =0 ]


• ρ= (12)
E [ Si|Zi =1 ]−E [ Si|Zi =0 ]

Es la relación entre la forma reducida y la primera etapa.


VARIABLES INSTRUMENTALES Y EXPERIMENTOS
Otra forma de ver variables instrumentales es a través de un diseño experimental.
Puede haber algunas fuerzas (exógenas) que influyen en la probabilidad de que un individuo reciba
tratamiento. En tal caso, es posible que una variable esté correlacionada con la asignación al
tratamiento, pero no tenga un impacto directo en el resultado.
Al igual que en los ensayos aleatorios, las fuerzas de la naturaleza, incluida la naturaleza humana, a
veces manipulan el tratamiento de una manera que evita la necesidad de controles. El método IV
aprovecha la asignación aleatoria parcial o incompleta, ya sea natural o generada por
investigadores.
Suponiendo que se realizó una asignación aleatoria, es decir, que unas personas van a tratamiento y
otras personas van a control, pero, no se cumplió completamente la asignación aleatoria, por lo que
parto de un estudio instrumental, pero tengo contaminación.
Aquí puedo utilizar la asignación aleatoria inicial como un instrumento.
Ejemplo: Escuelas Charter (Programa KIPP)
Este estudio consiste en que a algunas escuelas privadas les obligan a que tengan cupos para
personas de bajos recursos.
Los puestos se asignan aleatoriamente mediante una carta, donde le informan a la familia que el
niño ganó un cupo.
El problema es que por algún motivo, el niño no acepta el cupo (puede ser porque le queda lejos,
siente recelo, etc). Por tanto, decide ir a la escuela pública, mientras que otros niños si aceptan la
oferta; con ello, la aleatorización no se cumple completamente.
Con lo indicado, los que ganan el cupo se llamarán winners y los que no ganan son los lusers.
Mientras que, los parcial compliers son los que no respetaron la aleatorización, por lo tanto, el
experimento se contaminó y tendría un sesgo por selección.
Las estimaciones de IV capturan los efectos causales en el tipo de niño que se inscribe en el
programa cuando se le ofrece un puesto en una lotería, pero no lograría ingresar de otra manera.
Este grupo se conoce como cumplidores de lotería. La asignación aleatoria de la oferta debe
equilibrar las características demográficas de los solicitantes a los que se les ofreció y no se les
ofrecieron puestos.
Dado que la inscripción no se asigna al azar, las diferencias entre los estudiantes inscritos y los no
inscriptos pueden reflejar un sesgo de selección: los ganadores de lotería que eligen ir a otro lugar
pueden preocuparse menos por la escuela que aquellos que aceptaron participar en el programa.
Instrumento: es la asignación aleatoria original (no es la asistencia real).
Di= es la variable de asistencia real (de todos los postulantes, quienes fueron a una institución
privada y quienes no).
D=1 si se matriculó en una escuela privada.
D=0 si no se matriculó
Zi= 1 winners si ganaron el sorteo y tendrán beca
Zi= 0 Losers, si no ganaron el sorteo y no tendrán beca.

 Si no existió bastante contaminación, voy a tener bastante capacidad predictiva (Aquí el


instrumento será fuerte).
 Si existió mucha contaminación, el instrumento será débil.

Si el instrumento es la oferta de tratamiento de asignación aleatoria, LATE es el efecto del


tratamiento en aquellos que cumplen con la oferta pero no son tratados de otra manera.
La forma reducida (Reduce form): Me indica el efecto causal de la oferta de tratamiento. Es
decir, haberles ofertado el tratamiento (se calcula a través de la forma reducida). En el ejemplo es la
relación entre los logros académicos y la asignación aleatoria inicial. Esta es el intento de
tratamiento “intent to treat” (ITT).
ITT: es el efecto causal de la oferta de tratamiento, debido al hecho de que muchos de los elegidos
se han negado a participar.
La Primera Etapa (Local average treatment Efect- LATE): me da el efecto local, es decir, me
da el impacto en aquellos que asistieron a la escuela privada porque ganaron la lotería y en aquellos
que no asistieron a la escuela privada porque perdieron la lotería, es decir, en los cumplidores
(compliers), que serían los que no se contaminaron.
LATE=ITT/First Stage
Cuando se corre la primera etapa, es decir, (Di) en función de (Zi). Al calcular (Di) estimado, lo que
se hace es depurar la contaminación. Quita los contaminados y deja los cumplidores (compliers).
Estos son los que se matricularon por ser ganadores (tratamiento) y no se matricularon por ser
perdedores (control), ambos fueron asignados aleatoriamente.
Sobre los dos indicados, se da la estimación en dos etapas, lo que es conocido como Local Average
Treatment Efect (LATE).
En resumen, con lo mencionado, se tendrá tres regresiones:
1. Primera Etapa: Permite ver la relación entre la asignación aleatoria y la matrícula en
un colegio privado.
2. Forma Reducida: Relación entre la asignación aleatoria (es decir, oferta del cupo
versus los logros académicos). Esto es el Intent to treat (ITT).
3. Estimador en dos etapas (2SLS): es la relación entre la forma reducida y el first stage
(primera etapa). Esto permite ver el impacto solo en los compliers (Impacto local).

REQUISITOS DEL INSTRUMENTO


1. Que tenga un efecto grande predictivo de la variable endógena (en este caso es la
variable de tratamiento, este efecto causal se llama first stage).
2. Que el instrumento sea “as good as randomly assigned”, es decir, que sea tan bueno, como
si hubiera sido asignado al azar. Por tanto, no debería estar correlacionado con los errores.
Esto se conoce como Independence assumption (Ziee=0)
3. Exclusion Restriction: la restricción de exclusión describe un solo canal a través del cual el
instrumento afecta los resultados. En el caso del ejemplo planteado, el único canal a través
del cual, el instrumento afecta a los logros académicos, es mediante la participación de la
matrícula o no en el colegio privado.
4. Independencia + restricción de exclusión = exogeneidad del instrumento (instrumento
bueno). Cabe indicar, que sea exógeno, cumple dos cosas: que cumple con el supuesto de
independencia y que cumple con el supuesto de exclusion restriction.
5. Monotonocidad (Monotonocity): D i (1)≥ D i (0) Todos los afectados por el instrumento se
ven afectados de la misma manera. Esto quiere decir que el efecto de la aleatorización
siempre afecta la participación en un solo sentido, lo que significa que no existen (defaiers).
Por tanto, la variable de instrumento afectará a la variable de participación (Di) en sentido
positivo.
VI: LA CADENA DE IMPACTO
Ejemplo:
Si se quiere ver el efecto de matricularse en un colegio privado en los logros académicos, esto se
vería en la cadena de impacto:
1. Estaría dado primero por el efecto de la oferta (se ganó una beca).
2. Luego el efecto de que en realidad los individuos fueron a la escuela privada.
3. Luego, cómo eso afecta en los logros académicos.
Efecto de las ofertas en los puntajes = ({Efecto de las ofertas en la asistencia} x {Efecto de la
asistencia en los puntajes})
Al reorganizar el efecto causal de la asistencia a KIPP es:
Forma Reducida
Efecto de la matrícula en escuela privada en logros=
{Efecto de la oferta en loslogros } Primera Etapa
{Ef ecto de laoferta en la participaci ó n }
Con la fórmula anterior, queda claro que el impacto final es el ratio entre Reduce Form y First
Stage. Se supone que las ofertas de KIPP afectan los puntajes de las pruebas solo a través de la
asistencia de KIPP.

FIRST STAGE AND REDUCED FORM:

 El vínculo del instrumento con la variable causal de interés (el efecto de la oferta aleatoria
en la participación en el programa) se llama primera etapa, porque este es el primer eslabón
de la cadena.
 El efecto directo del instrumento sobre los resultados, que abarca toda la cadena (el efecto
de la oferta aleatoria en la variable de resultado), se denomina forma reducida.
 Finalmente, el efecto causal de interés –el segundo eslabón de la cadena- está determinado
por la relación entre la forma reducida y las estimaciones de la primera etapa.
 Este efecto causal se denomina efecto de tratamiento promedio local (LATE).
LATE:
REDUCED FORM
LATE ( IV )=
FIRST STAGE
1. First Stage: Es la relación entre el instrumento y la participación en el programa
E[Di|Zi=1] - E[Di|Zi=0], call this π 21.
2. Reduce Form: Es la relación entre el instrumento y la variable de resultado.
E[Yi|Zi=1] - E[Yi|Zi=0], call this π 11.
3. Local Average Treatment – Efecto local de tratamiento (LATE): es el efecto causal
promedio para aquellos cuya participación en el programa está determinado únicamente por
la asignación aleatoria.

π 21 E [Yi∨Zi=1]−E [Yi∨Zi=0]
ρ= =
π 11 E [D i∨Zi=1]−E [D i∨Zi=0]
Ejemplo: En variables instrumentales se tendrá los siguientes casos:
Zi=0 Si no ganaron la lotería.
Zi=1 Si ganaron la lotería.
Di=0 Si no participa
Di=1 Si participa

Mi estimador de variables instrumentales solo dará el impacto en


los compliers

Perdedores de la Lotería (Zi=0)


 

No participan Participan
(Di=0) (Di=1)

No Never-takers: los que nunca Defiers: no existen en realidad y si


Participan participan, hayan o no ganado la existen no cumplirían el requisito de
(Di=0) lotería (contaminados) Monotonocity (hacen lo contrario).

Ganadores de la
lotería
Zi=1 Compliers: participaron en el
Always-takers: Siempre participan,
programa porque ganaron la lotería y
Participan pierden la lotería, pero se buscan la
no participaron en el programa,
(Di=1) manera de participar del programa
porque perdieron la lotería (no
(contaminados)
contaminados)

COMPLIERS, ALWAYS AND NEVER TAKERS, AND DEFIERS


LATE: es el impacto promedio en los cumplidores
LATE: no dice nada sobre los que siempre participan y los que nunca participan. Porque su
participación en el programa no está afectando al instrumento. Es decir, es la parte (T) que se
contaminó.
Para quienes toman y nunca toman, ganen o pierdan, su elección de escuela no cambia (su
participación en el programa no se ve afectada por el instrumento).
Defiers: hacen lo contrario y está relacionado con monotonicidad.
VI CON RESULTADOS POTENCIALES HETEROGÉNEOS
Se tendrá efectos diferenciados por diferentes categorías de compliers:

Di=D0 i + ( D1 i−D 0i ) Z i=π 0+ π 1i Z i +ξ i

π 1 i Es el efecto heterogeneo causal del instrument en (Di). El efecto causal promedio de (Zi) sobre
(Di) es E[ π 1 i ¿ .

Este es mi primera etapa, el efecto de la (Zi) en el tratamiento.


SUPUESTO DE INDEPENDENCIA
El instrumento es exógeno, es independiente de los errores, es tan bueno como asignado al azar y es
independiente de los resultados potenciales:

• [ {Y i ( d , z ) ; ∀ d , z }, D 1 i , D 0 i ]⊥ Z i

Este supuesto de independencia permite ver el efecto causal de la forma reducida. Es decir, de la
(Zi) en las (Yi), esto es lo que se conoce como Intent to treat (ITT). También permite ver el efecto
causal de (Zi) en (Di) (First Stage).
RESTRICCIÓN DE EXCLUSIÓN (EXCLUSION RESTRICTION)
El instrumento opera a través de un único canal conocido:
• Yi(d,0) = Yi(d,1) for d = 0,1.
Cualquier impacto en (Yi) se debe a (Di) de (Zi) y no está correlacionado con los errores E[Z ini]=0.
Escrito en términos de posibles resultados:
• Yi= Y0i+(Y1i-Y0i)Di
(Yi) depende de (Di) y no de (Zi)
Y i=α 0 + ρi Di+ ηi
SUPUESTO DE MONOTONICIDAD:
Si bien el instrumento puede no tener efecto en algunas personas, todos los afectados, se ven
afectados de la misma manera.

• D1 i ≥ D 0 i or D0 i ≤ D1 i for all i.
Sin monotonicidad, no se garantiza que los estimadores IV estimen un promedio ponderado de
los efectos individuales subyacentes, Y1i – Y0i.
TEOREMA DE LATE:
Dados los supuestos de exclusion restriction, independencia del instrumento y los posibles
resultados (potencial outcomes), la existencia de una fuerte first stage y monotonicity; el estimador
de Wald puede interpretarse como el efecto del tratamiento en aquellos cuyo estado puede ser
modificado por el instrumento (LATE).
Deberá cumplir los siguientes supuestos:

1. Independencia: {Y i ( D 1 i ,1 ) , ( D 0 i , 0 ) , D 1 i , D0 i }⊥ Zi ;
2. Exclusión: Y i ( d ,0 )=Y i ( d , 1 ) ≡Y di for d=0,1;
3. First Stage: E [D 1 i−D 0 i ]≠ 0
4. Monotonicity: D 1 i−D0 i ≥0 ∀ i o viceversa;

E [Y i|Z i=1 ] −E [ Y i|Z i=0 ]


Luego: = E [Y 1 i−Y 0 i∨D 1i > D 0 i ]
E [ D i|Z i=1 ] −E [ D i|Z i=0 ]

= E [ρi ∨π i >0 ]
CASOS ESPECIALES:
Puede decirme algo sobre los always takers y never takers, cuando todos por el tratamiento fueron
tratados.
Es decir, la contaminación solo se dio en el grupo de control. Ahí el estimador está dando el efecto
de tratamiento en aquellos que fueron tratados y no tratados con el instrumento

 Di(0)=0 cuando no se trata a nadie del grupo de comparación. En este caso, la estimación
de Wald es el efecto del tratamiento sobre el tratado (ATT).
 Di(1)=1 cuando todos los miembros del grupo de tratamiento reciben tratamiento. Esto
sería a menudo cierto en los diseños de sobresuscripción, donde los solicitantes
seleccionados son escogidos de una lista y se les ofrece tratamiento. En este caso, la
estimación de Wald identifica el efecto del tratamiento en aquellos que no serían tratados
sin estímulo.
CUESTIONES DE INFERENCIA:

 Es el estimador de mínimos cuadrados (OLS) es insesgado y consistente.


 El estimador en 2 etapas (2SLS) es consistente pero es sesgado.
Significa que en largas muestras es insesgado, pero en pequeñas muestras va a ser sesgado. La
ventaja es que en evaluación de impacto, siempre se trabaja con muestras largas.
Hay dos características que debe cumplir un instrumento:
1. Que el instrumento sea válido: que sea exógeno, un instrumento es válido cuando esta
correlacionado con los errores de la ecuación original; esto significa que no se resolvió la
endogeneidad, por lo que se tendrá estimadores sesgados e inconsistentes. Es decir, que si
se va a trabajar con un instrumento endógeno, es mejor quedarse con el primer estimador
(por mínimos cuadrados ordinarios).
2. Instrumentos Débiles: son aquellos cuya correlación con la variable endógena es débil, no
es fuerte y en ese caso se puede generar instrumentos con inferencia.
PROBLEMAS DE INFERENCIA:
La fuente del sesgo en el estimador de dos etapas (2SLS) está en la primera etapa. La primera etapa
depura a la variable endógena.
Cuando tengo un instrumento débil, es decir, que no tiene una primera etapa fuerte. El sesgo está
centrado en el sesgo inicial, porque mi instrumento no me está prediciendo nada, por tanto no
mejora.
Entonces, cuando la primera etapa no es fuerte, el estimador en dos etapas (2SLS) va a mantener el
mismo sesgo que tenía en (OLS).
Por otro lado, el estimador en segunda etapa se desvanece cuando el (F) de la primera etapa es
largo, es decir: F>10

En variables instrumentales hay que ver que en la primera etapa (F) sea mayor a
10

EL SESGO DE LA MUESTRA FINITA EN EL (2SLS):


Bias ( β 21 SLS ) l
OLS
≈ 2
Bias ( β 1 ) n R
Mientras más instrumentos tenga, más probabilidad de tener sesgo. El sesgo se reduce a medida que
tenga una muestra más grande.
Regla de oro: mientras el denominador (nR2) sea mayor que el número de instrumentos, el sesgo en
mi segunda etapa (es decir, el 2SLS va a ser menor que el estimador OLS), esto es mejor.
Mientras menos instrumentos se tengan, es mejor, porque se tiene menos probabilidad de sesgo.
RESUMEN:
Todo estudio de Variables Instrumentales debe tomar en cuenta lo siguiente:
1. Debe mostrar la primera etapa: el coeficiente debe decir que es significativo, pero, también
tomar en cuenta la magnitud del coeficiente. Se debe ver el error estándar (que el
coeficiente sea significativo).
2. Reportar el estadístico (F) de la primera etapa F>10. Esto nos pone en la zona de un
instrumento fuerte. Si no se reporta el estadístico (F), puede ser que el instrumento no fue
fuerte y por eso no se reportó.
3. Es importante trabajar con el mejor instrumento.
4. Es importante reportar el Reduced Form (OLS): se debe ver la relación entre el instrumento
y la variable de resultado. Si no encuentro relación entre reduced form y la variable de
resultado, es bien raro que luego encuentre en el estimador de dos etapas (2SLS) un
impacto.
Luego se hace reportar el estimador de doble etapa y compararlo con el estimador (OLS).
El coeficiente va a cambiar porque OLS es insesgado, pero los errores estándar del
estimador de segunda etapa van a ser más grandes que los estimadores de la (OLS), porque
el estimador en dos etapas es sesgado. Esto dará una magnitud del sesgo y también una idea
de los errores estándar y de la eficiencia de los estimadores de segunda etapa, si el error
estándar se dispara exageradamente, es que se tiene algún problema con la estimación.
Por ello, se deberá revisar qué está pasando con el vector de variables (Xi), dado que no
estaría asegurando una eficiencia que se esperaría con los estimadores de doble etapa.

También podría gustarte