0% encontró este documento útil (0 votos)
3 vistas20 páginas

Modelos Logit Probit

El documento presenta una clase práctica sobre modelos de riesgo de crédito utilizando Stata, abarcando desde la interfaz del usuario hasta la implementación de modelos de regresión lineal y logística. Se discuten conceptos clave como la gestión del cut-off, la matriz de confusión, y la interpretación de resultados, así como las diferencias entre modelos lineales y no lineales. Además, se enfatiza la importancia de la sensibilidad y especificidad en la clasificación de buenos y malos pagadores.

Cargado por

Matias Caro
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas20 páginas

Modelos Logit Probit

El documento presenta una clase práctica sobre modelos de riesgo de crédito utilizando Stata, abarcando desde la interfaz del usuario hasta la implementación de modelos de regresión lineal y logística. Se discuten conceptos clave como la gestión del cut-off, la matriz de confusión, y la interpretación de resultados, así como las diferencias entre modelos lineales y no lineales. Además, se enfatiza la importancia de la sensibilidad y especificidad en la clasificación de buenos y malos pagadores.

Cargado por

Matias Caro
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Clase práctica:

Modelos de Riesgo de Crédito


con Stata
1-6-16
Stata: Interfaz del usuario
BOTÓN DATA EDITOR • Data editor: nos permite visualizar y
editar cada una de las variables y el • Variables: ventana con
valor que estas toman en cada las variables (y sus
registro. etiquetas) de la base.
✓ Con doble clic las
llamamos en la
ventana de
• Review: historial de
comandos.
comandos. Nos será útil
para replicar comandos
• Propiedades: ventana
que indicamos
con propiedades de las
anteriormente.
variables (tipo de
almacenamiento,
formato, etc).
• Command: ventana donde indicaremos los comandos al Stata. ✓ Botón lock/unlock
nos permite
editar.
Mostrar importación .xls
Abrir base .dta

Comandos básicos y de estadística


descriptiva
• generate
• drop
• clear
• describe (tipo variable base)
• sum (estadística descriptiva)
• sum , detail
✓ Tendencia central (media-mediana),
variabilidad, forma (curtosis y asimetría) Para detalles escritos ver guía.
• histogram o graphics histogram (, normal)
• tab (frecuencia -acumulada-)
Distribución de los buenos y malos
pagadores y gestión del Cut-off

MALOS BUENOS

SCORE BANCARIO

ETI ETII

CUT-OFF
Matriz de confusión
Realidad

Malo (+) Bueno (-)

Malo (+) ETI


Modelo
Bueno (-) ETII

• ETI implica que mi modelo afirma que el sujeto va a defaultear cuando en


verdad este era un buen pagador.
• Por lo tanto, me pierdo de otorgarle crédito y no poseo el rendimiento en intereses.
• ETII implica que mi modelo afirma que el sujeto es un buen pagador cuando en verdad va a
defaultear.
• Por ende, al otorgarle el crédito pierdo el capital. No considero como pérdida el rendimiento.
La gestión del Cut-off
• Si aumento el cut-off me aseguraré de tener más buenos pagadores (menos pérdidas por incobrables
que no devuelven el capital), pero aumentaré la cantidad de individuos que caen dentro del ETI.
• Menos colocaciones en volumen, menor incobrabilidad. La ganancia operativa contable de las carteras mejora
porque esta solo capta la mejoría en una menor incobrabilidad, no considera "el rendimiento en intereses que
me perdí por los créditos que no di" (ET1).
• En el overall, con la caída de las colocaciones la ganancia en el balance podría caer.
• Si reduzco el cut-off otorgaré más préstamos a aquellos individuos que mi modelo decía que eran
malos pagadores cuando en verdad eran buenos (cae el ET1), pero también mi modelo cometerá una
mayor cantidad de ETII.
• Mayores colocaciones en volumen, mayor incobrabilidad. La ganancia operativa contable de la cartera se ve
desmejorada por la mayor cantidad de ETII, y no muestra mejorías "adicionales" respecto a los nuevos buenos
pagadores incorporados, ya que estaba previsto que estos cancelaran sus deudas.
• Sin embargo, la ganancia en el balance podría aumentar dado el mayor volumen de colocaciones.
El resultado final en el balance dependerá del efecto que pondere más en cada caso.
En Estadística controlabamos el ETI, aquí dependerá de una decisión de gestión.
Si hay mucha liquidez quizás el banco prefiere aumentar las colocaciones aunque tenga que exponerse
a una mayor tasa de incobrabilidad; y viceversa. Vinculándolo con la fijación de la tasa de transferencia
bancaria: si el ALM le está exigiendo una tasa de transferencia pasiva muy baja implica que habría
condiciones de liquidez para reducir el cut-off; y viceversa.
Modelo de Regresión Lineal
“reg d age score embargos impagos veraz old disp”
Interpretación lineal de los coeficientes.
• Regla de decisión test de significatividad: si el p-valor (P>|t|) es menor o igual a 0,05 entonces el regresor es significativo para explicar la variable
dependiente
Solo quedan significativas “impagos disp, cons”.
Mostrar interpretación signo variables, más allá significatividad: fem (-), veraz (-) y mostrar por qué: “tab d veraz”.
• Desventajas de trabajar con MLP:
• Las funciones lineales implican una relación constante entre las variaciones en los regresores y su impacto sobre variable explicada.
• Podemos pensar que esta relación no necesariamente se cumple para ciertas variables. Ejemplo: edad. En los hechos “la edad no es proporcional a la probabilidad de
default”. Conclusión: repensar la forma en la que se modeliza.
• Podríamos pensar en una interpretación cuadrática (agesq por ejemplo). Sin embargo tampoco es significativa, y dada la homogeneidad relativa en edad de la cartera
quizás sí es adecuado el MLP.
• La perturbación aleatoria puede no seguir una distribución Normal. Al tratarse de una distribución dicotómica (default o no). Perdemos propiedades
estadísticas para tests que queramos realizar.
“predict default, xb” para obtener una predicción (de acuerdo al modelo ex-ante indicado) lineal. Se realizará de acuerdo al MLP y con todas las variables
de la cartera. Quedará almacenada como una nueva variable.
“summ default” para visualizar la probabilidad de default de la cartera.
Va ri able | Obs Mea n Std. Dev. Mi n Ma x
-------------+--------------------------------------------------------
defa ult | 189 .1481481 .0594092 -.0965676 .2666186

• Diferencias entre la estimación del modelo econométrico y el true: observar data editor.
• Corregir: “replace default =0 if default <0”
Modelo de probabilidad no lineal
• Dados los problemas del MLP utilizaremos modelos que sitúen a la variable explicada en el rango [0;1].
• Las funciones de distribución nos permiten realizar esto, al ser funciones continuas que toman valores en ese rango.

• Los modelos Logit y Probit son modelos de regresión no lineal, donde la variable explicada es una función particular que
arrojará valores entre [0 y 1] dados los parámetros y las variables explicativas.
• Estos últimos (la constante y los coeficientes multiplicados por las variables explicativas) entran en una función de
distribución de probabilidad. Así arrojarán una relación no lineal (entre explicativas y explicada) donde se observa que
hay leves incrementos en los extremos y mayores en la parte central. Con los valores de z me acerco “más lento” a los
extremos.

Fc de distribución Fc de distribución
Logit Probit
Modelo de regresión logística
• Interpretación de los parámetros estimados: el signo de los mismos
indica la dirección en que se mueve la probabilidad cuando aumenta
la variable explicativa correspondiente.
• Sin embargo, la cuantía del parámetro no coincide con la magnitud de la
variación en la probabilidad (como si ocurría en el MLP).
• Al suponer una relación no lineal entre las variables explicativas y la
probabilidad de ocurrencia del acontecimiento, cuando aumenta en
una unidad la variable explicativa los incrementos en la probabilidad
no son siempre iguales ya que dependen del nivel original de la
misma.
Modelo de regresión logística
• “logit d fem impagos disp” (SIGNOS) v.s.
• Ser de género femenino (variable dicotómica) disminuye la probabilidad de
default.
• Tener cuotas impagas aumenta la probabilidad de default.
• “logistic d fem impagos disp” (ODDS-RATIO)
• Dividiendo 1 por el odds-ratio<1 (1/0,37), restando 1 y multiplicando por 100
para expresarlo en porcentaje resulta que: siendo mujer (en vez de hombre)
tengo 170% más probabilidades de no defaultear que de defaultear.
• Restando 1 al odss-ratio y multiplicando por 100 para expresarlo en
porcentaje obtengo que: con una cuota impaga adicional (respecto a las
actuales) aumenta mi probabilidad de defaultear en 134,51% respecto las de
no defaultear.
*La interpretación de estos coeficientes se da cuando las variables se encuentran en su valor medio.
Modelo de regresión logística
“predict defaultlogit, pr” para generar la variable de predicción de default de toda
la cartera bajo el modelo logit.
“sum defaultlogit” para observar los resultados:
Variable | Obs Mean Std. Dev. Min Max
-------------+--------------------------------------------------------
defaultlogit | 189 .1481482 .1382439 .0087283 .7948883

Respecto a la predicción a la que llegamos con el MLP se observa que


Modelo de regresión logística
“estat ic”: obtendremos tanto el AIC como el BIC, que son medidas de
la calidad relativa de un modelo respecto a un conjunto determinado
de datos.
Akaike's information criterion and Bayesian information criterion
-----------------------------------------------------------------------------
Model | Obs ll(null) ll(model) df AIC BIC
-------------+---------------------------------------------------------------
. | 189 -79.28236 -66.78924 4 141.5785 154.5455
-----------------------------------------------------------------------------

Regla de decisión: a menor magnitud del criterio mejor la calidad del


modelo. Priorizaremos el uso del BIC.
Modelo de regresión logística
“estat clas” --------------------------------------------------
-------- True -------- Obtuvimos la matriz de confusión.
Classified | D ~D | Total • Se rechazaron 3 malos y 3 buenos (ETI). Se aceptaron 24
-----------+--------------------------+----------- malos (ETII) y 158 buenos.
+ | 4 3 | 7 • La sensibilidad, entendida como la potencia de mi modelo
- | 24 158 | 182 para identificar defaulteadores, fue casi del 15%.
-----------+--------------------------+----------- • La especificidad, entendida como la potencia de mi
modelo para identificar buenos pagadores que cancelaron
Total | 28 161 | 189 sus deudas, fue casi del 98%.
• De todos los casos clasificados, la precisión de mi modelo,
Classified + if predicted Pr(D) >= .5 es decir, la proporción de los casos correctamente
clasificados (donde no se cometió ETI ni ETII), fue de casi
True D defined as d != 0 del 85%
-------------------------------------------------- Quisiera mejorar tanto la sensibilidad como la especificidad
Sensitivity Pr( +| D) 14.29% pero existe un trade-off, aquel observado en el cut-off dada
la distribución de los buenos y malos pagadores respecto a su
Specificity Pr( -|~D) 98.14% score bancario. Realidad
-------------------------------------------------- Malo (+) Bueno (-)
Malo (+) a b
Modelo
Correctly classified 85.71% Bueno (-) c d
Especificidad Exactitud/Correcta
Sensitividad clasificación
a/(a+c) d/(b+d) (a+d)/(a+b+c+d)
Modelo de regresión logística
• “Cuantifique del ETI y ETII si la cartera posee un promedio por cliente
de $100.000 otorgados a una TEA del 58%”.
• ETI: dijimos que era inobservable a nivel contable (“no registro el rendimiento
en créditos que no coloqué”).
• ETII: dijimos que dado que el banco perdía a lo sumo el capital entregado (de
no haber colateral –garantía- que liquidar) el cálculo equivaldrá a: la cantidad
de clientes que cayeron en zona de ETII (24) por las colocaciones otorgadas
irrecuperables ($100 mil), en total $2 millones 400 mil.
Modelo de regresión logística
“estat class, cutoff(0.25)” Sensitivity Pr( +| D) 35.71%
Specificity Pr( -|~D) 86.96%
-------- True -------- --------------------------------------------------
Classified | D ~D | Total Correctly classified 79.37%
-----------+--------------------------+----------- --------------------------------------------------
+ | 10 21 | 31 • Al ubicar el cut-off en una posición más
- | 18 140 | 158 exigente se observa que:
• La sensibilidad de mi modelo aumenta.
-----------+--------------------------+----------- Identifico más defaulteadores que antes.
Total | 28 161 | 189 • La especificidad de mi modelo disminuye.
Dejo de otorgar créditos a buenos pagadores
que cancelarían sus deudas.
Classified + if predicted Pr(D) >= .25
--------------------------------------------------
Modelo de regresión logística
“lroc” para graficar la curva ROC. • Idealmente querría que mi curva se encuentre lo más cercana al
extremo superior izquierdo (donde minimizo el ETI en el eje x, y el
(1;1) donde el ETII en el eje y). Lo que coincide con un mayor poder predictivo.
cut-off es 1.
• Esto implica una mayor curvatura y una mayor área cubierta.

• Por el contrario, cuanto más cerca de la línea de 45° peor es mi


Potencia de mi modelo para

modelo.
identificar defaulteadores

• El criterio para aceptar un modelo es que el AUROC sea mayor a 0,8.


• “Quiero reducir del 50% al 25% los malos pagadores aceptados
(ETI)”. Reduzco el cut-off para dejar menos buenos pagadores
afuera, pero mi costo de oportunidad es pasar de una sensibilidad
cercana a 0,9 a una de 0,45. Es decir, soy menos exigente y termino
por aumentar notoriamente el ETII.
• Puede observarse que sería estratégico aprovechar las zonas
verticales u horizontales de acuerdo para ciertos cut-off.

(0;0) donde el cut-off es 0. “No


me equivoco rechazando
ETI
buenos pagadores pero termino
aceptando a todos los
defaulteadores también”.
Modelo de regresión logística
“prchange”
• El Stata nos mostrará qué impacto tiene en la probabilidad
predecida al pasar del mínimo valor de una variable al máximo.
logit: Changes in Predicted Probabilities for d • También observamos una columna que tiene un sentido
interpretativo para variables dicotómicas (de 0 a 1).
min->max 0->1 -+1/2 -+sd/2 MargEfct • Luego se detalla un cambio unitario (el rango +-1/2) y el de un
desvío estándar. Además se dispondrá el efecto marginal, que
fem -0.1192 -0.1192 -0.0961 -0.0385 -0.0945 puede interpretarse como una derivada cuando todos los
valores se encuentran en su media.
impagos 0.4736 0.0996 0.0821 0.0401 0.0810
• Adicionalmente, se indica la probabilidad de default de toda la
disp -0.5646 -0.0002 -0.0001 -0.0765 -0.0001 cartera cuando todas las variables se encuentren en su valor
medio.
0 1 • Más abajo se nos recuerda cuáles eran los valores medios de
los regresores utilizados en el modelo y sus respectivos desvíos
Pr(y|x) 0.8936 0.1064 estándar.
• Si deseamos conocer numéricamente cuáles son los valores de
los puntos de inicio de las variables y los valores hacia donde
fem impagos disp estas están cambiando podemos agregar en la sintaxis del
comando la indicación “, fromto”.
x= .793651 .195767 2944.29
sd(x)= .405759 .493342 729.016
Modelo de regresión logística
“prvalue, x(age) rest(mean)”
• De no adicionar nada obtendremos la parte de la información que nos
brinda prchange en relación a la probabilidad de riesgo de default de toda
la cartera.
• Pero lo interesante de este comando es la potencialidad que tiene para
permitirnos obtener la probabilidad de default para los valores puntuales
que queramos indicarle al modelo.
“prvalue, x(fem=1 disp=2000)”
En este caso estaríamos indicando que deseamos conocer la probabilidad de
default de un cliente femenino que posee un sueldo disponible de dos mil
pesos. Respecto a la variable de cuotas impagas, si omitimos especificar un
valor Stata la ubicará en su valor medio para mostrarnos el resultado final.
Modelo de regresión logística
“lsens” • Este comando grafica más claramente
el trade-off entre la sensitividad y
especificidad (en el eje y) respecto a
la probabilidad del cutoff (en el eje x).
• Equivale gráficamente a lo que
obtendríamos de aplicar “estat class”
(matriz de confusión) si fueramos
variando la probabilidad del cutoff de
0 a 1.
• Con “lsens” el banco podría
dimensionar gráficamente cuál es el
cutoff óptimo en ese determinado
contexto y luego revisarlo
cuantitativamente con “estat class”.
Modelo de regresión logística
“probit d age fem impagos disp”.

• En este modelo no poseo el odds-ratio para realizar una


interpretación lineal. Solo podemos interpretar los signos.
• Sí puedo utilizar “prchange” y “prchange, fromto” para realizar una
interpretación más exhaustiva.
• “predict probit, pr” + “sum probit” me permite conocer la
probabilidad de default de toda la cartera.
• Pueden compararse los criterios de información del Logit y Probit.
También las AUROC.

También podría gustarte