0% encontró este documento útil (0 votos)
6 vistas240 páginas

Modelos de Regresión en Credit Scoring

El documento aborda modelos multivariantes aplicados a la evaluación de riesgo crediticio, incluyendo regresión logit, redes neuronales y técnicas de puntuación. Se destaca la regresión lineal simple como una herramienta fundamental para entender la relación entre variables, aunque su uso en credit scoring presenta limitaciones debido a la naturaleza binaria de los resultados. También se discuten conceptos como la matriz de varianzas y covarianzas, así como el coeficiente de correlación de Pearson para evaluar relaciones entre variables.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
6 vistas240 páginas

Modelos de Regresión en Credit Scoring

El documento aborda modelos multivariantes aplicados a la evaluación de riesgo crediticio, incluyendo regresión logit, redes neuronales y técnicas de puntuación. Se destaca la regresión lineal simple como una herramienta fundamental para entender la relación entre variables, aunque su uso en credit scoring presenta limitaciones debido a la naturaleza binaria de los resultados. También se discuten conceptos como la matriz de varianzas y covarianzas, así como el coeficiente de correlación de Pearson para evaluar relaciones entre variables.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Análisis Mul*variado

Temario 2

MODELOS MULTIVARIANTES

· Regresión Logit
· Regresión Piecewise
· Redes Neuronales
· Algoritmos GenéCcos
· Modelos de supervivencia y default Cme.

DESARROLLO DEL SCORECARD

· Tarjeta de Puntuación
· Técnicas de Reject Inference

EJERCICIOS:

· Regresión Piecewise New


· EsCmación del Scorecard
El modelo
de
regresión
lineal
simple

3
Introducción
• En el ámbito de la evaluación de riesgo crediticio (credit scoring),
es fundamental contar con herramientas que permitan relacionar
de manera cuantitativa los factores que influyen en la
probabilidad de incumplimiento de pago por parte de un cliente.
• La regresión lineal simple (RLS) es un punto de partida clave, ya
que permite analizar cómo una variable dependiente (Y), como el
monto de un crédito o la probabilidad de pago, se relaciona con
una variable independiente (X), como el ingreso del cliente o su
historial crediticio.
• Aunque la regresión lineal no siempre es suficiente para
problemas que involucran resultados binarios (como "paga/no
paga"), sirve como una base intuitiva para entender modelos más
avanzados, como la regresión logística, que se utiliza
específicamente en problemas de clasificación como el credit
scoring.

4
¿Qué es el modelo de regresión
lineal simple (RLS)?
• El modelo de regresión lineal simple es una
herramienta estadís4ca que permite:
1. Evaluar relaciones causales: Determina si un
cambio en una variable independiente (X) afecta
de manera sistemá4ca a una variable
dependiente (Y).
2. Hacer predicciones: Calcula valores esperados de
Y en función de valores conocidos de X.
3. Controlar efectos: Aísla el efecto directo de X
sobre Y, suponiendo que no hay otras influencias
significa4vas fuera del término de error (U).
5
¿Qué es el modelo de regresión
lineal simple (RLS)?
• El modelo (ene la siguiente forma matemá(ca:
𝑌 = 𝛽! + 𝛽"𝑋 + 𝑈
Donde:
• Y: Es la variable dependiente que queremos explicar o
predecir. Ejemplo: el monto pagado o la probabilidad de
cumplimiento.
• X: Es la variable independiente que creemos afecta a Y.
Ejemplo: el ingreso mensual del cliente.
• 𝛽! : Es la constante, que representa el valor esperado de Y
cuando X=0.
• 𝛽" : Es la pendiente, que mide el cambio en Y por cada
unidad de cambio en X. Se interpreta como el efecto
marginal de X sobre Y.

6
¿Cómo interpretamos los
coeficientes?
[Link] (𝛽! ): Es el valor de Y cuando X=0. En
términos prác4cos, indica el punto de par4da del
modelo.
1. Ejemplo: Si X representa el ingreso, 𝛽! podría
interpretarse como el monto mínimo esperado en
ausencia de ingreso (aunque este valor no siempre es
realista).
[Link] (𝛽" ): Indica cuánto se espera que
cambie Y por cada unidad adicional de X,
manteniendo todo lo demás constante.
1. Ejemplo: Si 𝛽! = 0.5 y X aumenta en 1, Y aumentará en
0.5 unidades.

7
¿Para qué se usa en credit
scoring?
• En el contexto de credit scoring, podemos usar la RLS para
entender y predecir:
• ¿Cómo cambia la probabilidad de pago de un cliente (Y) cuando
su ingreso mensual (X) aumenta o disminuye?
• ¿Qué factores Oenen mayor impacto en el riesgo crediOcio?
• Sin embargo, hay limitaciones importantes:
1. Y en credit scoring suele ser binario (paga/no paga), y la RLS no
está diseñada para manejar este Opo de datos. Esto introduce
problemas de predicción y mal ajuste del modelo.
2. No restringe los valores de Y al rango entre 0 y 1, lo cual es
necesario para interpretar probabilidades.
• Estas limitaciones conducen a la necesidad de usar regresión
logís9ca, que es una extensión más adecuada para problemas de
clasificación como el credit scoring.

8
Supuestos del Modelo de
Regresión Lineal Simple
Supuesto 1. Linealidad de los parámetros
• El modelo poblacional puede expresarse como
𝑌 = 𝛽# + 𝛽! 𝑋! + 𝛽" 𝑋" + ⋯ + 𝛽$ 𝑋$ + 𝑈
donde 𝛽#, 𝛽!, 𝛽", … , 𝛽$ son los parámetros (constantes)
desconocidos de interés y u es un error aleatorio o
término de perturbación no observable.
Supuesto 2. Muestreo aleatorio
• Se cuenta con una muestra aleatoria de tamaño n,
𝑥% , 𝑦% : 𝑖 = 1, 2, … , 𝑛 que sigue el modelo
poblacional de la ecuación.
9
10
Supuestos del Modelo de
Regresión Lineal Simple
Supuesto 3. Variación muestral de la variable
explica4va
• No todos los valores muestrales de x, a saber {xi, i
1, …, n}, son iguales, es decir, no todos 4enen el
mismo valor.
Supuesto 4. Media condicional cero
• Para todo valor de la variable explica4va, el valor
esperado del error u es cero. Es decir,
𝑢 |𝑋 = 0

11
Teorema. Insesgamiento de los
esCmadores de MCO
• Empleando los supuestos 1 a 4,
𝐸 𝛽5# = 𝛽# y 𝐸 𝛽5! = 𝛽!
para cualquier valor de 𝛽# y 𝛽! . Es decir, 𝛽5# es un
es4mador insesgado de 𝛽# y 𝛽5! es un es4mador
insesgado de 𝛽!
• El insesgamiento es una propiedad de las
distribuciones muestrales de 𝛽5# y 𝛽5! .
• Se espera que, si la muestra es de alguna manera
“representa4va”, la es4mación deberá estar “cerca”
del valor poblacional.

12
La Matriz de varianzas y
covarianzas
La matriz de varianzas y covarianzas es una matriz cuadrada
que con(ene:
1. Las varianzas de cada variable en la diagonal principal.
2. Las covarianzas entre pares de variables en las posiciones
fuera de la diagonal.
• Para un conjunto de 𝑛 variables aleatorias 𝑋!, 𝑋", … , 𝑋% , la
matriz de varianzas y covarianzas (Σ) se define como:

𝑉𝑎𝑟(𝑋!) 𝐶𝑜𝑣(𝑋!, 𝑋") 𝐶𝑜𝑣(𝑋!, 𝑋% )



𝐶𝑜𝑣(𝑋", 𝑋!) 𝑉𝑎𝑟(𝑋") 𝐶𝑜𝑣(𝑋", 𝑋% )
Σ=
⋮ ⋱ ⋮
𝐶𝑜𝑣(𝑋% , 𝑋!) 𝐶𝑜𝑣(𝑋% , 𝑋") ⋯ 𝑉𝑎𝑟(𝑋% )

13
Elementos de la matriz:
1. Varianza (Var(𝑋& )): Representa la dispersión de cada
variable 𝑋& respecto a su media. Es el valor de la diagonal
principal.
𝑉𝑎𝑟 𝑋& = 𝐸 𝑋& − 𝜇& "
2. Covarianza (𝐶𝑜𝑣(𝑋& , 𝑋' )): Representa cómo dos variables
𝑋& , y 𝑋' varían juntas. Es el valor fuera de la diagonal.
𝐶𝑜𝑣(𝑋& , 𝑋' ) = 𝐸 (𝑋& − 𝜇& )(𝑋' − 𝜇' )
1. Si la covarianza es posi1va: las variables 1enden a moverse en la
misma dirección.
2. Si es nega1va: las variables 1enden a moverse en direcciones
opuestas.
3. Si es cero: las variables son independientes linealmente (aunque
no necesariamente independientes en un sen1do probabilís1co).

14
Propiedades clave
[Link]ía: La matriz de varianzas y covarianzas es
simétrica:
𝐶𝑜𝑣 𝑋! , 𝑋" = 𝐶𝑜𝑣(𝑋" , 𝑋! )
[Link]ón: La matriz 3ene dimensión n×n, donde n es
el número de variables.
[Link] posi6vas: Los elementos en la diagonal
principal (Var(𝑋! )) son siempre posi3vos o cero.
[Link] limitadas: Las covarianzas están limitadas
por las varianzas de las variables:
𝐶𝑜𝑣(𝑋! , 𝑋" ) ≤ 𝑉𝑎𝑟(𝑋! ) ⋅ 𝑉𝑎𝑟(𝑋" )

15
Uso en regresión
• En un modelo de regresión lineal múlOple:
𝑌 = 𝑋𝛽 + 𝜖
• La matriz de varianzas y covarianzas de los esOmadores 𝛽' se
expresa como:
𝑉𝑎𝑟 𝛽' = 𝜎 ! (𝑋 " 𝑋)#$
Donde:
• 𝜎 ! es la varianza del término de error 𝜖.
• X es la matriz de diseño que conOene las variables
independientes.
• (𝑋 " 𝑋)#$ es el inverso de la matriz producto 𝑋 " 𝑋.
• Esta matriz proporciona una medida de incerOdumbre para los
esOmadores 𝛽, ' ayudando a evaluar la precisión de las
esOmaciones y a construir intervalos de confianza.

16
Ejemplo prácCco
Supongamos que (enes dos variables 𝑋! (ingreso) y 𝑋" (gasto
mensual) con la siguiente información:
• 𝑉𝑎𝑟(𝑋!) = 100, 𝑉𝑎𝑟(𝑋") = 64
• 𝐶𝑜𝑣(𝑋!, 𝑋") = 40
La matriz de varianzas y covarianzas es:
100 40
Σ=
40 64
Interpretación:
• La varianza de 𝑋!(100) indica que el ingreso (ene mayor
dispersión que el gasto.
• La covarianza posi(va (40) sugiere que cuando el ingreso
aumenta, el gasto también (ende a aumentar.

17
Matriz de varianzas y
covarianzas del error (𝛴! )
La matriz de varianzas y covarianzas del error, denotada
como 𝛴# , describe cómo se distribuyen los términos de
error y cómo están correlacionados entre sí:
𝛴# = 𝐸[𝜖𝜖 $ ]
Donde:
• Los elementos diagonales representan las varianzas de
los términos de error para cada observación (𝑉𝑎𝑟(𝜖! )).
• Los elementos fuera de la diagonal representan las
covarianzas entre los errores de diferentes
observaciones (𝐶𝑜𝑣(𝜖! , 𝜖" )).

18
Matriz de varianzas y covarianzas

19
Supuesto clásico: Homocedas*cidad
e independencia
En un modelo de regresión clásico, asumimos:
1. Homocedas9cidad: Todos los errores Oenen la misma varianza
(𝜎 ! ).
2. Independencia: No hay correlación entre los errores de
diferentes observaciones.
Bajo estos supuestos:
Σ% = 𝜎 ! I
Donde:
• 𝜎 ! es la varianza común de los errores.
• I es la matriz idenOdad (𝑛×𝑛).
Este supuesto simplifica los cálculos e interpretaciones, pero si no
se cumple (heterocedasOcidad o correlación), los esOmadores aún
son insesgados pero pierden eficiencia.

20
Matriz de varianzas y covarianzas

21
Ejemplo numérico
Supongamos un modelo de regresión con:
&
• Y y X definidos, y los términos de error ϵ es;mados como 𝜖̂ = 𝑌 − 𝑌.
La matriz de varianzas y covarianzas del error se calcula a par;r de los residuos (𝜖):
̂
1. Calcular 𝜖̂ 𝜖̂ ! , que es;ma la estructura de covarianza.
2. Dividir por el número de grados de libertad (𝑛 − 𝑝), si se busca un es;mador de varianza.
• La matriz de varianzas y covarianzas del error (Σ" ) obtenida es una matriz diagonal, indicando
que los términos de error son independientes (no están correlacionados entre observaciones) y
;enen varianzas iguales bajo el supuesto de homocedas;cidad:

• Cada elemento diagonal representa la varianza es;mada del error para cada observación. Como
es homogénea, los valores fuera de la diagonal son 0, lo que confirma que los errores no están
correlacionados.

22
Coeficiente de Correlación de
Pearson
• Es un método propio de la estadís4ca paramétrica,
que no solo se usa para conocer la relación entre
dos variables cuan4ta4vas, sino también para la
predicción de una variable.
• Para una población:

• Para una muestra:

23
Coeficiente de Correlación de
Pearson
El coeficiente de correlación de Pearson oscila entre –1 y +1:
• Un valor menor que 0 indica que existe una correlación negativa,
es decir, que las dos variables están asociadas en sentido inverso.
• Cuánto más se acerca a -1, mayor es la fuerza de esa relación invertida
(cuando el valor en una sea muy alto, el valor en la otra será muy bajo).
• Cuando es exactamente -1, eso significa que tienen una correlación
negativa perfecta.
• Un valor mayor que 0 indica que existe una correlación positiva.
• En este caso las variables estarían asociadas en sentido directo. Cuanto
más cerca de +1, más alta es su asociación.
• Un valor exacto de +1 indicaría una relación lineal positiva perfecta.
• Finalmente, una correlación de 0, o próxima a 0, indica que no
hay relación lineal entre las dos variables.

24
Coeficiente de Correlación de
Pearson
• La representación gráfica de los datos es muy ú4l
para visualizar la relación existente entre las
variables, ya que hay que tener en cuenta que a
veces existen relaciones entre variables que no son
lineales.

25
Coeficiente de Correlación de
Pearson
• Los dos siguientes gráficos muestran relaciones lineales entre dos
variables.
• La primera )ene un coeficiente de correlación de +1, indicando una
relación lineal perfecta y posi)va (el crecimiento en una variable se asocia
con un crecimiento en la otra variable).
• La segunda )ene un coeficiente de correlación de -1, indicando también
una relación lineal total, pero nega)va, de sen)do inverso (el crecimiento
en una se asocia con un descenso en la otra).

26
Coeficiente de Correlación de
Pearson
• Estos niveles de correlación lineal tan perfectos no suelen
darse en la realidad, pero si que encontramos muchas veces
alta correlación, bien en un sen(do o en otro, con
representaciones gráficas similares a las que siguen, donde
el valor de “r” es cercano a 1.

27
Coeficiente de Correlación de
Pearson
• Puede verse como las nubes de puntos (pares de
datos de valores para las dos variables), siguen un
sen4do y se acumulan en su recorrido cerca de la
línea de tendencia, que es posi4va en un caso y
nega4va en el otro:

28
Coeficiente de Correlación de
Pearson
• En el primero de los dos siguientes ejemplos podemos comprobar que la nube
de puntos está bastante más dispersa, con un coeficiente de correlación de -
0,31.
• Intui)vamente nos damos cuenta de que la correlación es baja, a pesar de que
se apunta una ligera tendencia de correlación nega)va.
• En el caso de la derecha, la dispersión es total y se ve perfectamente que se
trata de dos variables no correlacionadas. Su coeficiente, valor “r” es de -0,05.

29
Coeficiente de Correlación de
Pearson
• Existe bastante consenso a la hora de interpretar
los valores del coeficiente de correlación de
Pearson u4lizando los siguientes criterios (y
considerando los valores absolutos):
• Entre 0 y 0,10: correlación inexistente
• Entre 0,10 y 0,29: correlación débil
• Entre 0,30 y 0,50: correlación moderada
• Entre 0,50 y 1,00: correlación fuerte

30
Contraste de hipótesis
• Una hipótesis estadís1ca es una
afirmación respecto a alguna
caracterís1ca de una población.
• Contrastar una hipótesis es
comparar las predicciones con la
realidad que observamos.
• Si dentro del margen de error
que nos permi1mos admi1r, hay
coincidencia, no rechazaremos la
hipótesis y en caso contrario la
rechazaremos.

31
Cálculo del P-Valor
• En lo que sigue ilustraremos el cálculo del p-valor en tres situaciones típicas.
Supongamos que tenemos una muestra aleatoria simple (X1, X2, …, Xn) de una
población normal (varianza desconocida) y queremos analizar uno de los
siguientes contrastes:

• Si bien las regiones de rechazo en estos contrastes son diferentes, el estadístico


̅
#$%
de contraste, 𝑡! , es el mismo: 𝑡! = $ # y sabemos que 𝑡! bajo la hipótesis nula
%
se distribuye como una 𝑡&$' .
• El p-valor en cada uno de los contrastes anteriores se obtiene de:

32
El valor P
• Los valores P o la probabilidad de error de los
coeficientes cuando se trabaja con un intervalo de
confianza del 95% debe ser inferior a 0.05
• Esto quiere decir que, si P < 0.05 se rechaza la
hipótesis nula de no significancia de los
coeficientes, es decir, los coeficientes resultan
significa4vos para explicar a la variable
dependiente

33
Pruebas estadísCcas
Supuesto de Normalidad
• El modelo de regresión múl3ple asume diverso
supuestos estadís3cos que determinan la validez de los
resultados econométricos, así como la inferencia
estadís3ca
• Representación matricial del modelo de regresión
múl3ple
Y = Xβ+ U
• Normalidad. El término de error se distribuye como
una función de densidad de probabilidad normal con
media cero y varianza constante
𝑢|X ~N (0, 𝜎%& )

34
a) Importancia del supuesto de
normalidad
En el contexto del modelo de regresión múl1ple, los es1madores de MCO
se distribuyen como una función de densidad de probabilidad normal.
𝛽& → 𝑁 𝛽, 𝜎,- 𝑋′𝑋 ./
Esta propiedad permite realizar inferencia estadís1ca sobre el modelo a
través de probar diferentes hipótesis en los valores de los es1madores.
- t-Student
- F-estadís,ca
- c2 ji-cuadrada
El rechazo de normalidad en los errores afecta el valor de los estadís1cos
de las pruebas de hipótesis como el t-Student y F. Los valores de los
estadís1cos son sensibles a la distribución normal.
El valor del estadís1co ji-cuadrada también se ve afectado. Bajo
condiciones de No-normalidad el valor crí1co del ji-cuadrado se modifica.
Los es1madores siguen siendo insesgados, pero cuando no se cumple el
supuesto de normalidad se pierde eficiencia.

35
Bondad del ajuste
El estadis4co R-cuadrado (R2)
• Es una medida estadís4ca de qué tan cerca están
los datos de la línea de regresión ajustada.
• También se conoce como coeficiente de
determinación, o coeficiente de determinación
múl4ple si se trata de regresión múl4ple.

36
Bondad del ajuste
La definición de R2 es bastante sencilla: es el
porcentaje de la variación en la variable de respuesta
que es explicado por un modelo lineal.
Es decir:
• R2 = Variación explicada / variación total
• El R2 siempre está entre 0 y 100%:
• 0% indica que el modelo no explica ninguna porción de
la variabilidad de los datos de respuesta en torno a su
media.
• 100% indica que el modelo explica toda la variabilidad
de los datos de respuesta en torno a su media.

37
Limitaciones Claves del R2

• El R2 no puede determinar si las es4maciones y


predicciones de los coeficientes están sesgadas, y
es por eso que se deben examinar las gráficas de
residuos.
• El R2 no indica si un modelo de regresión es
adecuado. Se puede tener un valor bajo del R2 para
un modelo adecuado o un valor alto del R2 para un
modelo que no se ajusta a los datos.

38
¿Son Malos los Valores Bajos del R2?
• ¡No! Hay dos razones principales por las que los valores
bajos del R2 podrían considerarse adecuados.
• En algunos campos, se espera completamente que los
valores del R2 sean bajos.
• Por ejemplo, cualquier disciplina que intenta predecir el
comportamiento humano, como la psicología, normalmente
(ene valores del R2 inferiores al 50%.
• Los seres humanos son simplemente más diYciles de predecir
que, por ejemplo, los procesos Ysicos.
• Ai el valor del R2 es bajo, pero se 4ene predictores
estadís4camente significa4vos, aún se puede obtener
conclusiones importantes acerca de la asociación entre
los cambios en los valores de los predictores y los
cambios en el valor de respuesta.
39
¿Son Buenos los Valores Altos del R2?
• ¡No! Un R2 alto no necesariamente indica que el modelo
tiene un buen ajuste.
• Eso podría sorprendernos, pero examinemos la gráfica de
línea ajustada y la gráfica de residuos de abajo.

• La gráfica de línea ajustada muestra que estos datos siguen


una función bastante estrecha y el R2 es 98,5%, lo que suena
genial. Sin embargo, si observamos más de cerca, veremos
cómo la línea de regresión predice sistemáticamente datos
demasiado altos o demasiado bajos (sesgo) en diferentes
puntos a lo largo de la curva.
40
Heteroscedas*cidad
El supuesto de homocedas)cidad
implica que, condicionando en las
variables explica1vas, la varianza del
término de error no observado es
constante. Por lo tanto, se asume
que los errores del modelo
presentan una varianza constante a
lo largo de la muestra
𝑉𝑎𝑟 𝑢0 = 𝐸 𝑢0- = 𝜎 -
La heterocedas)cidad se define
como un patrón sistemá1co que
presentan los errores donde su
• Fuente: Wooldridge (2005)
varianza no es constante, la varianza
del error es diferente para cada
valor de x.
𝑉𝑎𝑟 𝑢0 = 𝜎0-

Wooldridge, 2010 41
42
HeterocedasCcidad:
consecuencias
• Los es&madores MCO siguen siendo insesgados y consistentes.
• Bajo heterocedas&cidad, los errores estándar de los
es&madores están sesgados.
• Problema: en presencia de heterocedas&cidad los estadís&cos
habituales empleados en las pruebas de hipótesis bajo los
supuestos de Gauss-Markov ya no son válidos.
• Como Var(u|X) ya no es constante, el es&mador MCO ya no es
MELI y el es&mador MCO ya no es asintó&camente eficiente.
• En presencia de heterocedas&cidad es posible hallar
es&madores que sean más eficientes que el es&mador MCO,
aunque es necesario conocer la forma de la
heterocedas&cidad.
43
Autocorrelación
Supuesto:
La covarianza de los términos de error es igual a cero
𝐶𝑜𝑣 𝑢' 𝑢( = 𝐸 𝑢' 𝑢( = 0 ; 𝑡 ≠ 𝑠
No existe autocorrelación. Los términos de error son
estadís3camente independientes, no existe relación entre los
errores
Cuando el supuesto no se cumple el modelo presenta
problemas de Autocorrelación
𝐶𝑜𝑣 𝑢' 𝑢( = 0
Causas:
• La existencia de ciclos y/o tendencias
• Relaciones no lineales
• La omisión de variables relevantes
44
Autocorrelación

45
EstadísCco de Durbin Watson
Durbin y Watson proponen un estadísOco cuya distribución permita
manejar dos límites: uno superior y otro inferior
𝑟! ≤ 𝑟 ≤ 𝑟"
El estadísOco propuesto es el denominado d o estadísOco Durbin-
Watson, que se define como la razón de la suma del cuadrado de la
primera diferencia de los residuales con respecto a la suma del cuadrado
de los residuales
∑&#$% 𝑢4 # − 𝑢4 #'(
DW=
∑&#$( 𝑢4 #%
La distribución teórica del estadísOco de Durbin- Watson se define como:
& &
1
𝑘 𝑒𝑥𝑝 − % 1 + 𝜌% > 𝑢#% − 2𝜌 > 𝑢# 𝑢#'(
2𝜎
#$( #$(

𝐷𝑊 = 2 − 2𝜌 = 2(1 − 𝜌)
Si el DW se ubica entre 1.5 y 2.5 se puede asumir que no existe
autocorrelación
46
Ejemplo de regresión lineal simple
en Excel
Intervalo Intervalo
Clases
buenos Malos
0-20 5 5
21-40 10 5
41-60 9 4
61-80 37 18
81-100 24 7
101-120 51 19
121-140 53 15
141-160 90 19
161-180 118 16
181-200 210 30
201-220 268 23
221-240 371 31
241-260 491 33
261-280 654 25
281-300 808 29
301-320 1082 43
321-340 1804 27
341-360 2011 31
361-380 2303 37
381-400 2613 26
401-420 3030 23
421-440 3351 17
441-460 3478 12
461-480 3411 18
481-500 3316 9
501-520 3112 8
521-540 3091 7
541-560 2877 3
561-580 2617 4
581-600 2120 2
601-620 1607 1
621-640 1112 0.5
641-660 663 0.5
661-680 414 0.5
681-700 189 0.5
701-720 91 1

47
Ejemplo de regresión lineal simple
en RStudio
1. Importar datos de Excel a RStudio
• Primero, necesitamos instalar y cargar el paquete
readxl para importar datos de Excel:
[Link]("readxl")
library(readxl)

• Luego, importa tu archivo Excel. Supongamos que


tu archivo se llama "[Link]" y la hoja que
quieres importar se llama "Hoja1":
datos <- read_excel("[Link]", sheet = "Hoja1")

48
Ejemplo de regresión lineal simple
en RStudio
2. Explorar los datos
• Antes de ajustar un modelo, es úOl echar un vistazo a los datos:
head(datos)
summary(datos)

3. Ajustar un modelo de regresión lineal simple


• Supongamos que Oenes dos columnas en tus datos: buenos (que
es tu variable independiente) y malos (que es tu variable
dependiente). Ajustemos un modelo de regresión lineal simple:
modelo <- lm(buenos~ malos, data = datos)
summary(modelo)

49
Ejemplo de regresión lineal simple
en RStudio
4. Visualizar los resultados
• Podemos trazar los datos y la línea de regresión
para visualizar el ajuste:
plot(datos$malos, datos$buenos, main="Regresión Lineal Simple",
xlab="malos", ylab="buenos", pch=19, col="blue")

50
Ejemplo de regresión lineal
múltiple en R
#Importamos datos
datos <- read_excel ("ejercicio_econometría_3”).xlsx

#introducimos el modelo a estimar


lm(Y ~ IGAE + IPC + TIIE ,data=datos)
modelo <- lm(Y ~ IGAE + IPC + TIIE ,data=datos)

#estadisticas del modelo


summary (regresion)
vcov(regresion)
anova(regresion)

51
Ejemplo de regresión lineal
múlCple en R
#Análisis de residuales mediante análisis
gráfico
residuales<-modelo$residuals
rstint<-rstandard(modelo)
par(mfrow=c(1,3))
hist(rstint)
boxplot(rstint)
qqnorm(rstint)

52
Regresión Logit

53
Regresión Logística
• La regresión logísGca es un modelo estadís4co
u4lizado para predecir el valor de una variable
dependiente categórica (binaria o mul4nomial) a
par4r de una o más variables independientes.
• Es ampliamente usada en situaciones donde el
resultado 4ene categorías discretas, como en
problemas de clasificación.

54
¿Por qué no usamos regresión
lineal para problemas binarios?
La regresión lineal no es adecuada para datos categóricos
porque:
[Link] fuera del rango [0,1]: La salida de una
regresión lineal no está restringida, lo que hace imposible
interpretarla como una probabilidad.
[Link]ón no normal del error: En problemas binarios, los
errores no siguen una distribución normal, violando los
supuestos de la regresión lineal.
[Link]ón no lineal: La relación entre las variables
independientes y la probabilidad de un resultado binario no
es lineal.
La regresión logís(ca resuelve estos problemas al usar una
transformación no lineal.

55
Regresión logísCca: El modelo
LOGIT
• Para resolver esta posible falla del modelo en el
contexto del Credit Scoring, Wiginton en 1980 fue
uno de los primeros autores en introducir una
transformación, que lleva al modelo LOGIT.

56
¿Qué hace la regresión logísCca?
• La regresión logística transforma una combinación lineal de las variables
independientes en una probabilidad usando la función logística (o
sigmoide):
1
𝑃(𝑌 = 1 ∣ 𝑋) =
1 + 𝑒 .(1!21"3"21#3#2⋯21$ 3$ )
Donde:
• 𝑃 𝑌 = 1 𝑋 : Es la probabilidad de que el resultado sea la categoría 1
dado un conjunto de variables X.
• 𝛽5 , 𝛽/ ,…, 𝛽6 : Son los coeficientes a estimar.
• 𝑒 : Es la base del logaritmo natural (≈2.718).
La función logística asegura que:
• Las predicciones estén en el rango [0,1], lo que permite interpretarlas
como probabilidades.
• El modelo sea adecuado para datos categóricos.

57
Transformación logísCca: De
probabilidades a log-odds
• La regresión logística trabaja con los log-odds o logaritmo de las razones
de probabilidades, que se definen como:

𝑃 𝑌=1 𝑋
log − 𝑜𝑑𝑑𝑠 = ln = 𝛽% + 𝛽& 𝑋& + 𝛽' 𝑋' + ⋯ + 𝛽( 𝑋(
1−𝑃 𝑌 =1 𝑋

1. Razón de probabilidades (odds):

𝑃 𝑌=1
𝑂𝑑𝑑𝑠 =
1−𝑃 𝑌 =1
Es la proporción de éxito frente a fracaso.
2. Logaritmo de la razón de probabilidades (log-odds): La relación es
lineal entre las variables independientes y los log-odds, lo que facilita
la interpretación de los coeficientes.

58
La Distribución Logística
• Es una distribución de probabilidad continua cuya
función de distribución es la función logística, que
aparece en el contexto de la regresión logística y
determinados tipos de redes neuronales.
• Es similar a la distribución normal en forma, pero
tiene colas más pesadas (mayor curtosis).

59
• El modelo de regresión logística estima el logaritmo
de las probabilidades de que ocurra el evento en
cuestión (p. ej., incumplimiento).
• Para calcular las probabilidades esperadas, se
utilizan los datos de la cartera de préstamos.
• Por lo general, los modeladores definen el evento
de interés como el de un préstamo que se vuelve
"malo".

60
• Por lo tanto, el logaritmo de las probabilidades
malas/buenas está relacionado linealmente con la
puntuación.

𝑏𝑢𝑒𝑛𝑜
log 𝑑𝑒 𝑝𝑟𝑜𝑏 = 𝐵# + 𝐵! ∗ 𝑆𝑐𝑜𝑟𝑒
𝑚𝑎𝑙𝑜

61
• El administrador de riesgos asume que las
condiciones del mercado, incluidas las prác4cas de
suscripción y el entorno económico, serán las
mismas que las vigentes durante el período
representado por la muestra de referencia.
• Si este no es el caso, o si se espera que las
condiciones del mercado varíen, digamos, por
región geográfica, será necesario un análisis más
profundo.

62
La distribución logística
• Sea X una variable aleatoria con4nua, μ ∈ ℝ y s >
0, si X 4ene una distribución logís4ca con
parámetros μ y s, entonces escribiremos
X ∼ Logís)ca ( μ, s)

63
Interpretación de los
coeficientes
• En la regresión logís3ca:
• Cada coeficiente (𝛽! ) representa el cambio en los log-
odds cuando la variable 𝑋) aumenta en una unidad,
manteniendo constantes las demás variables.
• Exponenciando los coeficientes (𝑒 *) ) obtenemos el
factor de cambio en las odds. Si:
• 𝑒 *( > 1: La variable aumenta las probabilidades de éxito.
• 𝑒 *( < 1 : La variable disminuye las probabilidades de éxito.
• 𝑒 *( = 1 : La variable no Oene efecto en las probabilidades.

64
Ejemplo de modelo logit
• Supongamos que queremos predecir si un cliente pagará un
préstamo (Y=1) o no (Y=0) en función de su ingreso (𝑋( ):
[Link]:
𝑃 𝑌=1 𝑋
ln = −2 + 0.01𝑋(
1−𝑃 𝑌 =1 𝑋
[Link]ón del coeficiente 0.01:
1. Por cada aumento de una unidad en el ingreso (𝑋! ), los log-odds
aumentan en 0.01.
2. Exponenciando: 𝑒 "."! ≈ 1.01, lo que significa que las odds aumentan
en un 1% por cada unidad adicional de ingreso.
[Link] para un ingreso de $5,000:
1. Log-odds: −2 + 0.01(5000) = 3.
2. Odds: 𝑒 $ ≈ 20.1.
%".!
3. Probabilidad: ≈ 0.95 (95%).
!&%".!

65
EsCmación Logit
• El modelo Logit se inscribe dentro de llamadas
regresiones sobre "dummy" variables.
• Una variable "dummy" o dicotómica es una variable
numérica usada en el análisis de regresión lineal para
representar los subgrupos de la muestra en su estudio.
• En el diseño de la investigación, una variable "dummy"
se utiliza a menudo para distinguir a diversos grupos
del tratamiento.
• En el caso más simple, con valores 0 y 1.
• Las variables "dummy" son útiles porque nos permiten
utilizar una sola ecuación de la regresión para
representar a grupos múltiples.

66
La Logit es una de la llamada LPM
(Logit and Probit Models)

67
El modelo logit
• El modelo Logit, se define a partir de la siguiente
función de distribución

68
Las variables en el modelo logit
• Y las variables se definen de la siguiente forma:

69
Linearización: Transformación
Logarítmica
• La linearización de la función de distribución, se realiza
mediante la definición de la Logit que denotamos por 𝐿𝑖,
tomando el logaritmo natural de la razón entre las
probabilidades 𝑃𝑖 y las probabilidades
complementarias (1−𝑃𝑖).
• La transformación lineal logaritmo natural en base 𝑒, baja
los exponentes y permite trabajar en el espacio de la
regresión líneal con las operaciones binarias ordinarias, para
posteriormente con los coeficientes ya estimados volver al
espacio no lineal:

70
Ejemplo 2. Muestra de Datos
• Se ha extraído una muestra de 120.800 de
observaciones de clientes de la base datos.
• Filtrando por cada cliente su ingreso expresado en
una unidad monetaria y su cumplimiento de pago
respectivo.
• La muestra se ha distribuido en 9 clases o intervalos
de ingresos, asociando la frecuencia a la variable
dicotómica si cumplió o no cumplió.

71
Ejemplo 2. Muestra de Datos

72
Diagrama de Arbol -
Configuración de los Datos

73
Tabla de niveles de ingreso y
clientes
Ingreso en Miles de $ Cumplió No_Cumplió Tamaño Clase
!! "1! "2! #!
200 11078 1022 12100

350 7147 853 8000

500 6539 861 7400

700 15224 2376 17600

900 25521 4079 29600

1100 9342 1458 10800

1400 15564 2036 17600

1500 16164 1536 17700

1850 9819 881 10700

Total 116398 15102 131500

74
Ejemplo 2. Muestra de Datos
• Tal como lo muestra la Tabla para cada nivel de
ingreso 𝑋% , existen 𝑁% clientes.
• Donde 𝑛!& representa el número de créditos "Cumplió”
y,
• 𝑛"& los "No_Cumplió"
• para cada nivel de ingreso 𝑋& ,
• 𝑁& representa el tamaño del intervalo respec(vo.
• Es decir; 𝑋& = 𝑛!& + 𝑛"&

75
Ejemplo 2. Muestra de Datos
• Nótese que la data que se muestra en la
Tabla señala que cada clase 𝑋% 4ene un tamaño
total 𝑋% ≠ 0, donde cada 𝑛% ≤ 𝑁% .
• Es ahí entonces, que se calcula la frecuencia
rela4va asignada al es4mador 𝑃L% , tomando la
proporción entre el tamaño de las clases y el
tamaño total de las observaciones respec4vas.
• Esta frecuencia rela4va es usada como el es4mador
𝑃L% .
• De modo que mientras mayor sea el número de
observaciones 𝑁% , mejor será el es4mador 𝑃L% .
76
Clasificación No. Clientes según
Niveles de Ingreso

77
Estimación Parámetros
• Para es4mar los parámetros de la regresión Logit
u4lizaremos la frecuencia rela)va 𝑃L% (parámetro
es4mado) como la probabilidad de ser "Cumplió"
para cada nivel de ingreso 𝑋% :
𝑛%
𝑃L% =
𝑁%

78
Ejercicio de regresión logísCca
• Calcular la variable “𝐿% ”
• Aplicando el Método de los Mínimos Cuadrados,
estimar dependiente 𝐿% explicada por 𝑁% para
encontrar los siguientes parámetros:
Parámetro Es,mado Valor
𝛽*)
𝛽*'
𝑅*

79
Ejemplo 3. Logit multivariado
• El conjunto de datos utilizado es el conjunto de
datos de crédito alemán con 1000 observaciones.
• Cada observación representa a un cliente individual
y la respuesta indica su clasificación real (1 =
"Bueno" o 2 = "Malo") y las covariables indican
varios atributos relacionados con la información
personal o financiera del cliente.

80
Lista de variables explicativas

81
Ejemplo 3. Logit mulCvariado

Al-Aradi, A. (2014). Credit scoring via logistic regression. Department of Statistical Sciences, University of Toronto, Toronto, Canada..

82
Ejemplo 3. Logit multivariado.
Resultados
• Las probabilidades de solvencia crediticia de un
consumidor aumentan con un aumento en el
tamaño de su cuenta corriente.
• En términos generales, cuando se considera el
género y el estado civil por separado, no hay
diferencias entre hombres y mujeres o entre
divorciados/casados y solteros.
• En términos generales, cuando el propósito del
crédito se agrupa en "automóvil", "casa" y "otros",
no se encontró ninguna diferencia en las
probabilidades de solvencia.

83
Ejemplo 3. Logit multivariado.
Resultados
• En una visión más específica, se encontró que la mayor
diferencia en las probabilidades es entre los consumidores
cuyo propósito fue la educación y aquellos cuyo propósito
fue la compra de un auto usado, las probabilidades de estos
últimos son 5.497 veces mayores, adicionalmente, los
clientes cuyo propósito fue la compra de un auto usado o
una radio/TV tuvieron mayores probabilidades de solvencia
que quienes compran un auto nuevo por factores de 4.034 y
2.232, respectivamente.
• El aumento de la duración disminuye las probabilidades de
solvencia.
• En particular, un aumento de un mes en la duración reduce las
probabilidades esperadas de solvencia en un factor de 0.958.
• Esto tiene sentido ya que un préstamo más largo tiene una mayor
probabilidad de incumplimiento que uno más corto, después de
controlar otras variables.

84
Ejemplo de modelo logístico en R
# Cargar la biblioteca dplyr
library(dplyr)

# Establecer una semilla para reproducibilidad


[Link](123)

# Generar datos simulados


num_observaciones <- 1000

data <- [Link](ingresos = rnorm(num_observaciones, mean =


50000, sd = 10000), edad = rnorm(num_observaciones, mean = 35, sd
= 5), incumplimiento = rbinom(num_observaciones, size = 1, prob =
0.2) # Probabilidad de incumplimiento del 20%))
85
Ejemplo de modelo logístico en R
# Ajustar el modelo logístico
modelo_logistico <- glm(incumplimiento ~
ingresos + edad, data = data, family =
binomial)

summary(modelo_logistico)

data$prob_pred <- predict(modelo_logistico,


type = "response")

86
Ejemplo de modelo logístico en R
# Conver*r las probabilidades ajustadas en 0 o 1 según un umbral (por ejemplo, 0.5)
data$prediccion_binaria <- ifelse(data$prob_pred >= 0.5, 1, 0)

# Calcular la matriz de confusión


confusion_matrix <- table(data$incumplimiento, data$prediccion_binaria)

# Mostrar la matriz de confusión


print(confusion_matrix)

# Calcular la precisión del modelo


accuracy <- sum(diag(confusion_matrix)) / sum(confusion_matrix)
print(paste("Precisión del modelo:", accuracy))

87
Modelo de
regresión lineal
por partes
(Regresión
Piecewise)

88
Modelo de regresión lineal por
partes (Regresión Piecewise)
• Varios 3pos de problemas de programación lineal usan
funciones que no son realmente lineales, sino que se
ensamblan a par3r de segmentos lineales conectados:

• Estos términos “lineales por partes” son fáciles de


imaginar, pero pueden ser didciles de describir en
notación algebraica convencional.
89
Función lineal por partes, con tres
pendientes

90
Modelo de regresión lineal por
partes (Regresión Piecewise)
• La ecuación de regresión lineal simple del modelo es:
𝑌 = 𝛼) + 𝛽) 𝑋 + ℇ, 𝛼) , 𝛽) ∈ ℝ (a)
• Las principales ventajas de este modelo son su sencillez
(en el sentido de que intervienen pocos parámetros) y
fácil interpretación.
• Con esta notación, 𝛼) representaría el valor de la
variable respuesta predicho por el modelo cuando X=0
y 𝛽) mediría el aumento en la variable Y al incrementar
X una unidad.
• A partir de aquí, 𝛼) recibirá el nombre de intercepto y
𝛽) el de pendiente, pues se está modelizando la
relación mediante una recta.

91
Modelo de regresión lineal por
partes (Regresión Piecewise)
• Los modelos de regresión lineal asumen que el ritmo al
que crece 𝑌 al aumentar 𝑋 es el mismo
independientemente del valor que tenga 𝑋.
• Este hecho es, en ocasiones, poco realista y se antoja
necesaria la formulación de un modelo que contemple
estos casos.
• Una primera solución pasaría entonces por suponer
que existe un punto 𝜓 ∈ 𝑅 tal que la relación de X e Y
es lineal antes y después de 𝜓, pero con diferentes
pendientes.
• De ahora en adelante, el valor 𝜓 será denominado
punto de cambio
92
Modelo de regresión lineal por
partes (Regresión Piecewise)
• Adaptando la ecuación se reescribiría:
𝑌 = 𝛼) + 𝛽) 𝑋 + 𝛽; 𝑋 − ψ + ℇ, (b)
donde 𝑋 − ψ + = 𝑋 − ψ 𝐼 𝑋 > ψ , siendo 𝐼(·) la función
indicadora.
• Con esta notación, β1 es la pendiente del modelo
cuando 𝑋 ≤ 𝜓 𝑦 𝛽) + 𝛽< es la pendiente cuando X >
𝜓.
• Equivalentemente, 𝛽< puede ser interpretado como la
diferencia entre la primera y la segunda pendiente del
modelo.
• Nótese que, ya que se supone que el punto de cambio
existe, por definición se tiene que 𝛽< = 0.
• De no ser así, los modelos (a) y (b) coincidirían.

93
Modelo de regresión lineal por
partes (Regresión Piecewise)
• la anterior situación se puede adaptar a contextos
más generales en los que haya K puntos de cambio
𝜓! ,..., 𝜓$ para la variable explicativa.
• El modelo descrito en (b) sería un caso particular
del modelo general
D

𝑌 = 𝛼! + 𝛽! 𝑋 + Q 𝛽E$ 𝑋 − ψ$ F + ℇ,
$C!
• con 𝑋 − ψ$ F = 𝑋 − ψ$ 𝐼 𝑋 > ψ$ , 𝑘 ∈
1, … , 𝐾.

94
Modelo de regresión lineal por
partes (Regresión Piecewise)
• En este caso, 𝛽E$ representa el cambio de
pendiente entre 𝑋 = ψ$ y 𝑋 = ψ$F! cuando 𝑘 =
1, … , 𝐾 − 1.
• Equivalentemente, 𝛽E! + … + 𝛽E$ mide el
aumento de Y al aumentar una unidad X
cuando é sta toma valores en el intervalo
[ψ$ , ψ$F! ), 𝑘 ∈ {1, … , 𝐾 − 1} ó [ψ$ , +∞) en el
caso de 𝛽E$ .
• Del mismo modo que antes, se supondr á que la
funcio ń de regresi ó n debe ser con4nua en todos
los puntos ψ! , ..., ψ$ .
95
Modelo de regresión lineal por
partes (Regresión Piecewise)
Para poder realizar inferencia sobre el modelo de regresión
segmentada, es necesario que é ste verifique una serie de hipótesis:
• HomocedasOcidad.
• La varianza del error es la misma para cualquier valor de la variable X.
• Esto es, 𝑉𝑎𝑟 𝜀 𝑋 = 𝑥 = 𝜎 % ∀𝑥 ∈ 𝑆𝑜𝑝(𝑋), siendo 𝑆𝑜𝑝(𝑋) el soporte
de la variable X.
• Normalidad.
• Habitualmente, se suele exigir también que la distribución de 𝜀 sea
normal.
• Juntando
%
esta condición con la anterior, esto se traduciría en que 𝜀 ∼
𝑁(0, 𝜎 ).
• Independencia.
• Dada una muestra aleatoria simple de taman o ̃ n, las variables
aleatorias que representan a los errores 𝜀! , … , 𝜀' son mutuamente
independientes.

96
Modelo de regresión lineal por
partes (Regresión Piecewise)
• Ya que el modelo (b) es un modelo paramétrico, la
relación entre X e Y depende de unos parámetros
teóricos desconocidos en la prác3ca.
• Será necesario entonces tomar muestras con
observaciones conjuntas de las dos variables para
poder es3mar los parámetros del mismo.
• Este muestreo se puede realizar de dos maneras:
• Diseño fijo. En este caso los valores de la variable explicaOva
están fijados de antemano de acuerdo a algún criterio que
considere apropiado para sacar conclusiones del mismo.
• Diseño aleatorio. Los valores obtenidos de las dos variables al
tomar la muestra son aleatorios.

97
Modelo de regresión lineal por
partes (Regresión Piecewise)
Dada una muestra aleatoria simple, el modelo (b)
sugiere que:
𝑌% = 𝛼! + 𝛽! 𝑥% + 𝛽E 𝑥% − ψ F + ε% , 𝑖 ∈ 1, … , 𝑛
donde ε% es el error asociado a la i-ésima
observación de la muestra.
Por simplicidad, se supondrá que los 𝑥% están
ordenados de forma creciente. Es decir,
𝑥! ≤ 𝑥" ≤ … ≤ 𝑥G

98
Ejemplo: Coeficientes de Gini y
elevación

99
100
Ejemplo de Regresion lineal por
partes (Piecewise) en RStudio
Vamos a simular un escenario donde la probabilidad de incumplimiento
aumenta linealmente con el número de clientes hasta cierto punto, y
luego el aumento se desacelera.

101
Ejemplo de Regresion lineal por
partes (Piecewise) en RStudio
1. Generar datos aleatorios
[Link](123) # Para reproducibilidad

# Generamos 100 observaciones


n <- 100

# Variable independiente: número de clientes


clientes <- sort(runif(n, min = 0, max = 100))

# Generamos probabilidad de incumplimiento basados en clientes con un punto


de quiebre en 50
punto_quiebre <- 50
prob_incumplimiento <- ifelse(clientes <= punto_quiebre,
0.01 * clientes + rnorm(n, sd = 0.05),
0.01 * punto_quiebre + 0.005 * (clientes - punto_quiebre) +
rnorm(n, sd = 0.05))

datos <- [Link](clientes, prob_incumplimiento)


102
Ejemplo de Regresion lineal por
partes (Piecewise) en RStudio
2. Ajustar una regresión piecewise
• Para ajustar una regresión piecewise, necesitamos
crear una nueva variable que represente el tramo
después del punto de quiebre:
datos$clientes_post_quiebre <- pmax(0, datos$clientes -
punto_quiebre)

modelo_piecewise <- lm(prob_incumplimiento ~ clientes +


clientes_post_quiebre, data = datos)
summary(modelo_piecewise)

103
Ejemplo de Regresion lineal por
partes (Piecewise) en RStudio
3. Visualizar los resultados
plot(datos$clientes, datos$prob_incumplimiento, main="Regresión
Piecewise", xlab="Clientes", ylab="Probabilidad de Incumplimiento",
pch=19, col="blue")
abline(a=coef(modelo_piecewise)[1], b=coef(modelo_piecewise)[2],
col="red")
abline(a=coef(modelo_piecewise)[1] + coef(modelo_piecewise)[3] *
punto_quiebre, b=coef(modelo_piecewise)[2] +
coef(modelo_piecewise)[3], col="red")
legend("topleft", legend=c("Datos", "Regresión Piecewise"), col=c("blue",
"red"), pch=c(19, NA), lty=c(NA, 1))

104
Ejemplo de Regresion lineal por
partes (Piecewise) en RStudio
3. Visualizar los resultados
En este gráfico, los datos están en azul y la regresión piecewise en rojo.
Puedes ver cómo la relación cambia en el punto de quiebre.

105
Redes Neuronales
EN LA PROBABILIDAD DE INCUMPLIMIENTO

106
Modelo de Redes Neuronales
• Las redes neuronales ar4ficiales (RNA) son modelos
matemá4cos- computacionales que intentan imitar
el funcionamiento del cerebro y la forma como este
procesa la información.
• Se cataloga dentro de las técnicas no paramétricas
de credit scoring, como sistemas con la capacidad
de aprender a través de entrenamiento, también
conocido como la interpretación que ellas hacen de
la información que reciben.

107
Modelo biológico
• La figura muestra un 1po común de neurona biológica, que está
compuesta principalmente por:
• Un cuerpo central, que con)ene el núcleo celular, denominado Soma.
• La conexión entre neuronas se establece a par)r de una prolongación del
Soma, llamada Axón, que también se ramifica en su extremo final para
establecer conexión con otras neuronas, estas ramificaciones son
conocidas como terminales axónicos.
• Las dendritas que son ramificaciones del cuerpo central, con las cuales se
logra la conexión sináp)ca.

108
Modelo Biológico
• Se es1ma que alrededor de cien mil millones de neuronas son las que
conforman el sistema nervioso; estas se diferencian del resto de células
vivas en el hecho que poseen capacidad de comunicarse.
• En general, las dendritas y el Soma reciben las señales de entrada, el
cuerpo celular las combina y emite señales de salida; a con1nuación, el
Axón transmite esta señal a sus terminales, que se encargan de
distribuir la información a otro conjunto de neuronas .
• Un aspecto muy importante en el proceso de comunicación entre
neuronas es él término conocido como sinapsis: unión entre dos
neuronas, en el proceso de generación y transmisión de la señal
nerviosa.
• González y Hernando (2000) precisan la sinapsis como contactos
especiales, a través de los cuales fluyen neurotransmisores que llevan
las señales que se transmiten entre los terminales axónicos de una
neurona y las dendritas de la neurona siguiente.

109
Modelo Biológico
• Con relación al 3po de sinapsis, se puede establecer
dos 3pos de neuronas, las neuronas presináp3cas que
son las que envían las señales y las postsináp3cas las
cuales reciben.
• Así, se define dos 3pos de sinapsis:
• Sinapsis excitadora: es aquella cuyos neurotransmisores
facilitan la generación de impulsos a mayor velocidad.
• Sinapsis inhibidoras: Sus neurotransmisores dificultan la
emisión de impulsos.
• A con3nuación, se establece una similitud directa entre
las redes neuronales ar3ficiales y el proceso sináp3co.

110
Elementos de una red neuronal
arCficial
• Para introducir los elementos de una red neuronal ar)ficial, se hará uso de la
siguiente figura, que cuenta con una sola neurona; es decir, una pequeña parte
de un sistema de red neuronal ar)ficial.

111
Elementos de una neurona
• Los elementos que cons4tuyen a una neurona z son
los siguientes:
• Conjunto de entradas 𝑥𝑖 (𝑡), 𝑖 = 1, ... , 𝑛: las cuales
pueden ser binarias o con9nuas, dependiendo del 9po
de modelo y aplicación.
• Pesos sináp9cos de la neurona z: catalogados como 𝑤𝑧𝑖,
que representa la intensidad de interacción entre la
entrada i y la neurona z.
• Dependiendo de los pesos, se puede obtener la salida
necesaria, considerando entradas específicas.
• Cuanto más grande sea el peso, más fuerte y relevante será el
nodo de entrada.

112
Elementos de una neurona
• Función de agregación también llamada regla de
propagación: Se denomina función de agregación a
aquella regla que relaciona las entradas y los pesos para
obtener el valor de la señal postsináp9ca h𝑧, conocido
como potencial postsináp9co:
h- (𝑡) = 𝜎- (𝑤-& , 𝑥& (𝑡))
La función más habitual es lineal y consiste en la suma
ponderada de las entradas con los pesos sináp9cos,
%
h- (𝑡) = J 𝑤-& 𝑥& ( (𝑡))
&.!

113
Elementos de una neurona
• Función de ac9vación: La misma proporciona el estado
de ac9vación, en el 9empo t, 𝑎𝑧(𝑡), a par9r del potencial
postsináp9co h𝑧(𝑡) y del estado de ac9vación anterior
𝑎𝑧 (𝑡 − 1).
𝑎H (𝑡) = 𝑓H (𝑎H (𝑡 − 1), ℎH (𝑡))

• Sin embargo, muchos modelos de redes neuronales


consideran que el estado actual de la neurona (9empo t)
no depende de su estado anterior, por lo que:
𝑎- (𝑡) = 𝑓- (ℎ- (𝑡))

114
Elementos de una neurona
• En general se puede establecer dos estados
posibles, reposo y excitado, a los cuales se les
asigna un valor que puede ser con4nuo o discreto
• En la mayor parte de modelos la función de
ac4vación 𝑓(.) es monótona creciente y con4nua.

115
Funciones de acCvación usuales

116
Modos de operación de una red
neuronal
• Se considera dos 4pos de operación en un sistema
neuronal:
• El modo aprendizaje. Proceso en el cual se modifica los
pesos de la neurona en respuesta a la información de
entrada.
• El modo recuerdo o ejecución, una vez que la red a
concluido su fase de aprendizaje esta se “apaga o
desconecta”; es decir, pasa a un estado off line, por lo
cual, los pesos, conexiones y estructura de la red se
man9ene fijos y esta puede procesar nueva información.

117
Clasificación de los modelos
neuronales

118
Redes neuronales en la predicción de
probabilidad de incumplimiento
• La probabilidad de incumplimiento se refiere a la
probabilidad de que una en4dad (puede ser un
individuo, empresa, país, etc.) no cumpla con sus
obligaciones financieras, como el pago de un
préstamo.
• Las redes neuronales, específicamente las redes
neuronales profundas, se han conver4do en una
herramienta prominente en la predicción de
incumplimientos debido a su capacidad para
capturar relaciones no lineales y complejas en
grandes volúmenes de datos.

119
CaracterísCcas
• Adaptabilidad: Las redes neuronales se entrenan a
par4r de los datos, lo que significa que pueden
adaptarse a diferentes 4pos de datos y contextos.
• No linealidad: Capacidad de modelar relaciones
complejas y no lineales entre las variables.
• Capacidad de generalización: Una vez entrenadas,
pueden hacer predicciones sobre datos nunca
antes vistos.

120
Pasos básicos para implementar una
red neuronal en la predicción de
incumplimientos
• Recolección de datos: Obtener datos históricos de en9dades
que han incumplido y que no han incumplido sus
obligaciones.
• Preprocesamiento: Limpiar, normalizar y dividir los datos en
conjuntos de entrenamiento, validación y prueba.
• Definir la arquitectura de la red: Elegir el número de capas
ocultas, unidades por capa, función de ac9vación, etc.
• Entrenamiento: Usar el conjunto de entrenamiento para
ajustar los pesos de la red neuronal.
• Evaluación: Medir el desempeño del modelo en el conjunto
de validación y ajustar hiperparámetros si es necesario.
• Testeo: Finalmente, evaluar el modelo en el conjunto de
prueba para tener una idea de cómo se desempeñará en
datos no vistos.
121
Métricas de evaluación
Las métricas más comunes para evaluar el
desempeño de un modelo de clasificación binaria
como este son:
• Precisión (accuracy)
• Sensibilidad (recall)
• Especificidad
• Área bajo la curva ROC (AUC-ROC)
• F1 score

122
Importante
• Es vital tener en cuenta el desbalance de clases.
• Si, por ejemplo, el 95% de las en4dades no
incumplen y sólo el 5% incumple, un modelo que
prediga siempre "no incumplimiento" tendrá una
precisión del 95%.
• Por esto, métricas como el AUC-ROC o el F1 score son
más relevantes en estos casos.

123
Ejemplo prác<co de red neuronal
para probabilidad de incumplimiento
en RStudio
1. Datos:
• Imaginemos que tenemos un conjunto de datos con las
siguientes caracterís9cas para cada cliente:
• Edad
• Ingresos mensuales
• Número de créditos previos
• Historial credi)cio (por ejemplo, una puntuación de 0 a 1, donde 1 es un
historial perfecto)
Y la e9queta (target) sería:
• Incumplimiento (1 si el cliente incumplió, 0 si no)

124
Ejemplo prác<co de red neuronal
para probabilidad de incumplimiento
en RStudio
2. Preprocesamiento:
• Antes de entrenar la red neuronal, necesitamos
preparar los datos.
• Esto implica normalizar las caracterís4cas para que
todas tengan un rango similar (por ejemplo, entre 0
y 1) y dividir los datos en conjuntos de
entrenamiento, validación y prueba.

125
Ejemplo prác<co de red neuronal
para probabilidad de incumplimiento
en RStudio
1. Instalación y carga de paquetes • # Simulando algunas
necesarios: características
• A <- rnorm(n, 50, 10)
[Link]("MASS") • B <- rnorm(n, 100, 20)
[Link]("neuralnet") • C <- rnorm(n, 2, 0.5)
library(MASS) • D <- rnorm(n, 0.5, 0.1)
library(neuralnet)
• # Supongamos que esta es nuestra
función subyacente para decidir
2. Creación de datos simulados: incumplimiento (esto es solo para
simular datos)
Vamos a suponer que tenemos cuatro
caracterís;cas (A, B, C y D) y queremos • default_probability <- plogis(-20 +
predecir la probabilidad de incumplimiento 0.5*A - 0.3*B + 3*C - 2*D)
(variable binaria: 0 = no incumplimiento, 1 =
incumplimiento). • default <- ifelse(default_probability
> 0.5, 1, 0)
[Link](42) # Fija una semilla para
reproducibilidad
n <- 1000 • df <- [Link](A, B, C, D, default)
126
Ejemplo prác<co de red neuronal
para probabilidad de incumplimiento
en RStudio
3. División de datos en 4. Entrenamiento de la red
conjuntos de neuronal:
entrenamiento y prueba:
[Link](42)
[Link](123) nn <- neuralnet(default
train_index <- ~ A + B + C + D, data =
sample(1:n, 0.7*n) train, hidden = 5,
train <- df[train_index, [Link] = FALSE,
] threshold = 0.01)
test <- df[-train_index,
]

127
Ejemplo prác<co de red neuronal
para probabilidad de incumplimiento
en RStudio
5. Predicción en el conjunto de prueba: 6. Evaluación del modelo:
Para evaluar el modelo, puedes
predicted_values <- usar una matriz de confusión,
compute(nn, test[1:4]) calcular la precisión, el recall,
predicted_default <- etc.
ifelse(predicted_values$ne
[Link] > 0.5, 1, 0) actual_default <- test$default
table(predicted_default,
actual_default)

#Con la matriz de confusión,


podrás ver cuántas
observaciones se clasificaron
correctamente y cuántas se
clasificaron incorrectamente.

128
Ejemplo prác<co de red neuronal
para probabilidad de incumplimiento
en RStudio
7. Visualización de la red
neuronal:

plot(nn)

129
Comentarios generales
• Aunque las redes neuronales son poderosas y
pueden capturar interacciones complejas en los
datos, también son consideradas "cajas negras", lo
que significa que, a diferencia de otros modelos
(como la regresión lineal), no es fácil interpretar la
relación exacta entre las caracterís4cas y la
respuesta.
• Sin embargo, puedes evaluar la importancia de
cada caracterís4ca u4lizando técnicas específicas,
como el análisis de sensibilidad.

130
Ejemplo prác<co 2 de red neuronal
para probabilidad de incumplimiento
en RStudio
• En este segundo ejemplo se consideran las siguientes
mejoras:
[Link] del desbalance de clases: Usaremos la técnica
de "peso de clase" para compensar el desbalance.
[Link]ón: Para evitar el sobreajuste.
[Link]: También para evitar el sobreajuste al
"desac3var" aleatoriamente algunas neuronas durante
el entrenamiento.
[Link] stopping: Detener el entrenamiento si la métrica
de validación no mejora después de un número
determinado de épocas.

131
Ejemplo prác,co 2 de red neuronal para
probabilidad de incumplimiento en RStudio
• Vamos a simular datos para un conjunto de individuos (cada fila del
data-frame representa a un individuo). Cada individuo 1ene ciertas
caracterís1cas:
• A, B, C, D: Estas podrían representar caracterís1cas cuan1ta1vas de los
individuos, como ingresos, puntuación credi1cia, edad, etc.,
dependiendo de lo que hayas definido.
• EmploymentFull.)me, EmploymentPart.)me,
[Link], EmploymentUnemployed: Estas parecen
ser variables dummy relacionadas con el estado de empleo de un
individuo. Una variable dummy es una variable categórica que ha sido
conver1da en una serie de variables booleanas (0 o 1). Por ejemplo, si
un individuo está empleado a 1empo completo, entonces
"EmploymentFull.1me" sería 1 y las otras tres serían 0.
• Default: Esta podría ser una variable binaria que indica si un individuo
ha incumplido (por ejemplo, no ha pagado una deuda) o no. Un valor de
1 podría indicar un incumplimiento, mientras que un 0 podría indicar
que no ha habido incumplimiento. 132
Ejemplo prác<co 2 de red neuronal
para probabilidad de incumplimiento
en RStudio
# Instalacion y carga de librerias
[Link]("Cairo")
library(Cairo)
library(neuralnet)
library(MASS)

133
Ejemplo prác<co 2 de red neuronal
para probabilidad de incumplimiento
en RStudio
# Generación de datos simulados # Convertir "Default" a factor
[Link](123) df$Default <- ifelse(df$Default >= 0.5,
1, 0)
n <- 1000
Sigma <- diag(c(100, 250, 3, 1, 0.5,
0.3, 0.2, 0.1, 0.05)) # Dividir datos en entrenamiento y
prueba
[Link](123)
mu <- c(50, 500, 2, 0.5, 0.3, 0.2, 0.1,
0.05, 0.7) indices <- sample(1:nrow(df),
nrow(df)*0.7)
train <- df[indices,]
data <- MASS::mvrnorm(n, mu,
Sigma) test <- df[-indices,]
df <- [Link](data)
colnames(df) <- c("A", "B", "C", "D",
"[Link]",
"[Link]",
"[Link]",
"EmploymentUnemployed", "Default")

134
Ejemplo prác<co 2 de red neuronal
para probabilidad de incumplimiento
en RStudio
# Normalización de los datos # Dividir datos normalizados en
entrenamiento y prueba
normalize <- function(x) {
train_normalized <-
return ((x - min(x)) / (max(x) df_normalized[indices,]
- min(x)))
test_normalized <-
} df_normalized[-indices,]

df_normalized <- # Entrenar la red con más


[Link](lapply(df[,c("A", iteraciones
"B", "C", "D",
"[Link]", nn <- neuralnet(Default ~ A + B
"[Link]", + C + D + [Link] +
"[Link]", [Link] +
"EmploymentUnemployed")], [Link] +
normalize)) EmploymentUnemployed, data
= train_normalized, hidden = 5,
df_normalized$Default <- [Link] = "logistic", [Link]
df$Default = FALSE, stepmax = 1e+06)
135
Ejemplo prác<co 2 de red neuronal
para probabilidad de incumplimiento
en RStudio
predic;ons <- compute(nn,
test_normalized[,c("A", "B", "C", "D",
"EmploymentFull.;me", predicted_probs <- compute(nn,
"EmploymentPart.;me", test_normalized[,c("A", "B", "C", "D",
"[Link]", "[Link]",
"EmploymentUnemployed")])$[Link] "[Link]",
"[Link]",
"EmploymentUnemployed")])$[Link]
# Conver;r las predicciones a probabilidades
predicted_probabili;es <- predic;ons

# Opcionalmente, si deseas una clasificación


dura (es decir, 0 o 1 en lugar de una
probabilidad),
# puedes usar un umbral, por ejemplo 0.5, para
decidir las clases.
predicted_classes <-
ifelse(predicted_probabili;es > 0.5, 1, 0)

136
Ejemplo prác<co 2 de red neuronal
para probabilidad de incumplimiento
en RStudio
# el plot de los datos podría
requerir instalar xquartz
# hlps://[Link]/

hist(predicted_probs,
main="Distribución de
Probabilidades de
Incumplimiento",
xlab="Probabilidad de
Incumplimiento",
breaks=50, col="skyblue")
abline(v=0.5, col="red",
lwd=2) # Línea vertical en
el umbral del 50%

137
Resultados
1.A la izquierda de la línea roja (< 0.5): Estas son las observaciones
que, según el modelo, Oenen una probabilidad de menos del 50%
de incumplir. En otras palabras, el modelo esOma que es más
probable que estas observaciones cumplan.
2.A la derecha de la línea roja (> 0.5): Estas son las observaciones
que, según el modelo, Oenen una probabilidad de más del 50% de
incumplir. Es decir, el modelo esOma que es más probable que
estas observaciones incumplan.
Si la mayoría de tus datos están a la derecha de la línea roja, eso
sugiere que el modelo esOma que la mayoría de las observaciones
en tu conjunto de datos de prueba son propensas a incumplir.
• Sin embargo, es importante notar que esto no significa
necesariamente que el modelo sea preciso.
• Siempre es importante evaluar la precisión del modelo uOlizando
métricas apropiadas y comparando las predicciones del modelo con los
datos reales (verdaderos posiOvos, verdaderos negaOvos, falsos
posiOvos y falsos negaOvos).

138
Algoritmos
gené<cos (AG)
aplicados a la
probabilidad de
incumplimiento.

139
Breve introducción a los
algoritmos genéCcos
• Un algoritmo gené3co es un algoritmo de búsqueda
inspirado en el proceso de selección natural que
pertenece a la clase más grande de algoritmos
evolu3vos (AE).
• Se usa comúnmente para encontrar soluciones
aproximadas a problemas de op3mización y búsqueda.
• Funcionan mediante una población de posibles
soluciones a un problema, y a través de iteraciones
(generaciones), las soluciones son seleccionadas
basadas en su ap3tud y son some3das a operaciones
como cruza y mutación para formar una nueva
generación de soluciones.

140
Algoritmos gené<cos para modelar la
probabilidad de incumplimiento:
Esquema general
1. Representación del individuo: Cada individuo podría
representar un conjunto específico de reglas o parámetros que
determinan la probabilidad de incumplimiento.
Por ejemplo, un individuo podría ser una combinación de coeficientes si
estás usando una regresión logísOca.
2. Función de ap9tud: La función de apOtud (o fitness) podría ser
la precisión del modelo (o cualquier otra métrica de interés,
como el AUC) en un conjunto de validación.
3. Selección: Basado en la función de apOtud, selecciona a los
individuos que se reproducirán en la siguiente generación.
4. Cruza (recombinación): Combinar dos individuos para producir
uno o más descendientes.
Por ejemplo, si estás usando coeficientes de regresión, podrías
promediarlos.

141
Algoritmos gené<cos para modelar la
probabilidad de incumplimiento:
Esquema general
5. Mutación: Cambia aleatoriamente algunos valores de
un individuo con una cierta probabilidad.
6. Nueva generación: Produce una nueva población de
soluciones a par3r de las anteriores, u3lizando las
operaciones de selección, cruza y mutación.
7. Itera: Repite los pasos 3-6 hasta que se cumpla un
criterio de parada, como un número máximo de
generaciones o una mejora mínima en la función de
ap3tud.
Al final de este proceso, debes tener un conjunto de
parámetros o reglas que produzcan un buen modelo para
la probabilidad de incumplimiento.
142
Algoritmos gené<cos para modelar la
probabilidad de incumplimiento:
Consideraciones
• OverfiIng: Al igual que con cualquier otro método de
modelado, es esencial tener cuidado con el
sobreajuste. Es recomendable tener conjuntos
separados de datos para entrenamiento, validación y
prueba.
• Complejidad: Los AG pueden ser computacionalmente
intensivos, por lo que es esencial monitorear la
convergencia y tal vez establecer límites en la can3dad
de generaciones.
• Interpretabilidad: Aunque los AG pueden ser
poderosos, pueden no ser tan interpretables como
otros métodos. Si la interpretabilidad es esencial,
podría ser necesario buscar otras técnicas o formas de
post-procesar los resultados de los AG.
143
Ejemplo en RStudio para modelar la
probabilidad de incumplimiento u,lizando
algoritmos gené,cos con el paquete GA
• Supongamos que 4enes un conjunto de datos con
dos variables predictoras (var1 y var2) y una
variable binaria de respuesta (incumplimiento) que
indica si hubo incumplimiento (1) o no (0).

144
Ejemplo en RStudio para modelar la
probabilidad de incumplimiento u,lizando
algoritmos gené,cos con el paquete GA
1. Instala y carga los paquetes necesarios 2. Simulemos algunos datos:
[Link](123)
[Link]("GA")
[Link]("dplyr") # Generar datos ficticios
n <- 1000
library(GA) df <- [Link](
library(dplyr) var1 = rnorm(n, mean = 50, sd = 10),
var2 = rnorm(n, mean = 60, sd = 15)
)

# Añadir una respuesta binaria basada


en una regresión logística ficticia
df$incumplimiento <- with(df, ifelse(0.5
- 0.03*var1 + 0.02*var2 + rlogis(n) > 0,
1, 0))

145
Ejemplo en RStudio para modelar la
probabilidad de incumplimiento u,lizando
algoritmos gené,cos con el paquete GA
3. Definir la función de ap2tud para el algoritmo gené2co: 4. Ejecuta el algoritmo gené3co:

fitness_function <- function(string) { [Link](123)


beta0 <- string[1]
beta1 <- string[2] ga_model <- ga(
beta2 <- string[3] type = "real-valued",
fitness = fitness_function,
# Estimar la probabilidad usando una función logit min = c(-10, -0.1, -0.1),
predicted_prob <- with(df, exp(beta0 + beta1*var1 + max = c(10, 0.1, 0.1),
beta2*var2) / (1 + exp(beta0 + beta1*var1 +
beta2*var2))) popSize = 50,
maxiter = 100,
# Calcula la log-verosimilitud run = 50
ll <- with(df, sum(incumplimiento * )
log(predicted_prob) + (1 - incumplimiento) * log(1 -
predicted_prob)))

return(ll)
}

146
Ejemplo en RStudio para modelar la
probabilidad de incumplimiento u,lizando
algoritmos gené,cos con el paquete GA
5. Muestra los resultados:

summary(ga_model)
plot(ga_model)

147
Resultados

148
Resultados
• @soluLon: Representa la mejor solución encontrada,
es decir, los valores de las variables que maximizan (o
minimizan) la función de ap3tud. En el contexto de
nuestro ejemplo, estos serían los coeficientes que
maximizan la log-verosimilitud.
• @fitnessValue: Es el valor de la función de ap3tud para
la mejor solución encontrada. En nuestro caso, este es
el valor máximo de la log-verosimilitud.
• Otros: Hay muchos otros valores y configuraciones
almacenados en este objeto, pero los más relevantes
para interpretar los resultados son la solución y el valor
de ap3tud.

149
Resultados
• Eje x: Representa las generaciones. Cada punto en este eje es una
generación.
• Eje y: Representa el valor de la función de ap1tud.
• Línea azul: Muestra el valor de la función de ap1tud del mejor individuo
en cada generación. Si esta línea 1ende a estabilizarse, sugiere que el
algoritmo puede haber convergido a una solución.
• Línea roja: Es el promedio de la función de ap1tud de todos los
individuos en la población para una generación dada. Esta línea da una
idea de cómo está evolucionando la población en general.
Observar este gráfico puede ayudarte a entender si el algoritmo está
convergiendo y cuántas generaciones podrían ser necesarias para obtener
una buena solución.
Si las líneas se estabilizan y no hay mejoras notables durante varias
generaciones, es una señal de que el algoritmo podría haber encontrado
una solución óp1ma (o al menos una solución cercana al óp1mo).

150
Modelos de
supervivencia

151
Modelos de supervivencia
• Un modelo de supervivencia se refiere wpicamente
a técnicas estadís4cas que se u4lizan para predecir
el 4empo hasta un evento par4cular, como la
quiebra de una empresa o el incumplimiento de un
préstamo.
• El obje4vo es analizar y modelar el 4empo que
transcurrirá hasta que ocurra ese evento, dadas
ciertas condiciones o caracterís4cas.

152
Puntos clave sobre los modelos de
supervivencia en finanzas
• Función de Riesgo y Función de Supervivencia:
• La función de riesgo describe la probabilidad de que el evento de interés ocurra
en un momento específico, dado que no ha ocurrido hasta ese momento.
• La función de supervivencia muestra la probabilidad de que el evento no haya
ocurrido hasta un momento específico.
• Censura:
• Uno de los principales desaEos al trabajar con datos de supervivencia es la
censura, que ocurre cuando no se observa el evento de interés durante el
periodo de estudio.
• Por ejemplo, si estamos estudiando quiebras de empresas durante un periodo de 5 años,
algunas empresas podrían no haber quebrado al final de ese periodo. Esta falta de
observación se considera "censurada".
• Modelos Paramétricos y No Paramétricos: Existen diferentes formas de
abordar el análisis de supervivencia. Los modelos paramétricos asumen
una distribución específica para la duración hasta el evento (como una
distribución exponencial o Weibull), mientras que los modelos no
paramétricos no hacen tales suposiciones.

153
Puntos clave sobre los modelos de
supervivencia en finanzas
• Aplicaciones en Finanzas:
• Riesgo de Crédito: Los modelos de supervivencia pueden ser
u1lizados para predecir la probabilidad de que un prestatario
incumpla un préstamo basándose en sus caracterís1cas y
condiciones financieras.
• Análisis de Quiebras: Estos modelos pueden ayudar a predecir la
probabilidad de que una empresa entre en quiebra basándose en
sus estados financieros y condiciones del mercado.
• Estrategias de Trading: Los inversores pueden u1lizar modelos de
supervivencia para predecir la duración de ciertas condiciones de
mercado.
• Herramientas Populares: En el mundo del análisis de
supervivencia, el modelo de riesgos proporcionales de Cox
es una herramienta comúnmente u9lizada. Este modelo
permite es9mar el efecto de múl9ples variables sobre el
9empo hasta el evento sin asumir una forma funcional
específica para la línea de base del riesgo.
154
Modelos de riesgo proporcional
de Cox
• El modelo de riesgos proporcionales de Cox,
también conocido como el modelo de Cox, es un
modelo estadís8co ampliamente u8lizado en el
análisis de supervivencia.
• Este 8po de análisis se u8liza comúnmente en
áreas como la medicina, donde puede estar
interesado en analizar el 8empo hasta un evento,
como la muerte, la recuperación de una
enfermedad, o el fallo de un disposi8vo médico.

155
Modelos de riesgo proporcional
de Cox
• El modelo de Cox te permite examinar el efecto de
varias variables en el 8empo hasta que ocurra un
evento de interés.
• A diferencia de muchos otros modelos estadís8cos,
no asume una forma específica para la función de
8empo hasta el evento, lo que lo hace muy flexible.

156
Modelos de riesgo proporcional
de Cox
• Los "riesgos proporcionales" se refieren a una
suposición clave en el modelo de Cox: que el efecto
de las variables predictoras es mul8plica8vo con
respecto a la función de riesgo.
• En otras palabras, cambia el riesgo de forma
proporcional.

157
Modelos de riesgo proporcional
de Cox
• El modelo de riesgos proporcionales de Cox
también se puede aplicar en el análisis de riesgo
credi8cio, donde el evento de interés es el
incumplimiento de un préstamo o de un pago.
• En este contexto, el 8empo hasta el evento se
considera el 8empo hasta el incumplimiento.
• Las variables predictoras podrían ser caracterís8cas
del prestatario, como su historial credi8cio, su nivel
de ingresos, su edad, etc., así como caracterís8cas
del préstamo, como su tamaño, su duración, el 8po
de interés, etc.

158
Modelos de riesgo proporcional
de Cox
EsGmación del modelo:
• El modelo de Cox se u8liza para es8mar la función
de riesgo de incumplimiento en función de las
variables predictoras.
• Para cada prestatario, el modelo produce una
es8mación del riesgo de incumplimiento en
cualquier punto del 8empo, dadas las
caracterís8cas del prestatario y del préstamo.

159
Modelos de riesgo proporcional
de Cox
Interpretación de los coeficientes:
• Los coeficientes del modelo de Cox pueden ser
interpretados como las proporciones de riesgo. Por
ejemplo, si el coeficiente para "nivel de ingresos" es
nega8vo, esto sugiere que un mayor nivel de
ingresos se asocia con un menor riesgo de
incumplimiento.
• Si el coeficiente para "tamaño del préstamo" es
posi8vo, esto sugiere que un préstamo más grande
se asocia con un mayor riesgo de incumplimiento.
• Un coeficiente de 0 indica que no hay relación.
160
Modelos de riesgo proporcional
de Cox
Predicción del riesgo de incumplimiento
• Para un nuevo préstamo o prestatario, puedes
u8lizar el modelo de Cox para predecir el riesgo de
incumplimiento en función de sus caracterís8cas.
• Esto puede ser ú8l para tomar decisiones sobre si
conceder o no un préstamo, o para establecer las
condiciones del préstamo.

161
Ejercicio de riesgo proporcional
de Cox para PD en RStudio
# Instala la librería
[Link]("survival”)

# Carga la librería
library(survival)

# Carga los datos


data(lung)

162
Base de datos Lung
La base de datos lung es un conjunto de datos sobre supervivencia de pacientes con cáncer de pulmón avanzado.
Esta base de datos es parte del paquete survival en R. A con=nuación, describiré las variables que con=ene:
1. age: Edad del paciente al momento del diagnós=co.
2. sex: Sexo del paciente (1 = masculino, 2 = femenino).
3. [Link]: Puntuación de estado funcional del Eastern Coopera=ve Oncology Group (ECOG). Es una medida de la
capacidad del paciente para realizar ac=vidades diarias. Ranges from 0 (fully ac=ve) to 4 (completely disabled).
4. [Link]: Puntuación de estado funcional medida por el terapeuta u=lizando la escala de Karnofsky, que va
desde 0 (muerto) hasta 100 (sin síntomas, totalmente ac=vo). Es similar a [Link] pero en una escala
diferente.
5. [Link]: Puntuación de estado funcional medida por el paciente, también u=lizando la escala de Karnofsky.
6. [Link]: Calorías consumidas en una comida test.
7. [Link]: Pérdida de peso en los úl=mos seis meses.
8. :me: Tiempo de supervivencia o =empo hasta el evento (en días).
9. status: Estado al final del =empo de seguimiento.
1. 1: El paciente falleció (evento de interés).
2. 2: El paciente estaba vivo al final del estudio (censurado).
[Link]: Iden=ficador del ins=tuto médico donde fue tratado el paciente. Esta variable a menudo se omite de los
análisis ya que no =ene un significado claro sin información adicional sobre los ins=tutos.

163
Ejercicio de riesgo proporcional
de Cox para PD en RStudio
# Ajusta un modelo de Cox
cox_model <- coxph(Surv(time, status) ~ age
+ sex + [Link], data = lung)

# Imprime un resumen del modelo


summary(cox_model)

164
Modelos de supervivencia
paramétricos
• Los modelos de supervivencia paramétricos
asumen una distribución específica para el 8empo
hasta el evento.
• Estos modelos suelen ser más flexibles en términos
de las predicciones y extrapolaciones que pueden
hacer, pero requieren que los datos se ajusten a
una distribución específica.

165
Modelos de supervivencia
paramétricos comunes
• Modelo Exponencial: Es el más simple y asume un riesgo constante en
el 1empo.
h(t)=λ
donde h(t) es la función de riesgo y λ es una constante.
• Modelo Weibull: Generaliza el modelo exponencial al permi1r un
riesgo que no es constante.
h(t)=λptp−1
donde p es una forma o parámetro de escala.
• Modelo Gompertz: Es u1lizado en demograka y actuaría y asume una
función de riesgo que es una función exponencial del 1empo.
• Modelo Log-logís)co: Adecuado cuando el riesgo primero aumenta y
luego disminuye, o viceversa.
• Modelo Log-normal: Supone que el logaritmo del 1empo hasta el
evento sigue una distribución normal.

166
Ejemplo de modelos de
supervivencia en RStudio
#instala paquetes necesarios
[Link]("survival")
library(survival)

#Crea un conjunto de datos


[Link](123)
mis_datos <- [Link](
tiempo = rexp(100, rate = 0.05),
evento = rbinom(100, size = 1, prob = 0.7))

167
Ejemplo de modelos de
supervivencia en RStudio
#Ajusta un modelo de supervivencia Weibull
modelo_weibull <- survreg(Surv(tiempo, evento)
~ 1, data = mis_datos, dist = "weibull")
summary(modelo_weibull)

#modelo log-logístico
modelo_loglog <- survreg(Surv(tiempo, evento)
~ 1, data = mis_datos, dist = "loglogistic")
summary(modelo_loglog)

168
Modelo exponencial de
supervivencia
• Se basa en la suposición de que el riesgo o tasa de
fallo es constante en el 8empo.
• Es decir, la probabilidad de que el evento de
interés (por ejemplo, la muerte, la falla de un
disposi8vo, etc.) ocurra en el próximo instante de
8empo es la misma, sin importar cuánto 8empo ha
transcurrido.

169
Función de riesgo (hazard
funcCon)
• La función de riesgo h(t) es constante en el 8empo:
ℎ(𝑡) = 𝜆
• donde λ es la tasa de fallo. Es una constante
posi8va y refleja el riesgo promedio durante el
período de estudio.

170
Función de supervivencia
• La función de supervivencia, que da la probabilidad
de que un individuo sobreviva más allá del 8empo
t, se deriva de la función de riesgo y es:
𝑆(𝑡) = 𝑒 − 𝜆𝑡

171
Aplicaciones
• Dado que el modelo exponencial supone un riesgo
constante, se aplica mejor en situaciones donde
esta suposición es razonable.
• Esto podría ser el caso para ciertas enfermedades
donde el riesgo de mortalidad no aumenta ni
disminuye con el 8empo, o en contextos
industriales donde la probabilidad de fallo de un
disposi8vo es constante con el 8empo (por
ejemplo, fallo de componentes electrónicos en
ausencia de desgaste).

172
Ajuste en R
• Ajustar un modelo exponencial en R es similar al
ajuste de otros modelos de supervivencia.
• Usando el paquete survival, puedes ajustar un
modelo exponencial de la siguiente manera:
library(survival)
modelo_exponencial <- survreg(Surv(tiempo,
evento) ~ 1, data = mis_datos, dist = "exp")
summary(modelo_exponencial)

173
Limitaciones
• La principal limitación del modelo exponencial es
su suposición de riesgo constante.
• En muchos contextos reales, el riesgo no es
constante en el 8empo.
• Por ejemplo, la probabilidad de que un paciente con
una enfermedad crónica muera puede aumentar con el
9empo.
• En tales casos, otros modelos, como el Weibull, pueden
ser más apropiados.

174
Modelo Weibull
• A diferencia del modelo exponencial, el modelo
Weibull no supone un riesgo constante a lo largo
del 8empo.
• En cambio, permite que el riesgo aumente o
disminuya a medida que avanza el 8empo.

175
Función de riesgo (hazard
funcCon)
La función de riesgo para el modelo Weibull es:
ℎ(𝑡) = 𝜆𝑝𝑡 LM)
donde:
λ es una constante de escala.
p es el parámetro de forma. Este parámetro determina
cómo cambia el riesgo a lo largo del 3empo.
• Si p=1, el modelo Weibull se reduce al modelo
exponencial, y el riesgo es constante.
• Si p>1, el riesgo aumenta con el 3empo, y si p<1, el
riesgo disminuye con el 3empo.
176
Función de supervivencia
La función de supervivencia para el modelo Weibull
es:
𝑆 𝑡 = −λ𝑝𝑡 IJ!

177
Aplicaciones del modelo weibull
• El modelo Weibull es ampliamente u8lizado en
biometría y fiabilidad.
• Es especialmente ú8l cuando el riesgo de evento
no es constante a lo largo del 8empo, lo cual es
común en estudios de supervivencia médica y en
análisis de fiabilidad de productos.

178
Ajuste en R
• Ajustar un modelo Weibull en R es similar al ajuste
de otros modelos de supervivencia.
• Usando el paquete survival, puedes hacerlo de la
siguiente manera:
library(survival)
modelo_weibull <- survreg(Surv(tiempo,
evento) ~ 1, data = mis_datos, dist =
"weibull")
summary(modelo_weibull)

179
Ventajas y limitaciones
• Ventajas:
• El modelo Weibull es más flexible que el exponencial debido a
su parámetro de forma adicional.
• Esta flexibilidad le permite adaptarse a una variedad de patrones
de riesgo a lo largo del 5empo.
• Limitaciones:
• Aunque el modelo Weibull es más flexible que el exponencial,
todavía hace suposiciones paramétricas sobre la forma de la
función de riesgo.
• Si estas suposiciones no se cumplen, el modelo puede no ser
adecuado.
• Es importante realizar diagnósOcos de residuos y otros
chequeos para asegurarse de que el modelo se ajuste bien a
los datos.

180
Modelo Gompertz
• El modelo Gompertz describe un riesgo que
aumenta o disminuye exponencialmente con el
8empo.
• Es especialmente conocido por su capacidad para
capturar patrones de mortalidad en estudios
demográficos.

181
Función de riesgo (hazard
funcCon)
• La función de riesgo para el modelo Gompertz es:

182
Función de supervivencia
• La función de supervivencia para el modelo Gompertz se deriva de su
función de riesgo y es

183
Aplicaciones
• Dada su habilidad para modelar tasas de
mortalidad que cambian exponencialmente con la
edad, el modelo Gompertz ha sido ampliamente
u8lizado en demograVa y estudios de esperanza de
vida.
• También puede encontrarse en algunas
aplicaciones de fiabilidad y en estudios de
supervivencia médica.

184
Ajuste en R
• Ajustar un modelo Gompertz en R puede requerir
paquetes adicionales o funciones personalizadas.
• Sin embargo, una forma de hacerlo usando el
paquete flexsurv es:
[Link]("flexsurv")
library(flexsurv)
modelo_gompertz <- flexsurvreg(Surv(tiempo,
evento) ~ 1, data = mis_datos, dist = "gompertz")
summary(modelo_gompertz)

185
Ventajas y limitaciones
• Ventajas:
Al igual que el modelo Weibull, el Gompertz es más
flexible que el exponencial y es par9cularmente adecuado
para datos donde el riesgo cambia exponencialmente con
el 9empo.
• Limitaciones:
Aunque el modelo Gompertz puede adaptarse bien a
ciertos patrones de datos, hace suposiciones específicas
sobre la forma en que el riesgo cambia con el 9empo.
Si estos supuestos no se man9enen, el modelo puede no
ser adecuado.

186
Modelo Log-logísCco
• El modelo log-logís8co describe 8empos hasta un
evento que siguen una distribución log-logís8ca.
• Es decir, el logaritmo del 8empo hasta el evento
8ene una distribución logís8ca.

187
Función de riesgo (hazard
funcCon
• La función de riesgo para el modelo log-logís8co es:

188
Función de supervivencia
• La función de supervivencia para el modelo log-
logís8co es:

189
Aplicaciones
• El modelo log-logís8co se u8liza en estudios de
supervivencia médica, análisis de fiabilidad y
demograVa.
• Es especialmente ú8l en situaciones en las que el
riesgo primero aumenta y luego disminuye, o
viceversa, lo que se refleja en una función de riesgo
que 8ene un pico.

190
Ajuste en R
• Puedes ajustar un modelo log-logís8co en R
u8lizando el paquete survival

library(survival)
modelo_loglog <- survreg(Surv(tiempo, evento) ~ 1,
data = mis_datos, dist = "loglogistic")
summary(modelo_loglog)

191
Ventajas y limitaciones
• Ventajas:
• El modelo log-logísOco es versáOl y puede capturar patrones
de supervivencia que otros modelos paramétricos (como el
exponencial) no pueden.
• La forma de la función de riesgo, que puede tener un pico, lo
hace adecuado para muchos conjuntos de datos en
biometría.
• Limitaciones:
• Como cualquier modelo paramétrico, el log-logísOco hace
suposiciones específicas sobre la forma de la función de
supervivencia y de riesgo.
• Es importante verificar estas suposiciones y asegurarse de
que el modelo se ajuste adecuadamente a los datos

192
Modelo Log-normal
• En el modelo log-normal, se supone que el
logaritmo natural de los 8empos hasta el evento
sigue una distribución normal.
• Esto implica que el 8empo hasta el evento en sí
8ene una distribución log-normal.

193
Función de densidad de
probabilidad
La función de densidad de probabilidad para una
variable log-normal es:

donde:
μ es el parámetro de ubicación, que es igual al
logaritmo de la mediana del 8empo hasta el evento.
σ es el parámetro de escala, que representa la
dispersión.

194
Función de supervivencia:
• Dado que el 8empo hasta el evento sigue una
distribución log-normal, la función de supervivencia
es:

195
Ajuste en R:
• Puedes ajustar un modelo log-normal u8lizando el
paquete survival en R de la siguiente manera:

library(survival)
modelo_lognorm <- survreg(Surv(tiempo, evento) ~
1, data = mis_datos, dist = "lognormal")
summary(modelo_lognorm)

196
Modelos
Autoregresivos

197
Transformaciones de series
• Las transformaciones suelen ser ú3les para estabilizar
una serie antes de es3mar modelos.
• Esto es especialmente importante para modelos
ARIMA, que necesitan que las series
sean estacionarias antes de es3mar los modelos.
• Una serie es estacionaria si el nivel global (media) y la
desvianza media del nivel (varianza) son constantes a lo
largo de la serie.
• Aunque la mayoría de las series interesantes no son
estacionarias, ARIMA es eficaz siempre y cuando la
serie se pueda conver3r en estacionaria mediante la
aplicación de transformaciones tales como el logaritmo
natural, la diferenciación o la diferenciación estacional.

198
Serie Estacionaria y no
estacionaria

199
Transformaciones de
estabilización de la varianza
• Las series en las que la varianza cambia a lo largo
del 8empo con frecuencia se pueden estabilizar con
una transformación logarítmica natural o de raíz
cuadrada.
• También reciben el nombre de transformaciones
funcionales:
ØLogaritmo natural. El logaritmo natural se aplica a los
valores de las series.
ØRaíz cuadrada. La función de raíz cuadrada se aplica a los
valores de las series.

200
Transformaciones de
estabilización del nivel
• Un suave descenso de los valores de la Función de
Autocorrelación Simple indica que todos los valores de
la serie están estrechamente correlacionados con el
valor anterior.
• Si analiza el cambio de los valores de la serie, obtendrá
un nivel estable.
ØDiferenciación simple. Se calculan las diferencias existentes
entre cada valor y el anterior de la serie, a excepción del valor
más anOguo de la serie. Por tanto, la serie diferenciada tendrá
un valor menos que la serie original.
ØDiferenciación estacional. Es idénOca a la diferenciación
simple, excepto en que se calculan las diferencias existentes
entre cada valor y el valor estacional anterior.

201
Ejemplo de transformación

202
Pasos de iden4ficación de un
modelo de series temporales
1) Decidir si 𝑋K necesita ser transformada para
eliminar la no estacionariedad en media p en la
no estacionariedad en varianza
(heteroscedas8cidad).
• Puede ser conveniente u9lizar logaritmos de la serie o
aplicar la transformación de Box-Cox.

203
Pasos de iden4ficación de un
modelo de series temporales
2) Determinación del grado d de diferenciación
adecuado.
• En general, la falta de estacionariedad se manifiesta en que
los coeficientes de la función de autocorrelación esOmada
Oenden a decrecer muy lentamente.
• La pregunta es, ¿cuán lentamente ha de ser el decrecimiento
de los coeficientes de la función de autocorrelación parcial
(ACFP) para que el proceso sea estacionario?.
• En general, solo ocasionalmente los datos económicos del
correlograma dejarán de decrecer tras las primeras diferencias, y
en este caso serían necesarias segundas diferencias.
• Una diferenciación superflua solo sirve para alterar el esquema de
autocorrelación evidente en una serie estacionaria y complicarlo
innecesariamente.

204
Pasos de iden4ficación de un
modelo de series temporales
3) Decidir los valores de (p, q), y si existe una
componente estacional, decidir los órdenes de
los operadores estacionales (P, Q).
• Para este apartado se u9lizan las funciones de
autocorrelación (ACF) y autocorrelación parcial (ACFP)
según el siguiente cuadro:
Proceso Función de autocorrelación (ACF) Función de autocorrelación parcial (ACFP)
Solo los q primeros coeficientes son
Decrecimiento rápido exponencial
MA(q) significativos. El resto se anulan
atenuado u ondas sinusoidales.
bruscamente (coef. 0 para retardo >q)
Solo los p primeros coeficientes son
Decrecimiento rápido exponencial atenuado
AR(p) significativos. El resto se anulan
u ondas sinusoidales.
bruscamente (coef. 0 para retardo >q)
Comportamiento irregular en los retardos Decrece (aproximadamente con
ARIMA(p, d, q) (1, ... , q) con q picos. Decrecimiento para exponenciales atenuados y ondas
retardos posteriores a q. sinusoidales). No cero pronto.

205
Modelos Autorregresivos AR(p)
• Un modelo autorregresivo AR describe una clase
par8cular de proceso en que las observaciones en
un momento dado son predecibles a par8r de las
observaciones previas del proceso más un término
de error.
• El caso más simple es el ARIMA(1,0,0) o AR(1) o de
primer orden, cuya expresión matemá8ca es:
𝐴𝑅 1 ≡ 𝑋K = ϕ! 𝑋KJ! + 𝑎K

206
Modelo de Medias Móviles Ma(q)
• Un modelo de medias móviles MA describe una
serie temporal estacionaria.
• En este modelo el valor actual puede predecirse a
par8r de la componente aleatoria de este
momento y, en menor medida, de los impulsos
aleatorias anteriores.

207
Modelo de Medias Móviles Ma(q)
• El modelo ARIMA(0,0,1), también denotado por
MA(1), viene dado por la expresión:

𝑋K = 𝑎K − 𝑋! 𝑎KJ!

• Un proceso de medias móviles es siempre


estacionario.

208
Modelos ARMA (p, q)
• Una extensión natural de los modelos AR(p) y
MA(q) es un 8po de modelos que incluyen tanto
términos autorregresivos como de medias móviles
y se definen como ARIMA(p, 0, q).
• Se representan por la ecuación:

𝑋+ = 𝜙' 𝑋+$' + 𝜙* 𝑋+$* + … + 𝜙, 𝑋+$, + 𝑎+ − 𝑣' 𝑎+$' − 𝑣' 𝑎+$* −. . . −𝑣- 𝑎+$-

209
Modelos ARMA (p, q)
• que puede ponerse de la forma:
𝑋( − 𝜙! 𝑋()! + 𝜙% 𝑋()% + … + 𝜙* 𝑋()*
= 𝑎( − 𝑣! 𝑎()! − 𝑣! 𝑎()% −. . . −𝑣+ 𝑎()+

• es decir,
𝑋0 (1 − 𝜙/ B + 𝜙- 𝐵- − … − 𝜙7 𝐵7 ) = 𝑎0 (1 − 𝑣/ B − 𝑣- 𝐵- −. . . −𝑣8 𝐵8 )
• El proceso ARMA(p, q) es estacionario si lo es su
componente autorregresiva, y es inver8ble si lo es
su componente de medias móviles.

210
Modelos ARIMA (p, d, q)
• Un modelo ARIMA(0, d, 0) es una serie temporal
que se convierte en ruido blanco (proceso
puramente aleatorio) después de ser diferenciada d
veces.
• El modelo(0,d,0) se expresamediante:
(1 − 𝐵)R 𝑋K = 𝑎K
• El modelo general ARIMA(p, d, q) denominado
proceso autorregresivo integrado de medias
móviles de orden p, d, q, toma la expresión:
1 − 𝜙' B + 𝜙* 𝐵 * − … − 𝜙, 𝐵 , 1 − 𝐵 . 𝑋+ = (1 − 𝑣' B − 𝑣* 𝐵 * −. . . −𝑣- 𝐵 - ) 𝑎+

211
Modelos ARIMA (p, d, q)
• Un modelo ARIMA(p, d, q) permite describir una
serie de observaciones después de que hayan sido
diferenciadas d veces, a fin de extraer las posibles
fuentes de no estacionariedad.
• Esta fórmula se puede aplicar a cualquier modelo.
• Si hay alguna componente p, d, q, igual a cero, se
elimina el término correspondiente de la fórmula
general.

212
Series temporales: (AR2)
MODELO ARIMA(p, d, q) (P, D, Q)s
• Se han analizado las series temporales desde un
punto de vista determinista o clásico.
• A par8r de ahora se estudian desde un punto de
vista estocás8co o moderno, que u8liza métodos
más complejos y su aplicación requiere series más
largas.

213
Series temporales: (AR2)
• Box y Jenkins han desarrollado modelos
estadís8cos para series temporales que 8enen en
cuenta la dependencia existente entre los datos,
esto es, cada observación en un momento dado es
modelada en función de los valores anteriores.
• Los análisis se basan en un modelo explicito.
• Los modelos se conocen con el nombre genérico de
ARIMA (AutoRegresive Integrated Moving
Average), que deriva de sus tres componentes AR
(Autoregresivo), I(Integrado) y MA (Medias
Móviles).

214
Series temporales: (AR2)
• El modelo ARIMA permite describir un valor como
una función lineal de datos anteriores y errores
debidos al azar, además, puede incluir un
componente cíclico o estacional.
• Es decir, debe contener todos los elementos
necesarios para describir el fenómeno.
• Box y Jenkins recomiendan como mínimo 50
observaciones en la serie temporal.

215
La metodología de Box y Jenkins
se resume en cuatro fases
• La primera fase
• Consiste en iden;ficar el posible modelo ARIMA que sigue la serie, lo que requiere:
• Decidir qué transformaciones aplicar para conver=r la serie observada en una serie estacionaria.
• Determinar un modelo ARMA para la serie estacionaria, es decir, los órdenes p y q de su
estructura autorregresiva y de media móvil.
• La segunda fase:
• Seleccionado provisionalmente un modelo para la serie estacionaria, se pasa a la segunda
etapa de es;mación, donde los parámetros AR y MA del modelo se es;man por máxima
verosimilitud y se ob;enen sus errores estándar y los residuos del modelo.
• La tercera fase
• Es el diagnos;co, donde se comprueba que los residuos no ;enen estructura de
dependencia y siguen un proceso de ruido blanco. Si los residuos muestran estructura se
modifica el modelo para incorporarla y se repiten las etapas anteriores hasta obtener un
modelo adecuado.
• La cuarta fase
• Es la predicción, una vez que se ha obtenido un modelo adecuado se realizan predicciones
con el mismo.

216
Es#mación del
Scorecard

217
1. Definición del obje4vo del
Scorecard
• El obje8vo principal es predecir un evento binario,
como "pago o impago", "acepta o rechaza", etc.
• Se establece una métrica de rendimiento como la
probabilidad de incumplimiento (Probability of
Default, PD) o la probabilidad de respuesta.

218
2. Selección y preparación de
datos
a) Iden)ficación de variables:
• Se u1lizan variables predictoras que sean relevantes para el modelo,
como ingresos, edad, historial de crédito, entre otros.
• Las variables deben ser evaluadas en términos de su calidad, relevancia
y disponibilidad.
b) Limpieza y transformación:
• Imputación de valores faltantes.
• Eliminación de datos redundantes o irrelevantes.
• Transformación de variables categóricas en numéricas, generalmente
mediante codificaciones como one-hot encoding o weight of evidence
(WoE).
c) División de los datos:
• Los datos se dividen en conjuntos de entrenamiento y validación
(generalmente 70-30 o 80-20).

219
3. Binning de variables
El binning es un proceso clave en los Scorecards:
• Consiste en agrupar los valores de una variable con)nua o categórica en
intervalos o bins.
• El obje)vo es reducir la complejidad, mejorar la interpretabilidad y capturar
relaciones no lineales.
• Se puede hacer manualmente o u)lizando técnicas automá)cas como el
algoritmo de chi-cuadrado o de entropía.
Weight of Evidence (WoE):
• Para cada intervalo, se calcula el 𝑊𝑜𝐸:
%𝑏𝑢𝑒𝑛𝑜𝑠
𝑊𝑜𝐸 = ln
%𝑚𝑎𝑙𝑜𝑠
Donde:
• %𝑏𝑢𝑒𝑛𝑜𝑠 : proporción de clientes que no incumplen en el bin.
• %𝑚𝑎𝑙𝑜𝑠: proporción de clientes que incumplen en el bin.
• WoE permite transformar las variables en un formato más lineal y adecuado
para modelos logís)cos.

220
4. Construcción del modelo
a) Selección del modelo:
• El modelo más común para Scorecards es la regresión
logís3ca binaria, que predice la probabilidad de un evento
basado en las variables predictoras.
• Función:
1
𝑃(𝑌 = 1 ∣ 𝑋) =
1 + 𝑒 I(J, KJ- L- KJ. L. K⋯KJ/ L/ )
b) Entrenamiento del modelo:
• Ajuste del modelo usando los datos transformados (WoE
para variables categóricas o binned).
• Selección de variables significa9vas mediante pruebas
estadís9cas como el valor p o criterios de información
(AIC/BIC).

221
5. Conversión a Scorecard
• Una vez es3mado el modelo logís3co, se convierte a un
formato de Scorecard:
1. Se define una escala de puntaje (por ejemplo, de 300
a 850).
2. Se u3liza una transformación lineal para mapear las
probabilidades en puntajes:
𝑂𝑑𝑑𝑠
𝑆𝑐𝑜𝑟𝑒 = 𝑂𝑓𝑓𝑠𝑒𝑡 + 𝐹𝑎𝑐𝑡𝑜𝑟 × ln( )
1
Donde:
1. Offset y Factor son constantes determinadas por la escala
deseada.
2. Odds se calcula como la relación entre la probabilidad de
éxito y fracaso (𝑃/1 − 𝑃).

222
6. Validación del Scorecard
Se evalúa el desempeño del modelo mediante:
• KS StaGsGc (Kolmogorov-Smirnov): Diferencia
máxima entre las distribuciones acumuladas de
buenos y malos.
• ROC-AUC (Receiver OperaGng CharacterisGc - Area
Under Curve): Capacidad discrimina8va del
modelo.
• GINI Index: Otra métrica de discriminación.
• Li] y Gain: Capacidad del modelo para iden8ficar
correctamente los buenos y malos.

223
7. Implementación
• El Scorecard se implementa en sistemas opera8vos
para evaluar nuevas solicitudes o monitorear la
cartera existente, con reglas predefinidas para
acciones basadas en los puntajes.

224
Caso de estudio: Scorecard para evaluar
la probabilidad de incumplimiento
Supongamos que trabajas en un banco y deseas
construir un Scorecard para evaluar a los clientes que
solicitan un préstamo.
• Datos iniciales
• Tienes un conjunto de datos con las siguientes variables:
• Ingreso mensual (USD)
• Edad (años)
• Historial de pagos (categórico: "Bueno", "Regular",
"Malo")
• Resultado obje9vo (1 si incumple, 0 si no incumple)

225
Datos
Ingreso Historial de
Cliente Edad Incumplimiento
(USD) pagos

A 500 25 Malo 1

B 1500 40 Bueno 0

C 2000 35 Regular 0

D 800 28 Malo 1

E 1200 30 Bueno 0

226
Paso 1: Binning de variables
a) Ingreso mensual
• Agrupamos el ingreso en intervalos:
• Menos de 1000 USD
• Entre 1000 y 2000 USD
• Más de 2000 USD
Intervalo Buenos Malos % Buenos % Malos WoE

Menos de 1000 0 2 0% 100% −∞

1000-2000 2 0 100% 0% +∞

Más de 2000 1 0 100% 0% +∞

227
Paso 1: Binning de variables
b) Edad
• Agrupamos la edad en intervalos:
• Menos de 30 años
• 30 años o más

Intervalo Buenos Malos % Buenos % Malos WoE

Menos de 30 1 2 33.3% 66.7% −0.693

30 años o más 2 0 100% 0% +∞

228
Paso 1: Binning de variables
c) Historial de pagos
• Conver9mos los valores categóricos a WoE según el
comportamiento de buenos y malos:

Categoría Buenos Malos % Buenos % Malos WoE


Bueno 2 0 100% 0% +∞
Regular 1 0 100% 0% +∞
Malo 0 2 0% 100% −∞

229
Paso 2: Construcción del modelo
logístico
Modelo base
• La regresión logís8ca u8liza las variables
transformadas con WoE:
𝐿𝑜𝑔𝑖𝑡(𝑃)
= 𝛽# + 𝛽! (𝐼𝑛𝑔𝑟𝑒𝑠𝑜 𝑊𝑜𝐸) + 𝛽" (𝐸𝑑𝑎𝑑 𝑊𝑜𝐸)
+ 𝛽S (𝐻𝑖𝑠𝑡𝑜𝑟𝑖𝑎𝑙 𝑑𝑒 𝑝𝑎𝑔𝑜𝑠 𝑊𝑜𝐸)

230
Paso 2: Construcción del modelo
logís4co
Supongamos que los coeficientes es1mados son:
𝐿𝑜𝑔𝑖𝑡 𝑃
= −2 + 1.5 (𝐼𝑛𝑔𝑟𝑒𝑠𝑜 𝑊𝑜𝐸) + 1 (𝐸𝑑𝑎𝑑 𝑊𝑜𝐸)
+ 2.5(𝐻𝑖𝑠𝑡𝑜𝑟𝑖𝑎𝑙 𝑑𝑒 𝑝𝑎𝑔𝑜𝑠 𝑊𝑜𝐸)
• 𝛽5 = −2.0
• 𝛽/ = 1.5
• 𝛽- = 1.0
• 𝛽B = 2.5

Probabilidad de incumplimiento
• La probabilidad de incumplimiento se calcula como:
1
𝑃(𝑖𝑛𝑐𝑢𝑚𝑝𝑙𝑖𝑚𝑖𝑒𝑛𝑡𝑜) =
1 + 𝑒 .CDEF0(G)

231
Paso 3: Conversión a Scorecard
1. Definimos una escala con un puntaje base de 500
y un factor de 20.
2. Convertimos las probabilidades a puntajes con la
fórmula:

𝑆𝑐𝑜𝑟𝑒 = 500 + 20×(𝐿𝑜𝑔𝑖𝑡(𝑃))

232
Resultado final
Por ejemplo, para un cliente con:
• Ingreso WoE: -0.693
• Edad WoE: 1.0
• Historial de pagos WoE: 2.5
El logit sería:
𝐿𝑜𝑔𝑖𝑡(𝑃) = −2.0 + (1.5×−0.693) + (1.0×1.0) + (2.5×2.5) = 5.31
La probabilidad de incumplimiento:
1
𝑃= ≈ 0.995
1 + 𝑒 '-./(
El puntaje final:
𝑆𝑐𝑜𝑟𝑒 = 500 + 20×5.31 = 606
Este cliente obtiene un puntaje de 606 en el Scorecard, indicando
un alto riesgo de incumplimiento.

233
Ejemplo de Scorecard para evaluar
la probabilidad de incumplimiento
• Supongamos que trabajas en un banco y deseas
construir un Scorecard para evaluar a los clientes
que solicitan un préstamo.
Datos iniciales
Tienes un conjunto de datos con las siguientes variables:
• Ingreso mensual (USD)
• Edad (años)
• Historial de pagos (categórico: "Bueno", "Regular",
"Malo")
• Resultado objetivo (1 si incumple, 0 si no incumple)

234
1. Preparar los datos
Ingreso Historial de
Cliente Edad Incumplimiento
(USD) pagos
A 500 25 Malo 1
B 1500 40 Bueno 0
C 2000 35 Regular 0
D 800 28 Malo 1
E 1200 30 Bueno 0

235
2. Asignar WoE
Usamos reglas de binning para asignar los valores de WoE en las columnas
correspondientes. Para esto, utilizamos la función SI en Excel.
• Para WoE Ingreso
En la columna "WoE Ingreso", escribimos:

• Para WoE Edad


En la columna "WoE Edad", escribimos:
=SI(C2<30, -0.693, 0.693)

• Para WoE Historial


En la columna "WoE Historial", usamos:
=SI(D2="Malo", -0.693, SI(D2="Regular", 0, 0.693))

236
3. Calcular el Logit
En la columna "Logit(P)", usamos la fórmula de
regresión logística con los coeficientes 𝛽# =
− 2.0, 𝛽! = 1.5, 𝛽" = 1.0, 𝛽S = 2.5:
=-2.0 + (1.5 * E2) + (1.0 * F2) + (2.5 * G2)

237
4. Calcular la probabilidad (P)
• En la columna "Probabilidad (P)", calculamos la
probabilidad utilizando la función logística:
=1 / (1 + EXP(-H2))

238
5. Calcular el Score
Para conver8r la probabilidad a un puntaje en escala,
usamos la fórmula del Scorecard:
𝑆𝑐𝑜𝑟𝑒 = 500 + 20×𝐿𝑜𝑔𝑖𝑡(𝑃)
=500 + (20 * H2)

239
6. Resultados finales
Historial WoE WoE WoE Probabilidad
Cliente Ingreso (USD) Edad Logit (P) Score
de pagos Ingreso Edad Historial (P)
A 500 25 Malo -0.693 -0.693 -0.693 -5.465 0.3334 486.1
B 1500 40 Bueno 0 0.693 0.693 0.4255 0.6666 513.9
C 2000 35 Regular 0 0.693 0 -1.307 0.5000 500.0
D 800 28 Malo -0.693 -0.693 -0.693 -5.465 0.3334 486.1
E 1200 30 Bueno 0 0.693 0.693 0.4255 0.6666 513.9

240

También podría gustarte