0% encontró este documento útil (0 votos)
6 vistas4 páginas

Fijación de Precios con Modelos GLM

El documento describe el modelo de regresión generalizada (GLM) y sus componentes, supuestos y aplicaciones en la estimación de frecuencias y costos. Se detallan los tipos de modelos típicos como Poisson, Gamma, Logit y Tweedie, así como la importancia de seleccionar variables explicativas y realizar análisis previos. Además, se discuten métodos para ajustar tarifas y la utilización de modelos jerárquicos para mejorar la estimación en contextos con datos limitados.

Cargado por

ignacioyacachury
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
6 vistas4 páginas

Fijación de Precios con Modelos GLM

El documento describe el modelo de regresión generalizada (GLM) y sus componentes, supuestos y aplicaciones en la estimación de frecuencias y costos. Se detallan los tipos de modelos típicos como Poisson, Gamma, Logit y Tweedie, así como la importancia de seleccionar variables explicativas y realizar análisis previos. Además, se discuten métodos para ajustar tarifas y la utilización de modelos jerárquicos para mejorar la estimación en contextos con datos limitados.

Cargado por

ignacioyacachury
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

GLM: El intercepto (B0) es el costo medio de un riesgo cuyas características son las

que tome como base en todas las variables, o sea, eB0. Las X son las categorías. Se
utiliza una función de enlace que depende de lo que quiero estimar. Obtengo todos los
B para estimar la frecuencia esperada siendo eB0 la frecuencia base, tengo una
frecuencia base por categoría, multiplico las relatividades para llegar a la frecuencia
que yo quiero estimar.

El modelo tiene 3 supuestos: 1) Variable de respuesta es una familia exponencial, por


lo tanto, tiene una varianza no constante. 2) Mantiene una estructura lineal y se
relaciona con las Y a través de la función link. 3) La función de enlace tiene que
garantizar aditividad.

Tiene 4 componentes: 1) Componente aleatorio, las observaciones. 2) Sistemático, son


las variables predictoras combinadas. 3) Función de enlace, relaciona al predictor lineal
con la variable de respuesta. 4) Termino de compensación, sirve para compensar algo
como cantidad de observados con esperados.

Hay 4 modelos típicos: 1) Poisson, sirve para estimar frecuencias, es invariante en el


tiempo, el intercepto marca la frecuencia base, si eB es mayor al 5% entonces no hay
evidencia de que ese grupo sea distinto al grupo base. 2) Gamma, sirve para estimar
intensidad o costo medio, devuelve montos, el intercepto es el costo medio base, usa
log como función de enlace. 3) Logit, sirve para estimar fuga o retención de clientes,
devuelve resultados entre 0 y 1, o sea, probabilidades. 4) Tweedie, sirve para estimar la
prima pura, usa una masa de probabilidad con un rango de montos positivos, permite
incluir los 0 de gente que no tuvo siniestros.
Si utilizo la función de enlace identidad estoy usando un modelo lineal clásico, trae
distintos problemas, supone homocedasticidad lo que me impide que la varianza se
mueva lo suficiente, no es multiplicativo y el principal problema que es que existe la
posibilidad de tener valores negativos.

Para la construcción de un modelo necesito que mi volumen de datos tenga un


equilibrio entre tamaño de la base, frecuencia siniestral y el grado de segmentación,
para lograr este equilibrio puedo combinar información. Necesito 3 elementos:
1) Variables explicativas y un nivel base, utilizo como base la que tenga la mayor
cantidad de expuestos. 2) Interacciones: Hacer análisis bivariados previos para
encontrar las correlaciones. 3) Coberturas: Las variantes que presente cada ramo.
Tengo que hacer un análisis previo de la base donde voy a eliminar valores ilógicos,
donde tengo que controlar que sucede cuando cruzo la base de siniestros con la de
expuestos y tengo que definir que voy a hacer con los siniestros en 0 y con los
extraordinarios, normalmente los 0 los dejo y los extraordinarios los saco.
Para elegir las variables debo tener en cuenta la disponibilidad y calidad de la variable,
la lógica del negocio y su factibilidad para ser usada como variable, tiene que pasar
una validación técnica par ver si tiene valor explicativo como variable (Forward,
Backward y Stepwise) y debe tener una buena diferenciación entre categorías dentro
de cada variable. Para saber si el efecto de la variable es sistemático o no puedo
realizar una prueba de bondad de ajuste con y sin la variable, medir el nivel de
significatividad de la variable, ver si tiene consistencia en el tiempo y también usar el
sentido común sobre si tiene sentido que sea una variable que explique. Si tengo
variables multinivel donde tengo muchas categorías no significativas puedo usar el
modelo jerárquico para no unir categorías o si no lo quiero utilizar puedo realizar un
agrupamiento, suavizado o eliminación. Realizo un test de coeficiente de variación o
test informal que me ayuda a decidir si hay diferencia o no entre categorías para
agruparlas o no agruparlas.

Las interacciones son que una variable genere efecto en otra, puedo utilizarlas cuando
tengo variables con pocas categorías, se puede hacer de forma marginal donde las
mantengo separadas y agrego otra variable con la interacción o lo puedo hacer de
forma completa donde solo uso la interacción las utilizo cuando el contexto comercial y
la realidad me lo permiten.

La variable tiempo la uso un periodo para corregir el intercepto, busco una tendencia en
el tiempo para proyectar, si no utilizo el tiempo, el modelo usaría promedios erróneos
para encontrar la tendencia.

El IBNR puede traer un efecto negativo y me va a llevar a una tendencia incorrecta,


para evitarlo tengo que retirarme en el tiempo, esto me va a reducir la muestra mas
reciente que tengo que compensar con la variable de compensación.
Antes de hacer la presentación final de la tarifa tengo que revisar todo el modelo, en el
caso en el que un p value me de superior al alfa o un test informal me de unir variables
tengo que decidir según el sentido común, las covariables las agrego en lugar de
categorías cuando tengo irregularidades frente a lo comercial, para corregirlo tengo que
suavizar, modificar el beta o agrupar. El suavizado lo uso cuando tengo muestra chica o
cuando tiene alguna lógica comercial, también puedo aplicar mínimos o máximos, si
sigo teniendo distorsiones tengo que modificar el intercepto, modificar los mínimo o
máximo o cambiar el suavizado. Cuando corregir todo esto y voy a presentar la tarifa
tengo que analizar su impacto sobre el mercado, evaluar zonas vecinas que tengan
mucha diferencia, revisar la amplitud entre los mínimos y máximo, buscar como incluir
las variables que no puedo incluir explícitamente y controlar periódicamente las ventas
y los subsidios cruzados.
El balance property es una propiedad de los modelos glm que garantizan que el modelo
va a estimar la misma cantidad de siniestros que en la muestra y que el costo medio de
la base va a ser igual al estimado. El grossing up o down rompe esta balance property
alterando el intercepto.

Los modelos de costo medio los puedo obtener en unidades monetarias o en


porcentaje, en unidades monetarias obtengo la prima pura en plata, las sumas
aseguradas tienen mucha relevancia como variable explicativa, tiene la desventaja de
que las relatividades no se actualizan lo suficientemente rápido y que presenta más
inconvenientes para proyectar. El modelo en porcentaje me devuelve la prima pura
expresada en porcentaje, es mejor frente a la inflación, me lleva a revisar mas las
relatividades, tiene menor riesgo para proyectar, pero las sumas aseguradas no
siempre están disponibles de la forma mas deseable. Para elegir entre uno y otro busco
cual es mas estable, tengo que fijarme que tan ágil es la empresa para actualizar los
valores, si los datos son buenos y si tengo inflación o cambios en el tipo de cambio.
Cuando voy a tarificar con franquicias tengo que adaptar la base, esto implica modificar
la frecuencia, hay mucha variedad entre franquicias entonces busco franquicias
parecidas o de menor valor a la que quiero tarificar, las puedo utilizar en valores
porcentuales, esto tiene la desventaja de que quedan muy distorsionadas en contextos
inflacionarios. Si lo hago en unidades monetarias necesito estar actualizando
constantemente la suma asegurada, si lo hago en valores porcentuales tengo que tener
todos los datos bien actualizados.

La distribución logística sirve para estimar la retención de clientes, uso la función Logit
𝜋
que es ln (1−𝜋), también puedo utilizar como función de enlace la probit y la log-log, la
probit tiende más rápido a 0 o 1 y la log-log es asimétrica, elijo una de las tres
probando con bondad de ajuste. Esta distribución me sirve para hacer un análisis
dinámico que contemple las características del asegurado frente a cambios en el
precio, para realizarlo bien necesito guardar la historia de ofertas y respuestas.
La regresión logística con tarificación me devuelve una tarifa comercial obtenida con
glm, me permite mezclar la nueva tarifa con el modelo logístico que me da la
probabilidad de retener al cliente. Me permite ver los clientes mas sensibles al precio, la
recaudación estimada y que se le puede modificar a la tarifa ya que obtengo la tarifa
comercial y la retención esperada.

Dentro de un modelo puedo tener limitaciones o restricciones en la tarifa como en las


variables, tengo que buscar la forma de compensar el modelo globalmente,
normalmente se incluye en el offset el ln de las relatividades que quiero modificar.

El modelo glm jerárquico utiliza credibilidad para incluir actividades en las que no tengo
mucha información. Utiliza variables moderadas sacadas del glm y variables multinivel
sacadas del modelo jerárquico, permite analizar estas variables multinivel que un glm
solo no podría. Primero estimo relatividades de las variables glm, corrijo los expuestos,
corro el modelo jerárquico para obtener relatividades de las actividades detalladas que
las uso para corregir el offset del glm y repito el proceso hasta que el modelo converja
hacia unos valores de relatividades.

El modelo glm se puede utilizar para productos enlatados, calculo frecuencia y costo
medio de cada cobertura para obtener la prima pura de cada uno, sumo las primas
puras y agrego valores y después corro un glm sobre las primas puras generales.
Puedo analizar las resultados variable por variable o por efecto global. El efecto global
lo analizo con los gráficos de impacto, puedo tener grafico global o por variable, me
permite ver que categorías son rentables y cuales no y me ayuda a mejorar el
suavizado.

Para incluir los recargos a la tarifa obtenida en el glm se la tengo que sumar al
intercepto, al predictor lineal le agrego +ln (1+recargo).

También podría gustarte