0% encontró este documento útil (0 votos)
15 vistas19 páginas

Introducción a la Regresión Logística

La regresión logística es una técnica de aprendizaje automático utilizada para problemas de clasificación con datos binarios, que mide la relación entre variables dependientes e independientes a través de funciones matemáticas. Existen modelos univariados y multivariados, siendo el modelo binario el más común para predecir la probabilidad de eventos, mientras que el multivariado permite más de dos categorías. La interpretación de los resultados se realiza mediante p-valores y odds ratios, y se aplica en diversos campos como la evaluación de riesgos de deslizamientos y la liquefacción de suelos.

Cargado por

ricardo ortiz
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
15 vistas19 páginas

Introducción a la Regresión Logística

La regresión logística es una técnica de aprendizaje automático utilizada para problemas de clasificación con datos binarios, que mide la relación entre variables dependientes e independientes a través de funciones matemáticas. Existen modelos univariados y multivariados, siendo el modelo binario el más común para predecir la probabilidad de eventos, mientras que el multivariado permite más de dos categorías. La interpretación de los resultados se realiza mediante p-valores y odds ratios, y se aplica en diversos campos como la evaluación de riesgos de deslizamientos y la liquefacción de suelos.

Cargado por

ricardo ortiz
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

REGRESIÓN LOGÍSTICA

ELKIN MORALES TURIZO

RICARDO ORTIZ ZULUAGA

MARCO TEÓRICO

La regresión logística es una técnica de aprendizaje automático que proviene del campo
de la estadística, que requiere datos binarios y supone una distribución de Bernoulli.

Este es un método para problemas de clasificación, en los que se obtienen un valor binario
entre 0 y 1. Por ejemplo, un problema de clasificación es identificar si una operación dada
es exitosa o no. Asociándole una etiqueta “éxito” a unos registros y “fracaso” a otros.
Simplificando mucho es identificar si al realizar una afirmación sobre registro esta es cierta
o no (Rodríguez, 2018).

Esta regresión permite medir la relación entre las variables dependientes (lo que se desea
predecir) con una o más variables independientes o explicativas con las cuales se pretende
dar cuenta del comportamiento de la variable respuesta.

Este modelo se hace visible a través de funciones matemáticas, que expresan la relación
entre las variables dependientes e independientes, que en su forma mas simple incluye una
sola variable explicativa X1, a saber:

FUNCION LOGÍSTICA UNIVARIADA

𝟏
𝑷(𝒁 = 𝟏|𝑿) =
𝟏 + 𝒆𝒙𝒑[−(𝜷𝟎 + 𝜷𝟏 𝑿𝟏 )]

Un caso más general, que involucra p-variables explicativas X1, X2,…,Xp:

FUNCION LOGÍSTICA MULTIVARIADA

𝟏
𝑷(𝒁 = 𝟏|𝑿) =
𝟏 + 𝒆𝒙𝒑[−(𝜷𝟎 + 𝜷𝟏 𝑿𝟏 + 𝜷𝟐 𝑿𝟐 + 𝜷𝟑 𝑿𝟑 + ⋯ + 𝜷𝒑 𝑿𝒑 )]

β 0, β1, β2,…, βp son los parámetros del modelo.

Regresión Logística
Elkin morales
Ricardo Ortiz
Es importante anotar que las variables explicativas del modelo (independientes), pueden
ser del tipo nominal, ordinal o continuo.

En general, la función logística (univariada o multivariada ) es representada gráficamente


por una función sigmoide:

P(Z|X)

MODELO DE REGRESIÓN LOGÍSTICA BINARIA

Este modelo es el mas usado dada su sencillez y la eficacia que tiene a la hora de interpretar
los resultados ademas de que constituye la representación más parsimoniosa del problema
que se quiere resolver.

Este modelo de regresión se usa para modelar la relación entre una variable dependiente
dicotómica (éxito o fracaso) y variables independientes. Las variables independientes
pueden ser numéricas o categóricas y su dicotomía se puede expresar como estructuralmente
insegura (Z=1), o segura (Z=0), aunque esta codificación es arbitraria e irrelevante.

En estadística, la regresión logística se utiliza para predecir la probabilidad de ocurrencia


de un evento ajustando los datos a una curva logística. Es un modelo lineal generalizado
utilizado para la regresión binomial. (Kim 2018)

La forma general de la regresión logística binaria es la siguiente: Agresti (2002) y Salman


(2012):

Una vez estimados los parámetros del modelo, es necesario revisar la importancia de cada
variable para el modelo, determinando cual de ellas es la mas influyente y adquiere mayor
relevancia en el mismo. Estas determinaciones deben realizarse a través de revisión de p-
valores para un nivel de significancia prestablecido, y del análisis de los errores
encontrados.

Regresión Logística
Elkin morales
Ricardo Ortiz
Para lo anterior, existen procedimientos tales como el stepwise, con el cual pueden
constituirse modelos de varias combinaciones de las variables independientes e ir
identificando y excluyendo aquellas que nos son influyentes o relevantes dentro del modelo.

MODELO DE REGRESIÓN LOGÍSTICA MULTIVARIADA

El modelo de regresión logística multivariada se utiliza cuando la variable dependiente


puede asumir más de dos (2) categorías; por ejemplo, para clasificación de niveles de daños
estructurales que se evalúan en escalas del 1 al 5, siendo 5 el estado más grave y 1 el mejor
estado.

Aunque esta regresión permite trabajar con mayor número de categorías, el modelo
logístico multivariado resulta menos preciso a la hora de predecir un resultado, dado que
ya no habría solo dos opciones (caso regresión binaria) sino, por ejemplo 5 opciones como
en el caso de la clasificación de niveles arriba mencionada.

INTERPRETACIÓN DE DATOS DE SALIDA

El p-valor es el nivel de significación más pequeño para el que, con los datos de la muestra,
habría que rechazar Ho. Valores superiores al nivel de significancia especificado llevarían
a la aceptación de Ho, mientras que valores inferiores al nivel de significancia implicarían
el rechazo de Ho.

La odds ratio (oportunidad relativa) es la probabilidad que un evento ocurra dividido por la
probabilidad de que el evento no ocurra. Es muy utilizada estadística para comparar la
frecuencia de exposición de diferentes factores de riesgo.

Regresión Logística
Elkin morales
Ricardo Ortiz
EJEMPLOS DE APLICACIÓN
EJEMPLO 1:

MODELO DE REGRESIÓN LOGISTICA PARA EVALUAR LA PROBABILIDAD DE


LICUEFACCIÓN DEL SUELOS USANDO DATOS DE CPT (Prueba de penetración de cono)

(Logistic Regression Model for Evaluating Soil Liquefaction Probability Using CPT Data)

Sheng-Yao Lai; Wen-Jong Chang; and Ping-Sien Lin.

J. Geotech. Geoenviron. Eng., 2006, 132(6): 694-704

Es una modelación logística basada en 396 casos históricos, teniendo en cuenta que el
caso de licuefacción en suelos granulares saturados sometidos a cargas sísmicas es uno
de los tópicos más importantes en cuanto a la estabilidad de las estructuras que se
construyen en zonas de alto potencial de licuefacción.

Varios autores (Seed et al, Robertson et al) han desarrollado procesos simplificados para
la determinación de potencial de licuación basados en pruebas SPT, pero dadas las
características de este último ensayo, se hace necesario el análisis de las muestras
obtenidas en laboratorio (por ejemplo granulometría) para poder implementar los
procedimientos de cálculo.

Con el ensayo de Cono CPT se tiene la ventaja de obtener parámetros únicamente sitio y de
forma continua.

Dentro del marco de la regresión logística, la probabilidad de licuefacción P L es expresada


en términos de variables explicativas, que son factores que afectan la ocurrencia o no del
fenómeno a estudiar. Así mismo, Anderson (2003) and Johnson and Wichern (2002)
describen que las variables explicativas en un análisis estadístico de clasificación deben
ser:

1)independientes unas de otras

2)normalmente distribuidas

3)linealmente dependientes con el valor esperado PL (x)

Otros autores sugieren que, aunque las variables explicativas no sean linealmente
dependientes del modelo y no estén normalmente distribuidas, la transformación logística
de PL (x) se sigue cumpliendo 1) 2) y 3).

Desarrollo del modelo basado en pruebas CPT:

Se tomaron 396 datos de campo históricos de varios terremotos ocurridos en China, Taiwan
y EEUU , cuyo procesamiento incluyó:

a) Manipulación de la información

Regresión Logística
Elkin morales
Ricardo Ortiz
b) Revisión de probabilidades mediante diferentes transformaciones de la variable
explicativa.
c) Procedimiento de clasificación del suelo usando datos del ensayo CPT para arenas,
mezclas de arenas y mezclas de limos.

SELECCIÓN DE VARIABLES EXPLICATIVAS:

Las variables explicativas pueden ser dividida en dos: la primera corresponde la RELACION
DE TENSION CICLICA AL INICIO DE LA LICUEFACCIÓN (CRR) evaluada por medio del ensayo
de cono CPT (qn) y la segunda corresponde a perturbación sísmica inducida por los
terremotos que es representada como un equivalente de la relación de carga cíclica CSR

Donde qC1N es la resistencia de penetración de cono corregida.

CN: factor de corrección

qC: Resistencia de penetración de cono de campo

Donde CSR7.5 corresponde a la relación de carga cíclica para un terremoto de magnitud 7.5

Para satisfacer los preceptos de y distribución normal de cada variable explicativa se


hicieron transformaciones de q y CSR (q^0.5 y log CSR) usando graficas de probabilidad
para cada variable:

Regresión Logística
Elkin morales
Ricardo Ortiz
√𝑞 se observa mas normalmente distribuida que q y CSR es mas log- normalmente
distribuido que normalmente distribuido.

Finalmente √𝑞 y ln(CSR) son las variables explicativas más apropiadas del modelo, donde:

√𝑞 representa la variable explicativa para la resistencia a la licuación del suelo y

Ln (CSR) representa la variable explicativa para la perturbación sísmica,

Luego:

Regresión Logística
Elkin morales
Ricardo Ortiz
Finalmente, se dicotomiza la variable dependiente PL = 0.5 para dividir la condición de suelo
licuable o no licuable usando el procedimiento simplificado de Seed and Idriss (1971) cuyo
criterio de licuación se de para un factor de seguridad FS >1.

El análisis de regresión logística es hecho entre PL y FS, el cual muestra una forma sigmoide:

Regresión Logística
Elkin morales
Ricardo Ortiz
EJEMPLO 2:

EVALUACIÓN DE LA SUSCEPTIBILIDAD Y PELIGROSIDAD DE DESLIZAMIENTOS DE


LADERAS PARA EL SALVADOR

Tesis doctoral. María José García Rodríguez, Universidad de Alcalá, 2008.

Para este trabajo inicialmente se desarrolló un sistema de información geográfica SIG con
información específica para el salvador, denominado SIGSAL, que permitió la recopilación
e integración de diferentes bases de datos, mapas e información de la zona de estudio.

Las principales fuentes de datos fueron:

-Cartografía base a escala 1:25.000

-Capa Geológica: Contiene información de fallas, composición geotécnica, geología


superficial, volcanes, etc.

-Modelo digital del Terreno (MDT): Realizado a través del proceso de digitalización y
estructuración de bases de datos, georreferenciación, edición y validación.

-Inventario de deslizamientos: una de las principales dificultades en estudios de


peligrosidad de deslizamientos radica la necesidad de disponer de un buen inventario de
movimientos de ladera, que sea adecuado y completo, algo que es raro encontrar. Chacón
et al. (1992 y 1993) proponen el dato de pixeles en el terreno del contorno de la zona de
ruptura o escarpe para el análisis de susceptibilidad.

Par la aplicación de la metodología arriba enunciada, se creó una base de datos de


deslizamientos de laderas en El Salvador, correspondiente a deslizamientos producidos por
los terremotos del año 2001.

Después de hacer un riguroso análisis de los diferentes métodos aplicables a la evaluación


de la susceptibilidad y peligrosidad de deslizamientos de laderas, se ha concluido que los
más idóneos para modelar este fenómeno son los métodos estocásticos (REGRESION
LOGÍSTICA) y los métodos alternativos (REDES NEURONALES ARTIFICIALES), dado la
objetividad de sus análisis y la precisión de los resultados.

El análisis de la distribución de los deslizamientos de laderas es función de distintos


factores influyentes, a saber:

-LITOLOGIA

-ELEVACIÓN

-PENDIENTE

-ORIENTACIÓN

-RUGOSIDAD

-PRECIPITACIÓN ANUAL MEDIA

Regresión Logística
Elkin morales
Ricardo Ortiz
-USOS DE SUELO

Mediante el uso de la regresión logística para un nivel de significancia del 99%, se encontró
que la mayoría de los factores tienen un p-valor <0.01, lo cual indica que tienen un alto nivel
de significación, a excepción del factor USO DE SUELO, que obtuvo un p-valor>0.01.

También se evaluaron los factores mediante el método de regresión logística Stepwise


introduciendo una nueva variable llamada RUGOSIDAD, e introduciendo o eliminando
variables en pasos sucesivos en función de su significancia o importancia.

Con este ultimo modelo se mejoró el nivel de significancia del modelo ajustado y se
redujeron de forma notable las variables de la ecuación, resultando tan solo dos factores
influyentes: RUGOSIDAD(R) Y LITOLOGÍA (S), ajustándose a la siguiente ecuación:

Donde S1, S3 y S4 son categorías del suelo (roca dura, suelo consolidado y suelo no
consolidado respectivamente).

Se generaron las curvas COR (características operativas del Receptor) en función de la


detección de resultados posibles que para este caso son presencia de deslizamiento (1) y
ausencia de deslizamiento (0). Se grafica en términos de SENSIBILIDAD Y
ESPECIFICIDAD, siendo la primera la tasa de éxito la segunda corresponde a 1 menos la
tasa de falsa alarma.

Regresión Logística
Elkin morales
Ricardo Ortiz
EJEMPLO 3:

ANÁLISIS DE LA AMENAZA DE RIESGO POR DESLIZAMIENTOS DE LADERAS EN LA


CIUDAD DE CHILPANCINGO, Gro.
ZÚÑIGA Gutierrez Martín1, CUEVAS Sandoval Alfredo2, SÁNCHEZ Calvo Mateo3, BARRAGÁN Trinidad
Raziel4.

Unidad Académica de Ingeniería-UAGro. Av. Lázaro Cárdenas, S/N, CU_Sur, Chilpancingo.


Guerrero. México.

Este artículo se desprende del trabajo de grado(Zúñiga Gutierrez, 2012)1 donde se


considera la necesidad de proponer una metodología estadística y probabilística en el
análisis de los diferentes factores de riesgos topográficos, históricos, geotécnicos,
geomorfológicos y ambientales, establecidos en el deslizamiento de laderas.

Se propone la aplicación de un modelo de Regresión Logística Ordinal (RLO) para el análisis


de la amenaza de riesgo por deslizamiento de laderas en la Cd. De Chilpancingo, Guerrero.
Se considera el tipo de amenaza como variable respuesta las categorías: baja, moderada,
alta. Las variables predictoras que se integran al modelo representan factores topográficos,
históricos, geotécnicos, geomorfológicos y ambientales, los cuales son considerados por
Protección Civil del Estado de Guerrero.

Protección Civil del municipio de Chilpancingo, tiene identificadas 54 barrancas de las


cuales 13 las clasifica con riesgo alto, 22 de riesgo mediano y 19 de riesgo bajo. En estas
barrancas se aplicó un muestreo estratificado por cada grado de riesgo.

Se escogieron varias variables en función de factores topográficos, históricos, goetécnicos,


geomorfológicos y ambientales,

Regresión Logística
Elkin morales
Ricardo Ortiz
Modelo de regresión ordinal

El modelo de regresión ordinal se usa cuando la escala de la variable respuesta tiene 3 o


más categorías las cuales obedecen a un orden. La amenaza de riesgo por deslizamiento
de laderas (ARDL) es una variable medida en tres categorías en escala ordinal (Baja,
Moderada y Alta), de acuerdo a la clasificación establecida por Protección Civil del
Municipio.

Este caso trata de relacionar la variable dependiente o de respuesta “amenaza de riesgo


por deslizamientos de laderas -ARDL-” con 7 variables predictoras (tabla 4) mediante un
modelo de regresión logística ordinal.

ARDL es una variable medida en 3 categorías (Baja, moderada y alta).

Para validar cada uno de los modelos individuales, se calculan los estadísticos de Wald y el
de líneas paralelas. La prueba de Wald permite evaluar la significación estadística de una
variable explicativa sobre la variable dependiente, bajo la hipótesis:

H0: βj = 0, vs Ha: βj ≠ 0

Para j = 1, 2, 3, 4, 5, 6, 7.

Si el p-valor asociado al estadístico de Wald es menor que el nivel de significancia α, se


rechazará
la hipótesis nula al nivel de significancia α. La prueba de líneas paralelas (LP) nos ayuda a
evaluar si es correcto suponer que los parámetros son los mismos para todas las
categorías, bajo la hipótesis:
H0: los coeficientes de regresión β son los mismos entre las categorías de respuesta.

En resumen, en la estimación de los modelos individuales, se observa que las variables


predictoras inclinación del talud, tipo de suelo o roca, vegetación y uso de la tierra y régimen
de agua en laderas, resultan significativas para ser incluidas en el ajuste de un modelo de
regresión ordinal; no así las variables: desnivel entre la corona y el fondo de la barranca,
espesor de la capa de suelo y evidencias geomorfológicas de huecos en laderas contiguas.

Regresión Logística
Elkin morales
Ricardo Ortiz
DESARROLLO DE UN MODELO DE REGRESIÓN LOGÍSTICA
Para el presente trabajo se desarrolló un modelo de regresión logística para el cálculo La
resistencia no-drenada es la resistencia del suelo cuando se carga hasta la falla en
condiciones no-drenadas o sea cuando las cargas que producen la falla se aplican sobre la
masa de suelo a una velocidad superior a la del drenaje del suelo. El caso más común de
resistencia no-drenada, se presenta en los depósitos naturales de arcilla saturada cuando
éstos son cargados o descargados en forma relativamente rápida, comparada con la rata
en la cual puede ocurrir drenaje y/o consolidación.

Cuando se presenta esta condición se asume que hay un fenómeno de resistencia no-
drenada; el contenido de agua y el volumen de la arcilla permanecen constantes durante la
carga no-drenada y se generan presiones de poros en exceso. El comportamiento no-
drenado de arcillas saturadas se analiza en términos de esfuerzos totales y la evaluación
de las presiones de poros es innecesaria. Bajo esta situación se asume un método de
análisis Ø = 0 y la resistencia no-drenada Cu es igual al valor de cohesión en la envolvente
de Mohr-Coulomb para esfuerzos totales.

Modelo de análisis

(Cu)/σ=0.11+0.0037IP

Donde:

• CU = Resistencia no drenada (kg/m2)

• LL= Límite líquido (%)

• ɣd= Peso específico seco (kg/m3)

• z= profundidad (m)

• σ = ɣd*z

Los datos observados con los cuales se quiere validar y ajustar el modelo de Matteo et al
(2009) corresponden a 59 ensayos realizados para arcillas de Bogotá por la Universidad
Nacional, los cuales fueron suministrados por el ingeniero Rubén Tovar y se resumen en el
archivo llamado [Link]

Se determinó para la variable dependiente un rango de resistencia al corte no drenado bajo


menor a 150 kpa, y superiores estos una resistencia al corte no drenado alto.

Para los suelos con resistencia al corte no drenado alto Y=1 (buena condición) y para suelos
con resistencia al corte no drenado bajo Y = 0 (mala condición).

Categorizamos la variable índice de plasticidad, se definieron los siguientes rangos.

0-15 bajo

<15 medio.
Regresión Logística
Elkin morales
Ricardo Ortiz
Datos de campo

Prof (m) d (kN/m3) Cu (kPa) IP (%) 0,4 14,9 58 38


1,4 15,7 66 33 1 13,4 48 31
1,9 16,9 150 31 2,3 15,2 52 32
2,9 16,1 198 34 4,4 16,9 244 37
3,4 17,6 179 32 5 17,2 244 32
4,2 17,3 224 27 7,7 17,9 236 25
4,6 18,2 157 20 8,5 17,5 136 24
5,6 19,2 260 35 10 17,5 236 28
6,5 18,2 280 37 0,4 15,8 80 33
9,3 17,7 224 23 0,6 14,8 110 32
9,7 18,2 240 22 1,3 17,5 130 19
0,5 14,9 88 23 2,2 20,4 140 11
1 16,3 92 31 3,4 19,9 260 17
3,4 16,8 158 18 3,7 19,1 270 14
3,5 18,9 183 12 5 19,9 290 21
4 18,7 260 22 6,3 20 280 17
4,6 20,3 300 3 7 20,4 275 19
5,2 18,2 280 25 8,8 18,6 320 19
6,1 19,7 320 11 10 19,8 270 22
8,9 19 310 21 0,5 16,6 60 12
9,4 18,9 380 19 0,8 17,5 46 12
1 14,8 84 21 1,6 18 46 49
1,8 14,9 158 29 2,6 14,9 98 37
2,6 15,3 246 31 4,2 13,9 188 32
3 15,4 172 27 5 15,2 110 27
4,3 16,8 100 26 6,1 20 255 11
5 15,4 126 33 6,8 17,2 190 26
5,6 19,1 250 23 7,8 17,5 255 28
6,3 17,7 300 20 8 16 270 31
9 17,7 300 22
10 17,8 176 28

Regresión Logística
Elkin morales
Ricardo Ortiz
Datos categorizados

IP SIGMA CU medio 3,70242424 0


medio 13,6542424 0 medio 8,32424242 1
medio 19,9471212 0 medio 21,7175758 0
medio 29,0043939 1 medio 46,1933333 1
medio 37,1733333 1 medio 53,4242424 1
medio 45,1372727 1 medio 85,6216667 1
medio 52,0078788 1 medio 92,405303 1
medio 66,7927273 1 medio 108,712121 1
medio 73,4893939 1 medio 3,92606061 0
medio 102,257727 1 medio 5,51636364 0
medio 109,668788 1 medio 14,1325758 0
medio 4,6280303 0 bajo 27,88 0
medio 10,1257576 0 medio 42,0312121 1
medio 35,4836364 1 bajo 43,9010606 1
bajo 41,0931818 1 medio 61,8106061 1
medio 46,4666667 1 medio 78,2727273 1
bajo 58,0087879 1 medio 88,7090909 1
medio 58,7915152 1 medio 101,68 1
bajo 74,6510606 1 medio 123 1
medio 105,04697 1 bajo 5,15606061 0
medio 110,364545 1 bajo 8,6969697 0
medio 9,19393939 0 medio 17,8909091 1
medio 16,6609091 0 medio 24,0657576 1
medio 24,7118182 1 medio 36,2663636 1
medio 28,7 1 medio 47,2121212 1
medio 44,8763636 1 bajo 75,7878788 1
medio 47,8333333 1 medio 72,6569697 1
medio 66,4448485 1 medio 84,7954545 1
medio 69,2713636 1 medio 79,5151515 1
medio 98,9590909 1

Regresión Logística
Elkin morales
Ricardo Ortiz
MODELACION EN R

1. Generar el modelo de regresión logística

Respecto al modelo, el logaritmo de odds de que Cu esta positivamente relacionado con los
valores de los esfuerzos verticales (SIGMA) (coeficiente parcial = 0.25760), siendo
significativa esta relación (p-value = 0.00739). También existe una relación significativa
positiva entre el logaritmo de odds de Cu mayor a 150kpa y los rangos de IP(bajo y medio)
(p-value = 0.13707).

2. Intervalos de confianza
2.5 % 97.5 %
(Intercept) - 19.0269291 -2.9745124
SIGMA 0.1207142 0.5149528
IPmedio -0.4653233 9.9804677

Regresión Logística
Elkin morales
Ricardo Ortiz
intervalos basados en el error estándar

2.5 % 97.5 %
(Intercept) -16.1187035 - 1.1572319
SIGMA 0.0691228 0.4460754
IPmedio -1.1660534 8.4937908

3. Representación gráfica del modelo

Regresión Logística
Elkin morales
Ricardo Ortiz
4. Caculo de diferencia de residuos,
grados de libertad y p-value

• "Diferencia de residuos: 49.0264"


• "Grados de libertad: 2"
• "p-value: 2.2596719942e-11

[Link] de confusión

Predicciones

Observaciones 0 1

0 12 2

1 2 43

Regresión Logística
Elkin morales
Ricardo Ortiz
Predicciones

Observaciones 0 1

0 VN FP

1 FN VP

• Verdaderos negativos (VN)= 12


• Falsos negativos (FN)= 2
• Falsos positivos (FP) = 2
• Verdaderos Positivos (VP) = 43

MÉTRICAS

Exactitud = (VP+VN) / (VP+VN+FN+FP) = 93%

Precisión = (VP) / (VP+FP) = 95%

Exhaustividad = (VP) / (VP+FN) = 95%

Regresión Logística
Elkin morales
Ricardo Ortiz
CONCLUSIONES
El modelo logístico creado para predecir la probabilidad de que un suelo tenga una
resistencia no drenada superior a 150kpa a partir del índice plasticidad y de los esfuerzos
verticales es en conjunto significativo acorde al (p-value = 2.2596719942e-11). El p-value
de una de las variables es significativo (SIGMA= 0.00739), mientras que de la otra variable
no es tan bueno IP = 0.1307). La ratio de error obtenido empleando las observaciones con
las que se ha entrenado el modelo muestra un porcentaje de verdaderos positivos altos, lo
cual nos indica que el modelo predice de forma acertada nuevos valores.

BIBIOGRAFÍA
- Sheng-Yao Lai; Wen-Jong Chang; and Ping-Sien Lin. Logistic Regression Model for
Evaluating Soil Liquefaction Probability Using CPT Data.. J. Geotech. Geoenviron.
Eng., 2006, 132(6): 694-704.
- María José García Rodríguez, Universidad de Alcalá, 2008. EVALUACIÓN DE LA
SUSCEPTIBILIDAD Y PELIGROSIDAD DE DESLIZAMIENTOS DE LADERAS PARA EL
SALVADOR.
- ZÚÑIGA Gutiérrez Martín, CUEVAS Sandoval Alfredo, SÁNCHEZ Calvo Mateo,
BARRAGÁN Trinidad Raziel. Análisis de la Amenaza de Riesgo por Deslizamiento de
Laderas en la Ciudad de Chilpancingo, Gro. Articulo “Foro de estudios sobre
guerrero” Mayo 2015-Abril 2016 Vol. 2 No.3 224-243
- LADY JOHANNA SAUZA RODRÍGUEZ, DETERMINACIÓN DEL ESTADO DE REDES
LOCALES DE ALCANTARILLADO Y SU NECESIDAD O NO DE SER SOMETIDAS A
RENOVACIÓN/REHABILITACIÓN TENIENDO EN CUENTA CCTV EN UN NÚMERO
LIMITADO DE TUBERÍAS. CASO DE ESTUDIO ZONA 1 DE LA EAAB – ESP.
UNIVERSIDAD DE LOS ANDES, BOGOTÁ D.C., ENERO DE 2020.
- Das, Braja M. Fundamentos de ingeniería geotécnica. Cuarta Edición. ISBN:978-607-
519-372-4

Regresión Logística
Elkin morales
Ricardo Ortiz

También podría gustarte