0% encontró este documento útil (0 votos)
4 vistas40 páginas

Introducción al Bagging en ML

El documento aborda los fundamentos del aprendizaje automático, centrándose en el uso de árboles de decisión y la técnica de bagging para mejorar la precisión y estabilidad de los modelos. Se discuten las limitaciones de los árboles de decisión, como el sobreajuste y el subajuste, y se propone el uso de bagging para reducir la varianza y mejorar el rendimiento. Además, se menciona el proceso de bootstrapping como método para generar conjuntos de datos y la importancia de la validación cruzada para optimizar la profundidad de los árboles.

Cargado por

Martin Vallejos
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas40 páginas

Introducción al Bagging en ML

El documento aborda los fundamentos del aprendizaje automático, centrándose en el uso de árboles de decisión y la técnica de bagging para mejorar la precisión y estabilidad de los modelos. Se discuten las limitaciones de los árboles de decisión, como el sobreajuste y el subajuste, y se propone el uso de bagging para reducir la varianza y mejorar el rendimiento. Además, se menciona el proceso de bootstrapping como método para generar conjuntos de datos y la importancia de la validación cruzada para optimizar la profundidad de los árboles.

Cargado por

Martin Vallejos
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Fundamentos de Machine Learning

Bagging
Limitaciones árboles de decisión
Condiciones de parada
La condición de parada más común es limitar la profundidad máxima (max_ depth) del árbol.

Profundidad = 1
max_depth = 1
Condiciones de parada
La condición de parada más común es limitar la profundidad máxima (max_ depth) del árbol.

Profundidad = 1
max_depth = 2

Profundidad = 2
Condiciones de parada
La condición de parada más común es limitar la profundidad máxima (max_ depth) del árbol.

Profundidad = 1
max_depth = 3

Profundiada = 2

Profundidad = 3
Condiciones de parada
Otras condiciones comunes de parada simple son:

• No divida una región si todas las instancias de la región pertenecen a la misma clase.

Nodos de hoja
pura
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.

Registro de un
solo dato

Como se selecciona
un modelo adecuado?
Overfitting

Evite el sobreajuste limitando la


profundidad del árbol y usando
Conjunto de Validación (CV).

Complejo de validación
Ayuda a determinar la
profundidad óptima. El complejo de entrenamiento tiende a
encontrar hasta 99,9% de precisión.
Reducir la varianza: profundidad del árbol

Val

Hemos visto que los árboles Use entrenamiento/validación


con alta profundidad tienen o cross-validation para
una gran variación y son estimar la mejor profundidad.
propensos a sobreajustarse.
12
Limitaciones de los modelos de árboles de decisión

• Los modelos de árboles de decisión son altamente interpretables y rápidos


de entrenar
• Sin embargo, para capturar un límite de decisión complejo (o aproximar
una función compleja), necesitamos usar un árbol grande (ya que cada vez
solo podemos hacer divisiones alineadas con el eje).

• Hemos visto que los árboles grandes tienen una gran variación y son propensos
a sobreajustarse.

Por estas razones, en la práctica, los modelos de árboles de decisión suelen


tener un rendimiento inferior al de otros métodos de clasificación o
regresión.

…..como se puede mejorar?


Bagging
Motivación para el método de embolsado (bagging)
Es una técnica de aprendizaje conjunto que busca mejorar la precisión y estabilidad de los modelos
de aprendizaje automático.

Los modelos de árboles de decisión a menudo tienen un rendimiento inferior al de otros métodos de
clasificación o regresión en situaciones de límites y varianza complejos.

Como puede ver, …y en ciertos casos


en ciertos casos sobreajusta
subajusta
Motivación para el método de embolsado (bagging)

Necesitamos un mejor modelo


Conceptos importantes de bagging

ENSEMBLE LEARNING
y

BOOTSTRAPPING
Aprendizaje en conjunto - Intuición
Imágenes por resonancia Esta es la intuición detrás del método de
magnética de pacientes con conjunto, un método para construir un solo
modelo entrenando y agregando múltiples
tumores cerebrales
modelos.

Los médicos se capacitaron en


varias muestras de resonancias Estan situados en distintias regions
magnéticas de tumores (entrenan con datos distintos).
cerebrales en las instituciones
educativas en las que estudiaron.
Hospital A Hospital B Hospital C

El Sr. X envía su resonancia


magnética para obtener el Si No
No
diagnóstico de 3 médicos
solo para asegurarse de
que los resultados sean
más confiables.
No: 2 [Link]: 1
Aprendizaje en conjunto
Los métodos de conjunto son una técnica de machine learning que combina varios modelos básicos
para producir un modelo predictivo óptimo.

Modelo 1 Predicción 1

Training Set
Modelo 2 Predicción 2
Predicción Final

Modelo 3 Predicción 3

. . !
. . Para la Clasificación,
Test Data . . devolvemos la pluralidad
de los modelos.
Modelo N Predicción N
Aprendizaje en conjunto
Los métodos de conjunto son una técnica de machine learning que combina varios modelos básicos
para producir un modelo predictivo óptimo.

Modelo 1 Predicción 1

Training Set
Modelo 2 Predicción 2
Predicción Final

Modelo 3 Predicción 3

. . • La predicción de un grupo de
. .
Test Data . . modelos da una mejor
precisión
• Se usa cuando un solo
Modelo N Predicción N
modelo se sobreajusta
• Para reducir el sesgo y la
varianza
Aprendizaje en conjunto
Los métodos de conjunto son una técnica de machine learning que combina varios modelos básicos
para producir un modelo predictivo óptimo.

Modelo 1 Predicción 1

Training Set
Modelo 2 Predicción 2
Predicción Final

Modelo 3 Predicción 3

. .
. .
Test Data . . En esta sesión, analizaremos el
método de embolsado
Modelo N Predicción N (bagging).
Aprendizaje en conjunto - Intuición

¿CÓMO APRENDEN ESTOS


MODELOS? ¿QUÉ CONJUNTO
DE DATOS VEN?
Bootstrap - Motivación

En la práctica, no tenemos diferentes conjuntos de datos o


diferentes médicos.

Queremos que varios modelos (médicos) se capaciten en


diferentes conjuntos de datos, sin embargo, solo tenemos un
conjunto de datos.

¿Cómo podemos generar conjuntos de datos?


Bootstrapped datasets!

Pero, ¿qué es
Bootstrapping?
Bootstrapping
Bootstrapping es el proceso de muestreo con reemplazo de un conjunto de
datos y la realización de cálculos en dichos conjuntos de datos múltiples
para obtener una inferencia agregada general.
Conjunto de datos que consiste en las
resonancias magnéticas de 5 pacientes Posibles conjuntos de datos Bootstrapped

Muestra aleatoria con reemplazo

…y mas
Bootstrapping
Bootstrapping es el proceso de muestreo con reemplazo de un conjunto de
datos y la realización de cálculos en dichos conjuntos de datos múltiples
para obtener una inferencia agregada general. La elección aleatoria de datos y
la posibilidad de duplicación se
denomina Muestreo con
Conjunto de datos que consiste en las reemplazo.
resonancias magnéticas de 5 pacientes Posibles conjuntos de datos Bootstrapped

Tenga en cuenta que el


conjunto de datos de
bootstrap consta de la misma
cantidad de datos que el
Muestra aleatoria con reemplazo
conjunto de datos original.

…y mas
Bootstrap Aggregation

Bagging
Bagging
Este método se llama Bagging (Breiman, 1996), abreviatura de, Bootstrap Aggregating.

Data Bootstrap

Training S ets

Bootstrap Sample 1 Bootstrap Sample 2


Bootstrap Sample 3

Decision Trees Tree Tree Tree


Aggregrating
!● Para Clasificación, devolvemos
pluralidad de los arboles
Predicción Predicción : x
Bagging - Bootstrap + Aggregate
Test Data
Árbol 1

1. Bootstrap: generamos múltiples


muestras de datos de Árbol 2
entrenamiento, vía bootstrapping.
Entrenamos un árbol de decisión Aggregation
más profundo en cada muestra de
datos. Árbol 3

2. Aggregate: para una entrada .


Training data .
determinada, generamos las . .
.
salidas promediadas de todos los . Predicción
modelos para esa entrada.
Árbol N

Bootstrap
Samples
10 sets of bootstrap
100 sets of bootstrap
150 sets of bootstrap
Ventajas del bagging

Bagging :
• Mayor complejidad: mediante el uso de árboles más profundos, cada
modelo puede aproximar funciones complejas y límites de decisión.

• Baja varianza: promediar la predicción de todos los modelos reduce la


varianza en la predicción final, suponiendo que elijamos un número
suficientemente grande de árboles.

33
Desventajas de bagging
Pregunta: ¿Ves algún problema?

• Si los árboles son demasiado poco profundos, aún pueden ser subajustados.

• Existe la posibilidad de sobreajuste si los árboles son demasiado grandes.

Interpretabilidad.-
• El principal inconveniente del embolsado (y otros métodos de conjunto que
estudiaremos) es que el modelo promediado ya no es fácilmente interpretable, es
decir, ya no se puede rastrear la "lógica" de una salida a través de una serie de
decisiones basadas en valores predictores

34
Underfitting y Overfitting
Aquí ajustamos 100 árboles utilizando muestras de bootstrap. Incluso con múltiples estimadores,
el árbol poco profundo no podrá capturar el patrón real.

61
Casos de underfitting y overfitting en Bagging
Underfitting Overfitting

¿Cómo resolverlo?

Cross Validation
Random Forest
Parámetros clave de Random Forest

También podría gustarte