Fundamentos de Machine Learning
Bagging
Limitaciones árboles de decisión
Condiciones de parada
La condición de parada más común es limitar la profundidad máxima (max_ depth) del árbol.
Profundidad = 1
max_depth = 1
Condiciones de parada
La condición de parada más común es limitar la profundidad máxima (max_ depth) del árbol.
Profundidad = 1
max_depth = 2
Profundidad = 2
Condiciones de parada
La condición de parada más común es limitar la profundidad máxima (max_ depth) del árbol.
Profundidad = 1
max_depth = 3
Profundiada = 2
Profundidad = 3
Condiciones de parada
Otras condiciones comunes de parada simple son:
• No divida una región si todas las instancias de la región pertenecen a la misma clase.
Nodos de hoja
pura
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Sobreajuste
• Cuando un árbol no es muy profundo, no puede dividir los datos de entrada en
suficientes regiones, por lo que el modelo no se ajusta adecuadamente.
• Cuando el árbol es demasiado profundo, divide el espacio de entrada en demasiadas
regiones y se ajusta al ruido de los datos, por lo que el modelo puede
sobreajustarse.
Registro de un
solo dato
Como se selecciona
un modelo adecuado?
Overfitting
Evite el sobreajuste limitando la
profundidad del árbol y usando
Conjunto de Validación (CV).
Complejo de validación
Ayuda a determinar la
profundidad óptima. El complejo de entrenamiento tiende a
encontrar hasta 99,9% de precisión.
Reducir la varianza: profundidad del árbol
Val
Hemos visto que los árboles Use entrenamiento/validación
con alta profundidad tienen o cross-validation para
una gran variación y son estimar la mejor profundidad.
propensos a sobreajustarse.
12
Limitaciones de los modelos de árboles de decisión
• Los modelos de árboles de decisión son altamente interpretables y rápidos
de entrenar
• Sin embargo, para capturar un límite de decisión complejo (o aproximar
una función compleja), necesitamos usar un árbol grande (ya que cada vez
solo podemos hacer divisiones alineadas con el eje).
• Hemos visto que los árboles grandes tienen una gran variación y son propensos
a sobreajustarse.
Por estas razones, en la práctica, los modelos de árboles de decisión suelen
tener un rendimiento inferior al de otros métodos de clasificación o
regresión.
…..como se puede mejorar?
Bagging
Motivación para el método de embolsado (bagging)
Es una técnica de aprendizaje conjunto que busca mejorar la precisión y estabilidad de los modelos
de aprendizaje automático.
Los modelos de árboles de decisión a menudo tienen un rendimiento inferior al de otros métodos de
clasificación o regresión en situaciones de límites y varianza complejos.
Como puede ver, …y en ciertos casos
en ciertos casos sobreajusta
subajusta
Motivación para el método de embolsado (bagging)
Necesitamos un mejor modelo
Conceptos importantes de bagging
ENSEMBLE LEARNING
y
BOOTSTRAPPING
Aprendizaje en conjunto - Intuición
Imágenes por resonancia Esta es la intuición detrás del método de
magnética de pacientes con conjunto, un método para construir un solo
modelo entrenando y agregando múltiples
tumores cerebrales
modelos.
Los médicos se capacitaron en
varias muestras de resonancias Estan situados en distintias regions
magnéticas de tumores (entrenan con datos distintos).
cerebrales en las instituciones
educativas en las que estudiaron.
Hospital A Hospital B Hospital C
El Sr. X envía su resonancia
magnética para obtener el Si No
No
diagnóstico de 3 médicos
solo para asegurarse de
que los resultados sean
más confiables.
No: 2 [Link]: 1
Aprendizaje en conjunto
Los métodos de conjunto son una técnica de machine learning que combina varios modelos básicos
para producir un modelo predictivo óptimo.
Modelo 1 Predicción 1
Training Set
Modelo 2 Predicción 2
Predicción Final
Modelo 3 Predicción 3
. . !
. . Para la Clasificación,
Test Data . . devolvemos la pluralidad
de los modelos.
Modelo N Predicción N
Aprendizaje en conjunto
Los métodos de conjunto son una técnica de machine learning que combina varios modelos básicos
para producir un modelo predictivo óptimo.
Modelo 1 Predicción 1
Training Set
Modelo 2 Predicción 2
Predicción Final
Modelo 3 Predicción 3
. . • La predicción de un grupo de
. .
Test Data . . modelos da una mejor
precisión
• Se usa cuando un solo
Modelo N Predicción N
modelo se sobreajusta
• Para reducir el sesgo y la
varianza
Aprendizaje en conjunto
Los métodos de conjunto son una técnica de machine learning que combina varios modelos básicos
para producir un modelo predictivo óptimo.
Modelo 1 Predicción 1
Training Set
Modelo 2 Predicción 2
Predicción Final
Modelo 3 Predicción 3
. .
. .
Test Data . . En esta sesión, analizaremos el
método de embolsado
Modelo N Predicción N (bagging).
Aprendizaje en conjunto - Intuición
¿CÓMO APRENDEN ESTOS
MODELOS? ¿QUÉ CONJUNTO
DE DATOS VEN?
Bootstrap - Motivación
En la práctica, no tenemos diferentes conjuntos de datos o
diferentes médicos.
Queremos que varios modelos (médicos) se capaciten en
diferentes conjuntos de datos, sin embargo, solo tenemos un
conjunto de datos.
¿Cómo podemos generar conjuntos de datos?
Bootstrapped datasets!
Pero, ¿qué es
Bootstrapping?
Bootstrapping
Bootstrapping es el proceso de muestreo con reemplazo de un conjunto de
datos y la realización de cálculos en dichos conjuntos de datos múltiples
para obtener una inferencia agregada general.
Conjunto de datos que consiste en las
resonancias magnéticas de 5 pacientes Posibles conjuntos de datos Bootstrapped
Muestra aleatoria con reemplazo
…y mas
Bootstrapping
Bootstrapping es el proceso de muestreo con reemplazo de un conjunto de
datos y la realización de cálculos en dichos conjuntos de datos múltiples
para obtener una inferencia agregada general. La elección aleatoria de datos y
la posibilidad de duplicación se
denomina Muestreo con
Conjunto de datos que consiste en las reemplazo.
resonancias magnéticas de 5 pacientes Posibles conjuntos de datos Bootstrapped
Tenga en cuenta que el
conjunto de datos de
bootstrap consta de la misma
cantidad de datos que el
Muestra aleatoria con reemplazo
conjunto de datos original.
…y mas
Bootstrap Aggregation
Bagging
Bagging
Este método se llama Bagging (Breiman, 1996), abreviatura de, Bootstrap Aggregating.
Data Bootstrap
Training S ets
Bootstrap Sample 1 Bootstrap Sample 2
Bootstrap Sample 3
Decision Trees Tree Tree Tree
Aggregrating
!● Para Clasificación, devolvemos
pluralidad de los arboles
Predicción Predicción : x
Bagging - Bootstrap + Aggregate
Test Data
Árbol 1
1. Bootstrap: generamos múltiples
muestras de datos de Árbol 2
entrenamiento, vía bootstrapping.
Entrenamos un árbol de decisión Aggregation
más profundo en cada muestra de
datos. Árbol 3
2. Aggregate: para una entrada .
Training data .
determinada, generamos las . .
.
salidas promediadas de todos los . Predicción
modelos para esa entrada.
Árbol N
Bootstrap
Samples
10 sets of bootstrap
100 sets of bootstrap
150 sets of bootstrap
Ventajas del bagging
Bagging :
• Mayor complejidad: mediante el uso de árboles más profundos, cada
modelo puede aproximar funciones complejas y límites de decisión.
• Baja varianza: promediar la predicción de todos los modelos reduce la
varianza en la predicción final, suponiendo que elijamos un número
suficientemente grande de árboles.
33
Desventajas de bagging
Pregunta: ¿Ves algún problema?
• Si los árboles son demasiado poco profundos, aún pueden ser subajustados.
• Existe la posibilidad de sobreajuste si los árboles son demasiado grandes.
Interpretabilidad.-
• El principal inconveniente del embolsado (y otros métodos de conjunto que
estudiaremos) es que el modelo promediado ya no es fácilmente interpretable, es
decir, ya no se puede rastrear la "lógica" de una salida a través de una serie de
decisiones basadas en valores predictores
34
Underfitting y Overfitting
Aquí ajustamos 100 árboles utilizando muestras de bootstrap. Incluso con múltiples estimadores,
el árbol poco profundo no podrá capturar el patrón real.
61
Casos de underfitting y overfitting en Bagging
Underfitting Overfitting
¿Cómo resolverlo?
Cross Validation
Random Forest
Parámetros clave de Random Forest