Fitting (Over y Under)
Overfitting y Underfitting en Machine Learning
1. Objetivo
Comprender los conceptos de overfitting y underfitting.
Relacionar estos fenómenos con los modelos vistos: regresión lineal,
regresión logística, SVM, y árboles de decisión.
Interpretar el efecto del grado de complejidad en modelos polinomiales.
Visualizar estos fenómenos a través de ejemplos prácticos.
2. Conceptos Clave
Overfitting (Sobreajuste)
El modelo aprende muy bien los datos de entrenamiento, incluyendo ruido y
variaciones irrelevantes.
Tiene baja capacidad de generalización.
Presenta bajo error de entrenamiento y alto error en test.
Es común en modelos muy complejos o con muchos parámetros.
Underfitting (Subajuste)
El modelo es demasiado simple y no capta la estructura subyacente de los
datos.
Tiene mal desempeño tanto en entrenamiento como en test.
Presenta alto sesgo y baja varianza.
3. Visualización y Grados del Modelo Polinomial
El grado de un modelo polinomial es una medida de su complejidad:
Fitting (Over y Under) 1
Grado 1: modelo lineal -> alto sesgo, underfitting.
Grado 4: buen ajuste -> equilibrio sesgo/varianza.
Grado 15: modelo demasiado flexible -> alto riesgo de overfitting.
Esta progresión se puede visualizar en un gráfico con los datos originales y la
curva ajustada por cada modelo.
4. Tabla Comparativa: Relación con Modelos del Curso
Riesgo de
Modelo Riesgo de Overfitting Regularización
Underfitting
Alto si la relación no
Regresión lineal Bajo Ridge, Lasso
es lineal
Regresión Alto si hay pocas
Moderado L1/L2 (penalización)
logística variables
Alto con kernel muy
SVM Bajo con kernel lineal Parámetro C
flexible
Árboles de Bajo si árbol muy max_depth,
Muy alto si sin poda
decisión chico min_samples_split
5. Cómo Detectarlos
Indicadores de Overfitting:
Alta precisión en entrenamiento, baja en test.
Curva de error en test creciente al aumentar complejidad.
Indicadores de Underfitting:
Bajo rendimiento en ambos conjuntos.
Curvas de error planas con alta magnitud.
6. Estrategias para Mitigarlos
Técnica Problema que aborda Efecto principal
Fitting (Over y Under) 2
Regularización Overfitting Penaliza la complejidad
Poda de árboles Overfitting Simplifica el modelo
Cross-validation Ambos Mejora estimación general
Aumentar datos Overfitting Reduce varianza
Feature engineering Underfitting Reduce sesgo
Fitting (Over y Under) 3