“Diploma de Alta Especialización en Big Data y Data Science”
Modelos de Machine Learning for Data Science
Ing. Jorge Rodríguez
SESIÓN: MACHINE LEARNING –
MODELOS SUPERVISADOS
OBJETIVOS DE LA SESIÓN: Comprender las principales aplicaciones de los modelos
supervisados identificando relaciones en datos estructurados
CONTENIDO
DE LA 1. TEMAS DE LA SESIÓN:
SESIÓN Tema 1: Modelos de regresión: Paramétrico y No paramétrico
Tema 2: Regresión Lineal: Modelos y Aplicaciones
Tema 3: Modelo de Árboles de clasificación
Tema 4: Métricas para evaluación de modelos supervisados
Tema 5: Búsqueda de recomendaciones óptimas para la toma de decisiones
¿Cómo funciona el proceso de
Aprendizaje Supervisado?
TEMA 1
Modelos de regresión:
Paramétrico y No
paramétrico
Regresión Lineal
Los modelos de regresión son herramientas fundamentales en el
aprendizaje automático para predecir valores numéricos. Se clasifican
principalmente en dos categorías: paramétricos y no paramétricos.
• Modelos Paramétricos: Asumen una forma funcional específica para
la relación entre las variables independientes y la variable
dependiente. Estos modelos tienen un número fijo de parámetros que
deben ser estimados a partir de los datos.
• Modelos No Paramétricos: No hacen suposiciones previas sobre la
forma funcional de la relación. En cambio, permiten que los datos
"hablen por sí mismos" y ajustan una función más flexible a los datos.
¿Cuándo usar qué modelo?
• Modelos Paramétricos: Son adecuados cuando se tiene una idea
previa de la relación entre las variables y se dispone de pocos datos.
Son más rápidos de entrenar y evaluar.
• Modelos No Paramétricos: Son más flexibles y pueden capturar
relaciones complejas. Son útiles cuando no se tiene una idea clara de
la forma funcional y se dispone de una gran cantidad de datos. Sin
embargo, pueden ser más propensos al sobreajuste y son
computacionalmente más costosos.
TEMA 2
Regresión Lineal:
Modelos y
Aplicaciones
La regresión lineal es una técnica fundamental en el aprendizaje automático y la estadística que busca
modelar la relación lineal entre una variable dependiente (la que queremos predecir) y una o más
variables independientes (las que utilizamos para hacer la predicción). En términos más simples, trata
de encontrar la mejor línea recta que se ajuste a un conjunto de datos.
Practicando qué regresión usar:
1. Deseo predecir el precio de casas
Regresión Lineal
2. Deseo predecir si un cliente va a
comprar o no mis productos al siguiente
mes ( 1 es que sí lo compra, 0 que no lo
compra)
Regresión Polinómica
3. Deseo predecir el monto que el cliente
gastará en consumos en los próximos 3
meses.
Regresión Exponencial
4. Deseo predecir si el paciente tiene
una enfermedad o no (1 es que sí la
tiene, 0 que no la tiene)
Regresión Logística
BREAK TIME
Tomémonos un descanso
de 15 mins.
VAMOS AL
CÓDIGO…
TEMA 3
Modelo de Árboles de
Clasificación
El algoritmo del árbol de decisión
Un árbol de decisión es una
estructura arbórea similar a un
diagrama de flujo, en la que un nodo
interno representa una característica
(o atributo), la rama representa una
regla de decisión y cada nodo hoja
representa el resultado.
El nodo superior de un árbol de
decisión se conoce como nodo raíz.
Aprende a dividir en función del valor
del atributo. Particiona el árbol de
forma recursiva, llamada partición
recursiva. Esta estructura en forma
de organigrama te ayuda en la toma
de decisiones. Es una visualización
como un diagrama de flujo que imita
fácilmente el pensamiento a nivel
humano. Por eso los árboles de
decisión son fáciles de entender e
interpretar.
¿Cómo funciona el algoritmo del árbol de
decisión?
La idea básica de cualquier algoritmo de árbol de decisión es la siguiente:
1. Selecciona el mejor atributo utilizando las Medidas de Selección de Atributos (ASM) para dividir los registros.
2. Convierte ese atributo en un nodo de decisión y divide el conjunto de datos en subconjuntos más pequeños.
3. Comienza la construcción del árbol repitiendo este proceso recursivamente para cada hijo hasta que una de las condiciones
coincida:
• Todas las tuplas pertenecen al mismo valor de atributo.
• No quedan más atributos.
• No hay más instancias.
Medidas de selección de atributos
Ganancia de Información
Claude Shannon inventó el concepto de
entropía, que mide la impureza del conjunto de
entrada. En física y matemáticas, se denomina
entropía a la aleatoriedad o impureza de un
sistema. En teoría de la información, se refiere a
la impureza de un grupo de ejemplos. La
ganancia de información es la disminución de la
entropía.
La ganancia de información calcula la diferencia
entre la entropía antes de la división y la
entropía media después de la división del
conjunto de datos en función de los valores de
los atributos dados. El algoritmo de árbol de
decisión ID3 (dicotomizador iterativo) utiliza la
ganancia de información.
Medidas de selección de atributos
Índice de Gini
El índice de Gini es una medida de impureza
utilizada comúnmente en los algoritmos de
aprendizaje automático, especialmente en los
árboles de decisión. En términos simples, el
índice de Gini nos indica qué tan mezcladas
están las clases en un conjunto de datos. Un
valor de Gini cercano a 0 significa que todas las
muestras pertenecen a la misma clase (alta
pureza), mientras que un valor cercano a 1
indica que las clases están distribuidas
uniformemente (alta impureza).
En la construcción de un árbol de decisión, el
índice de Gini se utiliza para determinar el mejor
atributo para dividir los datos en cada nodo. El
algoritmo busca el atributo que produzca la
división con la menor impureza promedio en los
nodos hijos.
TEMA 4
Métricas para
evaluación de
modelos supervisados
Métricas de evaluación – Clasificación
Métricas de evaluación – Regresión
TEMA 5
Búsqueda de
recomendaciones
óptimas para la toma
de decisiones
Recomendaciones
1. Selección cuidadosa de los datos:
• Calidad: Los datos deben ser precisos, relevantes y completos.
• Cantidad: Una cantidad suficiente de datos es esencial para entrenar un modelo robusto.
• Representación: Los datos deben ser transformados de manera adecuada para que el modelo pueda
aprender patrones significativos.
2. Elección del algoritmo adecuado:
• Problema: El algoritmo debe ser apropiado para el tipo de problema que se quiere resolver (clasificación,
regresión, etc.).
• Complejidad: La complejidad del algoritmo debe ajustarse a la cantidad y calidad de los datos.
3. Validación del modelo:
• Conjunto de prueba: Es crucial evaluar el rendimiento del modelo en un conjunto de datos que no se haya
utilizado para el entrenamiento.
• Métricas: Se deben utilizar métricas adecuadas para evaluar la precisión del modelo (por ejemplo, precisión,
recall, F1-score para clasificación; error cuadrático medio para regresión).
4. Interpretabilidad:
• Entender el modelo: Es importante comprender cómo el modelo llega a sus conclusiones, especialmente en
aplicaciones críticas.
• Técnicas de interpretación: Existen diversas técnicas para visualizar y explicar las decisiones de un modelo
(por ejemplo, árboles de decisión, SHAP).
5. Actualización continua:
• Cambios en los datos: Los modelos deben ser actualizados regularmente para reflejar cambios en los datos
y en el entorno.
• Nuevos datos: Incorporar nuevos datos puede mejorar la precisión del modelo a lo largo del tiempo.
AHORA SÍ, VAMOS
AL CÓDIGO…
“Diploma de Alta Especialización en Big Data y Data Science”
Modelos de Machine Learning for Data Science
Ing. Jorge Rodríguez