MODELOS DE
APRENDIZAJE
AUTOMÁTICO
Proceso en el que se seleccionan, entrenan y aplican
algoritmos de modelado para abordar los objetivos
definidos en las fases anteriores. El científico de datos
construye y ajusta modelos predictivos o descriptivos
utilizando técnicas estadísticas, de machine learning y
otros, con el fin de resolver el problema de negocio
planteado.
MODELOS SUPERVISADOS
Es un algoritmo de aprendizaje automático que aprende de datos etiquetados. El modelo
recibe datos de entrada junto con las respuestas correctas (etiquetas) y aprende a hacer
predicciones basadas en esa información.
Ejemplo: Queremos predecir si un estudiante aprobará o reprobará un curso. Para
entrenar un modelo supervisado, necesitamos datos de estudiantes como: como horas de
estudio, edad, tareas entregadas; y, la etiqueta que indica si aprobaron o no el examen.
Algoritmos supervisados pueden ser:
• Regresión lineal: Predicción de un valor continuo, ejemplo: predecir el precio
de una casa.
• Árboles de decisión: Clasificación de datos, ejemplo: si un email es spam o
no.
MODELOS NO SUPERVISADOS
Es un algoritmo que no tiene etiquetas. El modelo explora los datos y encuentra patrones o
relaciones por sí mismo.
Ejemplo: Un grupo de estudiantes con datos: edad, horas de estudio, género, pero no se
conoce si aprobaron o reprobaron el curso. Un modelo no supervisado podría agrupar a
los estudiantes en grupos similares como si los estudiantes que estudian mucho y otros que
estudian poco, sin conocer si aprobaron o no.
Algoritmos no supervisados pueden ser:
• Clustering: Agrupar por características similares, ejemplo: Agrupar a los
clientes de una tienda según sus comportamientos de compra.
• Redes Neuronales: encuentra patrones o representaciones estructuradas en
los datos, ejemplo: detectar fraudes en transacciones financieras.
APRENDIZAJE POR REFUERZO
Un agente aprende a tomar decisiones a través de prueba y error, recibiendo
recompensas o castigos por sus acciones.
Ejemplo: Un robot que quiere aprender a manejar una bicicleta, el agente (robot) prueba
como pedalear, estabilizarse o girar el manubrio.
• Cada vez que avanza sin caerse, recibe un punto positivo (recompensa).
• Si se cae, recibe un punto negativo (penalización).
El robot aprende con cada intento ganando más puntos y minimizando errores.
EJEMPLO: MODELO DE REGRESIÓN LINEAL
Es un algoritmo de aprendizaje automático supervisado para modelar la relación entre una
variable dependiente (o de respuesta) y una o más variables independientes (o predictoras).
Para predecir el precio de una casa (variable
dependiente), tendríamos las siguientes variables
Independientes: y
• Tamaño en metros cuadrados
• Número de habitaciones
• Ubicación
• Antigüedad
Precio de Regresión ϵ
una casa Lineal
X
EJEMPLO: MODELO DE CLASIFICACIÓN
Es un algoritmo de aprendizaje automático supervisado que se utiliza para
asignar una etiqueta o categoría a una entrada de datos.
Dada una serie de características el modelo predice a qué grupo o clase
pertenece.
Transacción
financiera es
normal o Random Forest
sospechosa
(posible fraude)
EJEMPLO: REDES NEURONALES
Pueden ser supervisados o no supervisados, son como un sistema de "cerebros artificiales"
que pueden aprender de los datos para hacer predicciones o detectar patrones sin que
les digan exactamente qué hacer. Aprenden por sí mismos aplicados para
reconocimiento de imágenes y voz.
Ejemplo: se podría utilizar para revisar millones de transacciones financieras
realizadas por una entidad pública. La red puede aprender a identificar patrones
que podrían indicar fraude, como pagos repetidos a la misma persona en corto
tiempo o gastos que no siguen las normativas.
Al entrenar la red con ejemplos de transacciones correctas e
incorrectas, puede luego señalar automáticamente aquellas que
necesitan ser auditadas más a fondo, ayudando a los auditores a
centrarse en los casos más relevantes y a detectar irregularidades
más rápido.
[Link]
MACHINE LEARNING Subajuste (underfitting)
Aprendizaje Automático
Para lograr un modelo capaz de entender
patrones generales de los datos con los que fue
entrenado, para luego usarlos correctamente
con datos nuevos, se debe evitar el subajuste y
sobreajuste.
Sobreajuste (overfitting)
Acciones para prevenir
• Datos de calidad
• Validación cruzada
• Muestras representativas
Fuente: [Link]