0% encontró este documento útil (0 votos)
10 vistas19 páginas

Introducción a Machine Learning y Clasificación

El documento presenta una introducción al aprendizaje automático (Machine Learning), enfocándose en el aprendizaje supervisado y sus aplicaciones en clasificación y predicción. Se discuten conceptos clave como la definición de tareas, experiencia, rendimiento y el ciclo de vida de ML, así como técnicas de preprocesamiento y algoritmos comunes como Naive Bayes y Árboles de Decisión. Además, se destaca la importancia del análisis exploratorio de datos (EDA) y el preprocesamiento para asegurar la calidad de los modelos predictivos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
10 vistas19 páginas

Introducción a Machine Learning y Clasificación

El documento presenta una introducción al aprendizaje automático (Machine Learning), enfocándose en el aprendizaje supervisado y sus aplicaciones en clasificación y predicción. Se discuten conceptos clave como la definición de tareas, experiencia, rendimiento y el ciclo de vida de ML, así como técnicas de preprocesamiento y algoritmos comunes como Naive Bayes y Árboles de Decisión. Además, se destaca la importancia del análisis exploratorio de datos (EDA) y el preprocesamiento para asegurar la calidad de los modelos predictivos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Introducción a

Machine
Learning
Sesión 1
Introducción a ML

• Machine Learning

• Aprendizaje supervisado.

• Algoritmos de clasificación

• EDA

• Peprocesamiento

• Naive Bayes

• Árbol de Decisión

• Gradient Boosting Classifier.


Objetivo de Aprendizaje

Meta Principal Conocimientos Aplicación Práctica


Identificar los conceptos de
Clave Implementar algoritmos de
aprendizaje supervisado para el Machine Learning en problemas
desarrollo de algoritmos de Dominar técnicas de clasificación y reales
clasificación binaria preprocesamiento de datos
¿Qué es Machine Learning?

La idea de Machine Learning es que habrá algún algoritmo


de aprendizaje que ayudará a la máquina aprender de los
datos. El profesor Mitchell lo definió de la siguiente manera.

"Se dice que un programa informático aprende de la


experiencia E con respecto a alguna clase de tareas T
y una medida de rendimiento P, si su rendimiento en
las tareas de T, medido por P, mejora con la
experiencia E".

Aunque esta definición puede parecer desalentadora al


principio, le pido que la lea un par de veces lentamente
centrándose en los tres parámetros -T, P y E- que son los
principales componentes de cualquier algoritmo de
aprendizaje.
Definir la Tarea Específica

La tarea, T, que puede definirse con un


doble enfoque. Desde el punto de vista del
problema, la tarea, T, es básicamente el
problema del mundo real que hay que
resolver, que puede ser cualquier cosa, desde
encontrar la mejor combinación de marketing
o de productos hasta predecir los fallos de la
infraestructura.

En el mundo del aprendizaje automático, lo


mejor es definir la tarea de la forma más
concreta posible, de manera que problema
exacto que se pretende resolver y cómo se
podría definir o formular el problema en una
tarea específica de aprendizaje automático.
Ejemplos de Tareas
Clasificación Predicción

Detección Anomalías

Clustering o agrupaciones Procesamiento de Lenguaje Natural


Experiencia (Entrenamiento)

La idea de que un modelo o algoritmo


adquiera experiencia E suele producirse
como un proceso iterativo, también conocido
como entrenamiento del modelo. Se podría
pensar que el modelo es una entidad como un
ser humano queque adquiere conocimientos o
experiencia a través de los puntos de datos,
observando y aprendiendo más y más sobre
los diversos atributos, relaciones y patrones
presentes en los datos. Por supuesto, hay
varias formas y maneras de aprender y
adquirir experiencia, como el aprendizaje
supervisado, el no supervisado y el de
refuerzo.
Rendimiento (Perfomance)

Supongamos que tenemos un algoritmo de aprendizaje


automático que debe realizar una tarea, T, y que va
ganando experiencia, E, con puntos de datos durante un
período de tiempo. Pero, ¿cómo sabemos si está actuando
bien o no?

¿Cómo se comporta? Aquí es donde entra en juego el


rendimiento, P, del modelo.

El rendimiento, P, suele ser una medida cuantitativa o


métrica que se utiliza para ver lo bien que el algoritmo o
modelo realiza la tarea, T, con experiencia, E. Aunque las
métricas de rendimiento suelen ser métricas estándar que
se han establecido tras años de investigación y desarrollo,
cada métrica suele calcularse específica para la tarea, T,
que se intenta resolver en un momento dado.
Ciclo de vida de ML
Tipos de Variables - Estadística
Tipos de Algoritmos de ML
Aprendizaje Supervisado

Técnica de Machine Learning donde se entrena un


modelo utilizando un conjunto de datos etiquetado.
Cada ejemplo de entrenamiento consta de una entrada
(características o atributos) y una etiqueta o resultado
deseado.

Objetivo: función que pueda mapear las entradas a las


etiquetas o resultados correctos, permitiendo hacer
predicciones precisas sobre nuevas entradas.

• Datos etiquetados con relaciones


conocidas
Aspectos
Clave • Aprendizaje de patrones en los
datos

• Evaluación mediante métricas de


rendimiento
Aplicaciones del Aprendizaje Supervisado

Clasificación Regresión
• Asignar etiquetas o categorías a entradas. • Predecir valores numéricos continuos. Ejemplos:
Ejemplos: clasificar correos como spam o no predecir el precio de una casa según tamaño, ubicación
spam, identificar especies de animales en y características.
imágenes.

El aprendizaje supervisado es una de las técnicas más utilizadas en ML debido a


su versatilidad y aplicabilidad en problemas del mundo real, desde clasificación
hasta predicción y toma de decisiones.
Algoritmos de Clasificación
Los algoritmos de clasificación son técnicas de Machine Learning que asignan una etiqueta o categoría a un elemento
de entrada basándose en sus características. Predicen la clase a la que pertenece el elemento usando patrones
aprendidos de datos de entrenamiento etiquetados.

Correo Electrónico Imágenes Documentos


Determinar si es spam o no spam Identificar objetos como gatos, Categorizar en diferentes temas
perros o automóviles

Diagnóstico Médico Recomendaciones


Predecir enfermedades según síntomas Sugerir productos según preferencias
Algoritmos Comunes de Clasificación

1 Máquinas de Soporte Vectorial (SVM)


Útiles para clasificación binaria y pueden manejar datos no lineales de manera efectiva.

2 Árboles de Decisión
Representan decisiones y pueden manejar datos categóricos y numéricos simultáneamente.

3 Naive Bayes
Basado en el teorema de Bayes, ideal para clasificación de texto y documentos.

4 Random Forest
Conjunto de árboles de decisión que combina múltiples modelos para mejorar la precisión.

La elección del algoritmo depende del problema específico, la naturaleza de los datos y los objetivos del aprendizaje automático
Análisis Exploratorio de Datos
(EDA)
EDA es una etapa crucial que aplica técnicas estadísticas y visuales
para examinar datos, identificar patrones, tendencias, relaciones y
posibles anomalías.

Propósitos Principales Beneficios Clave


• Comprender estructura y • Visualización clara de datos
naturaleza de los datos • Identificación de valores faltantes
• Detectar anomalías y valores • Selección de características
atípicos relevantes
• Explorar distribuciones de variables
• Validación de suposiciones iniciales
• Identificar relaciones y • Resumen de hallazgos clave
correlaciones
• Seleccionar técnicas de
modelado apropiadas
Preprocesamiento de Datos
El preprocesamiento es una fase crítica que implica preparar y limpiar datos brutos antes de análisis avanzados o
construcción de modelos predictivos. Es esencial para garantizar que los datos estén en condiciones óptimas y los
resultados sean confiables.

01 02 03
Limpieza de Datos Transformación Selección de
Identificar y tratar valores Normalización,
Características
atípicos y valores faltantes estandarización y Identificar y mantener solo
que pueden distorsionar el codificación de variables las características más
análisis. categóricas en formatos relevantes para reducir
numéricos. dimensionalidad.

04 05
Manejo de Desbalances Reducción de Ruido
Abordar desequilibrios en las clases que Eliminar información irrelevante
afectan el aprendizaje del modelo. que dificulta la precisión del análisis.
Preprocesamiento de Datos
El preprocesamiento es una fase crítica que implica preparar y limpiar datos brutos antes de análisis avanzados o
construcción de modelos predictivos. Es esencial para garantizar que los datos estén en condiciones óptimas y los
resultados sean confiables.

01 02 03
Limpieza de Datos Transformación Selección de Características
Identificar y tratar valores atípicos y Normalización, estandarización y Identificar y mantener solo las
valores faltantes que pueden codificación de variables categóricas características más relevantes para
distorsionar el análisis. en formatos numéricos. reducir dimensionalidad.

04 05
Manejo de Desbalances Reducción de Ruido
Abordar desequilibrios en las clases que afectan el Eliminar información irrelevante que dificulta la precisión del análisi
aprendizaje del modelo.
Naive Bayes

Naive Bayes es un algoritmo de clasificación supervisada basado en el Aplicaciones Comunes


teorema de Bayes. El nombre "Naive" (ingenuo) se refiere a la
• Clasificación de texto y documentos
suposición simplificada de independencia entre características, que
aunque no siempre es cierta, resulta efectiva en la práctica. • Detección de spam
• Análisis de sentimientos
A pesar de esta suposición simplificada, los clasificadores Naive Bayes
son rápidos de entrenar y usar, siendo ampliamente utilizados en • Sistemas de recomendación
procesamiento de lenguaje natural, clasificación de textos, sistemas de • Diagnóstico médico
recomendación y detección de spam. • Detección de fraudes
Árbol de Decisión y Gradient Boosting

Árbol de Decisión Gradient Boosting Classifier


Estructura jerárquica donde cada nodo interno Algoritmo de ensamble que combina múltiples
representa una pregunta sobre una característica, árboles de decisión débiles de manera secuencial.
cada rama una respuesta, y cada hoja una decisión Cada iteración mejora el rendimiento corrigiendo
o etiqueta. Altamente interpretable y maneja datos errores anteriores mediante ponderación, logrando
mixtos para clasificación y regresión. mayor precisión en clasificación y regresión.

Ambos algoritmos son fundamentales en Machine Learning, ofreciendo


soluciones robustas para problemas complejos de clasificación y predicción.

También podría gustarte