0% encontró este documento útil (0 votos)
5 vistas93 páginas

Introducción al Aprendizaje Automático

Cargado por

Nadin H
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
5 vistas93 páginas

Introducción al Aprendizaje Automático

Cargado por

Nadin H
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Descripción del aprendizaje automático

Objetivos

⚫ Al finalizar este curso, usted comprenderá lo siguiente:


 Definiciones de algoritmos de aprendizaje y proceso de aprendizaje automático
 Conceptos relacionados, como hiperparámetros, descenso del gradiente y validación
cruzada
 Algoritmos comunes de aprendizaje automático

2 Material confidencial de Huawei


Contenidos

1. Algoritmos de aprendizaje automático

2. Tipos de aprendizaje automático

3. Proceso del aprendizaje automático

4. Conceptos importantes del aprendizaje automático

5. Algoritmos comunes de aprendizaje automático

3 Material confidencial de Huawei


Algoritmos del aprendizaje automático (1)
⚫ El aprendizaje automático a menudo se combina con métodos de aprendizaje profundo para
estudiar y observar algoritmos de IA. Se dice que un programa informático aprende de la
experiencia 𝐸 respecto de alguna clase de tareas 𝑇 y mediciones de rendimiento 𝑃, si su
rendimiento en las tareas 𝑇, medido por 𝑃 mejora con la experiencia 𝐸.

Algoritmo de Entendimiento
Datos
aprendizaje (Medición
(Experiencia 𝐸)
(Tarea 𝑇) del rendimiento 𝑃)

4 Material confidencial de Huawei


Algoritmos de aprendizaje automático (2)

Experiencia Datos
históricos

Resumir Entrenar

Entrada Predecir Entrada Predecir


Problema Datos Atributos
nuevo
Reglas Futuro nuevos
Modelo
futuros

6 Material confidencial de Huawei


Creado por: Jim Liang

Diferencias entre los algoritmos de aprendizaje automático y los


métodos tradicionales basados en reglas
Método basado en reglas Aprendizaje automático

Datos de
entrenamiento

Aprendizaje
automático

Datos
nuevos Modelo Predicción

• Los modelos se entrenan en función de muestras.


• Utiliza la programación explícita para resolver
problemas. • Las reglas de toma de decisiones son complejas o
difíciles de describir.
• Las reglas se pueden determinar manualmente.
• Las máquinas aprenden las reglas automáticamente.

7 Material confidencial de Huawei


Cuándo utilizar el aprendizaje automático (1)
⚫ El aprendizaje automático proporciona soluciones a problemas complejos o que implican una gran cantidad de datos
cuya función de distribución no puede determinarse.
⚫ Considere los siguientes escenarios:
Las reglas de tareas cambian con el tiempo,
La distribución de datos cambia a lo largo
por ejemplo, el etiquetado de partes del
Las reglas son complejas o difíciles de del tiempo y los programas necesitan
discurso, ya que se pueden generar nuevas
describir, por ejemplo, en el reconocimiento adaptarse constantemente a los nuevos
palabras o las palabras pueden adquirir
de voz. datos, por ejemplo, en el caso de previsión
significados distintos en cualquier
de tendencias de ventas.
momento.

8 Material confidencial de Huawei


Cuándo utilizar el aprendizaje automático (2)

Alta
Reglas manuales Algoritmos de aprendizaje
automático

Complejidad
de las reglas

Preguntas sencillas Algoritmo basado en


Baja reglas

Pequeña Grande
Escala del problema

9 Material confidencial de Huawei


Fundamentos de los algoritmos de aprendizaje automático

Ecuación de destino
𝑓: 𝑋 → 𝑌

Ideal

Real
Datos de entrenamiento Algoritmo de Función hipotética
𝐷: {(𝑥1 , 𝑦1 ) ⋯ , (𝑥𝑛 , 𝑦𝑛 )} aprendizaje 𝑔≈𝑓

⚫ La función objetivo 𝑓 es desconocida y el algoritmo de aprendizaje no puede


obtener una función 𝑓 perfecta.
⚫ La función de hipótesis g se aproxima a la función 𝑓, pero puede ser diferente de la
función 𝑓.

10 Material confidencial de Huawei


Principales problemas resueltos por el aprendizaje automático
⚫ El aprendizaje automático puede resolver muchos tipos de tareas. Los tres tipos más comunes son los siguientes:
◼ Clasificación: Para especificar una de las categorías k específicas para la entrada, el algoritmo de aprendizaje suele generar una función 𝑓: 𝑅𝑛 →
(1,2, … , 𝑘) . Por ejemplo, los algoritmos de clasificación de imágenes en la visión artificial resuelven tareas de clasificación.
◼ Regresión: El programa predice el resultado en función de los datos ingresados. Los algoritmos de aprendizaje suelen generar una función
𝑓: 𝑅𝑛 → 𝑅 . Dichas tareas incluyen, por ejemplo, predecir el monto de un reclamo de un asegurado para fijar una prima de seguro o predecir el
precio de la garantía.
◼ Agrupación: Sobre la base de similitudes internas, el programa agrupa una gran cantidad de datos sin etiquetar en múltiples clases. Los datos de
la misma clase son más similares que los datos de clases diferentes. Las tareas de agrupación incluyen la búsqueda por imágenes y la generación
de perfiles de usuario.
⚫ La clasificación y la regresión son dos de los principales tipos de tareas de predicción. La salida de la clasificación son valores de
clase discretos, y la salida de la regresión son valores continuos.

11 Material confidencial de Huawei


Contenidos

1. Algoritmos de aprendizaje automático

2. Tipos de aprendizaje automático

3. Proceso del aprendizaje automático

4. Conceptos importantes del aprendizaje automático

5. Algoritmos comunes de aprendizaje automático

12 Material confidencial de Huawei


Tipos de aprendizaje automático
⚫ Aprendizaje supervisado: El programa toma un conjunto conocido de muestras y entrena un modelo óptimo para generar
predicciones. Luego, el modelo entrenado correlaciona todas las entradas con las salidas y realiza valoraciones sencillas sobre los
resultados. De esta manera, todos los datos desconocidos se clasifican.
⚫ Aprendizaje no supervisado: El programa construye un modelo basado en los datos de entrada sin etiquetar. Por ejemplo, un
modelo de agrupación agrupa objetos según sus similitudes. Los algoritmos de aprendizaje no supervisado modelan las muestras
altamente similares, calculan la similitud entre muestras nuevas y existentes, y clasifican las muestras nuevas en función de las
similitudes.
⚫ Aprendizaje semisupervisado: El programa entrena un modelo a través de la combinación de una pequeña cantidad de datos
etiquetados y una gran cantidad de datos no etiquetados.
⚫ Aprendizaje por refuerzo: Los sistemas de aprendizaje aprenden el comportamiento del entorno para maximizar el valor de la
función de señal de recompensa (refuerzo). El aprendizaje por refuerzo difiere del aprendizaje supervisado del conexionismo en
que, en lugar de indicarle al sistema la acción correcta, el entorno proporciona señales escalares de refuerzo para evaluar sus
acciones.
⚫ La evolución del aprendizaje automático está dando lugar a nuevos tipos de aprendizaje automático, por ejemplo, el aprendizaje
autosupervisado, el aprendizaje contrastivo y el aprendizaje generativo.

13 Material confidencial de Huawei


Aprendizaje supervisado

Características de los datos Etiquetas

Característica 1 ······ Característica n Objetivo

Algoritmo de aprendizaje
Característica 1 ······ Característica n Objetivo
supervisado

Característica 1 ······ Característica n Objetivo

Velocidad del Adecuado para el


Clima Temperatura
viento ejercicio
Soleado Alta Alta Sí
Lluvioso Baja Media No

Soleado Baja Baja

15 Material confidencial de Huawei


Aprendizaje supervisado - Regresión
⚫ La regresión refleja las características de los atributos de ejemplo en un conjunto de datos. Se
utiliza una función para expresar la relación de correlación de las muestras y descubrir aún más
la dependencia entre atributos. Ejemplos:
◼ ¿Cuánto dinero puedo ganar con las acciones la próxima semana?
◼ ¿Cuál será la temperatura el martes?

Lunes Martes

38° ?

16 Material confidencial de Huawei


Aprendizaje supervisado - Clasificación
⚫ La clasificación utiliza un modelo de clasificación para asignar muestras de un conjunto de
datos a una categoría determinada.
◼ ¿A qué categoría de basura pertenece la botella de plástico?
◼ ¿El correo electrónico es un correo no deseado?

17 Material confidencial de Huawei


Aprendizaje no supervisado
Características de los datos

Característica 1 ······ Característica n

Similitudes
······
Algoritmo de aprendizaje dentro de un
Característica 1 Característica n
no supervisado clúster

Característica 1 ······ Característica n

Volumen de ventas Categoría


Producto Período de venta
mensuales
Clúster 1
1,000-2,000 Raqueta de bádminton 6:00-12:00
Clúster 2
500-1,000 Básquetbol 18:00-24:00
1,000-2,000 Consola de juegos 00:00-6:00

18 Material confidencial de Huawei


Aprendizaje no supervisado - Agrupación
⚫ La agrupación utiliza un modelo de grupos para clasificar las muestras de un conjunto de datos
en varias categorías según sus similitudes.
◼ Definición de peces de la misma especie.
◼ Recomendación de películas para los usuarios.

19 Material confidencial de Huawei


Aprendizaje semisupervisado

Características de los datos Etiquetas

Característica 1 ······ Característica n Objetivo

Característica 1 ······ Característica n


Algoritmo de aprendizaje Desconocido
semisupervisado

Característica 1 ······ Característica n Desconocido

Velocidad del Adecuado para el


Clima Temperatura ejercicio
viento
Soleado Alta Alta Sí

Lluvioso Baja Media /


/
Soleado Baja Baja

20 Material confidencial de Huawei


Aprendizaje por refuerzo
⚫ Un modelo de aprendizaje por refuerzo aprende del entorno, toma acciones y las adapta en
función de un sistema de recompensas.

Modelo

Estado 𝑠𝑡 Recompensa 𝑟𝑡 Acción 𝑎𝑡

𝑟𝑡+1

𝑠𝑡+1 Entorno

21 Material confidencial de Huawei


Aprendizaje por refuerzo - La mejor acción
⚫ El aprendizaje por refuerzo siempre trata de encontrar la mejor acción.
◼ Vehículos autónomos: Los semáforos parpadean en color amarillo. ¿El vehículo debe frenar o acelerar?
◼ Aspiradora: El nivel de la batería es del 10 % y falta limpiar un área pequeña. ¿El robot debe continuar limpiando
o recargar la batería?

22 Material confidencial de Huawei


Contenidos

1. Algoritmos de aprendizaje automático

2. Tipos de aprendizaje automático

3. Proceso del aprendizaje automático

4. Conceptos importantes del aprendizaje automático

5. Algoritmos comunes de aprendizaje automático

23 Material confidencial de Huawei


Proceso del aprendizaje automático

Extracción y Despliegue e
Preparación Limpieza de Entrenamiento Evaluación
selección de integración del
de datos datos del modelo de modelos
características modelo

Comentarios e
iteración

24 Material confidencial de Huawei


Conceptos básicos del aprendizaje automático - Conjunto de datos

⚫ Conjunto de datos: Recopilación de datos utilizados en tareas de aprendizaje automático, donde cada
dato se considera una muestra. Los elementos o atributos que reflejan la presentación o la naturaleza de
una muestra en un aspecto particular se denominan características.
 Conjunto de entrenamiento: Conjunto de datos utilizado en el proceso de entrenamiento, donde cada muestra
se denomina muestra de entrenamiento. Aprendizaje (o entrenamiento) es el proceso de construcción de un
modelo a partir de datos.
 Conjunto de prueba: Conjunto de datos utilizado en el proceso de prueba, donde cada muestra se denomina
una muestra de prueba. La prueba se refiere al proceso durante el cual se usa el modelo entrenado para realizar
predicciones.

25 Material confidencial de Huawei


Panorama de los datos
⚫ Composición típica del conjunto de datos

Característica 1 Característica 2 Característica 3 Etiqueta

N.º Área Ubicación Orientación Precio de la vivienda

1 100 8 Sur 1,000

2 120 9 Sudoeste 1,300


Conjunto de
entrenamiento
3 60 6 Norte 700

4 80 9 Sudeste 1100

Conjunto de
pruebas
5 95 3 Sur 850

26 Material confidencial de Huawei


Importancia del procesamiento de datos
⚫ Los datos son cruciales para los modelos y determinan el alcance de sus capacidades. Todo
buen modelo requiere de buenos datos.

Limpieza de datos Preprocesamiento de Estandarización de


datos
los datos
Se completan los Se estandarizan los
valores que faltan y se datos para reducir el
detectan y eliminan los ruido y mejorar la
ruidos y demás puntos precisión del modelo
anormales Reducción de la dimensión
de los datos

Se simplifican los atributos de


datos para evitar la maldición
de la dimensionalidad

27 Material confidencial de Huawei


Cargas de trabajo de limpieza de datos
⚫ Tareas a las que se dedican los científicos de datos relacionadas con el aprendizaje automático:

3 % Reconstrucción de conjuntos de entrenamiento


5 % Otras
4 % Optimización de modelos

9 % Minería de datos para patrones

19 % Recopilación de conjuntos de datos

60 % Limpieza y organización de datos

CrowdFlower Data Science Report 2016

28 Material confidencial de Huawei


Limpieza de datos
⚫ La mayoría de los modelos de aprendizaje automático procesan características, que
generalmente son representaciones numéricas de variables de entrada que se pueden usar en
el modelo.
⚫ En la mayoría de los casos, los datos preprocesados solo pueden ser usados por los algoritmos.
El preprocesamiento de datos incluye las siguientes operaciones:
◼ Filtrado de datos
◼ Manejo de pérdidas de datos
◼ Manejo de posibles errores o valores anormales
◼ Combinación de datos de múltiples fuentes
◼ Consolidación de datos
29 Material confidencial de Huawei
Datos erróneos
⚫ Los datos sin procesar generalmente tienen problemas de calidad:
◼ Datos incompletos: Datos incompletos o falta de atributos o valores relevantes.
◼ Ruido: Los datos contienen registros incorrectos o puntos anormales.
◼ Incoherencia: Los datos contienen registros contradictorios.

Valor faltante

Valor no válido

Valor en campo
erróneo

Elementos duplicados no Formato


válidos incorrecto Atributos dependientes Error ortográfico

30 Material confidencial de Huawei


Conversión de datos
⚫ Los datos preprocesados deben convertirse en una representación adecuada para modelos de aprendizaje
automático. Las siguientes representaciones para convertir datos son las más usadas:
◼ Codificación de datos categóricos en numerales para la clasificación.
◼ Conversión de datos numéricos en datos categóricos para reducir los valores de las variables (por ejemplo, segmentación de
datos de edad).
◼ Otros datos:
◼ Incrustar palabras en texto para convertirlas en vectores de palabras (Generalmente, se usan modelos como word2vec y BERT).
◼ Procesamiento de datos de imágenes, como conversión de espacios de colores, conversión de imágenes en escala de grises, conversión
geométrica, características similares a Haar y mejora de imágenes.
◼ Ingeniería de características:
◼ Normalización y estandarización de las características para garantizar que las diferentes variables de entrada de un modelo entren en el
mismo rango de valores.
◼ Aumento de características: Combinación o conversión de las variables existentes para generar características nuevas, como promedios.

31 Material confidencial de Huawei


Necesidad de selección de características
⚫ En general, un conjunto de datos tiene muchas características, algunas de las cuales pueden ser
innecesarias o irrelevantes para los valores que se quieren predecir.
⚫ La selección de características es necesaria en los siguientes aspectos:

Simplifica los
Acorta el tiempo
modelos para
de
facilitar la
entrenamiento
interpretación

Mejora la
Evita la maldición generalización
de la del modelo y
dimensionalidad evita el
sobreajuste

32 Material confidencial de Huawei


Métodos de selección de elementos - Filtrado
⚫ Los métodos de filtrado son independientes de los modelos durante la selección de
características.
Al evaluar la correlación entre cada característica y
atributo de destino, un método de filtrado califica
cada característica usando una medición estadística y
luego ordena las características por puntaje. Esto
permite preservar o eliminar características
específicas.
Métodos comunes:
Selección del mejor
Exploración de Algoritmo de
Evaluación de • Coeficiente de correlación de Pearson
todas las subconjunto de aprendizaje
características características modelos • Coeficiente de chi-cuadrado
• Información mutua
Proceso del método de filtrado
Limitaciones de los métodos de filtrado:
• Los métodos de filtrado tienden a seleccionar
variables redundantes porque no tienen en cuenta
las relaciones entre las características.

33 Material confidencial de Huawei


Métodos de selección de características - Wrapper
⚫ Los métodos wrapper utilizan un modelo de predicción para calificar un subconjunto de
características. Los métodos wrapper tratan la selección de
características como un problema de búsqueda y evalúan
y comparan diferentes combinaciones. Los métodos
wrapper utilizan un modelo predictivo para evaluar las
diferentes combinaciones de características y calificar los
Selección del mejor subconjunto de subconjuntos de características en función de la precisión
características del modelo.
Método común:
Exploración de Generación de un
Algoritmo de
Evaluación de • Eliminación de características recursivas
todas las subconjunto de modelos
características características aprendizaje Limitaciones de los métodos wrapper:
• Los métodos wrapper entrenan un nuevo modelo para
cada subconjunto de características, lo que puede
Proceso del método wrapper requerir de muchos recursos de cómputo.
• Los métodos wrapper suelen proporcionar conjuntos de
características de alto rendimiento para un tipo
específico de modelo.

34 Material confidencial de Huawei


Métodos de selección de características - Integrados
⚫ Los métodos integrados tratan la selección de elementos como parte del proceso de modelado.

La regularización es el tipo más común de los


métodos integrados.
Los métodos de regularización, también
Selección del subconjunto de características más adecuado denominados métodos de penalización, introducen
restricciones adicionales en la optimización de un
algoritmo predictivo para sesgar el modelo hacia una
Exploración de
Generación de un Algoritmo de aprendizaje menor complejidad y reducir la cantidad de
todas las
subconjunto de + evaluación del modelo características.
características
características

Proceso del método integrado Método común:


• Regresión LASSO

35 Material confidencial de Huawei


Proceso general de construcción de un modelo de IA
Proceso de construcción de un modelo

1 2 3

Separación de los datos Entrenamiento del modelo Validación del modelo


Separe los conjuntos de datos en Utilice los datos procesados por la Utilice el conjunto de
conjuntos de entrenamiento, ingeniería de características y la validación para evaluar la
validación y prueba. limpieza de datos. eficacia del modelo.

6 5 4

Ajuste del modelo Despliegue del modelo Prueba del modelo


Ajuste continuamente el Despliegue en escenarios Utilice el conjunto de pruebas
modelo en función de los de producción reales. para evaluar la capacidad de
datos reales del servicio. generalización del modelo.

36 Material confidencial de Huawei


Ejemplo de aprendizaje supervisado - Fase de aprendizaje
⚫ Utilice un modelo de clasificación para determinar si una persona es un jugador de básquetbol en función de
características específicas.
Características (atributos) Objetivo (etiqueta)

Datos de Nombre Ciudad Edad Etiqueta Conjunto de


servicio entrenamiento
Miguel Miami 42 Sí Datos utilizados por el
Guillermo Nueva York 32 No modelo para determinar las
(Características y etiquetas limpias) relaciones entre las
Alejandro Orlando 18 No características y los
Dividir
Tarea: Usar un modelo de clasificación para Patricia Miami 45 Sí objetivos.
determinar si una persona es un jugador de
básquetbol en función de características Mariana Phoenix 35 % No Conjunto de pruebas
específicas
Gastón Chicago 72 Sí Nuevos datos para evaluar
la efectividad del modelo.
Juan Nueva York 48 Sí

Entrenar el
modelo Cada característica o conjunto de características
proporciona una base de decisión para el modelo.

37 Material confidencial de Huawei


Ejemplo de aprendizaje supervisado - Fase de predicción
Nombre Ciudad Edad Etiqueta
Marina Miami 45 ? Datos desconocidos
Julián Miami 52 ? Los datos recientes no
Datos pueden determinar si son
nuevos Federico Orlando 20 ? jugadores de básquetbol.
Marta Boston 34 ?
Nicolás Phoenix 90 ?
SI ciudad = Miami → Probabilidad = +0.7
SI ciudad= Orlando → Probabilidad = +0.2
Aplicar el SI edad >42 → Probabilidad = +0.05*edad + 0.06
modelo SI edad <=42 → Probabilidad = +0.01*edad + 0.02

Nombre Ciudad Edad Predicción


Marina Miami 45 0.3
Datos Posibilidad predicha
nuevo Julián Miami 52 0.9 Utilice el modelo con los
nuevos datos para predecir
s Federico Orlando 20 0.6
Datos la posibilidad de que sean
Marta Boston 34 0.5 jugadores de básquetbol.
predichos
Nicolás Phoenix 90 0.4

38 Material confidencial de Huawei


¿Qué es un buen modelo?

• Generalización
La precisión de las predicciones basadas en datos
reales

• Explicabilidad
Los resultados predichos son fáciles de explicar

• Velocidad de predicción
El tiempo necesario para hacer una predicción

39 Material confidencial de Huawei


Eficacia del modelo (1)
⚫ Capacidad de generalización: El objetivo del aprendizaje automático consiste en garantizar que los
modelos funcionen bien con muestras nuevas, no solo con las que se utilizan para el entrenamiento. La
capacidad de generalización, también llamada robustez, hace referencia a la medida en que un modelo
aprendido puede aplicarse a nuevas muestras.
⚫ Error es la diferencia entre la predicción de un modelo aprendido en una muestra y el resultado real de
la muestra.
◼ El error de entrenamiento es el error del modelo en el conjunto de entrenamiento.
◼ El error de generalización es el error del modelo en nuevas muestras. Obviamente, preferimos un
modelo con un menor error de generalización menor.
⚫ Subajuste: El error de entrenamiento es grande.
⚫ Sobreajuste: El error de entrenamiento de un modelo entrenado es pequeño mientras que el error de
generalización es grande.

40 Material confidencial de Huawei


Eficacia del modelo (2)
⚫ La capacidad del modelo, también conocida como complejidad del modelo, es la capacidad del modelo para
ajustarse a diferentes funciones.
◼ Con la capacidad suficiente para manejar la complejidad de las tareas y los volúmenes de datos de entrenamiento, los
resultados del algoritmo son óptimos.
◼ Los modelos con una capacidad insuficiente no pueden manejar tareas complejas porque puede producirse un subajuste.
◼ Los modelos de gran capacidad pueden gestionar tareas complejas, pero puede producirse un sobreajuste cuando la capacidad
sea mayor que la cantidad que requiere la tarea.

Subajuste: Sobreajuste:
características no aprendidas Ajuste adecuado ruidos aprendidos
41 Material confidencial de Huawei
Causa del sobreajuste - Errores
⚫ Error de predicción = Sesgo2 + Varianza + error que no se puede
eliminar
Varianza
⚫ En general, los dos factores principales del error de predicción son la
varianza y el sesgo. Sesgo

⚫ Varianza:
◼ Cuánto se desvía un resultado de predicción de la media
◼ La varianza es causada por la sensibilidad del modelo a pequeñas
fluctuaciones en un conjunto de entrenamiento.
⚫ Sesgo:
◼ Diferencia entre el promedio de los valores predichos y los valores
reales.
42 Material confidencial de Huawei
Varianza y sesgo
⚫ Diferentes combinaciones de varianza y sesgo:
◼ Bajo sesgo y baja varianza ➜ modelo adecuado
◼ Bajo sesgo y alta varianza ➜ modelo inadecuado
◼ Alto sesgo y baja varianza ➜ modelo inadecuado
◼ Alto sesgo y alta varianza ➜ modelo malo
⚫ Un modelo ideal puede capturar con precisión las
reglas de los datos de entrenamiento y generalizarse
ante datos invisibles (nuevos). Sin embargo, es
imposible que un modelo realice ambas tareas al
mismo tiempo.

43 Material confidencial de Huawei


Complejidad y errores de los modelos
⚫ Cuanto más complejo es un modelo, menor es su error de entrenamiento.
⚫ A medida que la complejidad del modelo aumenta, el error de prueba disminuye antes de
volver a aumentar, lo que forma una curva convexa.

Error de prueba
Error

Error de entrenamiento

Complejidad del modelo

44 Material confidencial de Huawei


Evaluación del rendimiento del aprendizaje automático - Regresión
⚫ Error absoluto medio (MAE). Un valor de MAE más cercano a 0 indica que el modelo se ajusta
mejor a los datos de entrenamiento.
1 m
MAE =  yi − yi
m i =1
⚫ Error cuadrático medio (MSE). 2
1 m
MSE =  ( yi − yi )
m i =1
⚫ El rango de valor de 𝑅2 es [0.1]. Un valor mayor indica que el modelo se ajusta mejor a los
datos de entrenamiento. 𝑇𝑆𝑆 indica la diferencia entre muestras, y 𝑅𝑆𝑆 indica la diferencia
entre los valores predichos y los valores de muestra.
m 2

RSS  ( yi − yi )
R = 1−
2
= 1 − i =1 2
TSS m

( y
i =1
i − yi )

45 Material confidencial de Huawei


Evaluación del rendimiento del aprendizaje automático -
Clasificación (1)
⚫ Términos:
◼ 𝑃: positivo; indica la cantidad de casos positivos reales en los datos. Predicción
◼ 𝑁: negativo; indica la cantidad de casos negativos reales en los datos. Yes No Total
Real
◼ 𝑇P : positivo verdadero; indica la cantidad de casos positivos clasificados
Sí 𝑇𝑃 𝐹𝑁 𝑃
correctamente.
◼ 𝑇𝑁: negativo verdadero; indica la cantidad de casos negativos clasificados No 𝐹𝑃 𝑇𝑁 𝑁
correctamente.
Total 𝑃′ 𝑁′ 𝑃+𝑁
◼ 𝐹𝑃: falso positivo; indica la cantidad de casos positivos clasificados
incorrectamente.
Matriz de confusión
◼ 𝐹𝑁: falso negativo; indica la cantidad de casos negativos clasificados
incorrectamente.
⚫ La matriz de confusión es una tabla 𝑚 × 𝑚 como mínimo. La entrada 𝐶𝑀𝑖,𝑗 en las primeras 𝑚 filas y 𝑚 columnas indica la
cantidad de casos que pertenecen a la clase 𝑖, pero se etiquetan como 𝑗.
 Para los clasificadores con alta precisión, la mayoría de los casos deben estar representados por entradas en la diagonal de la matriz de
confusión de 𝐶𝑀1,1 a 𝐶𝑀𝑚,𝑚 , mientras que las otras entradas son 0 o cercanas a 0. Es decir, 𝐹𝑃 y 𝐹𝑁 se acercan a 0.

46 Material confidencial de Huawei


Evaluación del rendimiento del aprendizaje automático -
Clasificación (2)
Medición Fórmula
𝑇𝑃 + 𝑇𝑁
Precisión, tasa de reconocimiento
𝑃+𝑁
𝐹𝑃 + 𝐹𝑁
Tasa de error, tasa de clasificación errónea
𝑃+𝑁
Tasa de positivos verdaderos, sensibilidad, 𝑇𝑃
recuperación 𝑃
𝑇𝑁
Tasa de negativos verdaderos, especificidad
𝑁
𝑇𝑃
Precisión
𝑇𝑃 + 𝐹𝑃
valor 𝐹1 , media armónica de precisión y 2 × 𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 × 𝑟𝑒𝑐𝑎𝑙𝑙
recuperación 𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 + 𝑟𝑒𝑐𝑎𝑙𝑙
(1 + 𝛽 2 ) × 𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 × 𝑟𝑒𝑐𝑎𝑙𝑙
valor 𝐹𝛽 , donde 𝛽 es un número real no negativo 𝛽 2 × 𝑝𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 + 𝑟𝑒𝑐𝑎𝑙𝑙

47 Material confidencial de Huawei


Evaluación del rendimiento del aprendizaje automático - Ejemplo

⚫ En este ejemplo, se entrenó un modelo de aprendizaje automático (ML) para identificar una imagen de
un gato. Para evaluar el rendimiento del modelo, se utilizaron 200 imágenes, de las cuales 170 eran
gatos.
⚫ El modelo reportó que 160 imágenes eran gatos. Predicción
𝒚𝒆𝒔 𝒏𝒐 Total
𝑇𝑃 140 Real
Precisión: 𝑃 = = = 87.5%
𝑇𝑃+𝐹𝑃 140+20
𝑦𝑒𝑠 140 30 170
𝑇𝑃 140
Recuperación: 𝑅 = = = 82.4% 𝑛𝑜 20 10 30
𝑃 170

𝑇𝑃+𝑇𝑁 140+10 Total 160 40 200


Exactitud: 𝐴𝐶𝐶 = 𝑃+𝑁
=
170+30
= 75%

48 Material confidencial de Huawei


Contenidos

1. Algoritmos de aprendizaje automático

2. Tipos de aprendizaje automático

3. Proceso del aprendizaje automático

4. Conceptos importantes del aprendizaje automático

5. Algoritmos comunes de aprendizaje automático

49 Material confidencial de Huawei


Métodos de entrenamiento de aprendizaje automático - Descenso
de gradiente (1)
⚫ Este método utiliza la dirección de gradiente negativo de la
posición actual como la dirección de búsqueda, que es la
dirección de descenso más rápida de la posición actual. La
fórmula se calcula de la siguiente manera:


w = w −   f
𝜂 representak +la1 tasa dekaprendizaje.
( x i
wk𝑖 indica) el 𝑖-ésimo registro
de datos. 𝜂𝛻𝑓𝑤𝑘 (𝑥 𝑖 ) indica el cambio del parámetro de
ponderación 𝑤 en cada iteración.
⚫ Convergencia significa que el valor de la función objetivo
cambia muy poco o alcanza la cantidad máxima de iteraciones.

50 Material confidencial de Huawei


Métodos de entrenamiento de aprendizaje automático - Descenso
de gradiente (2)
⚫ El descenso del gradiente por lotes (BGD) utiliza la suma de los gradientes de todas las muestras 𝑚 del conjunto de
datos en el punto actual para actualizar el parámetro de ponderación.
m
1
wk +1 = wk −   f wk ( x )
i

m i =1
⚫ El descenso del gradiente estocástico (SGD) usa aleatoriamente el gradiente de una muestra aleatoria del conjunto
de datos en el punto actual para actualizar el parámetro de ponderación en el gradiente actual.

wk +1 = wk − f wk ( x ) i
⚫ El descenso del gradiente por minilotes (MBGD) combina las características de BGD y SGD y elige los gradientes de
𝑛muestras en un conjunto de datos cada vez para actualizar el parámetro de ponderación.

1 t + n −1
wk +1 = wk −   f wk ( x i )
n i=t
51 Material confidencial de Huawei
Métodos de entrenamiento de aprendizaje automático - Descenso
de gradiente (3)
⚫ Comparación de métodos de descenso del gradiente
◼ SGD elige muestras aleatoriamente para cada fase del entrenamiento, lo que genera inestabilidad.
Como resultado, la función de pérdida fluctúa o incluso produce un desplazamiento inverso durante
el proceso de descenso al mínimo.
◼ BGD es el más estable, pero consume demasiados recursos de cómputo. MBGD representa un
equilibrio entre BGD y SGD.
BGD
Utiliza todas las muestras de entrenamiento en cada fase de
entrenamiento.

SGD
Utiliza una muestra de entrenamiento en cada fase de
entrenamiento.

MBGD
Utiliza una determinada cantidad de muestras de
entrenamiento en cada fase de entrenamiento.

52 Material confidencial de Huawei


Parámetros e hiperparámetros
⚫ Un modelo no solo contiene parámetros, sino también hiperparámetros. Los hiperparámetros permiten
que el modelo aprenda las configuraciones óptimas de los parámetros.
◼ Los modelos aprenden los parámetros automáticamente.
◼ Los hiperparámetros se configuran de forma manual.
Los parámetros se
“destilan” de los
datos.

Modelo

Entrenar
Usar hiperparámetros
para controlar el
entrenamiento

53 Material confidencial de Huawei


Hiperparámetros
• Comúnmente utilizados para estimar los • λ de regresión de Lasso/Ridge
parámetros del modelo. • Tasa de aprendizaje, cantidad de iteraciones,
• Especificados por el usuario. tamaño del lote, función de activación y
• Configurados heurísticamente. cantidad de neuronas de una red neuronal
• A menudo ajustados para un problema de para entrenar
modelado predictivo dado. • 𝐶 y 𝜎 de máquinas de vectores de soporte
(SVM)
• k en el algoritmo de vecinos k más cercanos
(k-NN)
• Cantidad de árboles en una selva forestal

Los hiperparámetros
Hiperparámetros
son configuraciones
comunes
fuera del modelo.

54 Material confidencial de Huawei


Proceso y métodos de búsqueda de hiperparámetros

1. Divida un conjunto de datos en un conjunto de entrenamiento, un conjunto de


validación y un conjunto de prueba.
2. Optimice los parámetros del modelo utilizando el conjunto de entrenamiento basado
en las métricas de rendimiento del modelo.
3. Busque hiperparámetros de modelos utilizando el conjunto de validación basado en
Proceso general de métricas de rendimiento del modelo.
búsqueda de 4. Siga los pasos 2 y 3 de forma alterna hasta que se determinen los parámetros y los
hiperparámetros hiperparámetros del modelo y se evalúe el modelo usando el conjunto de prueba.

•Grid search o búsqueda exhaustiva


•Búsqueda aleatoria
•Búsqueda inteligente heurística
Algoritmos de búsqueda •Búsqueda bayesiana
(paso 3)

55 Material confidencial de Huawei


Métodos de ajustes de hiperparámetros - Grid Search
⚫ Este tipo de búsqueda realiza una búsqueda exhaustiva de todas las combinaciones
posibles de hiperparámetros para formar una grilla de valores de hiperparámetros.

Grid search o búsqueda


⚫ En la práctica, los rangos y los pasos de hiperparámetros se exhaustiva
5
especifican manualmente.
4

Hiperparámetro 1
⚫ Es un tipo de búsqueda costosa y requiere mucho tiempo.
3
 Este método funciona bien cuando hay relativamente pocos hiperparámetros.
Por lo tanto, es viable para algoritmos generales de aprendizaje automático, 2

pero no para redes neuronales (consulte el curso de aprendizaje profundo). 1

0 1 2 3 4 5

Hiperparámetro 2

56 Material confidencial de Huawei


Métodos de ajuste de hiperparámetros - Búsqueda aleatoria
⚫ Si el espacio de búsqueda de hiperparámetros es grande, la
búsqueda aleatoria es más apropiada que la búsqueda
Búsqueda aleatoria
exhaustiva.
⚫ En una búsqueda aleatoria, cada elemento de configuración se
muestrea a partir de posibles valores de parámetros para

Hiperparámetro 1
encontrar el subconjunto de parámetros más apropiado.
⚫ Nota:
◼ En una búsqueda aleatoria, primero se realiza una búsqueda dentro de un
rango amplio, y luego el rango se reduce en función de la ubicación del
mejor resultado.
Hiperparámetro 2
◼ Algunos hiperparámetros son más importantes que otros y afectan las
preferencias de búsqueda aleatoria.

57 Material confidencial de Huawei


Validación cruzada (1)
⚫ La validación cruzada es un método de análisis estadístico utilizado para verificar el rendimiento de los
clasificadores. Divide los datos originales en el conjunto de entrenamiento y el conjunto de validación. El primero se
usa para entrenar un clasificador, mientras que el último se usa para evaluar el clasificador probando el modelo
entrenado.
⚫ Validación cruzada de k iteraciones (CV de k veces):
◼ Divide los datos originales en subconjuntos 𝑘 (generalmente del mismo tamaño).
◼ Cada grupo único se trata como un conjunto de validación, y los 𝑘 − 1 grupos restantes se tratan como el
conjunto de entrenamiento. De esta manera, se obtienen los modelos 𝑘.
◼ La calificación media de la exactitud de clasificación de los modelos 𝑘 en el conjunto de validación se utiliza
como métrica de rendimiento para los clasificadores de validaciones cruzadas de k veces.

58 Material confidencial de Huawei


Validación cruzada (2)

Conjunto de datos completo

Conjunto de
Conjunto de entrenamiento
pruebas

Conjunto de Conjunto de
Conjunto de entrenamiento
validación pruebas

⚫ Nota: la k en la expresión k veces CV es un hiperparámetro.

59 Material confidencial de Huawei


Contenidos

1. Algoritmos de aprendizaje automático

2. Tipos de aprendizaje automático

3. Proceso del aprendizaje automático

4. Conceptos importantes del aprendizaje automático

5. Algoritmos comunes de aprendizaje automático

60 Material confidencial de Huawei


Descripción del algoritmo de aprendizaje automático
Aprendizaje automático

Aprendizaje supervisado Aprendizaje no supervisado

Clasificación Regresión Agrupación Otros

Regresión logística Regresión lineal Agrupación de k-medias Regla de asociación

Análisis de componentes principales


SVM SVM Agrupación jerárquica

Red neuronal Red neuronal Agrupación basada en densidades Modelado de mezcla gaussiana

Árbol de decisión Árbol de decisión

Bosque aleatorio Bosque aleatorio


Árbol de decisión potenciado por
GBDT
gradiente (GBDT)

k-NN k-NN

Bayesiano ingenuo

61 Material confidencial de Huawei


Regresión lineal (1)
⚫ La regresión lineal utiliza el análisis de regresión de estadísticas matemáticas para determinar la
relación cuantitativa entre dos o más variables.
⚫ La regresión lineal es un tipo de aprendizaje supervisado.

Regresión lineal simple Regresión lineal múltiple

62 Material confidencial de Huawei


Regresión lineal (2)
⚫ La función del modelo de regresión lineal es la siguiente, donde 𝑤 es el parámetro de ponderación, 𝑏 es el sesgo y 𝑥 representa la
muestra:
h ( x) = w x + b
w
T

⚫ La relación entre el valor predicho por el modelo y el valor real es la siguiente, donde 𝑦 indica el valor real y 𝑦 indica el error:

⚫ y = w T
La +
El error 𝜀 se ve afectado por muchos factores independientes. x b + lineal supone que el error 𝜀 sigue la distribución normal.
regresión
La función de pérdida de regresión lineal se puede obtener usando la función de distribución normal y la estimación por máxima
verosimilitud (MLE):

1
J ( w) =  (valor
hw ( x) − y )
2
⚫ Queremos que el valor predicho se aproxime lo máximo2posible
m al real, para minimizar el valor de pérdida. Podemos usar un
algoritmo de descenso del gradiente para calcular el parámetro de ponderación 𝑤 cuando la función de pérdida alcanza el mínimo,
y completar así la construcción del modelo.

63 Material confidencial de Huawei


Extensión de regresión lineal - Regresión polinómica
⚫ La regresión polinómica es una extensión de la regresión lineal. Debido a que la complejidad de un
conjunto de datos excede la posibilidad de realizar el ajuste usando una línea recta (obviamente ocurrirá
un subajuste si se utiliza el modelo de regresión lineal original), se utiliza la regresión polinómica.

hw ( x ) = w1 x + w2 x 2 + + wn x n + b

Here, la potencia 𝑛-ésima indica el grado del polinomio.

La regresión polinómica es un tipo de regresión lineal.


Aunque sus características son no lineales, la relación
entre sus parámetros de ponderación 𝑤 sigue siendo
lineal. Comparación entre la regresión lineal y la polinómica

64 Material confidencial de Huawei


Prevención del sobreajuste de la regresión lineal
⚫ Los términos de regularización permiten reducir el sobreajuste. El valor 𝑤 no puede ser
demasiado grande ni demasiado pequeño en el espacio de muestra. Puede agregar una pérdida
de suma cuadrada a la función objetivo:
1 2 2
𝐽(𝑤) = ෍ ℎ𝑤 (𝑥) − 𝑦 +𝜆 𝑤 2
2𝑚
⚫ Término de regularización: Este término de regularización se denomina norma L2. La regresión
lineal que utiliza esta función de pérdida se denomina regresión Ridge.
1 2
𝐽(𝑤) = ෍ ℎ𝑤 (𝑥) − 𝑦 +𝜆 𝑤 1
2𝑚
⚫ La regresión lineal con una pérdida absoluta se llama regresión Lasso.

65 Material confidencial de Huawei


Regresión logística (1)
⚫ El modelo de regresión logística es un modelo de clasificación que se utiliza para resolver problemas de clasificación.
El modelo se define de la siguiente manera:
𝑒 −(𝑤𝑥+𝑏)
𝑃 𝑌=0𝑥 =
1 + 𝑒 −(𝑤𝑥+𝑏)
1
𝑃 𝑌=1𝑥 =
1 + 𝑒 −(𝑤𝑥+𝑏)

𝑤 w representa la ponderación, 𝑏representa el sesgo y 𝑤𝑥 + 𝑏 representa una función lineal con respecto a 𝑏.
Compare los dos valores de probabilidad anteriores. 𝑥 pertenece al tipo con un valor de probabilidad mayor.

66 Material confidencial de Huawei


Regresión logística (2)
⚫ La regresión logística y la regresión lineal son ambas modelos lineales en el sentido amplio. La primera
introduce un factor no lineal (función sigmoide) sobre la base de la segunda y establece un umbral. Por
lo tanto, la regresión logística se aplica a la clasificación binaria.
⚫ De acuerdo con la función del modelo de regresión logística, la función de pérdida de regresión logística
se puede calcular a través de la estimación de máxima verosimilitud de la siguiente manera:

1
J ( w) = -  ( y ln hw ( x) + (1 − y ) ln(1 − hw ( x)) )
m
⚫ En la fórmula, 𝑤 indica el parámetro de ponderación, 𝑚 indica la cantidad de muestras, 𝑥 indica la
muestra y 𝑦 indica el valor real. Los valores de todos los parámetros de ponderación 𝑤 también se
pueden obtener utilizando un algoritmo de descenso del gradiente.

67 Material confidencial de Huawei


Extensión de regresión logística - Softmax (1)
⚫ La regresión logística se aplica principalmente a la clasificación binaria. Para la clasificación
multiclase, generalmente se usa la función Softmax.

Problema de clasificación binaria Problema de clasificación multiclase

¿Uva?

¿Hombre? ¿Naranja?

¿Manzana?

¿Mujer? ¿Plátano?

68 Material confidencial de Huawei


Extensión de regresión logística - Softmax (2)
⚫ La regresión Softmax es una generalización de la regresión logística y se aplica a la clasificación
k-clase.
⚫ La función Softmax comprime (asigna) un vector K-dimensional de valores reales arbitrarios a
otro vector k-dimensional de valores reales, donde cada elemento vectorial está en (0, 1).
⚫ La función de probabilidad de regresión Softmax es la siguiente:

wkT x
e
p( y = k | x; w) = K
, k = 1, 2 ,K
e
l =1
wlT x

69 Material confidencial de Huawei


Extensión de regresión logística - Softmax (3)
⚫ Softmax asigna un valor de probabilidad a cada clase en un problema de clasificación de
múltiples clases. La suma de todas las probabilidades es 1.
◼ Softmax puede presentar las clases generadas de la siguiente manera:

Clase Probabilidad
¿Uva?
0.09

• Suma de todas las probabilidades:


¿Naranja? 0.22 • 0.09 + 0.22 + 0.68 + 0.01 =1
• El objeto más posible en la imagen:
¿Manzana? Manzana
0.68

¿Plátano?
0.01

70 Material confidencial de Huawei


Árbol de decisión
⚫ Cada nodo no secundario del árbol de decisión denota una prueba de un atributo; cada “rama” representa el
resultado de una prueba y cada nodo secundario (o terminal) representa una etiqueta de clase. El algoritmo
comienza en el nodo raíz (nodo que se encuentra en la parte superior del árbol), prueba los atributos seleccionados
en los nodos intermedios (internos) y genera “ramas” de acuerdo con los resultados de las pruebas. Luego, guarda
las etiquetas de clase en los nodos secundarios como los resultados de la decisión.
Nodo raíz

Pequeño Grande

Cuello Cuello
No chirria Chirría corto largo

Nariz Nariz
Podría ser corta larga Podría ser una
Podría ser
una ardilla. jirafa.
una rata.
Permanece en Permanece
la tierra Podría ser un
en el agua elefante.
Podría ser un Podría ser un
rinoceronte. hipopótamo.

71 Material confidencial de Huawei


Estructura de un árbol de decisión

Nodo raíz

Nodo
Nodo
secundario
secundario

Nodo
Subnodo Subnodo secundario Subnodo

Subnodo Subnodo Subnodo

72 Material confidencial de Huawei


Clave para la construcción del árbol de decisión
⚫ Un árbol de decisión requiere atributos de características y una estructura de árbol apropiada. El paso clave para
construir un árbol de decisión es dividir los datos de todos los atributos de características, comparar los conjuntos de
resultados en términos de pureza y seleccionar el atributo con la pureza más alta como el punto de datos para la
división de conjuntos de datos.
⚫ La pureza se mide principalmente a través de la entropía de la información y el coeficiente GINI. La fórmula se
calcula de la siguiente manera:
K K
H ( X )= - pk log 2 ( pk ) Gini = 1 −  pk2
k =1
2 2k =1
𝑚𝑖𝑛𝑗,𝑠 [𝑚𝑖𝑛𝑐1 ෍ 𝑦𝑖 − 𝑐1 + 𝑚𝑖𝑛𝑐2 ෍ 𝑦𝑖 − 𝑐2 ]
𝑥𝑖 ∈𝑅1 𝑗,𝑠 𝑥𝑖 ∈𝑅2 𝑗,𝑠

⚫ 𝑝𝑘 indica la probabilidad de que una muestra pertenezca a una categoría 𝑘 (en un total de K categorías). Una mayor diferencia de
pureza entre la muestra antes y después de la división indica un mejor árbol de decisión.
⚫ Los algoritmos comunes del árbol de decisión incluyen ID3, C4.5 y CART.

73 Material confidencial de Huawei


Proceso de construcción del árbol de decisión
⚫ Selección de características: Seleccione una de las características de los datos de
entrenamiento como el estándar de división del nodo actual. (Diferentes estándares distinguen
diferentes algoritmos del árbol de decisión).
⚫ Generación del árbol de decisión: Genere subnodos de arriba hacia abajo en función de la
característica seleccionada y deténgase cuando el conjunto de datos ya no se pueda dividir.
⚫ Poda: El árbol de decisión puede sobreajustarse fácilmente a menos que se realice la poda
necesaria (incluyendo la poda previa y la poda posterior) para reducir el tamaño del árbol y
optimizar su estructura de nodos.

74 Material confidencial de Huawei


Ejemplo de árbol de decisión
⚫ La siguiente figura muestra un árbol de decisión para un problema de clasificación. El resultado de la
clasificación se ve afectado por tres atributos: reembolso, estado civil e ingresos imponibles.

Imponible
TID Reembolso Estado civil Engaño
Ingresos

1 Sí Soltero/a 125 K No Reembolso


2 No Casado/a 100 K No

3 No Soltero/a 70 K No
No Estado civil
4 Sí Casado/a 120 K No

5 No Divorciado/a 95 K Sí

6 No Casado/a 60 K No Imponible
Ingresos No
7 Sí Divorciado/a 220 K No

8 No Soltero/a 85 K Sí

9 No Casado/a 75 K No No Sí
10 No Soltero/a 90 K Sí

75 Material confidencial de Huawei


Máquina vectorial de soporte
⚫ Las máquinas vectoriales de soporte (SVM) son modelos de clasificación binaria. Su modelo básico es el clasificador
lineal que maximiza el ancho de la brecha entre las dos categorías en el espacio de las características. Las SVM
también tienen un truco de núcleo, que lo convierte en un clasificador no lineal. El algoritmo de aprendizaje de las
SVM es el algoritmo óptimo para la programación cuadrática convexa.

Mapeo

Difícil de dividir en un espacio Fácil de dividir en un espacio


de baja dimensión. de alta dimensión.

76 Material confidencial de Huawei


SVM lineal (1)
⚫ ¿Cómo podemos dividir los puntos de datos rojos y azules con una sola línea?

Conjunto de datos Tanto el método de división de la izquierda como el de la


bidimensional con dos derecha pueden dividir datos. Pero, ¿cuál es correcto?
categorías de muestra

77 Material confidencial de Huawei


SVM lineal (2)
⚫ Podemos utilizar diferentes líneas rectas para dividir los datos en diferentes categorías. Las SVM encuentran una
línea recta y mantienen los puntos más cercanos lo más lejos posible de la línea. Esto le da al modelo una sólida
capacidad de generalización. Estos puntos más cercanos se denominan vectores de soporte.
⚫ En el espacio bidimensional, se usa una línea recta para la división; en el espacio de alta dimensión, se usa un
hiperplano para la división.

Maximizar la
distancia de cada
vector de soporte a
la línea

78 Material confidencial de Huawei


SVM no lineal (1)
⚫ ¿Cómo podemos dividir un conjunto de datos lineal inseparable?

La SVM lineal funciona bien en un Un conjunto de datos no


conjunto de datos separable lineal no se puede dividir
lineal. mediante una línea recta.

79 Material confidencial de Huawei


SVM no lineal (2)
⚫ Las funciones de kernels se pueden usar para crear SVM no lineales.
⚫ Las funciones de kernels permiten que los algoritmos se ajusten a un hiperplano de margen
máximo en un espacio transformado de características de alta dimensión.
Funciones comunes de los kernels

Kernel
Kernel lineal
polinómico

Kernel Kernel
gaussiano sigmoide
Espacio de entrada Espacio de
características de
alta dimensión

80 Material confidencial de Huawei


Algoritmo de vecinos k más cercanos (1)
⚫ El algoritmo de clasificación de vecinos k más cercanos
(k-NN) es un método teóricamente maduro y uno de
los algoritmos de aprendizaje automático más simples.
La idea de la clasificación k-NN es que, si la mayoría de
las k muestras más cercanas (vecinos más cercanos) ?
de una muestra en el espacio de características
pertenecen a una categoría, la muestra también
pertenece a esta categoría.

La categoría de punto ? varía según la cantidad


de nodos vecinos que se elijan.

81 Material confidencial de Huawei


Algoritmo de k vecinos más cercanos (2)
⚫ La lógica de k-NN es simple: Si los k vecinos más cercanos de un objeto pertenecen a una clase, también
lo hace el objeto.
⚫ k-NN es un método no paramétrico y se utiliza a menudo para conjuntos de datos con límites de decisión
irregulares.
◼ k-NN utiliza típicamente el método de votación mayoritaria para predecir la clasificación, y utiliza el método de
valor medio para predecir la regresión.
⚫ k-NN requiere una gran cantidad de cómputo.

82 Material confidencial de Huawei


Algoritmo de k vecinos más cercanos (3)
⚫ Típicamente, un valor de k mayor reduce el impacto del ruido en la clasificación, pero hace que el límite entre clases
sea menos obvio.
◼ Un valor de k grande indica una mayor probabilidad de subajuste porque la división es demasiado aproximada; mientras que
un valor de k pequeño indica una probabilidad de sobreajuste más alta porque la división es demasiado precisa.

• Como se observa en la figura, el límite se


suaviza a medida que aumenta el valor
de k.
• A medida que el valor de k aumenta, los
puntos finalmente se volverán todos
azules o todos rojos.

83 Material confidencial de Huawei


Bayesiano ingenuo (1)
⚫ Los clasificadores de Bayes ingenuo son una familia de simples “clasificadores probabilísticos” basados en el
teorema de Bayes con fuertes supuestos de independencia entre las características. Para una característica de
muestra determinada 𝑋, la probabilidad de que la muestra pertenezca a la categoría 𝐻 es la siguiente:
P ( X 1 ,  , X n | Ck ) P ( C k )
P ( Ck | X 1 ,  , X n ) =
P ( X 1 , , X n )
◼ 𝑋1 , 𝑋2 , … , 𝑋𝑛 son características de los datos, que generalmente se describen por valores de mediciones m del conjunto de
atributos.
◼ Por ejemplo, el atributo de la característica de color puede ser rojo, amarillo y azul.

◼ 𝐶𝑘 indica que los datos pertenecen a una clase específica 𝐶.


◼ 𝑃(𝐶𝑘 |𝑋1 , 𝑋2 , … , 𝑋𝑛 ) es la probabilidad posterior o la probabilidad posterior de 𝐻 bajo la condición 𝐶𝑘 .
◼ P(𝐶𝑘 ) es la probabilidad anterior independiente de 𝑋1 , 𝑋2 , … , 𝑋𝑛 .
◼ 𝑃(𝑋1 , 𝑋2 , … , 𝑋𝑛 ) es la probabilidad anterior de 𝑋.

84 Material confidencial de Huawei


Bayesiano ingenuo (2)
⚫ Ejemplo de hipótesis independiente de características:
◼ Si una fruta es roja, redonda y de unos 10 cm de diámetro, puede considerarse una manzana.
◼ Un clasificador bayesiano ingenuo cree que cada una de estas características contribuye independientemente a
la probabilidad de que la fruta sea una manzana, independientemente de cualquier posible correlación entre el
color, la redondez y las características de diámetro.

85 Material confidencial de Huawei


Aprendizaje por conjuntos
⚫ El aprendizaje por conjuntos es un paradigma del aprendizaje automático en el que múltiples aprendices se
entrenan y combinan para resolver un problema. Cuando se utilizan varios aprendices, la capacidad de
generalización del conjunto puede ser mucho más sólida que cuando se utiliza uno solo.
⚫ Por ejemplo, si hace una pregunta compleja a miles de personas al azar y luego se resumen todas las respuestas
recibidas, la respuesta resumida es más precisa que la respuesta de un experto en la mayoría de los casos. A esto se
lo denomina la sabiduría de la multitud. Conjunto de
entrenamiento

Conjunto de Conjunto de Conjunto de


datos 1 datos 2 datos m

Modelo 1 Modelo 2 Modelo m

Modelo
Conjunto grande

86 Material confidencial de Huawei


Tipos de aprendizaje de conjunto

Ejemplo: bosque aleatorio


• Este método construye independientemente múltiples
Bagging
aprendices básicos y luego promedia sus predicciones.
• En promedio, un aprendiz en conjunto suele ser mejor que un
aprendiz único porque la varianza es menor.
Aprendizaje por
conjuntos

Ejemplo: AdaBoost, GBDT, XGBoost

Boosting
El método Bagging construye aprendices básicos en secuencia y
reduce gradualmente los sesgos del aprendiz en conjunto. Un
aprendiz en conjunto tiene una gran capacidad de ajuste, pero
puede sobreajustarse.

87 Material confidencial de Huawei


Aprendizaje por conjunto - Bosque aleatorio
⚫ Bosque aleatorio = Bagging + Árbol de clasificación y regresión (CART)
⚫ El bosque aleatorio construye múltiples árboles de decisión y combina sus resultados para hacer que la predicción
sea más exacta y estable.
◼ El algoritmo de bosque aleatorio se puede usar para problemas de clasificación y regresión.
Muestreo de Bootstrap Construir Combinar resultados
árboles
Subconjunt
o1 Predicción 1

Subconjunt
o2 Predicción 2 • Clasificación:
voto mayoritario
Todos los datos de
Predicción final
entrenamiento
• Regresión:
Predicción
valor medio

Subconjunt Predicción n
on

88 Material confidencial de Huawei


Aprendizaje en conjunto - Árbol de decisión potenciado por
gradiente
⚫ El árbol de decisión potenciado por gradiente (GBDT) es un tipo de algoritmo de impulso.
⚫ El resultado de predicción del modelo de conjunto es la suma de los resultados de todos los aprendices básicos. La esencia del
GBDT es que el próximo aprendiz básico intenta ajustar el residual de la función de error al valor de la predicción, es decir, el
residual es el error entre el valor de la predicción y el valor real.
⚫ Durante el entrenamiento del modelo GBDT, el valor de la función de pérdida de la muestra predicha por el modelo debe ser lo
más pequeño posible.

Predecir
30 20
Calcular el
residual
Predecir
10 9
Calcular el
residual
Predecir
1 1

89 Material confidencial de Huawei


Aprendizaje no supervisado - Agrupación de k medias
⚫ La agrupación de k-medias toma la cantidad de clústeres k y un conjunto de datos de n objetos como
entradas, y genera k clústeres con varianzas minimizadas dentro del clúster.
⚫ En el algoritmo de k-medias, la cantidad de clústeres es k, y los n objetos de datos se dividen en k
clústeres. Los clústeres obtenidos cumplen los siguientes requerimientos: alta similitud entre objetos del
mismo clúster, y baja similitud entre objetos de clústeres diferentes.
x1 x1

Agrupación de k-medias

En la agrupación de k-medias,
los datos sin etiquetar se
clasifican automáticamente.
x2 x2

90 Material confidencial de Huawei


Aprendizaje no supervisado - Agrupación jerárquica
⚫ La agrupación jerárquica divide un conjunto de datos en diferentes capas y forma una estructura de agrupación en
forma de árbol. La división del conjunto de datos puede adoptar una política de agregación “ascendente”, o una
política de división “descendente”. La jerarquía de la agrupación se representa en un diagrama de árbol. La raíz es el
único grupo de todas las muestras, y las hojas son grupos de muestras individuales.

91 Material confidencial de Huawei


Resumen

⚫ En este curso se define el aprendizaje automático y sus diferentes tipos, así como los
problemas que este resuelve. Luego, se introducen los puntos de conocimiento clave
del aprendizaje automático, incluido el procedimiento general (preparación de datos,
limpieza de datos, selección de características, evaluación de modelos y despliegue
de modelos), algoritmos comunes (regresión lineal, regresión logística, árbol de
decisión, SVM, Bayes ingenuos, k-NN, aprendizaje en conjunto y agrupación de k-
medias) e hiperparámetros.

92 Material confidencial de Huawei


Quiz

1. (Respuesta única) ¿Cuál de los siguientes no es un algoritmo de aprendizaje supervisado? (


)
A. Regresión lineal
B. Árbol de decisión
C. k-NN
D. Agrupación de k-medias
2. (Verdadero o falso) El descenso del gradiente es el único método de aprendizaje automático.
( )

93 Material confidencial de Huawei


Recomendaciones

⚫ Huawei Talent
 [Link]

⚫ Base de conocimientos de Huawei


 [Link]

94 Material confidencial de Huawei


Gracias. 把数字世界带入每个人、每个家庭、
每个组织,构建万物互联的智能世界。
Llevamos tecnologías digitales a cada persona, hogar y
organización para lograr un mundo inteligente y
totalmente conectado.

Copyright©2023 Huawei Technologies Co., Ltd.


Todos los derechos reservados.
La información contenida en este documento puede incluir
estimaciones tales como, entre otras, declaraciones sobre resultados
financieros y operativos futuros, sobre carteras de productos futuros,
sobre tecnologías nuevas, etc. Hay determinados factores que
podrían determinar que los resultados y desarrollos reales difieran
significativamente con respecto a lo expresado explícita o
implícitamente en las estimaciones realizadas. Por lo tanto, dicha
información se suministra solo para referencia y no constituye oferta
ni aceptación de ningún tipo. Huawei puede modificar esta
información en cualquier momento y sin previo aviso.

También podría gustarte