100% encontró este documento útil (2 votos)
59 vistas37 páginas

Introducción a Machine Learning en IA

El documento describe los conceptos fundamentales del machine learning. Explica que el machine learning permite que los agentes artificiales mejoren su comportamiento a través de la experiencia. Describe diferentes enfoques como el aprendizaje supervisado, no supervisado y por refuerzo, y provee ejemplos como el reconocimiento de dígitos, predicción de precios de casas y segmentación de mercados. También cubre temas como preprocesamiento de datos, selección de características, sobreajuste y regularización.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
100% encontró este documento útil (2 votos)
59 vistas37 páginas

Introducción a Machine Learning en IA

El documento describe los conceptos fundamentales del machine learning. Explica que el machine learning permite que los agentes artificiales mejoren su comportamiento a través de la experiencia. Describe diferentes enfoques como el aprendizaje supervisado, no supervisado y por refuerzo, y provee ejemplos como el reconocimiento de dígitos, predicción de precios de casas y segmentación de mercados. También cubre temas como preprocesamiento de datos, selección de características, sobreajuste y regularización.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

INTELIGENCIA

ARTIFICICIAL
TEMA: MACHINE LEARNING
(Introducción)

Ing. Iván A. Calle Flores


1
In which we describe agents that can improve their behavior through diligent
study of their own experiences

● El área de Machine Learning es una de las áreas mas


activas de la I.A

● Tiene mucho en común con el ‘Reconocimiento de patrones’

P.R tiene sus orígenes en la ingeniería

M.L tiene sus orígenes en la I.A y ‘Computer science’

● Existen diversos enfoques ‘escuelas’

2
● El problema de la búsqueda de patrones en la data tiene una
larga y exitosa historia

Descubrimiento de las leyes de


Estaciones, fases de la luna movimiento de los planetas

● El campo del reconocimiento de patrones tiene como objetivo


el reconocimiento automático de estas regularidades mediante
el uso de algoritmos computacionales

3
Ejemplo. Reconocimiento de digitos

Se desea construir un sistema


que tome la imagen de un numero
y que identifique la identidad del
mismo

y(x)  '6'
y(x, w)
x  R2828  0, 0, 0, 0, 0, 0,1, 0, 0, 0 

Mediante el conjunto de aprendizaje se busca ajustar los parámetros

4
1. Etapa de entrenamiento

Conjunto de
entrenamiento x n , t n  n  1,..., N N: Numero de patrones de
entrenamiento

Entradas Targets

1, 0,..., 0   ' 0 '


y(x, w)
 0, 0,...,1  '9 '

5
2. Etapa de prueba

Se presenta un conjunto
de prueba y se evalúa su
x n , t n  n  1,..., NT N: Numero de patrones
de prueba
desempeño
Entradas Targets

Salida del sistema Target

y(x)  1, 0,..., 0  t1  1, 0,..., 0   ' 0 '


y(x, w)
y(x)   0,..,1,.., 0  t 7   0,..,1,.., 0   '6 '

6
Generalización

● En diversas aplicaciones la
variabilidad de la data de
entrada es tal, que el
sistema solo puede ser
entrenado usando una parte
de la misma

Se busca que el sistema tenga la


habilidad de identificar nuevas
entradas

7
Invariancia al
escalamiento a la
rotación

Robusto al ruido de
la data

8
Aprendizaje no supervisado
Solo se tienen las entradas
• K-nearest neighborhood
• K-means clustering
• Mixture models and E.M

Aprendizaje supervisado
Se tienen las entradas junto
con sus targets
• Redes neuronales artificiales
• Support Vector Machine
• Kernel methods

Aprendizaje por reforzamiento


Se tienen las entradas y un indicador
de desempeño
9
Ejemplos de aprendizaje supervisado

10
Reconocimiento de
digitos

400

300
Price ($) 200
in 1000’s House pricing
100
prediction
0
0 500 1000 1500 2000 2500
Size in feet2

11
Ejemplos de aprendizaje no
supervisado

12
13
Market
segmentation

Social network
analysis

14
Ejemplos de aprendizaje por
reforzamiento

15
Autonomous helicopter

16
Clasificación: Cuando el objetivo es clasificar las entradas
en un numero finito de categorías.

Aplicación: Detección de rostros

17
Regresión: Cuando las salidas asumen valores continuos.

Aplicación: Predicción de energía

18
El procesamiento de la data es esencial en cualquier sistema de reconocimiento

Pre-
Procesamiento

• Normalización de la entradas
• Principal Component Analisis (PCA)
• Selección de características

El uso de del pre procesamiento de la data puede incrementar


grandemente el desempeño del sistema. 19
Reconocimiento de rostros usando Redes Neuronales

20
Las características pueden ser escogidas a mano basados en algún conocimiento del
problema en particular o a través de un procedimiento automático.

Ejemplo: Reconocimiento de caracteres


x1  1
altura
x1 
ancho x1  2

Ploteando la identidad vs la Línea de decisión (threshold)


caracteristica
C1  ' a '
C2  ' b '

21
Una manera de mejorar el sistema es considerar una segunda
característica.

Los círculos denotan la data de la


Considerando x2
letra “a”, y las cruces denotan data
de la letra “b”.

Podríamos considerar una mayor cantidad de características, sin


embargo, la consideración de muchas características puede llevarnos a
un desempeño mas pobre.

22
Usar un mayor numero de características, o
usar todos los pixeles (28*28=784).

El problema de usar una mayor


cantidad de características es
que el numero de patrones de
entrenamiento requerido
crece exponencialmente

En la practica, el numero de patrones es bastante limitado.


23
x y t
y(x, w)

Conjunto de entrenamiento

t  sin(2 x)    x1   0   0.1382 
  
x   
 2   0.111   0.9143 
 Regularidad
x   x3    0.222  t  1.0011 
 Tiene ruido      
     
 x  1.0   0.0807 
 10     
24
1 N
E (w)    y( xn , w)  tn 
M 2

y ( x, w)  w0  w1 x  ...  wM x M   w j x j 2 n1
j 0
w  ( AT A)1 AT b

t  sin(2 x)   • Underfitting: El modelo no es capaz de


capturar la estructura de la data.
• Overfitting: El modelo se ajusta demasiado a la
data.

El mejor modelo es aquel de complejidad intermedia

25
Examinando los valores de
los coeficientes.

Para un modelo dado, el problema de over-fitting se puede reducir


si se considera un mayor numero de patrones.

26
Otra manera de superar el fenómeno de over-fitting es el mediante
el uso de un regularizador, el cual consiste en:


E (w)  E (w)  wT w
2

27
Dependencia de lambda

 1   exp(9)   exp(18)

  exp(40)
28
Error RMS para
diferentes valores
de lambda

29
7. ENFOQUE PROBABILISTICO
Expresando explícitamente nuestra incertidumbre sobre el ‘target’

  N  0,  1 
x t  y 
y(x, w)  : Precisión

Tenemos una interpretación


probabilística.

p  t | x, w,    N  t | y( x, w),  1 

30
Función de probabilidad en el problema de interpolación

Si la data es i.d.d, la
‘función de probabilidad’
esta dada por:

Función de probabilidad – ‘likelihood function’

Es la probabilidad de la data en función de


p ( D | w) los parámetros

 No es una función de distribución de probabilidad

 La escuela frecuentista se basa en la maximización


de este función

31
ENFOQUE FRECUENTISTA

Los parámetros se escogen maximizando la función de probabilidad

La maximización de la función de probabilidad es


equivalente a la minimización del error cuadrático

De igual manera el
parámetro “B” es:

32
t  sin(2 x)  
En el caso del ejemplo
anterior

Enfoque no probabilístico Enfoque probabilístico


M
y ( x, w)   w j x j p  t | x, w,    N  t | y( x, w),  1 
j 0

33
ENFOQUE MAP: Maximización de la distribución
posterior

D={xn, tn}

p( D | w) p(w)
p(w) p(w | D) 
p ( D)
Distribución Distribución
inicial posterior

Consideremos la distribución previa sobre los parámetros


( M 1)/2
    
p  w |    N  w | 0,  1I     exp  wT w   : Precisión
 2   2 

34
Usando el Teorema de Bayes:

p(w | x, t,  ,  )  p(t | x, w,  ) p(w |  )

p(t | x, w,  )   N  tn | y( xn , w),  p  w |    N  w | 0,  1I 



N
1

n 1

Hallando el logaritmo de la distribución posterior

 
N 2

ln p(w | x, t,  ,  )  
2
 y( xn , w)  t 
n 1 2
wT w + cte

El error regularizado se puede ver como la maximización de la


distribución posterior bajo la asunción de distribución previa
gausiana y ruido gausiana.
35
ENFOQUE BAYESIANO
● En el problema de interpolación,
el objetivo es hallar la siguiente
distribución de probabilidad

p (t | x, X , T )

● Usando las leyes del producto y


la suma

Distribución de Distribución
la salida posterior
36
● Se puede demostrar que la distribución
de la salida esta dado por

p (t | x, X , T )  N (t | m( x), s ( x))
2

37

También podría gustarte