INTELIGENCIA
ARTIFICICIAL
TEMA: MACHINE LEARNING
(Introducción)
Ing. Iván A. Calle Flores
1
In which we describe agents that can improve their behavior through diligent
study of their own experiences
● El área de Machine Learning es una de las áreas mas
activas de la I.A
● Tiene mucho en común con el ‘Reconocimiento de patrones’
P.R tiene sus orígenes en la ingeniería
M.L tiene sus orígenes en la I.A y ‘Computer science’
● Existen diversos enfoques ‘escuelas’
2
● El problema de la búsqueda de patrones en la data tiene una
larga y exitosa historia
Descubrimiento de las leyes de
Estaciones, fases de la luna movimiento de los planetas
● El campo del reconocimiento de patrones tiene como objetivo
el reconocimiento automático de estas regularidades mediante
el uso de algoritmos computacionales
3
Ejemplo. Reconocimiento de digitos
Se desea construir un sistema
que tome la imagen de un numero
y que identifique la identidad del
mismo
y(x) '6'
y(x, w)
x R2828 0, 0, 0, 0, 0, 0,1, 0, 0, 0
Mediante el conjunto de aprendizaje se busca ajustar los parámetros
4
1. Etapa de entrenamiento
Conjunto de
entrenamiento x n , t n n 1,..., N N: Numero de patrones de
entrenamiento
Entradas Targets
1, 0,..., 0 ' 0 '
y(x, w)
0, 0,...,1 '9 '
5
2. Etapa de prueba
Se presenta un conjunto
de prueba y se evalúa su
x n , t n n 1,..., NT N: Numero de patrones
de prueba
desempeño
Entradas Targets
Salida del sistema Target
y(x) 1, 0,..., 0 t1 1, 0,..., 0 ' 0 '
y(x, w)
y(x) 0,..,1,.., 0 t 7 0,..,1,.., 0 '6 '
6
Generalización
● En diversas aplicaciones la
variabilidad de la data de
entrada es tal, que el
sistema solo puede ser
entrenado usando una parte
de la misma
Se busca que el sistema tenga la
habilidad de identificar nuevas
entradas
7
Invariancia al
escalamiento a la
rotación
Robusto al ruido de
la data
8
Aprendizaje no supervisado
Solo se tienen las entradas
• K-nearest neighborhood
• K-means clustering
• Mixture models and E.M
Aprendizaje supervisado
Se tienen las entradas junto
con sus targets
• Redes neuronales artificiales
• Support Vector Machine
• Kernel methods
Aprendizaje por reforzamiento
Se tienen las entradas y un indicador
de desempeño
9
Ejemplos de aprendizaje supervisado
10
Reconocimiento de
digitos
400
300
Price ($) 200
in 1000’s House pricing
100
prediction
0
0 500 1000 1500 2000 2500
Size in feet2
11
Ejemplos de aprendizaje no
supervisado
12
13
Market
segmentation
Social network
analysis
14
Ejemplos de aprendizaje por
reforzamiento
15
Autonomous helicopter
16
Clasificación: Cuando el objetivo es clasificar las entradas
en un numero finito de categorías.
Aplicación: Detección de rostros
17
Regresión: Cuando las salidas asumen valores continuos.
Aplicación: Predicción de energía
18
El procesamiento de la data es esencial en cualquier sistema de reconocimiento
Pre-
Procesamiento
• Normalización de la entradas
• Principal Component Analisis (PCA)
• Selección de características
El uso de del pre procesamiento de la data puede incrementar
grandemente el desempeño del sistema. 19
Reconocimiento de rostros usando Redes Neuronales
20
Las características pueden ser escogidas a mano basados en algún conocimiento del
problema en particular o a través de un procedimiento automático.
Ejemplo: Reconocimiento de caracteres
x1 1
altura
x1
ancho x1 2
Ploteando la identidad vs la Línea de decisión (threshold)
caracteristica
C1 ' a '
C2 ' b '
21
Una manera de mejorar el sistema es considerar una segunda
característica.
Los círculos denotan la data de la
Considerando x2
letra “a”, y las cruces denotan data
de la letra “b”.
Podríamos considerar una mayor cantidad de características, sin
embargo, la consideración de muchas características puede llevarnos a
un desempeño mas pobre.
22
Usar un mayor numero de características, o
usar todos los pixeles (28*28=784).
El problema de usar una mayor
cantidad de características es
que el numero de patrones de
entrenamiento requerido
crece exponencialmente
En la practica, el numero de patrones es bastante limitado.
23
x y t
y(x, w)
Conjunto de entrenamiento
t sin(2 x) x1 0 0.1382
x
2 0.111 0.9143
Regularidad
x x3 0.222 t 1.0011
Tiene ruido
x 1.0 0.0807
10
24
1 N
E (w) y( xn , w) tn
M 2
y ( x, w) w0 w1 x ... wM x M w j x j 2 n1
j 0
w ( AT A)1 AT b
t sin(2 x) • Underfitting: El modelo no es capaz de
capturar la estructura de la data.
• Overfitting: El modelo se ajusta demasiado a la
data.
El mejor modelo es aquel de complejidad intermedia
25
Examinando los valores de
los coeficientes.
Para un modelo dado, el problema de over-fitting se puede reducir
si se considera un mayor numero de patrones.
26
Otra manera de superar el fenómeno de over-fitting es el mediante
el uso de un regularizador, el cual consiste en:
E (w) E (w) wT w
2
27
Dependencia de lambda
1 exp(9) exp(18)
exp(40)
28
Error RMS para
diferentes valores
de lambda
29
7. ENFOQUE PROBABILISTICO
Expresando explícitamente nuestra incertidumbre sobre el ‘target’
N 0, 1
x t y
y(x, w) : Precisión
Tenemos una interpretación
probabilística.
p t | x, w, N t | y( x, w), 1
30
Función de probabilidad en el problema de interpolación
Si la data es i.d.d, la
‘función de probabilidad’
esta dada por:
Función de probabilidad – ‘likelihood function’
Es la probabilidad de la data en función de
p ( D | w) los parámetros
No es una función de distribución de probabilidad
La escuela frecuentista se basa en la maximización
de este función
31
ENFOQUE FRECUENTISTA
Los parámetros se escogen maximizando la función de probabilidad
La maximización de la función de probabilidad es
equivalente a la minimización del error cuadrático
De igual manera el
parámetro “B” es:
32
t sin(2 x)
En el caso del ejemplo
anterior
Enfoque no probabilístico Enfoque probabilístico
M
y ( x, w) w j x j p t | x, w, N t | y( x, w), 1
j 0
33
ENFOQUE MAP: Maximización de la distribución
posterior
D={xn, tn}
p( D | w) p(w)
p(w) p(w | D)
p ( D)
Distribución Distribución
inicial posterior
Consideremos la distribución previa sobre los parámetros
( M 1)/2
p w | N w | 0, 1I exp wT w : Precisión
2 2
34
Usando el Teorema de Bayes:
p(w | x, t, , ) p(t | x, w, ) p(w | )
p(t | x, w, ) N tn | y( xn , w), p w | N w | 0, 1I
N
1
n 1
Hallando el logaritmo de la distribución posterior
N 2
ln p(w | x, t, , )
2
y( xn , w) t
n 1 2
wT w + cte
El error regularizado se puede ver como la maximización de la
distribución posterior bajo la asunción de distribución previa
gausiana y ruido gausiana.
35
ENFOQUE BAYESIANO
● En el problema de interpolación,
el objetivo es hallar la siguiente
distribución de probabilidad
p (t | x, X , T )
● Usando las leyes del producto y
la suma
Distribución de Distribución
la salida posterior
36
● Se puede demostrar que la distribución
de la salida esta dado por
p (t | x, X , T ) N (t | m( x), s ( x))
2
37