Introducción a la Lógica Difusa
Introducción a la Lógica Difusa
INTRODUCCIÓN:
z Logica Difusa:
En vez de trabajar con el clásico concepto de inclusión o exclusión,
introduce una función que expresa el grado de “pertenencia” de una
variable hacia un atributo o “variable lingüística” tomando valores en
el rango de 0 a 1.
z Conjunto Difuso: Par Variable lingüística – funcion de pertenencia
A = {x / µA(x) ∀ x ∈ X}
Ejemplo: Descripción del estado de una puerta
z Lógica Clásica: z Logica Difusa:
De acuerdo a la lógica clásica Logica Difusa establece que una
existen dos estados posibles puerta no tiene por que estar
para una puerta. necesariamente abierta o cerrada,
existen además otros estados.
Una puerta está abierta (1)
Una puerta está cerrada (0) Puerta abierta (1)
Puerta bastante abierta (0.8)
Puerta abierta a medias (0.5)
Puerta casi cerrada (0.1)
Una puerta está cerrada (0)
Representación gráfica:
Donde:
ce :Puerta cerrada
casice :Puerta casi cerrada
amedias :Puerta a medias
basab :Puerta bastante abierta
abierta :Puerta abierta
Ventajas de Logica Difusa
z La principal ventaja de utilizar términos lingüísticos como:
a medias, bastante, casi, un poco, mucho, algo, etc, está en que
permite plantear el problema en los mismos términos en los que lo
haría un experto humano.
DEFUZZIFICACIÓN
SETPOINT ERROR
FUZZIFICACIÓN
CONCLUSIÓN
APLICACIÓN
SELECCIÓN
CONTROL
CAMBIO ERROR
VALOR MEDIDO
TABLA DE REGLAS
CONTROL FINO
VARIABLES LINGÜÍSTICAS
FUNCIONES DE PERTENENCIA
MODELO LINGÜÍSTICO
RANGO DE VARIACIÓN DE ENTRADA
PROCESO
Configuración Básica de un Controlador Difuso
z FUZZIFICACIÓN:
Es la primera acción en el diseño del controlador difuso, a partir
de los valores deterministas de E y CE, se le adjudica su
correspondiente valor difuso.
Consideremos el diseño de un controlador fuzzy logic para
controlar el nivel de un estanque de agua el cual se regula a través
de un válvula de entrada-salida de flujo.
CONTROLADOR
FUZZY LOGIC
SENSOR
ENTRADA
ERROR Y
VELOCIDAD
SALIDA
SETPOINT
CFL ESTADO DE
Control del Nivel de Agua de un Estanque VÁLVULA
z En este caso, para las variables de entrada al controlador, es decir:
E (error en el nivel de agua) y CE (velocidad de cambio de nivel), se
establecen las siguientes variables lingüísticas, con su
correspondiente rango de variación.
N AF CS CS
C AS MA CS
P AS AS CF
Main
Sistemas Expertos
Difusos
CONOCIMIENTO IMPRECISO
El conocimiento cuenta con predicados o
cuantificadores vagos (no precisos)
Ejemplos:
0
0.
0. 1
0. 2
0. 4
0. 6
18
REPRESENTACION GRAFICA
ce :Puerta cerrada
casice :Puerta casi cerrada
amedias :Puerta a medias
basab :Puerta bastante abierta
abierta :Puerta abierta
Ejemplo
Si el predicado P es “Persona joven” y W = {Ana, Pepe}.
Además x, x W. Edad(x) U = {10, 20, 30, 40, 50, 60, 70}
Escogeremos como etiqueta del predicado la variable lingüística
“Joven”. Definimos extensionalmente la función de pertenencia:
Joven( Edad(x)=10 ) = 1
Joven( Edad(x)=20 ) = 1
Joven( Edad(x)=30 ) = 0.8
Joven( Edad(x)=40 ) = 0.6
Joven( Edad(x)=50 ) = 0.4
Joven( Edad(x)=60 ) = 0.2
Joven( Edad(x)=70 ) = 0
• Variable Lingüística
• Universo de Discurso
• Conjunto Difuso
• Valor Lingüístico
• Función de Pertenencia
Variable linguistica vs Grado de pertenencia
(Edad)
Edad
X
• EDAD:
10 ≤ Edad ≤ 30 JOVEN(Edad) = (30-Edad) / 20 =0.1 Edad=28
• Función L
1
Puede definirse simplemente como 1
menos la función GAMMA
a m
0 para x a
x a 1
para a x b
b a
( x) 1 para b x c
d x
para c x d a b c d
dc
0 para x d
13
FUNCIONES DE PERTENENCIA
• Función S
0 para x a
x a 2 ac
2 , para a x
S (x) c a 2 2
1 2 x a , para a c x c
ca 2
1 para x c a (a+c)/2 c
• Función Z (opuesta de la S)
Z(x) = 1- S(x)
• Función P
S ( x) para x b
P (x)
Z ( x) para x b
b-d b b+d
14
AIRE ACONDICIONADO
BASE DE REGLAS
Las reglas que regulan el aire acondicionado son los siguientes:
REGLA 1:
Si TEMP es FRIO entonces la velocidad es MÍNIMA
REGLA 2:
Si TEMP está FRESCO entonces la velocidad es LENTA
REGLA 3:
Si TEMP es AGRADABLE entonces la velocidad es MEDIA
Regla 4:
Si TEMP está TEMPLADA entonces velocidad es RÁPIDA
Regla 5:
Si TEMP está CALIENTE entonces la velocidad es MAXIMA
VARIABLE: TEMPERATURA
Las graduaciones de Temp COLD COOL PLEASANT WARM HOT
temperatura están (0C). (frio) (fresco) (Agradable) (Templad
o)
(Calie
nte)
relacionadas con la 0 Y* N N N N
percepción de Johnny de la 5 Y Y N N N
temperatura ambiente. 10 N Y N N N
12.5 N Y* N N N
Donde: 15 N Y N N N
Y : 0<A(x)<1 17.5 N N Y* N N
20 N N N Y N
22.5 N N N Y* N
Y* : A(x)=1
25 N N N Y N
27.5 N N N N Y
N : A(x)=0 30 N N N N Y*
VARIABLE: TEMPERATURA
Temperature Fuzzy Sets
1
0.9
0.8 Cold
Truth Value
0.7
0.6 Cool
0.5 Pleasent
0.4
0.3
Warm
0.2 Hot
0.1
0
0 5 10 15 20 25 30
Temperature Degrees C
• FRIO: • FRESCO:
0 ≤ t ≤ 10 0 ≤ t ≤ 12.5 FRESCO(t) = t / 12.5
FRIO(t) = 10– t / 10
12.5 ≤ t ≤ 17.5 FRESCO(t) = 17.5– t / 5
VARIABLE: VELOCIDAD
Las graduaciones de la Rev/sec MINIMAL SLOW MEDIUM FAST BLAST
(Mínima) (Lenta) (Media) (Rápi (Máxim
velocidad están relacionadas (RPM)
da) a)
Y* : A(x)=1 60 N N N Y N
70 N N N Y* N
80 N N N Y Y
N : A(x)=0 90 N N N N Y
100 N N N N Y*
VARIABLE: VELOCIDAD
Speed Fuzzy Sets
1
0.8 MINIMAL
Truth Value
0.6 SLOW
MEDIUM
0.4
FAST
0.2 BLAST
0
0 10 20 30 40 50 60 70 80 90 100
Speed
MINIMAL:
for 0 ≤ v ≤ 30 MINIMAL(t) = – v / 30 + 1
SLOW:
for 10 ≤ v ≤ 30 SLOW(t) = v / 20 – 0.5
for 30 ≤ v ≤ 50 SLOW(t) = – v / 20 + 2.5
Las variables lingüísticas y
coberturas
Degree of
Membership
1.0
Short Short
Tall
0.8
0.6 Average
0.4
Very Short Very
VeryTall
Tall
0.2 Tall
0.0
150 160 170 180 190 200 210
Height, cm
Las variables lingüísticas y
coberturas
Mathematical
Hedge Graphical Representation
Expression
More or less A ( x )
Somewhat A ( x )
2 [A ( x )]2
if 0 A 0.5
Indeed
1 2 [1 A ( x )]2
if 0.5 < A 1
MECANISMO DE INFERENCIA
Intersección
AB(x) = min [A(x), B(x)] = A(x) B(x)
Unión
AB(x) = max [A(x), B(x)] = A(x) B(x)
0 x1 X 0 Z
Rule 3: IF x is A1 (0.5) THEN z is C3 (0.5)
INFERENCIA DE TAKAGI SUGENO KANG
0 x1 X 0 k3 Z
Rule 3: IF x is A1 (0.5) THEN z is k3 (0.5)
DEFUZZIFICACION
Varios esquemas de defuzzificacion
Discretizando
Degree of
Membership
1.0
0.8
0.6
0.4
0.2
0.0
0 10 20 30 40 50 60 70 80 90 100
67.4 Z
( z)dz
B
~
1 4 z 3
3.6 5.5 6 7 8
0 (.3 z ) zdz 1 (.3 z ) dz 3.6 2 4
zdz (.5) zdz 5.5 z 5 zdz 6 zdz 7 8 z zdz
1 4 z 3
.3z dz (.3)dz
3.6 5.5 6 7 8
dz (.5)dz ( z 5)dz dz (8 z )dz
0 1 3.6
2 4 5.5 6 7
4.9meters
Método del promedio ponderado
z *
.3 2.5 .5 5 1 6.5
5.41meters
.3 .5 1
Promedio ponderado
0 z1 Z
Crisp Output
z1
¿Mamdani o Sugeno?
• El Método de Mamdani es ampliamente aceptado para
elicitar el conocimiento del experto. Nos permite
describir la experiencia de manera más intuitiva y más
parecido al humano. Sin embargo, la inferencia de
Mamdani implica una carga computacional considerable.
62
Ejemplo. Aire acondicionado
Implementado en JAVA
OUTPUT
Ejemplo. Aire acondicionado
Implementado en JAVA
Ejemplo. Aire acondicionado
Implementado en JAVA
Ejemplo. Aire acondicionado
Sensor
temperatura
Circuito
potencia
“La razón por la cual el lenguaje
natural se expresa en términos
difusos
no es porque el pensamiento
humano sea difuso, sino por que
el mundo es difuso”.
Los nombres de las personas jóvenes o recientemente empleadas pero con sueldo alto
son:
Nombre µbúsqueda(x,y,z)
Anderson 0.5
Long 1.0
Smith 0.8
Ejemplo
Supongamos una clase Persona en la cual se pueden definir atributos tales como,
edad que puede tomar valores de “infantil”, “joven” y “adulto”, por otro lado, se
puede definir el atributo color del pelo que puede tomar valores de “Rubio”,
“Castaño” y “Pelirrojo”.
En una base de datos clásica, cada instancia sólo puede tomar uno de estos tres
valores, tanto para la edad, como para el color del pelo.
Pero es usual que los requerimientos del usuario van más allá de éstas
consideraciones, constantemente nos enfrentamos al hecho de que, una persona
describe su edad como “entre joven y adulto” o que su color del pelo es “entre
rubio y castaño”, consideramos que el modelado de datos en UML, no es capaz de
representar este tipo de requerimientos.
Edad
Consulta 1: Jóvenes con grado de pertenencia 0.2 de pelo pelirrojo con grado de
similitud 0.8
Respuesta Parte 1:
Respuesta Parte 2:
Persona Edad Color de Gs c/r pelirrojo
pelo
P1 14 Pelirrojo 1
La respuesta a la consulta 1 está dada por la intersección de la respuesta de la
parte 1 y la respuesta de la parte 2 :
1. Acceso:
Para acceder al toolbox fuzzy se debe digitar la palabra fuzzy en la línea de comandos y
luego oprimir enter. En el caso de encontrar un error, por no hallarse cargado el toolbox se debe
agregar el CD de instalación de Matlab. El menú al cual se debería acceder es el siguiente:
En el Menú 1, se podrá modificar los métodos de los operadores lógicos and y or, los
métodos de implicación, de agregación y de defuzificación.
2. Elección de Modelo:
Para elegir el tipo de modelo a usar, Sugeno o Mamdani, se debe acceder al menú File ->
New FIS… -> Mamdani (Sugeno).
Figura 2. Elección de Modelo
Para agregar alguna variable, ya sea de entrada o de salida, se debe seleccionar el menú
Edit -> Add Variable -> Input (Output).
Las funciones de pertenencia, tanto para las variables de entrada como para las de salida,
se modifican en un menú especial Membership Function Editor que aparece al hacer doble click en
la variable de interés.
Figura 4. Editor de Funciones de Pertenencia, Membership Editor
1. Se tiene las siguientes variables linguisticas Servicio con los conjuntos “Malo”, “Bueno” y
“Excelente”, Comida con los conjuntos “Fea” y ”Deliciosa”
4. Para la variable de salida propina el rango será de 0 - 30 los parámetros Poca 0 5 10 Media
10 15 20 y Generosa 20 25 30
5. Luego agregamos la reglas
INFERENCIA DIFUSA
A
B
d
Usted está conduciendo un coche en una carretera. Usted quiere mantener una distancia segura
para el coche B que está delante de usted.
Diseñar un (simplificado) sistema de lógica difusa, que cumpla los requisitos.
ENTRADA: distancia d
Vamos a utilizar la caja de herramientas difusa para definir el sistema difuso dando valores
numéricos para las variables indicadas
Fuzzy
BASE DE REGLAS
SOLUCIÓN:
Configurar una nueva base de reglas con dos entradas de distancia y velocidad, una salida, la
potencia de frenado.
Aquí solamente los pasos principales se muestran.
BASE DE REGLAS
ELEGIBILIDAD: No apto (0,0,0.4), medio apto (0.1, 0.5, 0.9), apto (0.6,1,1)
Base de Reglas:
Actividad 2. Lavadora
Hay varias máquinas de lavado en el mercado que utilizan la lógica difusa. La discusión aquí, sin
embargo, no se refiere a cualquier máquina de lavado en particular, sino más bien relacionadas
con una lavadora hipotética. El objetivo es proporcionar un simple ejemplo de las etapas iniciales
del diseño de un control difuso para una lavadora
La facilidad de uso es una característica deseable, junto con la capacidad para establecer los
parámetros de lavado según las características de lavandería de carga. Las características de la
carga de ropa (insumos) son: el peso real, los tipos de tela, y la cantidad de suciedad. Los
parámetros de lavado (salidas) son: cantidad de detergente, tiempo de lavado, la agitación, el nivel
del agua y la temperatura. El control de estos parámetros podría llevar a la lavandería a ser más
limpia, conservar el agua, ahorra detergente, energía eléctrica, tiempo y dinero.
El diseño de una máquina para cumplir con tales especificaciones puede ser una tarea exigente. Es
obvio que no existe un modelo matemático simple que pueda ser de utilidad práctica para
relacionar las entradas con las salidas, pero un operador experto puede hacer la tarea
manualmente. Aquí es donde entra en juego la lógica difusa, con una base de reglas se puede
crear la base en el conocimiento de que el operador controle el proceso. El Análisis será necesario
para asegurar que se alcanzan resultados plausibles.
Consideremos, por simplicidad, una máquina con dos entradas y una salida, las entradas son:
La suciedad de la carga de una medida por la opacidad del agua de lavado mediante un
sistema de sensores ópticos.
El peso de la carga de ropa, medido por un sistema de sensor de presión.
La salida es la cantidad de detergente que dispensan.
La suciedad se define en el rango de 0 a 100, por definir subconjuntos borrosos: Casi limpio, sucio,
muy sucio, inmundo, como se muestra en la figura 6. El peso de la ropa se define en el rango de 0
a 100 por conjuntos difusos: muy ligero, ligero, pesado y muy pesado, como se muestra en la
figura 7. La salida, para simplificar, se define por los subconjuntos singleton muestra en la figura 8.
2. Probabilidad individual
𝑃(𝐴𝑖) ∗ 𝑃(𝐵/𝐴𝑖)
𝑃(𝐴𝑖/𝐵) =
𝑃(𝑇)
Ejercicio 1º: El parte meteorológico ha anunciado tres posibilidades para el fin de semana:
Segunda forma
A Accidente
B/A AxB/A 𝑃(𝐴𝑖/𝐵) =
𝑃(𝐴𝑖) ∗ 𝑃(𝐵/𝐴𝑖)
𝑃(𝑇)
Si
0.20
0.1 0.71
llueva
0.50 No 0.80
0.20 No 0.90
No 0.95
REDES BAYESIANAS
REDES BAYESIANAS
INTELIGENCIA ARTIFICIAL
2 /73
Cerebro Humano
• 1011 Neuronas
(procesadores)
• Poder desconocido
• 1000 – 10000
conecciones por
neurona
• Capacidad basada en
las conexiones.
• Cada neurona es muy
compleja.
• Almacenamiento
redundante.
• No binario, no estable
y no síncrono.
3 /73
¿Cómo funciona ?
Neuronas
Sonido información
Conexiones
Sabor
Olor
Color
Tersura
acciones
4 /73
Unidad de Procesamiento: La Neurona
Dendritas
Axon
Señal
Cuerpo (Información)
Sinapsis
5 /73
6 /73
7 /73
8 /73
9 /73
10 /73
Conexiones del Sistema Nervioso.
GENÉTICO.
• El niño nace con un conjunto de conexiones por defecto
(definidas genéticamente)
EXPERIENCIA.
• Nuevas conexiones se crean en el proceso de aprendizaje.
• Las conexiones se refuerzan con la repetición.
• Las conexiones se refuerzan cuando se crean redes de
resonancia.
11 /73
Características del Sistema Nervioso
• adaptabilidad
• aprendizaje continuo
12 /73
REDES NEURONALES
13 /73
Redes Neuronales.
• Intento de producir sistemas de aprendizaje inspirados en
la naturaleza (basado en modelos abstratos de cómo
pensamos y cómo funciona el cerebro)
• Modelo matemático inspirado en el funcionamientos de las
neuronas biológicas
• Conformado por varias unidades de procesamiento
(neuronas) interligadas por conexiones (sinapsis)
• Eficiente donde los métodos tradicionales son considerados
inadecuados.
• El aprendizaje se logra en la actualización de esos pesos.
14 /73
Red Neuronal
Arquitectura
Neuronas intermedias
Neuronas de Neuronas de
Entrada salída
Conexiones
15 /73
Elemento Procesador
Entrada / Función de Transferencia / Salida
elemento
Entrada procesador Salida
Señal
16 /73
Elemento Procesador
Entrada / Función de Transferencia / Salida
17 /73
Elemento Procesador
1 X1
.. W1u
. Xk Wku
k u
.. Yu
. Xn
Wnu
n Yu = f (Entrada Neta u )
n
Xi Wiu )
n
Entrada Neta u = Xi Wiu
i 1
Yu = f (
i 1
18 /73
Función de Transferencia
Función de Activación o Transferencia
1 X1
.. W1u
. Xk Wku
k u
.. Yu
. Xn
Wnu
n Yu = f (Entrada Neta u )
n
Xi Wiu )
n
Entrada Neta u = Xi Wiu
i 1
Yu = f (
i 1
19 /73
Elemento Procesador
p
y=f( Xi Wiu )
i 1
p
Entrada Neta u = Xi Wiu
i 1
Na+ Na+
K+ K+
Valores de entrada / salida
• Las señales de e/s de una RNA son generalmente
números reales
• Estos números deben encontrarse dentro de un intervalo
• típicamente entre [0,1] o [–1,1]
• Técnica de codificación mas simples es la binaria
2 5 9 3 0 5
6 2 1 3 5 4 5 5 2 3 1 4
3 4 5 7 3 1
21 /73
Conexiones
• Semejantes a la sinapsis.
22 /73
Aplicaciones
• Se usan para la clasificación y reconocimiento de
patrones.
• Problemas donde es importante el patrón más que los
datos exactos.
• Aplicaciones:
• Clasificación.
• Predicción
• Clustering
• Aproximación de curvas
• Optimización.
• Reconocimiento de patrones.
23 /73
Clasificación
24 /73
Predicción
25 /73
Clustering
26 /73
Aproximación de curvas
27 /73
Optimización
28 /73
TIPOS DE REDES
NEURONALES
29 /73
Topologia o Arquitectura de RN
Clasificación de RN por el tipo de sus Conexiones
30 /73
Topologia o Arquitectura de RN
Clasificación de RN por el tipo de sus Conexiones
31 /73
Tipos de Aprendizaje Artificial
Aprendizaje Supervisado
Aprendizaje No Supervisado
32 /73
Aprendizaje Supervisado
• Se logra comparando la salida de la red con la respuesta
correcta ya conocida por el MAESTRO.
33 /73
Aprendizaje No Supervisado
• No requiere influencia externa para ajustar sus pesos de
las conexiones entre sus neuronas.
34 /73
Tipos de Redes Neuronales
• Redes de nivel simple
• Redes de Multiple nivel
• Redes recurrentes
35 /73
REDES DE NIVEL SIMPLE
36 /73
Perceptrón
• Separa espacio con hiperplanos
y = f ( w1 u1 + w2 u2 + ... + wn un ), u2
f(s) = { 1 si s0, 0 si s<0 }
• Puede incluir offset w0. u1
37 /73
Perceptrón
38 /73
Perceptrón
39 /73
Adaline
• Adaptive Linear Element y=0
• Estructura:
– Como un Perceptrón
pero con función lineal
a la salida.
• Permite trabajar con
problemas más generales
que usando el perceptrón. n
y wi xi w0
i 1
E p t p y p
1 2
2
p wi t p y p xi
40 /73
Perceptrón Multicapa
• Werbos (1972)
• Red lineal Wij2 Wij3
Wij 1 3
• Activaciones dependen: u1 1 6 y1
– entradas
4
– activaciones de neuronas y2
precedentes
u2 2 7
5
• Derivadas ordenadas
backpropagation
y1
u1
1 2 3 4 5 6 7 y2
u2
i 1 ni
xi f i wij x j wik uk i
0
j 1 k 1
41 /73
Aprendizaje
j i
entrada neta a i
salida de i
error de la salida k
error total
regla de aprendizaje
η: velocidad de aprendizaje
42 /73
REDES RECURRENTES
43 /73
Redes de Base Radial
• Red feed-forward
• Combinación lineal de funciones base
o receptores dadas. Wi
x1
• Funciones Base:
– Gaussianas, Logistic y
– Normalizadas en gral x2
• Aplicaciones
– Aproximación funcional,
interpolación
– Clasificación de datos
x i
2
– Clustering N N
– Modelado y control de sistemas
y ( x ) wi .Ri ( x ) w .e i
2 i 2
dinámicos i 1 i 1
44 /73
Redes de Hopfield
• Hopfield
– McCulloch-Pitts (1943): modelo discreto. u
y
– Recurrente, totalmente conectada
• Asociada con sistema dinámico
• Actualización de activaciones
– Extensiones: Neuronas con constante de X i sgn Wij X j U i
tiempo, uso de probabilidad en salida j
– Concepto de energía y entropía
desarrollado P X i 1 g Wij X j U i
• Aplicaciones j
– Descripción de sistemas cristalinos, y dX
fenómenos físicos asociados i i Xi f Wij X j U i
dt j
– Uso en optimización
1
• ej: TSP, distribución, despacho de carga E
2 ij
Wij X i X j
– Memoria asociativa
• Deducir patrón asociado a partir de dato 1
parcial Wij
N
X i
p
X jp
– Representables en hardware p
• VLSI
45 /73
Mapas Auto-Organizados
• Self-organizing maps (Kohonen, 1982)
• Identificar estructura en datos de trabajo
– conservan topología de datos
• Hipótesis:
– Entradas similares producen salidas similares
– Conjuntos entrada-salida similares agrupables
• Estructura
– red de una capa
• distribución espacial especificada
• capa competitiva
– entradas: dimensión de espacio
– Pueden usarse neuronas con dinámica
capa
• Neuronas competitivas - selección 2D
– Dada entrada, selecciona neurona con mayor
activación
– Uso de pesos para inhibición lateral
– Cooperación:
• Adaptación restringida a vecindad de neurona
seleccionada
• Aplicaciones
– Clasificación de datos, Clustering
– Componentes principales (PCA)
– Codificación
Entradas (u)
46 /73
MAPEADOR UNIVERSAL
47 /73
Mapeo Universal
• Pregunta:
– Qué tipo de funciones puedo representar con una ANN?
• La idea se remonta al problema #13 de Hilbert (1900).
– Representar función de N variables como combinación lineal de funciones
en una variable (bajar dimensionalidad del problema)
• Respuesta:
– Puedo representar el conjunto de funciones “suaves”.
– Hay varias pruebas para diferentes arquitecturas
– Kolgomorov (1957)
– Cybenko (1960)
– Hornik (1989)
– Chen (1991)
48 /73
CONCLUSIONES
• Las redes neuronales se aplican a resolver problemas de
reconocimiento de patrones.
• Las redes neuronales de nivel simple, permiten reconocer
patrones donde el espacio puede ser divido en dos por un
hiperplano.
• Las redes neuronales de múltiple nivel pueden reconocer
patrones del tipo XOR.
• El aprendizaje de la red se realiza modificando los pesos
de las conexiones.
• La arquitectura de la red es la disposición de las neuronas
(capas y elementos por capa)
49 /73
Machine Learging
No supervisado
REDES NEURONALES
MAPAS AUTO-ORGANIZADOS
¿A o B?
B A
Aprendizaje No Supervisado
¿Qué pasaría si no tenemos la etiqueta en los datos? ¿Cómo saber en cuantas clases se
agrupan los datos? …. Es aquí en donde tenemos que hacer uso de técnicas no
supervisadas.
En el aprendizaje no supervisado el
modelo es ajustado
automáticamente a las datos.
Aprendizaje No Supervisado
En el siguiente conjunto de puntos nosotros podemos establecer visualmente una malla
de separación de puntos basándonos en la cohesión interna. Cada celda agrupa puntos
cercanos entre si.
Este modelo de
malla se adapta
mejor.
Aprendizaje No Supervisado
¿Y si tenemos más puntos que tienden a una distribución uniforme como sería nuestra
malla? … la topología de la malla debe adaptarse a los datos.
Esto los hace ideales para explorar espacios vectoriales en los que se
desconoce la estructura de clasificación de los vectores.
Mapas Auto-Organizados: Arquitectura
5. Actualizar los pesos de esta neurona y las neuronas cercanas (en una vecindad
especificada)
6. Finalmente, formar los grupos asignando cada entrada a su neurona más cercana.
Algoritmo de Aprendizaje: paso a paso
1. Todos los pesos de las neuronas Wi de salida reciben, inicialmente,
valores aleatorios.
X(1)
BMU(2) X(2)
Algoritmo de Aprendizaje: paso a paso
3. Para medir la cercanía entre el vector de pesos de las neuronas y el vector de
entrenamiento, normalmente se usa la distancia euclidiana:
Esta sujeto al tipo
𝐷
de aplicación.
Ej. En text-mining
𝑋 − 𝑊 = 𝑑 𝑋, 𝑊 = (𝑥𝑗 − 𝑤𝑗 )2
𝑗=1
se suele usar la
distancia coseno.
ℎ𝑖 𝑡 = 𝛼 𝑡 ∗ 𝑑(𝑊𝑖 , 𝑊𝑐 )
distancia entre el BMU
y la neurona vecina
taza de aprendizaje
𝑡
𝛼 𝑡 = 1.0 −
𝑚𝑎𝑥 maximo número de iteraciones
Rango de distancia
𝜎 𝑡 = 𝐻+𝑊 𝛼 𝑡
alto y ancho del mapa neuronal
Algoritmo de Aprendizaje: ejemplo
Dada la siguiente
topología del SOM
|| x − wR ||= (2 − 3) 2 + (−4 + 2) 2 = 5,
|| x − wS ||= (2 + 2) 2 + ( −4 + 3) 2 = 17,
|| x − wT ||= (2 − 3) 2 + (−4 − 2) 2 = 37,
|| x − wU ||= (2 − 4) 2 + (−4 + 1) 2 = 13.
Algoritmo de Aprendizaje: ejemplo
Therefore, the winner node is R, since it has the smallest distance from x. As a ne
Por lo tanto, la neurona ganadora es R, ya que éste tiene la distancia mas pequeña a x.
El siguienteweights of the en
paso consiste nodes in SOM
actualizar losmust bede
pesos adjusted usingcon
la vecindad thelaformula
fórmulagiven
vista in
enequatio
el paso 4. En donde la tasa de aprendizaje queda definido de la siguiente manera:
Let the neighborhood function be defined as,
0.5 if nodeesiselthe
Si la neurona winner
BMU.
hck (t ) = 0.25 if nodeesiselimmediate
Si la neurona neighbor
vecino inmediato al [Link] the winner
0 En otros casos.
otherwise
Algoritmo de Aprendizaje: ejemplo
Let node
Let us begin with the winner us begin
R. with the winner node R.
Vamos a empezar con el BMU, es decir la neurona R, los nuevos pesos serían:
The new weight of R willThe
be new weight of R will be
3 2 3 3 3 3
2 −1 3 2.5 −1 2.5
+ 0.5 − = + +
0.50.5 − = =
. + 0.5 = .
− − − −
−2 − −
− 4 − 2 −2 −2 −3
2 4 2 2 2 3
2.5 0.5
= . The immediate neighborsThe
of Rimmediate
are Q andneighbors
S, thereforeofnew weights for Q and S are weights
−3 Los vecinos inmediatos de R son Q y S, entonces los nuevos pesos serían:
R are Q and S, therefore new f
2
−1 0.5
therefore new weights for Q and −S3.25
and are respectively. −1 other
Since nodes in the given SOM have a neighborhood
2 and respectively. Since other nodes in the given SOM
−3.25
function value zero, their weights do not change.
function value zero, their weights do not change.
es in the given SOM have a neighborhood
Presentando el SOM
Matriz de neuronas: para cada neurona visualizamos su vector de pesos Wi (datos en
3D, colores, espacios continuos)
Entonces, para un mapa de color con 3 entradas, si los pesos de la neurona son (0.7,
0.2, 0.3), mostraríamos un color rojizo con 0.7 de rojo, 0.2 de verdes y 0.3 de azul.
Para un mapa de puntos en el plano con dos entradas, dibujaríamos un punto para
cada neurona en posición (Wx, Wy).
Presentando el SOM
Matriz de neuronas: para cada neurona visualizamos su vector de pesos Wi (datos en
3D, colores, espacios continuos)
Presentando el SOM
Mapa de centroides: representar cada neurona por un elemento del conjunto de
entrenamiento X que está más cerca del vector Wi. Dicho elemento también se le conoce
como centroide.
Presentando el SOM
Matriz Unificada De Distancias
17 estilos de baile
Fin
Redes Neuronales
PERCEPTRON MULTICAPA
BACKPROPAGATION
Función de
activación sigmoidal
Perceptrón Multicapa: Arquitectura
❖ Todas las neuronas transmiten información hacia delante: se
denominan redes feedforward.
❖ Cada neurona posee un umbral independiente. Se considera
como una entrada más cuya entrada es 1.
❖ Generalmente se utilizan redes completamente conectadas.
Perceptrón Multicapa: Arquitectura
Feed forward
Back propagation
Perceptrón de tres capas
Cálculo de las salidas en cada capa
o Capa I
Perceptrón de tres capas
Cálculo de las salidas en cada capa
o Capa II
o Capa III
Perceptrón de tres capas
Cálculo del error: Suma del error cuadrático instantáneo
Algoritmo Backpropagation
1. Inicialización aleatoria
2. Propagación hacia adelante de la entrada
3. Propagación hacia atrás del error 𝛿
4. Adaptación de los pesos
5. Repetir desde el 2 hasta convergencia o finalización
Algoritmo Backpropagation: ejemplo gráfico
Problema:
• Asignación ciega de los pesos
𝑦 = 𝑤1 𝑥1 + ⋯ + 𝑤𝑛 𝑥𝑛 + 𝜃 • Demasiadas iteraciones
• Difícil convergencia
Recordar la red ADALINE
¿Cómo lo mejoramos?
Usaremos el error cuadrático para poder aplicar el método del gradiente
descendiente.
Gradiente Descendente
Gradiente descendiente
En la ADALINE, la salida puede representarse de la siguiente manera:
En donde:
𝑁 es la cantidad de entradas
𝑁 + 1 representa el umbral
El error cuadrático:
En donde:
𝑝 es la cantidad total de ejemplos
𝑧 𝑘 es la salida deseada para el ejemplo 𝑘
Gradiente descendiente
Vamos a seguir el método del gradiente descendiente, es decir, los pesos se actualizarán
por la dirección opuesta a la dirección del gradiente del error.
En donde:
η representa la taza de aprendizaje, controla la longitud del paso que vamos a dar en la dirección opuesta
del gradiente. Conforme mayor sea η mayor será la cantidad por la que se modificarán los pesos
sinápticos. Dicho parámetro debe ser un valor pequeño para evitar dar pasos demasiado largos, es decir,
que nos lleven a soluciones peores que la que teníamos.
Gradiente descendiente
En el caso anterior se aplicó el método de gradiente sobre la función de activación de identidad. Como
seria la derivación para las funciones sigmoidales.
a) Función logística:
Donde:
Gradiente descendiente
Fin
Redes Neuronales
• Perceptron simple
• Adaline
Mario Aquino Cruz
Introducción
Introducción
Las redes neuronales artificiales emulan el comportamiento de las neuronas
humanas.
◦ Las neuronas son las células del sistema nervioso encargadas de transmitir información
mediante impulsos nerviosos.
◦ Una red neuronal es la unión entre dos o más neuronas, estas se relacionan entre si y
pueden transmitir la información de manera eficaz.
2. Una regla de propagación hi definida a partir del conjunto de entradas y los pesos sinápticos. Es
decir:
ℎ𝑖 (𝑥1 , … , 𝑥𝑛 , 𝑤𝑖,1 , … , 𝑤𝑖,𝑛 )
𝑦𝑖 = 𝑓(ℎ𝑖 ) = 𝑓 𝑤𝑖,𝑗 𝑥𝑗 − 𝜃𝑖
𝑗=1
Funciones de activación de neurona artificial
El modelo estándar de neurona artificial
Tipos de Redes Neuronales
PERCEPTRÓN SIMPLE
Perceptron Simple
❖ Fue introducido por Rosenblatt en 1962.
❖ Se concibió como un sistema capaz de realizar tareas de clasificación de forma
automática.
+1, 𝑠𝑖 𝑤1 𝑥1 + ⋯ + 𝑤𝑛 𝑥𝑛 + 𝜃 > 0
𝑦=ቊ
−1, 𝑠𝑖 𝑤1 𝑥1 + ⋯ + 𝑤𝑛 𝑥𝑛 + 𝜃 ≤ 0
Perceptron Simple: Arquitectura
❖ El perceptron equivale a un hiperplano de dimensión 𝑛 − 1 capaz de
separar las clases
o Si la salida del perceptron es +1, la entrada pertenecerá a una clase (estará situada a
un lado del hiperplano)
o Si la salida es -1, la entrada pertenecerá a la clase contraria (estará situada al otro lado
del hiperplano)
𝑤1 𝑥1 + 𝑤2 𝑥2 + ⋯ + 𝑤𝑛 𝑥𝑛 + 𝜃 = 0
Perceptron Simple: Ejemplo 2 dimensiones
+1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 > 0
𝑦=ቊ
−1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 ≤ 0
𝑥1
La ecuación del hiperplano es: 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 = 0
𝑥2
𝑤1 𝜃
𝑥2 = − 𝑥1 − Punto de corte
𝑤2 𝑤2
Pendiente de la recta
Perceptron Simple: Aprendizaje
❖ Se dispone de un conjunto de observaciones (patrones, ejemplos, datos) de los que
se sabe su categoría o clase.
❖ Los ejemplos o datos son puntos en un espacio multidimensional:
ℜ𝑛 : (𝑥1 , … , 𝑥𝑛 )
❖ Hay que determinar la ecuación del hiperplano que deja a un lado los ejemplos de
una clase y a otro lado los de la otra clase.
❖ La ecuación del hiperplano se deduce a partir de los ejemplos o datos.
❖ Proceso iterativo supervisado.
Perceptron Simple: Aprendizaje
𝑑 𝑥 = −1 𝑠𝑖 𝑥 ∈ 𝐵
Perceptron Simple: Aprendizaje
1. Comenzar con valores aleatorios para pesos y umbral
2. Modificación de los pesos y umbral hasta encontrar el hiperplano discriminante
a. Seleccionar un ejemplo 𝑥 del conjunto de entrenamiento
b. Se calcula la salida de la red: y = 𝑓(𝑤1 𝑥1 + 𝑤2 𝑥2 , … , 𝑤𝑛 𝑥𝑛 + 𝜃)
c. Si 𝑦 ≠ 𝑑(𝑥) (clasificación incorrecta) se modifican los pesos y el umbral:
𝑤𝑖 𝑡 + 1 = 𝑤𝑖 𝑡 + 𝑑(𝑥) ∗ 𝑥𝑖
𝜃 𝑡 + 1 = 𝜃(𝑡) + 𝑑(𝑥)
𝑥1
𝑤1 = 1
Inicialmente al azar
𝑥2 𝑤2 = 1
𝜃 = 0.5
Perceptron Simple: Ejemplo
❖ Función lógica AND
x1 x2 AND 𝑥1
𝑤1 = 1
-1 -1 -1 𝑦 +1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 > 0
𝑦=ቊ
−1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 ≤ 0
1 -1 -1
-1 1 -1 𝑥2 𝑤2 = 1
1 1 1 𝜃 = 0.5
𝑤1 = 𝑤1 + 𝑑 𝑥 ∗ 𝑥1 = 1 − 1 = 0
𝒚 = 𝒇 −𝟐. 𝟓 = −𝟏 Bien clasificado
𝑤2 = 𝑤2 + 𝑑 𝑥 ∗ 𝑥2 = 1 + 1 = 2
𝜃 = 𝜃+ 𝑑 𝑥 = 0.5 − 1 = −0.5
Perceptron Simple: Ejemplo
❖ Función lógica AND
x1 x2 AND 𝑥1
𝑤1 = 0
-1 -1 -1 𝑦 +1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 > 0
𝑦=ቊ
−1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 ≤ 0
1 -1 -1
-1 1 -1 𝑥2 𝑤2 = 2
1 1 1 𝜃 = −0.5
𝑤1 = 𝑤1 + 𝑑 𝑥 ∗ 𝑥1 = 0 + 1 = 1
𝒚 = 𝒇 −𝟏. 𝟓 = −𝟏 Bien clasificado
𝑤2 = 𝑤2 + 𝑑 𝑥 ∗ 𝑥2 = 2 − 1 = 1
𝜃 = 𝜃+ 𝑑 𝑥 = −0.5 − 1 = −1.5
Perceptron Simple: Ejemplo
❖ Función lógica AND
x1 x2 AND 𝑥1
𝑤1 = 1
-1 -1 -1 𝑦 +1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 > 0
𝑦=ቊ
−1, 𝑠𝑖 𝑤1 𝑥1 + 𝑤2 𝑥2 + 𝜃 ≤ 0
1 -1 -1
-1 1 -1 𝑥2 𝑤2 = 1
1 1 1 𝜃 = −1.5
𝑦 = 𝑤1 𝑥1 + ⋯ + 𝑤𝑛 𝑥𝑛 + 𝜃
ADALINE
❖ La diferencia con el perceptron es la manera de utilizar la salida en la regla de
aprendizaje.
o El perceptron utiliza la salida de la función umbral (binaria) para el aprendizaje. Sólo
se tiene en cuenta si se ha equivocado o no.
o En Adaline se utiliza directamente la salida de la red (real) teniendo en cuenta cuánto
se ha equivocado.
❖ La regla de aprendizaje de ADALINE considera el error entre la salida lograda 𝒚 versus
la salida deseada 𝒅: 𝑑𝑝 − 𝑦 𝑝
❖ Esta regla se conoce como REGLA DELTA. La constante α se denomina TASA DE
APRENDIZAJE. ∆𝑤𝑖 = 𝛼 𝑑𝑝 − 𝑦 𝑝 𝑥𝑖
❖Se busca minimizar la desviación de la red para todos los patrones de entrada, eligiendo
una medida del error global. Normalmente se utiliza el error cuadrático medio:
ADALINE : Aprendizaje
1. Inicializar los pesos y umbral de forma aleatoria
2. Seleccionar un ejemplo 𝑥 del conjunto de entrenamiento
3. Calcular la salida de la red: y = 𝑓(𝑤1 𝑥1 + ⋯ + 𝑤𝑛 𝑥𝑛 + 𝜃)
y obtener la diferencia 𝑑𝑝 − 𝑦 𝑝
Multicapas
Fin
INTELIGENCIA
ARTIFICIAL
TEMA: REDES NEURONALES
Patrón de salida
Patrón de entrada X o vector Y
RNA
Y = f(X,W)
W = vector de pesos
¿CÓMO ES LA ESTRUCTURA DE
UNA RNA?
NEURONAS
X1 y1
X2 y2
X3 . . y3
. . .
. . . . .
.
. . .
.
X.N .
. .
yM
. .
Capa de Capa de
. entrada salida
Regiones de Problema de Clases con Formas de regiones
Estructwa
decisión la XOR regiones mezcladas mÁ generales
Medio plano
limitado por
2 Capas
hiperplano
[Link]
3 Capas cerradas o
convexas
Arbitraria
complejidad
4 Capas limitada por
el nímero de
neuronas
La Neurona
dendrita axón
terminal
Dendritas de entradas nódulo de
Ravier
Un axón de salida neuron
a
Sinapsis de conexión.
104 sinapsis por neurona célula de
Comunicación mediante Potenciale s axón
schwann
yh
wjh
Unidad Ui
F(aj(t), Netj)
yi wji = fj(aj(t+1) yj
Netj aj(t+1) =
yj
. ..
wjg
yg
Unidad Ug
Unidad Uj
¿CUÁLES SON LAS VENTAJAS DE
UTILIZAR LAS RNA?
Aprendizaje adaptativo. Es la capacidad que tiene para aprender a
realizar tareas basadas en un entrenamiento o experiencias iniciales.
Autoorganización. Las RNA crean su propia organización o forma
de representar la información que recibe en la etapa previa de
aprendizaje.
Tolerancia a fallos. Si esta red sufre algún daño en forma parcial,
conlleva a una degradación en su estructura; pero a pesar de esto, se
conserva algunas de las capacidades de esta.
Operación en tiempo real. Para minimizar el tiempo de
funcionamiento requerido en una RNA, esta puede ser descompuesta
en sub-redes y así acoplarlas de manera que su funcionamiento se
realice en forma paralela, disminuyendo ostensiblemente el tiempo
requerido.
¿CUÁLES SON LAS VENTAJAS DE
UTILIZAR LAS RNA?
Función escalón
Función lineal y mixta
Función sigmoidal
Función gaussiana.
FUNCIÓN DE TRANSFERENCIA
CENTRADA DE CADA NEURONA
Neurona (Ficticia)
0
Neuron
a 1 y1,wi
1 wi0 = i
y0 = 1
.
.
yi
. y2, wij
Neuron Neuron
a .j a f, i
.
. y3, w
. i
k
[Link]
k
.
.
¿QUÉ ES EL APRENDIZAJE DE
UNA RNA?
El aprendizaje es el proceso por el cual una red modifica sus pesos
en respuesta a una información de entrada. Los cambios que se
producen durante el proceso de aprendizaje se reducen a la
destrucción, modificación y creación de conexiones entre las
neuronas.
Durante el proceso de aprendizaje, los pesos de las conexiones de la
red sufren modificaciones, por tanto se puede afirmar que este
proceso ha terminado (la red ha aprendido) cuando los valores de
dwij
los pesos permanecen estables 0
dt
Superficie del error para la búsqueda de
gradiente descendiente en el espacio de
pesos
¿CUÁLES SON LAS REGLAS DE
APRENDIZAJE?
Aplicaciones:
[Link]ón.
[Link]ón
[Link] (Agrupamiento)
[Link]ón de curvas
EQUIVALENCIAS EN LA TERMINOLOGÍA
ESTADÍSTICA Y DE RNA
EQUIVALENCIAS ENTRE MODELOS
ESTADÍSTICOS Y MODELOS DE RNA
Inteligencia Artificial
Mario Aquino Cruz
Inteligencia Artificial
• Aprendizaje Supervisado, Aprendizaje No Supervisado y por refuerzo
• Redes Neuronales
Datos
Computadora Resultado
Reglas
Aprendizaje Automático
Datos
Computadora Reglas
Resultado
6
Ejemplos Aprendizaje Automático
7
Aprendizaje Automático
Suponga que su programa de correo electrónico observa qué mensajes de correo electrónico marcao
no como spam, y en base a eso aprende cómo filtrar mejor el spam. ¿Cuál es la tarea T en este
entorno?
a. Clasificar los correos electrónicos como spam o no spam.
b. Observar etiquetar correos electrónicos como spam o no spam.
c. El número (o fracción) de correos electrónicos clasificados correctamente como spam / no spam.
Ninguno de los anteriores, este no es un algoritmo de aprendizaje automático.
Ejemplos Aprendizaje automático
9
Otros ejemplos de aplicación
10
Aprendizaje supervisado
En el aprendizaje supervisado, se nos da un conjunto de datos y
ya sabemos cómo debería ser nuestra salida correcta, teniendo la
idea de que existe una relación entre la entrada y la salida. Los
problemas de aprendizaje supervisado se clasifican en problemas
de "regresión" y "clasificación".
11
Aprendizaje supervisado: Regresión
En un problema de regresión, estamos tratando de predecir
resultados dentro de una salida continua, lo que significa que
estamos tratando de asignar variables de entrada a alguna
función continua.
12
Regresión
Objetivo: Predecir un valor numérico
13
Otros ejemplos de regresión
• Pronóstico de ventas
• Valor de cliente a futuro
• Predecir cantidad de lluvia
14
Aprendizaje supervisado: Clasificación
En un problema de clasificación, en cambio, estamos tratando de
predecir resultados en una salida discreta. En otras palabras,
estamos tratando de mapear variables de entrada en categorías
discretas.
15
Clasificación
Objetivo: Predecir una categoría
Soleado
Ventoso
Lluvioso
Nublado
Otros ejemplos de clasificación
• Propensión de compra
• Clasificación de un tumor como benignos o malignos (Binaria)
• Determinación de riesgo (alto, medio, bajo) para una solicitud
de préstamo.
• Sentimiento en las redes sociales como positivo, negativo o
neutro
17
Aprendizaje supervisado
Ejemplo 1: Teniendo en cuenta los datos sobre el tamaño de las
casas en el mercado inmobiliario, intente predecir su precio. El
precio en función del tamaño es una salida continua, por lo que
este es un problema de regresión. Podríamos convertir este
ejemplo en un problema de clasificación al hacer nuestra salida
sobre si la casa "se vende por más o menos que el precio de
venta". Aquí clasificamos las casas según el precio en dos
categorías discretas.
18
Aprendizaje supervisado
Ejemplo 2: (a) Regresión: dada una imagen de una persona,
tenemos que predecir su edad sobre la base de la imagen dada
(b) Clasificación: dado un paciente con un tumor, tenemos que
predecir si el tumor es maligno o benigno
19
Aprendizaje no supervisado
El aprendizaje no supervisado nos permite abordar los problemas
con poca o ninguna idea de cómo deberían ser nuestros
resultados. Podemos derivar la estructura de datos donde no
necesariamente conocemos el efecto de las variables. Podemos
derivar esta estructura agrupando los datos en función de las
relaciones entre las variables en los datos. Con el aprendizaje no
supervisado, no hay retroalimentación basada en los resultados
de la predicción.
20
Aprendizaje no supervisado: Segmentación
Valor Medio
21
A l t o valo r
© Copy rig h t VIEW N EX T2 016
Genes
Individuals
Organize computing clusters Social network analysis
24
Aprendizaje no supervisado: Asociación
25
Otros ejemplos de asociación
• Recomendaciones de compra basado en historial de compras y
navegación
26
Aprendizaje supervisado y no supervisado
Supervisado No Supervisado
Target Sin Target
Clasificación Segmentación
Regresión Asociación
27
Aplicaciones
Tipologías de problemas
28
ML vs. Deep Learning
La mayoría de los métodos de aprendizaje automático funcionan bien debido a las
representaciones y características de entrada diseñadas por humanos.
ML se convierte simplemente en optimización de pesos para hacer mejor una predicción final
¿Qué es Deep Learning (DL) ?
Es un subcampo de aprendizaje automático de representaciones de datos de aprendizaje.
Excepcional eficacia en los patrones de aprendizaje.
Los algoritmos de aprendizaje profundo intentan aprender (múltiples niveles de) representación
mediante el uso de una jerarquía de múltiples capas.
Si le proporciona al sistema toneladas de información, comienza a comprenderla y a responder
de manera útil.
¿Por qué DL es util?
• Las características diseñadas manualmente a menudo están sobreespecificadas, están
incompletas y requieren mucho tiempo para diseñarlas y validarlas.
• Las funciones aprendidas son fáciles de adaptar, rápidas de aprender
• El aprendizaje profundo proporciona un marco de aprendizaje muy flexible (¿casi?) universal para
representar información mundial, visual y lingüística. Puede aprender tanto sin supervisión como
supervisado
• Aprendizaje eficaz del sistema conjunto de principio a fin
• Utiliza grandes cantidades de datos de entrenamiento
Inteligencia Artificial..
• Neural Networks (Redes Neuronales)
• Genetic Algorithms (Algoritmos Genéticos)
• Genetic Programming(Programación Genética)
• Behavior-Based Systems (Sistemas basados en Comportamiento)
Redes Neuronales
Una neurona artificial Una neurona biológica
La neurona artificial
La neurona es la unidad de procesamiento básica de una red neuronal.
Consiste de:
Funcion de activacion
v=u+b
v
es el campo local inducido
por la neurona
Funciones de activación
Selección de la función de activación y los parámetros
Tamaño(m2) Precio($)
20 22000
30 35000
40 41000
50 52000
60 63000
Machine Learning
Regresión Lineal
Fuente: [Link] 2
Caso de Estudio
• Observar las ventas recientes de casas en mi
vecindario
– ¿A cuánto las vendieron?
3
Caso de Estudio
• Graficar las ventas de casas más recientes
Y Terminología:
x – atributo (feature)
precio ($)
y – respuesta (target)
4
Caso de Estudio
• Predecir el precio de la casa considerando
casas similares
Y
recientemente tenía
exactamente el
mismo tamaño
5
Caso de Estudio
• Considerar el precio promedio en el rango
Y Problema
• ¡Solo dos casas!
• Descartas la
información de todas
precio ($)
6
Regresión Lineal
• Solución: usar un modelo de regresión lineal
– Ajustar una línea a los datos
Y
precio ($)
f(x) = w0 + w1x
Parámetros del
modelo
7
Regresión Lineal
• Solución: usar un modelo de regresión lineal
– Ajustar una línea a los datos
Y
precio ($)
fw(x) = w0 + w1x
Función
parametrizada por
w = (w0, w1)
metros cuadrados (mc) X
8
Regresión Lineal
• ¿Cuál linea usar?
Y
precio ($)
fw(x) = w0 + w1x
diferentes parámetros w
9
Método de Mínimos Cuadrados
• “Costo” de usar una determinada línea
Ec (w0, w1)=
Y
($casa1 – [w0 + w1mccasa1])2
+ ($casa2 – [w0 + w1mccasa2])2
+ ($casa3 – [w0 + w1mccasa3])2
precio ($)
10
Mejor Predicción
fŵ(x) = ŵ0 + ŵ1x
Y
Mejor predicción de
precio de casa:
precio ($)
ŷ = ŵ0 + ŵ1mccasa
11
Formalizando…
• Se desea ajustar el siguiente modelo lineal a
los datos observados
f(x) = w0 + w1x
– w0, w1 son parámetros del modelo y se llaman
coeficientes de regresión
• Método de mínimos cuadrados
– Encontrar los parámetros (w0, w1) que minimizan
la suma del error cuadrático:
N N
i i
[y – f(x )]2=
[yi – w0 – w1x]2
i1 i1
12
Añadir un orden mayor a lineal
• ¿Y si se intenta ajustar una función cuadrática?
Y
precio ($)
13
¿Un polinomio aún mayor?
• Puede minimizar el
error, pero ¿la casa
Y vale tan poco en
verdad?
este modelo?
14
Evaluación de overfitting
con conjuntos de
entrenamiento/prueba
Overfitting
• ¿Se le puede creer a este modelo?
Y
• Minimiza el error,
pero se obtendrían
malas predicciones
precio ($)
18
Agregar más Atributos
fw(x) = w0 + w1mc + w2nb
Y
precio ($)
X2
19
¿Cuántos atributos usar?
• Algunas posibilidades:
– Tamaño en metros cuadrados
– Número de baños
– Número de habitaciones
– Año de construcción
–…
20
Otros Ejemplos de Regresión
• Sueldo después del curso de IA
– ¿Cuánto será tu sueldo? (y = $$)
– Depende de:
• Desempeño en exámenes
• Calidad del trabajo final
• Estudio independiente
22
Otros Ejemplos de Regresión
• Popularidad de Tweets
– ¿Cuántas personas le derán “retweet” a mi tweet?
– Depende de:
• Número de seguidores
• Número de seguidores de mis seguidores
• Características del texto tweeteado
• Popularidad del hashtag
• …
23
Otros Ejemplos de Regresión
• Casas inteligentes
– Tienes varios sensores distribuidos
– ¿Cuál es la temperatura en la biblioteca? (no hay
sensor)
• Aprender una función espacial para predecir
temperatura
– Depende de:
• Configuración del termostato
• Ventanas abiertas o cerradas
• Temperatura en el exterior
• Hora del día
24
Fin
25