0% encontró este documento útil (0 votos)
2 vistas36 páginas

Machine Learning

El documento presenta los clasificadores supervisados, enfocándose en el algoritmo K-Vecino más Cercano (KNN) y sus distintas métricas de distancia, como Euclidiana, Manhattan, Chebychev y Mahalanobis. También se introduce el concepto de Máquinas de Soporte Vectorial (SVM), explicando su aplicación en la clasificación de datos lineal y no linealmente separables. Se detallan los fundamentos matemáticos y ejemplos prácticos para ilustrar el uso de estos métodos en la clasificación.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas36 páginas

Machine Learning

El documento presenta los clasificadores supervisados, enfocándose en el algoritmo K-Vecino más Cercano (KNN) y sus distintas métricas de distancia, como Euclidiana, Manhattan, Chebychev y Mahalanobis. También se introduce el concepto de Máquinas de Soporte Vectorial (SVM), explicando su aplicación en la clasificación de datos lineal y no linealmente separables. Se detallan los fundamentos matemáticos y ejemplos prácticos para ilustrar el uso de estos métodos en la clasificación.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Capítulo 1

CLASIFICADORES SUPERVISADOS

1.1. Késimo Vecino más Cercano (KNN)


Es uno de los clasicadores más sencillos de emplear, consiste en la clasicación de un elemento desconocido,
determinando la distancia más corta entre el elemento a clasicar y los elementos de las clases conocidas.
Sin embargo, no siempre resulta conveniente realizar la clasicación del elemento desconocido, teniendo solo
en cuenta la clase conocida más cercana, por tanto se debe considerar K vecinos y seleccionar el que más se
repita, tal como se muestra en el ejemplo de la Figura 1.1 donde el elemento a clasicar está representado por
un circulo amarillo y las clases conocidas por triángulos y estrellas.

Figura 1.1: Ejemplo del clasicador Knn para distintos K vecinos.

En este ejemplo, se puede ver los diferentes resultados de la clasicación del elemento desconocido para
distintos número de K vecinos, de este modo si K =1 o si K =2 el elemento desconocidos es asignado a la
clase de los triángulos, y si K=5 el elemento es asignado a la clase de las estrellas.
Para medir las distancias entre los datos, existen diferentes métricas, a continuación se mostrara el modelo
matemático general de algunas de ellas:

1.1.1. DISTANCIA EUCLIDIANA:


Es la distancia más utilizada, y en esta, la métrica de la distancia entre los puntos a y b está dada por:

v
u n q
uX 2 2 2
D= t (ai − bi ) = (a1 − b1 ) + (a2 − b2 ) + · · · + (an − bn )2 (1.1)
i=1

1
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 2

Ejemplo:

la distancia entre los puntos de la Figura 1.2 a (2, 2)y b (7, 6) :

q
2 2
D ([(ai , a2 ) , (b1 , b2 )]) = (a1 − b1 ) + (a2 − b2 )
p
D= (2 − 7)2 + (2 − 6)2
p
D = (−5)2 + (−4)2

D = 25 + 16

D = 6.4
Figura 1.2: Distancia Euclidiana en-
tre dos puntos.

Para medir la distancia Euclidiana entre vectores se utiliza: 

v
u n
uX T
D = t (A − B) (A − B) (1.2)
i=1

1.1.2. DISTANCIA MANHATTAN (CITY BLOCK)

En esta distancia se suma la longitud de la proyección del segmento de


linea entre los puntos sobre el sistema de ejes coordenados, por tanto esta métrica se dene así:

n
X
D= |ai − bi | + |a2 − b2 | + · · · + |an − bn | (1.3)
i=1

Ejemplo:

La distancia entre los puntos a(2, 2) y b(7, 6) mostrada en la Figura 1.3 se calcula así:

D ([(a1 , a2 ) , (b1 , b2 )]) = |a1 − b1 | + |a2 − b2 |

D = |2 − 7| + |2 − 6|

D =5+4

D=9
Figura 1.3: Distancia Manhattan (city
Block) entre dos puntos.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 3

1.1.3. DISTANCIA CHEBYCHEV


También es llamada la métrica del valor máximo y se dene

D = max {|a1 − b1 | , |a2 − b2 | , · · · |an − bn |} (1.4)

Ejemplo:

La distancia entre los puntos a(2, 2) y b(7, 6) mostrada en la Figura1.4

Figura 1.4: Distancia Chebychev entre dos puntos.

D ([(a1 , a2 ) , (b1 , b2 )]) = max {|a1 − b1 | , |a2 − b2 |}

D = max {|2 − 7| , |2 − 6|}

D=5

1.1.4. DISTANCIA MAHALANOBIS


Esta distancia es similar a la distancia euclidiana, la diferencia radica en que la Mahalanobis tiene en cuenta
la desviación estándar (σ)por tanto su modelo matemático es:

s 2  2  2
a 1 − b1 a2 − b2 an − bn
D= + + ··· + (1.5)
σ1 σ2 σn

Ejemplo:

La distancia entre los puntos a(2, 2) y b(7, 6) en la Figura1.5 es calculada así


CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 4

Figura 1.5: Distancia Mahalanobis entre dos puntos.

s 2  2
a1 − b1 a2 − b2
D ([(a1 , a2 ) , (b1 , b2 )]) = +
σ1 σ2
El primer paso sera calcular la desviación estándar σ1 y σ2 utilizando la ecuación

v
u n
u 1 X 2
σ=t (xi − x) (1.6)
n − 1 i=1
r
1 h 2 2
i
σ1 = (7 − 4.5) + (2 − 4.5)
2−1

σ1 = 12.5 = 3.54
r
1 h 2 2
i
σ2 = (6 − 4) + (2 − 4)
2−1

σ2 = 8 = 2.83
Luego se calcula la distancia

s 2  2
2−7 2−6
D ([(a1 , a2 ) , (b1 , b2 )]) = +
3.54 2.83
s 2  2
−5 −4
D= +
3.54 2.83

D = 2+2=2
Para medir la distancia Mahalanobis entre vectores se utiliza la siguiente ecuación:

v
u n
uX T
D=t (A − B) S −1 (A − B) (1.7)
i=1

Donde S es una matriz diagonal cuyos elementos en la diagonal son la desviación estándar.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 5

Ejemplo del clasicador Knn


Se desea realizar una clasicación entre tres especies caninas : zorro, lobo y perro. En esta clasicación se
tomaron dos características de la huella (ancho y largo) de una de sus patas. En la tabla se encuentra la base
de de datos.

Figura 1.6: Especies caninas

Figura 1.7: Huellas de cada especie

MUESTRA LARGO ANCHO HUELLA

1 55 35 Zorro
2 53 34 Zorro
3 52 33 Zorro
4 51 32 Zorro
5 85 70 Lobo
6 84 69 Lobo
7 83 68 Lobo
8 82 67 Lobo
9 60 50 Perro
10 59 49 Perro
11 58 48 Perro
12 57 47 Perro

Cuadro 1.1: Base de datos de largo y ancho de la huella de perro, lobo y Zorro.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 6

Figura 1.8: Clasicación gráca en diferentes tipos de huellas caninas.

Para la clasicación se tomó K = 3 y se utilizó la métrica Euclidiana para medir la distancia entre las
muestras y los datos a clasicar, los cuales tienen un valor de largo 50 y ancho 60. En la Tabla1.2 se muestra
los resultados de la medición de las distancias entre la base de datos y los datos a clasicar, además se pueden
ver resaltados los 3 valores más cercanos a los datos a estimar.

MUESTRA LARGO ANCHO D. EUCLIDIANA HUELLA

1 55 35 25,50 Zorro
2 53 34 26,18 Zorro
3 52 33 27,08 Zorro
4 51 32 28,02 Zorro
5 85 70 36,41 Lobo
6 84 69 35,18 Lobo
7 83 68 33,96 Lobo
8 82 67 32,76 Lobo
9 60 50 14,15 Perro
10 59 49 14,22 Perro
11 58 48 14,43 Perro
12 57 47 14,77 Perro
Estimar 50 60

Cuadro 1.2: Distancia Euclidiana entre la base de datos y los datos a clasicar.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 7

Figura 1.9: Estimación gráca en diferentes tipos de huellas caninas, distancia más cercana.
Capítulo 2

Máquinas de Soporte Vectorial (Support


Vector Machines, SVMs)

Las máquinas de soporte vectorial, (Support Vector Machines, SVMs) son un conjunto de algoritmos de
aprendizaje supervisado desarrollados por Vladimir Vapnik y su equipo en los laboratorios AT&T. Son diversos
los campos en los que han sido utilizadas con éxito, tales como visión articial, reconocimiento de caracteres,
caracterización de texto e hipertexto, clasicación de proteínas, procesamiento de lenguaje natural, análisis de
series temporales. De hecho, desde su introducción, han ido ganando un merecido reconocimiento gracias a sus
sólidos fundamentos teóricos.

2.1. CASO LINEALMENTE SEPARABLE


Supongamos que nos han dado un conjunto S de puntos etiquetados para entrenamiento como se aprecia en
la Figura 2.1

Figura 2.1: Caso linealmente separable.

Cada punto de entrenamiento N xiϵℜ pertenece a alguna de dos clases y se le ha dado una etiqueta ϵ {−1, 1} i
y para i = 1, · · · , l. En la mayoría de los casos, la búsqueda de un hyperplano adecuado en un espacio de entrada
es demasiado restrictivo para ser de uso práctico. Una solución a esta situación es mapear el espacio de entrada
en un espacio de características de una dimensión mayor y buscar el hyperplano óptimo allí. Sea z = ϕ (x) la
notación del correspondiente vector en el espacio de características con un mapeo ϕ de ℜN a un espacio de
características Z. Deseamos encontrar el hyperplano

8
CAPÍTULO 2. MÁQUINAS DE SOPORTE VECTORIAL (SUPPORT VECTOR MACHINES, SVMS) 9

wz+b=0
Denido por el par (w, b), tal que podamos separar el punto xi de acuerdo a la función

(
1 yi = 1
f (xi ) = sign (w · z + b) = (2.1)
−1 yi = −1
Donde wϵzi y bϵℜ. Más precisamente, el conjunto S se dice que es linealmente separable si existe (w  b) tal
que las in-ecuaciones

(
(w · z + b) ≥ 1, yi = 1
i = 1, · · · , l
(w · zi + b) ≤ −1 yi = −1
Sean válidas para todos los elementos del conjunto S . Para el caso linealmente separable de S, podemos encon-
trar un único hyperplano óptimo, para el cual, el margen entre las proyecciones de los puntos de entrenamiento
de dos diferentes clases es maximizado

2.2. CASO NO LINEALMENTE SEPARABLE


Si el conjunto S no es linealmente separable, violaciones a la clasicación deben ser permitidas en la formu-
lación de la SVM.

Figura 2.2: Caso no linealmente separable

Para tratar con datos que no son linealmente separables, el análisis previo puede ser generalizado introdu-
ciendo algunas variables no-negativas el problema del hyperplano óptimo es entonces re-denido como la solución
al problema

( l
)
1 X
min w·w+C ξi (2.2)
2 i=1

s.a yi (w · z + b) ≥ 1 − ξi , i = 1, · · · , l

ξi ≥ 0, i = 1, · · · , l
Donde C es una constante. El parámetro C puede ser denido como un parámetro de regularización. Este es
el único parámetro libre de ser ajustado en la formulación de la SVM. El ajuste de éste parámetro puede hacer
un balance entre la maximización del margen y la violación a la clasicación.
CAPÍTULO 2. MÁQUINAS DE SOPORTE VECTORIAL (SUPPORT VECTOR MACHINES, SVMS) 10

Figura 2.3: Aparición del parámetro de error en clasicación.

Buscando el hyperplano óptimo es un problema QP, que puede ser resuelto construyendo un Lagrangiano y
transformándolo en el dual.

l l l
X 1 XX
M ax W (a) = αi − αi αj yi yj zi · zj
i=1
2 i=1 j=1

l
X
s.a yi αi = 0, 0 ≤ αi ≤ C, i = 1, · · · , l
i=1

Para construir el hyperplano óptimo w · z + b, se utiliza

l
X
W = αi yi zi (2.3)
i=1

La función de decisión generalizada es tal que

l
!
X
f (x) = singn (w · z + b) = singn αi yi zi · z + b (2.4)
i=1

2.3. TRUCO DEL KERNEL PARA EL CASO NO LINEALMENTE


SEPARABLE
Como no tenemos ningún conocimiento de ϕ , el cálculo del problema (7) y (11) es imposible. Hay una
buena propiedad de la SVM la cual es que no es necesario tener ningún conocimiento acerca de ϕ . Nosotros
sólo necesitamos una función K(·, ·) llamada kernel que calcule el producto punto de los puntos de entrada en
el espacio de características Z, esto es

zi · zj = φ (xi ) · φ (xj ) = K(xi , xj )


CAPÍTULO 2. MÁQUINAS DE SOPORTE VECTORIAL (SUPPORT VECTOR MACHINES, SVMS) 11

Figura 2.4: Idea del uso de un kernel para transformación del espacio de los datos.

Las Funciones que satisfacen el teorema de Mercer pueden ser usadas como productos punto y por ende
pueden ser usadas como kernels. Podemos usar el kernel polinomial de grado d

d
K (xi , xj ) = (1 + xi · xj ) (2.5)

Para construir un clasicador SVM. Entonces el hyperplano no lineal de separación puede ser encontrado
como la solución de

l l
X 1 XX
M ax W (α) = αi − αi αj yi yj K (xi , xj) (2.6)
2 i=1 j=1

l
X
s.a yi αi = 0, 0 ≤ αi ≤ C, i = 1, · · · , l
i=1

y la función de decisión es:

l
!
X
f (x) = singn (w · z + b) = singn αi yi K (xi , xj ) + b
i=1

EJEMPLO DE APLICACIÓN
Capítulo 3

CLASIFICADOR BAYESIANO

Un clasicador de Bayes asume que la presencia o ausencia de una característica particular no está relacionada
con la presencia o ausencia de cualquier otra característica, dada la clase variable. Por ejemplo, una fruta puede
ser considerada como una manzana si es roja, redonda y de alrededor de 7 cm de diámetro. Un clasicador de
Bayes considera que cada una de estas características contribuye de manera independiente a la probabilidad de
que esta fruta sea una manzana, independientemente de la presencia o ausencia de las otras características. Una
ventaja del clasicador de Bayes es que solo se requiere una pequeña cantidad de datos de entrenamiento para
estimar los parámetros (las medias y las varianzas de las variables) necesarias para la clasicación. Como las
variables independientes se asumen, solo es necesario determinar las varianzas de las variables de cada clase y
no toda la matriz de covarianza

P (D | h) P (h)
P (h/D) = (3.1)
P (D)
Donde:

P (h) es la probabilidad apriori de la hipótesis h.

P (D) es la probabilidad de observar el conjunto de entrenamiento D.

P (D | h) es la probabilidad de observar el conjunto de entrenamiento D en un universo donde se verica


la hipótesis h.

P (h | D) es la probabilidad aposteriori de h, cuando se ha observado el conjunto de entrenamiento D.

La hipótesis más probable o MAP (maximun a posteriori hipótesis):

hM AP = arg maxhϵH (P (h | D))


 
P (D | h) P (h)
hM AP = arg maxhϵH
p (D)

hM AP = arg maxhϵH (P (D | h) P (h))


Un algoritmo Bayesiano puede ser fácilmente implantado si se calculan todas las posibles hipótesis en la
ecuación 1 y se selecciona la hipótesis de mayor probabilidad. En general si tiene un sistema de aprendizaje de lo
general a lo especíco (o al revés) que busca especializaciones más generales (o generalizaciones más especícas)
se puede caracterizar asumiendo que las hipótesis más generales (o especícas) son más probables que otras. El
principio básico, ilustrado en el párrafo anterior, puede ser empleado para determinar de una forma a priori la
clase en la cual puede ser clasicado un dato, según las probabilidades generadas por una serie de funciones de
clasicación bayesiana, previamente denidas.
De otro lado, es importante señalar que los algoritmos basados en un enfoque bayesiano han sido usados en
varias y diversas áreas de la ingeniería como:

a. Formulación de nuevos métodos para la extracción y agrupamiento de características en la visión articial;


encontrándose una mayor eciencia, robustez y exibilidad frente a otros métodos tradicionales

12
CAPÍTULO 3. CLASIFICADOR BAYESIANO 13

b. Clasicación automática de patrones, presentes en los carbones colombianos. En esta investigación se


compara el modelo bayesiano, frente a otros modelos de clasicación como las máquinas de soporte vec-
torial y redes neuronales; encontrándose que el modelo bayesiano genera la mayor capacidad predictiva,
principalmente por su robustez frente al ruido.

c. Extracción y clasicación de posturas labiales en niños entre 5 y 10 años en la ciudad de Manizales.

d. Identicación de voces normales y disfuncionales, en la zona centro de Colombia, a partir de su análisis


acústico. Considerando, que no existe un único patrón de voz normal, en esta investigación, el clasicador
bayesiano inicia con una etapa de aprendizaje sobre la normalidad de la voz en un contexto determinado,
nalmente se realizan los respectivos procesos de validación con resultados superiores al 95 %.

3.1. METODOLOGÍA USADA PARA APLICAR LA CLASIFICA-


CIÓN TIPO BAYES
Sea Xi , la matriz de hiperpuntos que contiene cada una de las n clase, de tamaño Nc (muestras por clase)
× D (Número de características) × C (Clases). Se procede del siguiente modo:

a. Se calcula el vector de medias de µi y de Xi .


b. Se calcula la matriz de Covarianza .....

c. Se calculan los coecientes de las funciones discriminantes para cada una de las n clases:

l−1
1X
Wi = (3.2)
2 i

−l
X
Wi = µi
i

−l
1 tX 1 X
Wio = µi µi − ln + ln P (ϖi )
2 i
2 i

Los coecientes de las funciones discriminantes, son calculados para cada una de las n clases, con una base
de datos de entrenamiento, previamente denidas.

d. Se denen las funciones discriminantes para cada una de las n clases:

gi = xt Wi x + wit x + ωio (3.3)

e. Los valores de características seleccionadas y pertenecientes a la base de datos de validación son evaluados
sobre cada una de las n funciones discriminantes de probabilidad generadas (Ecuación 8). Se supone que
la muestra evaluada, pertenece a aquella clase cuya función de probabilidad genera el máximo valor.

f. Los resultados obtenidos en el numeral anterior son comparados con una etiqueta previamente establecida,
la cual indica el valor real de la clase, a la que pertenece la muestra. Como resultado de la anterior
comparación se dene el porcentaje de aciertos y errores que el sistema proporciona en la identicación,
de las clases a las cuales pertenece la muestra.
CAPÍTULO 3. CLASIFICADOR BAYESIANO 14

Largo Alto Canino Largo Alto Canino

80 66 Perro 115 72 Lobo


82 62 Perro 120 72 Lobo
85 64 Perro 120 66 Lobo
85 70 Perro 125 68 Lobo
90 62 Perro 125 70 Lobo
90 64 Perro 130 68 Lobo
90 70 Perro 130 70 Lobo
90 62 Perro 130 72 Lobo
95 64 Perro 135 66 Lobo
95 66 Perro 135 70 Lobo
95 68 Perro 135 72 Lobo
95 72 Perro 140 66 Lobo
100 62 Perro 140 68 Lobo
100 66 Perro 140 70 Lobo
100 68 Perro 140 72 Lobo
105 66 Perro 140 74 Lobo
105 68 Perro 145 68 Lobo
110 64 Perro 145 70 Lobo
115 64 Perro 145 72 Lobo
120 64 Perro 150 72 Lobo

Cuadro 3.1: Mediciones de Perros y Lobos en alto y largo.

Histograma Probabilidad - Largo

Figura 3.1: Histograma de mediciones en lobos y perros

¾Qué probabilidad hay de que sea un perro si el largo de su cuerpo es de 120 cm?

Existen 20 de 40 datos que son de perros

20
P (P erro) = = 0.5
40

Solo 1 de 20 datos corresponde a datos de perros en el histograma con 120 cm

1
P (L = 120/P erro) = = 0.05
20
CAPÍTULO 3. CLASIFICADOR BAYESIANO 15

Según el teorema de probabilidad de Bayes se multiplica la probabilidad de que sean perros por la proba-
bilidad de los datos que corresponden a 120 cm

P (P erro/L = 120) = 0.5 ∗ 0.05 = 0.025

Se hace el mismo proceso con los datos de lobos

20
P (Lobo) = = 0.5
40
2
P (L = 120/Lobo) = = 0.1
20
P (Lobo/L = 120) = 0.5 ∗ 0.1 = 0.05
En conclusión la probabilidad que sea un perro es de 2.5 % y de que sea un lobo de 5 %.

CALCULO DE LA PROBABILIDAD SEGÚN EL ALTO


¾Qué probabilidad hay de que sea un perro si el alto de su cuerpo es de 66 cm?

Figura 3.2: Gráca de mediciones en lobos y perros, tomando como alto el eje Y.

Existen 20 de 40 datos que son de perros

20
P (P erro) = = 0.5
40
Solo 5 de 20 datos corresponde a datos de perros en el histograma con 66 cm

5
P (A = 66/P erro) = = 0.25
20
Según el teorema de probabilidad de Bayes se multiplica la probabilidad de que sean perros por la proba-
bilidad de los datos que corresponden a 66 cm

P (P erro/A = 66) = 0.5 ∗ 0.25 = 0.125

Se hace el mismo proceso con los datos de lobos

20
P (Lobo) = = 0.5
40
3
P (A = 66/Lobo) = = 0.15
20
P (Lobo/A = 66) = 0.5 ∗ 0.15 = 0.075
En conclusión la probabilidad que sea un perro es de 12.5 % y de que sea un lobo de 7.5 %.
CAPÍTULO 3. CLASIFICADOR BAYESIANO 16

PREDICCIÓN 2 VARIABLES EN ALTO Y LARGO


¾Qué probabilidad hay de que sea un perro si el largo de su cuerpo es de 120 y el alto es de 66 cm?

P (P erro/A = 66 L = 120) = P (P erro) × P (A = 66/P erro) × P (L = 120/P erro)


= 0.5 ∗ 0.25 ∗ 0.05 = 0.00625
P (P erro/A = 66 L = 120) = 45.45 %
Para el lobo se hará el mismo procedimiento

P (Lobo/A = 66 L = 120) = P (Lobo) × P (A = 66/Lobo) × P (L = 120/Lobo)


= 0.5 ∗ 0.15 ∗ 0.1 = 0.0075
P (P erro/A = 66 L = 120) = 54.54 %
Capítulo 4

REDES NEURONALES

Las redes neuronales son más que otra forma de emular ciertas características propias de los humanos,
como la capacidad de memorizar y de asociar hechos. Si se examinan con atención aquellos problemas que no
pueden expresarse a través de un algoritmo, se observará que todos ellos tienen una característica en común: la
experiencia. El hombre es capaz de resolver estas situaciones acudiendo a la experiencia acumulada.

Historia de las Redes Neuronales


1936 - Alan Turing. Fue el primero en estudiar el cerebro como una forma de ver el mundo de la compu-
tación.

1949 - Donald Hebb. Fue el primero en explicar los procesos del aprendizaje (que es el elemento básico de
la inteligencia humana) desde un punto de vista Psicológico.

1950 - Karl Lashley. En sus series de ensayos, encontró que la información no era almacenada en forma
centralizada en el cerebro sino que era distribuida encima de él.

1956 - Congreso de Dartmouth. Este Congreso frecuentemente se menciona para indicar el nacimiento de
la inteligencia articial.

1957 - Frank Rosenblatt. Comenzó el desarrollo del Perceptron. Esta es la red neuronal más antigua;
utilizándose hoy en día para aplicación como identicador de patrones.

1959 - Frank Rosenblatt: Principios de Neurodinámica. (Teorema de Convergencia del Perceptron).

1960 - Bernard Widro/Marcian Ho. Desarrollaron la primer red neuronal aplicada (ADAptative LINear
Elements).

1969 - Marvin Minsky/Seymour Papert. Se produjo la muerte abrupta de las Redes Neuronales; probaron
matemáticamente que el Perceptron no era capaz de resolver problemas relativamente fáciles, tales como
el aprendizaje de una función no-lineal.

1985 - John Hopeld. Provocó el renacimiento de las redes neuronales con su libro: Computación neuronal
de decisiones en problemas de optimización.

Ventajas de las redes neuronales


Aprendizaje Adaptativo. Capacidad de aprender a realizar tareas basadas en un entrenamiento o en una
experiencia inicial.

Auto-organización. Una red neuronal puede crear su propia organización o representación de la información
que recibe mediante una etapa de aprendizaje.

Tolerancia a fallos. La destrucción parcial de una red conduce a una degradación de su estructura; sin
embargo, algunas capacidades de la red se pueden retener.

17
CAPÍTULO 4. REDES NEURONALES 18

Operación en tiempo real. Los cómputos neuronales pueden ser realizados en paralelo; para esto se diseñan
y fabrican máquinas con hardware especial para obtener esta capacidad.

Fácil inserción dentro de la tecnología existente. Se pueden obtener chips especializados para redes neuro-
nales que mejoran su capacidad en ciertas tareas.

4.1. ELEMENTOS QUE COMPONEN UNA RED NEURONAL

Figura 4.1: Elementos que componen una red neuronal

4.2. Algoritmo Básico


1. Se inicia aleatoriamente los pesos y umbral.

2. Se toma un patrón de entrada-salida.

3. Se calcula la salida de la red.

4. Si y = d(x) (clasicación correcta).

5. Si y ̸= d(x) (clasicación incorrecta) se modican los parámetros.

6. Se vuelve al paso 2 hasta completar el conjunto de patrones de entrenamiento

7. Se repiten los pasos anteriores hasta alcanzar el criterio de parada.

Existen diferentes Modelos Matemáticos para Interpretarlos por medio de Algoritmos:

Figura 4.2: Cuatro modelos matemáticos para ser interpretados por algoritmos
CAPÍTULO 4. REDES NEURONALES 19

4.2.1. ALGORITMO BÁSICO DEL PERCEPTRÓN


1. se dan valores iniciales aleatorios a los pesos ωi , al valor Bias b y el delta de aprendizajeδ

S = x0 ω0 + x1 ω1 + · · · xn ωn + b
2. Se calcula la salida S
Pn
S= i=0 xi ωi + b
3. Se evalúa la salida S en la función umbral f
O = f (s)

4. Se estima el Error como la diferencia entre el valor esperado T la salida O. Si este es próximo a cero para
todas las salidas, entonces se toman estos pesos ωi y termina el calculo

E =T −O
5. Se determina el factor de ajuste A.

A=δ×E
6. Se reajustanωi lo pesos nuevamente y se vuelve a el paso 2.

ω0+ = ω0 + x0 × A0
ω1+ = ω1 + x1 × A1
.
.
.

ωn+ = ωn + xn × An

Figura 4.3: Respuesta de una Red usando operadores OR


CAPÍTULO 4. REDES NEURONALES 20

Figura 4.4: Grácas de operadores NOR,AND,NAND,NOT usados en redes neuronales.

4.2.2. MÚLTIPLES CLASES

Figura 4.5: Traca de tres clases separadas.

Figura 4.6: Clasicador para tres clases.


CAPÍTULO 4. REDES NEURONALES 21

4.2.3. ANN USANDO EL SOFTWARE MATLAB



Capítulo 5

ÁRBOL DE DECISIONES

El árbol decisión es uno de los métodos más usados para llevar a cabo inferencias inductivas, por tanto son
utilizados en sistemas de clasicación donde se cuenta con una serie de juicios para obtener una sola respuesta,
tales como el diagnostico de casos médicos, o en sistemas de bancos que desarrollan la evaluación de clientes
solicitantes de préstamos, entre otros. Un árbol de decisión se compone de una raíz, nodos y ramas como se
muestra en la Figura5.1 . Las ramas se representan con líneas y descienden de los nodos, los cuales representan
una posible decisión, y la raíz es el nodo principal, por el cual se empieza a desplegar las ramas y los demás
nodos.

Figura 5.1: Estructura de un árbol de decisión

Para realizar una clasicación a través de un árbol de decisión, se emplea el algoritmo ID3, el cual construye
el árbol comenzando en la raíz y luego va desplegando nodos y ramas hacia abajo, para lo cual realiza una
evaluación estadística de cada atributo de entrenamiento, y así poder determinar cuál es el mejor candidato del
nodo a crear, proceso que se repite hasta tener todos los datos de entrenamiento dentro del árbol de decisión.
Dicha evaluación estadística consiste en la medición de la ganancia de información. Antes de explicar en que
consiste la ganancia de información, se debe denir que es la entropía, la cual caracteriza la impureza de una
colección arbitraria de datos y mide la cantidad de información que lleva una señal, su cálculo se realiza utilizando
la siguiente formula:

entropia (S) = −p⊕ log2 p⊕ − p⊖ log2 p⊖ (5.1)

Donde:

p⊕ : Es la probabilidad de los elementos positivos S.


p⊖ : Es la probabilidad de los elementos negativos de S.

Para entender como se calcula la entropía de una colección de datos, suponga que se desea calcular la entropía
de la colección de datos S, la cual posee 14 elementos, 9 de ellos positivos y 5 de ellos negativos, por consiguiente
se hacen los siguientes cálculos:

22
CAPÍTULO 5. ÁRBOL DE DECISIONES 23

       
9 9 5 5
entropia ([9+, 5−]) = − log2 − log2
14 14 14 14

entropia ([9+, 5−]) = 0, 940


El resultado de la entropía siempre va a estar entre los valores de 0 y 1, de este modo si la distribución de los
datos es igual, la entropía dará su valor máximo, es decir 1 y si por el contrario los datos se encuentra distribuidos
en una sola clase, el valor de la entropía será 0, en la ½Error! No se encuentra el origen de la referencia.8 se muestra
la gráca de la función de la entropía.

Figura 5.2: Traca de la función de la Entropia.

Es importante reasaltar que el caso de entropia mencionado anteriormente es uno en donde la clasicación
es booleana, es decir con solo dos opciones (positivo y negativo), sin embargo puede existir una clasicación con
n numero de clases, en la cual la entropia esta denida de la siguiente manera

n
X
entropı́a (S) = −pi log2 pi (5.2)
i=1

Donde

pi : Es la probabilidad de los elementos S pertenecientes a la clase i.


Expuesta la entropía, ya se puede denir la ganancia de información como la reducción esperada de la entropía
después de una división de datos, su expresión matemática está dada por

Atributos
X
Gain (S) = entropı́a (S) − pi (Sv ) entropı́a (Sv ) (5.3)
i=1

Donde

S: Es el grupo principal.

Sv : subgrupo derivado del principal.

Entropı́a (S): Entropía del grupo del nodo principal.

Entropı́a (Sv ): Entropía del subgrupo del nodo principal.


CAPÍTULO 5. ÁRBOL DE DECISIONES 24

pi (Sv ): Probabilidad del subgrupo del nodo principal.

Por ejemplo, se tiene una colección de datos S con 14 elementos, 9 de ellos positivos y 5 de ellos negativos. De
estos 14 elementos, suponga que 6 de los datos positivos y 2 de los datos negativos son de la clase `w', los demás
elementos de la colección pertenecen a la clase `T'. La ganancia de información debido a la división de los datos
en las clases `W' y `T', de la colección de datos S es calculada así.

S = [9+, 5−]

Sw ← [6+, 2−]

ST ← [3+, 3−]

Atributos
X
Gain (S) = entropı́a (S) − pi (Sv ) entropı́ai (Sv )
i=1

Gain (S) = entropı́a (S) − p (Sw ) entropı́aw (Sw ) − p (ST ) entropı́aT (ST )
Primero se debe calcular las entropías y luego ya calcular la ganancia de información:

    
  
9 9 5 5
entropı́a (S) = − log2 − log2 = 0, 94
14 14 14 14
   
6 6 2 2
entropı́a (W ) = − log2 − log2 = 0, 811
8 8 8 8
   
3 3 3 3
entropı́a (T ) = − log2 − log2 =1
6 6 6 6
8 6
Gain (S) = 0, 94 − (0, 811) − (1)
14 14

Gain (S) = 0, 048


Teniendo ya el resultado de la ganancia, el algoritmo ID3 elige el mejor atributo para realizar el nodo, dicho
atributo es el que mayor ganancia tiene. De este manera se va creando un clasicador árbol de decisiones, a
partir de la medición de la ganancia de datos de entrenamiento.

Ejemplo de árbol de decisiones


Se desea predecir según el pronóstico del tiempo, si un partido de tenis se puede jugar el día sábado en la
mañana. Para esta predicción se cuenta con los datos expuestos en la Tabla 5.1.
CAPÍTULO 5. ÁRBOL DE DECISIONES 25

DÍA PRONOSTICO TEMPERATURA HUMEDAD VIENTO JUEGO DE TENIS

1 soleado calor alta débil no


2 soleado calor alta fuerte no
3 nublado calor alta débil si
4 lluvioso templado alta débil si
5 lluvioso frio normal débil si
6 lluvioso frio normal fuerte no
7 nublado frio normal fuerte si
8 soleado templado alta débil no
9 soleado frio normal débil si
10 lluvioso templado normal débil si
11 soleado templado normal fuerte si
12 nublado templado alta fuerte si
13 nublado calor normal débil si
14 lluvioso templado alta fuerte no

Cuadro 5.1: Entropía de las opciones del juego de tenis.

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Soleado 2 3 5,00 0,35714 0,9710


Nublado 4 0 4,00 0,28571 0,00
Llovioso 3 2 5,00 0,35714 0,9710
Total 9 5 14,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,6936
GANANCIA 0,2467

Cuadro 5.2: Calculo Ganancia de información para el atributo PRONÓSTICO

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Frio 3 1 4,00 0,28571 0,8113


Calor 2 2 4,00 0,28571 1,0000
Templado 4 2 6,00 0,42857 0,9183
Total 9 5 14,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,9111
GANANCIA 0,0292

Cuadro 5.3: Calculo Ganancia de información para el atributo TEMPERATURA.

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Normal 6 1 7,00 0,50000 0,5917


Alta 3 4 7,00 0,50000 0,9852
Total 9 5 14,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,7885
GANANCIA 0,1518

Cuadro 5.4: Calculo Ganancia de información para el atributo HUMEDAD


CAPÍTULO 5. ÁRBOL DE DECISIONES 26

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Débil 6 2 8,00 0,57143 0,8113


Alto 3 3 6,00 0,42857 1,0000
Total 9 5 14,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,8922
GANANCIA 0,0481

Cuadro 5.5: Cálculo Ganancia de información para el atributo VIENTO.

ATRIBUTO GANANCIA

Pronostico 0,2467
Temperatura 0,0292
Humedad 0,1518
Viento 0,0481

Cuadro 5.6: Ganancia de información de los atributos.

Como se puede ver en la Tabla5.6, donde se encuentra las ganancias de información de cada atributo, la
ganancia más alta equivale al atributo `pronostico', por tanto este atributo será el nodo raíz del árbol de decisión
y las ramas debajo de este serán sus posibles opciones, es decir, soleado, nublado y lluvioso, ver Figura5.3 .

Figura 5.3: Nodo raíz del árbol de decisión.

De este modo, tenemos 3 nuevos nodos a analizar calculándoles las ganancias de información y así seguir
dividiendo el árbol. El primero que se le hallaran las ganancias será el nodo `soleado' de la siguiente manera:

1. Se hallará la entropía del nodo soleado como se muestra en la Tabla5.7 y luego se hallarán las ganancias
para cada atributo como se muestra en las Tablas

SOLEADO

SI NO TOTAL ENTROPÍA
2 3 5 0,9710

Cuadro 5.7: Entropía del nodo Soleado.


CAPÍTULO 5. ÁRBOL DE DECISIONES 27

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Frio 1 0 1,00 0,20000 0,0000


Calor 0 2 2,00 0,40000 0,0000
Templado 1 1 2,00 0,40000 1,0000
Total 2 3 5,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,4000
GANANCIA 0,5710

Cuadro 5.8: Calculo Ganancia de información para el atributo TEMPERATURA para el nodo soleado.

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Normal 2 0 2,00 0,40000 0,0000


Alta 0 3 3,00 0,60000 0,0000
Total 2 3 5,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,0000
GANANCIA 0,9710

Cuadro 5.9: Calculo Ganancia de información para el atributo HUMEDAD para el nodo soleado.

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Débil 1 2 3,00 0,60000 0,9183


Alto 1 1 2,00 0,40000 1,0000
Total 2 3 5,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,9510
GANANCIA 0,0200

Cuadro 5.10: Cálculo Ganancia de información para el atributo VIENTO para el nodo soleado.

ATRIBUTO GANANCIA

Temperatura 0,571
Humedad 0,971
Viento 0,02

Cuadro 5.11: Ganancia de información de los atributos para el nodo soleado.

Como se observa en la tabla 16, donde se encuentra las ganancias de información de cada atributo para el
nodo soleado, la ganancia más alta equivale al atributo `humedad', por tanto este atributo será el siguiente nodo
debajo del nodo soleado, y las ramas debajo de este serán sus posibles opciones, es decir, alta y normal, ver
Figura 5.4
CAPÍTULO 5. ÁRBOL DE DECISIONES 28

Figura 5.4: División del árbol por el nodo soleado.

Si se mira el árbol de decisión de la Figura 5.4, se puede ver que la opción `normal' del nodo `humedad' solo
lleva a un solo resultado que es positivo, por ende su entropía en nula y por tanto ya no hay más división en esta
rama, esto ocurre igualmente para en la opción `alto' y para el nodo `nublado'. Analizados los nodos de `soleado'
y `nublado', se seguirá examinando el nodo llamado `lluvioso', y como se hizo con los anteriores, se empezará
por calcular la entropía de este (Tabla 5.12) y luego las ganancias para cada atributo (Tabla5.13 )

LLUVIOSO

SI NO TOTAL ENTROPÍA
3 2 5 0,9710

Cuadro 5.12: Entropía del nodo lluvioso.

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Frio 1 1 2,00 0,40000 1,0000


Calor 0 0 0,00 0,00000 0,0000
Templado 2 1 3,00 0,60000 0,9183
Total 3 2 5,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,9510
GANANCIA 0,0200

Cuadro 5.13: Calculo Ganancia de información para el atributo TEMPERATURA para el nodo lluvioso.
CAPÍTULO 5. ÁRBOL DE DECISIONES 29

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Normal 2 1 3,00 0,60000 0,9183


Alta 1 1 2,00 0,40000 1,0000
Total 3 2 5,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,9510
GANANCIA 0,2000

Cuadro 5.14: . Calculo Ganancia de información para el atributo HUMEDAD para el nodo lluvioso

PRONOSTICO SI NO TOTAL PROMEDIO ENTROPIA

Débil 3 0 3,00 0,60000 0,0000


Alto 0 2 2,00 0,40000 0,0000
Total 3 2 5,00
PAtributos
i=1 pi (Sv ) entropı́ai (Sv ) 0,0000
GANANCIA 0,971

Cuadro 5.15: . Cálculo Ganancia de información para el atributo VIENTO para el nodo lluvioso.

ATRIBUTO GANANCIA

Temperatura 0,020
Humedad 0,020
Viento 0,971

Cuadro 5.16: Ganancia de información de los atributos para el nodo lluvia.

Si se mira la Tabla 5.16, donde se encuentra las ganancias de información de cada atributo para el nodo
`lluvia', la ganancia más alta equivale al atributo `viento', por tanto este atributo será el siguiente nodo debajo
del nodo nombrado `lluvioso', y las ramas debajo de este serán sus posibles opciones, es decir, fuerte y débil, ver
Figura 5.5.
CAPÍTULO 5. ÁRBOL DE DECISIONES 30

Figura 5.5: División del árbol por el nodo lluvioso.

Como se puede ver en la Figura 5.5, las opciones fuerte y débil del nodo `viento' solo conllevan a una sola
respuesta, por ende sus entropías son nulas y la división del árbol para. De este modo, el árbol de
entrenamiento queda listo para futuras predicción, como por ejemplo, en caso que se deseara saber si en las
mañanas de los días sábados con los pronósticos de tiempo estipulados en la

PRONOSTICO TEMPERATURA HUMEDAD VIENTO JUEGO DE TENIS

Lluvioso Calor Alta Débil SI


Soleado Calor Alta Débil NO

Cuadro 5.17: Ejemplo de predicción de juego de tenis.


Capítulo 6

EVALUACIÓN DEL CLASIFICADOR

La evaluación de los clasicadores cumple un papel importante dentro de cualquier proceso de minería
de datos, pues permite demostrar de forma cuantitativa que tan eciente es la clasicación realizada por el
método elegido. La evaluación más usada es la prueba de validez, la cual permite medir el grado en que los
resultados de una prueba corresponden realmente a aquello que se está midiendo, y para la visualización de
estos resultados, se utiliza la matriz de confusión. Matriz de confusión: Esta matriz es también llamada matriz
de error o de contingencia (Figura6.1 ), y es una herramienta utilizada para mostrar el nivel de acierto entre las
clases asignadas por el clasicador con respecto a una muestra de prueba no entrada. La matriz de confusión
tiene un tamaño de NxN, donde N es el número de clases asignado al clasicador.

Figura 6.1: Estructura de la matriz de confusión

Para la construcción de esta matriz, se bebe tener en cuenta que es y cómo se calcula la especicidad, sensi-
bilidad y exactitud.

Sensibilidad (TPR): también llamada tasa de verdaderos positivos, es la proporción de casos positivos que
fueron clasicados correctamente como positivos, en ingles estos casos son llamados `true positive' (TP).Para
calcular la sensibilidad se utiliza la siguiente formula:

TP
TPR = (6.1)
TP + FN
Donde:
T P R: Tasa de verdaderos positivos, (true positive rate)
T P : Casos de verdaderos positivos, (true positive)
F N : Casos de falsos negativos, (false negative).

Especicidad (TNR): También denominada tasa de negativos positivos, es la proporción de casos negativos

31
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 32

que fueron clasicados correctamente como negativos, en ingles estos casos son llamados `true negative' (TN).
La especicidad se calcula de la siguiente manera:

TN
TNR = (6.2)
TN + FT
Donde:
T N R: Tasa de verdaderos negativoss, (true negative rate)
T N : Casos de negativos positivos, (negative positive)
F P : Casos de falsos positivos, (false positive)

Otras medidas que se pueden obtener a través de la matriz de confusión son, la tasa de los falsos negativos
y la tasa de los falsos positivos.

Tasa de los falsos negativos (FNR): Es la proporción de casos positivos que fueron clasicados incorrectamente
como negativos, estos casos en ingles son denominados como `false negative' (FN). La fórmula para hallar esta
tasa es:

FN
FNR = (6.3)
FN + TP
Donde:
F N R: Tasa de falsos negativos, (false negative rata)
T P : Casos de verdaderos positivos, (true positive)
F P : Casos de falsos positivos, (false positive)

Tasa de los falsos positivos (FPR): Es la proporción de casos negativos que fueron clasicados incorrectamente
como positivos, estos casos en ingles son denominados como `false positive' (FN). La fórmula para hallar esta
tasa es:

FP
FPR = (6.4)
FP + TN
Donde:
F P R: Tasa de falsos positivos, (false positive rata)
T N : Casos de negativos positivos, (negative positive)
F P : Casos de falsos positivos, (false positive)

Exactitud: Es la proporción total de predicciones correctas positivas, en la matriz de confusión equivale a la


diagonal y se calcula de la siguiente manera.

TP + TN
AC = (6.5)
TP + TN + FP + FN
Donde:
AC : exactitud, (accuracy)
T N : Casos de negativos positivos, (negative positive)
F P : Casos de falsos positivos, (false positive)
T P : Casos de verdaderos positivos, (true positive)
F N : Casos de falsos negativos, (false negative).

Error: Es la proporción total de predicciones incorrectas Positivas y Negativas. Un valor pequeño (cercano a
0) indica un buen clasicador.

Error = 1 − Exactitud (6.6)

6.1. EJEMPLO DE LA MATRIZ DE CONFUSIÓN


Para el siguiente ejemplo se tomaran unos valores de entrada, los cuales serán evaluados por un clasicador
determinado, obteniendo así una salida como se muestra en la siguiente 6.2.
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 33

Figura 6.2: Valores de entrada y salida

Haremos el procedimiento paso a paso así:

True Negative.

Figura 6.3: True Negative

False Negative.

Figura 6.4: Falsos negativos

False Positive

Figura 6.5: False Positive

True Positive
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 34

Figura 6.6: True Positve

Teniendo así la siguiente matriz de confusión mostrada en la 6.7

Figura 6.7: Matriz de confusion

Ahora, hallaremos la tase de verdaderos negativos, falsos negativos, falsos positivos y verdaderos positivos.

Tasa de verdaderos positivos TPR


4
TPR = = 0.8
4+1
Tasa de verdaderos negativos TNR
3
TNR = = 0.6
3+2
Tasa de falsos negativos FNR
1
FNR = = 0.2
1+4
Tasa de falsos positivos FPR
2
FPR = = 0.4
2+3
Exactitud
3+4
AC = = 0.7
3+4+2+1
Error
Error = 1 − AC = 0.3
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 35

Figura 6.9: Método Holdout

Figura 6.8: Matriz de confusion

6.2. METODOS DE ENTRENAMIENTO


6.2.1. MÉTODO HOLDOUT
6.3. CURVA ROC (RECEIVER OPERATING CHARACTERISTIC)
La curva ROC (Figura?? ) es una gráca que representa la sensibilidad (TPR) frente a la tasa de falsos
positivos (FPR), y es usada para visualizar el desempeño de los clasicadores cuando tienen una distribución
binomial. De este modo, Cada punto de la curva ROC representa una combinación de TPR y FPR, y el espacio de
este punto representa el equilibrio entre la sensibilidad y la tasa de falsos positivos (equivalente a 1-especicidad),
pues un aumento en la sensibilidad va acompañado de una disminución en FPR.
En la gráca de la curva, la sensibilidad es representada por el eje `Y' y la tasa de falsos positivos por el eje
`X', sus coordenadas mínimas son (0,0) y las máximas son (1,1). Teniendo en cuenta lo anterior, se describirán
3 casos, (ver Figura6.10 ): El primero implica que si un clasicador posee una discriminación perfecta, con alta
sensibilidad y baja FPR, la curva de ROC pasa por la esquina superior izquierda. En el segundo caso si un
clasicador tiene igual distribución, con igual sensibilidad y FPR, la curva será una línea diagonal de 45° desde
la esquina inferior izquierda hasta la esquina superior derecha y dicho clasicador tendrá mal desempeño. El
caso tercero es cuando un clasicador tiene una alta FPR y baja sensibilidad, en este, la curva cae por debajo
de la línea diagonal de 45°, teniendo este clasicador un mal desempeño.
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 36

Figura 6.10: Casos de la curva ROC.

Con lo mencionado anteriormente, se puede concluir que al momento de elegir un clasicador, se debe tener
en cuenta que su curva ROC sea lo más cerca posible a la esquina izquierda superior de la gráca, pues si se
encuentra en este lugar es porque este clasicador cuenta con una alta sensibilidad y baja tasa de falsos positivos.

EJEMPLO DE LA CURVA ROC (RECEIVER OPERATING CHARACTERIS-


TIC)
Se desea clasicar 10 estaturas, 5 de ellas de hombre y 5 de mujer. La clasicación se hará por medio de
diferentes umbrales, que separan los datos en dos clases, de este modo si la estatura es menor al umbral estipulado,
será clasicada como de mujer, y si la estatura es mayor al umbral esta se clasicará como de hombre. Para
realizar la demostración se representaran con un `1' la clase de los hombres y con un '0' la clase de las mujeres.

También podría gustarte