Machine Learning
Machine Learning
CLASIFICADORES SUPERVISADOS
En este ejemplo, se puede ver los diferentes resultados de la clasicación del elemento desconocido para
distintos número de K vecinos, de este modo si K =1 o si K =2 el elemento desconocidos es asignado a la
clase de los triángulos, y si K=5 el elemento es asignado a la clase de las estrellas.
Para medir las distancias entre los datos, existen diferentes métricas, a continuación se mostrara el modelo
matemático general de algunas de ellas:
v
u n q
uX 2 2 2
D= t (ai − bi ) = (a1 − b1 ) + (a2 − b2 ) + · · · + (an − bn )2 (1.1)
i=1
1
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 2
Ejemplo:
q
2 2
D ([(ai , a2 ) , (b1 , b2 )]) = (a1 − b1 ) + (a2 − b2 )
p
D= (2 − 7)2 + (2 − 6)2
p
D = (−5)2 + (−4)2
√
D = 25 + 16
D = 6.4
Figura 1.2: Distancia Euclidiana en-
tre dos puntos.
v
u n
uX T
D = t (A − B) (A − B) (1.2)
i=1
n
X
D= |ai − bi | + |a2 − b2 | + · · · + |an − bn | (1.3)
i=1
Ejemplo:
La distancia entre los puntos a(2, 2) y b(7, 6) mostrada en la Figura 1.3 se calcula así:
D = |2 − 7| + |2 − 6|
D =5+4
D=9
Figura 1.3: Distancia Manhattan (city
Block) entre dos puntos.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 3
Ejemplo:
D=5
s 2 2 2
a 1 − b1 a2 − b2 an − bn
D= + + ··· + (1.5)
σ1 σ2 σn
Ejemplo:
s 2 2
a1 − b1 a2 − b2
D ([(a1 , a2 ) , (b1 , b2 )]) = +
σ1 σ2
El primer paso sera calcular la desviación estándar σ1 y σ2 utilizando la ecuación
v
u n
u 1 X 2
σ=t (xi − x) (1.6)
n − 1 i=1
r
1 h 2 2
i
σ1 = (7 − 4.5) + (2 − 4.5)
2−1
√
σ1 = 12.5 = 3.54
r
1 h 2 2
i
σ2 = (6 − 4) + (2 − 4)
2−1
√
σ2 = 8 = 2.83
Luego se calcula la distancia
s 2 2
2−7 2−6
D ([(a1 , a2 ) , (b1 , b2 )]) = +
3.54 2.83
s 2 2
−5 −4
D= +
3.54 2.83
√
D = 2+2=2
Para medir la distancia Mahalanobis entre vectores se utiliza la siguiente ecuación:
v
u n
uX T
D=t (A − B) S −1 (A − B) (1.7)
i=1
Donde S es una matriz diagonal cuyos elementos en la diagonal son la desviación estándar.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 5
1 55 35 Zorro
2 53 34 Zorro
3 52 33 Zorro
4 51 32 Zorro
5 85 70 Lobo
6 84 69 Lobo
7 83 68 Lobo
8 82 67 Lobo
9 60 50 Perro
10 59 49 Perro
11 58 48 Perro
12 57 47 Perro
Cuadro 1.1: Base de datos de largo y ancho de la huella de perro, lobo y Zorro.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 6
Para la clasicación se tomó K = 3 y se utilizó la métrica Euclidiana para medir la distancia entre las
muestras y los datos a clasicar, los cuales tienen un valor de largo 50 y ancho 60. En la Tabla1.2 se muestra
los resultados de la medición de las distancias entre la base de datos y los datos a clasicar, además se pueden
ver resaltados los 3 valores más cercanos a los datos a estimar.
1 55 35 25,50 Zorro
2 53 34 26,18 Zorro
3 52 33 27,08 Zorro
4 51 32 28,02 Zorro
5 85 70 36,41 Lobo
6 84 69 35,18 Lobo
7 83 68 33,96 Lobo
8 82 67 32,76 Lobo
9 60 50 14,15 Perro
10 59 49 14,22 Perro
11 58 48 14,43 Perro
12 57 47 14,77 Perro
Estimar 50 60
Cuadro 1.2: Distancia Euclidiana entre la base de datos y los datos a clasicar.
CAPÍTULO 1. CLASIFICADORES SUPERVISADOS 7
Figura 1.9: Estimación gráca en diferentes tipos de huellas caninas, distancia más cercana.
Capítulo 2
Las máquinas de soporte vectorial, (Support Vector Machines, SVMs) son un conjunto de algoritmos de
aprendizaje supervisado desarrollados por Vladimir Vapnik y su equipo en los laboratorios AT&T. Son diversos
los campos en los que han sido utilizadas con éxito, tales como visión articial, reconocimiento de caracteres,
caracterización de texto e hipertexto, clasicación de proteínas, procesamiento de lenguaje natural, análisis de
series temporales. De hecho, desde su introducción, han ido ganando un merecido reconocimiento gracias a sus
sólidos fundamentos teóricos.
Cada punto de entrenamiento N xiϵℜ pertenece a alguna de dos clases y se le ha dado una etiqueta ϵ {−1, 1} i
y para i = 1, · · · , l. En la mayoría de los casos, la búsqueda de un hyperplano adecuado en un espacio de entrada
es demasiado restrictivo para ser de uso práctico. Una solución a esta situación es mapear el espacio de entrada
en un espacio de características de una dimensión mayor y buscar el hyperplano óptimo allí. Sea z = ϕ (x) la
notación del correspondiente vector en el espacio de características con un mapeo ϕ de ℜN a un espacio de
características Z. Deseamos encontrar el hyperplano
8
CAPÍTULO 2. MÁQUINAS DE SOPORTE VECTORIAL (SUPPORT VECTOR MACHINES, SVMS) 9
wz+b=0
Denido por el par (w, b), tal que podamos separar el punto xi de acuerdo a la función
(
1 yi = 1
f (xi ) = sign (w · z + b) = (2.1)
−1 yi = −1
Donde wϵzi y bϵℜ. Más precisamente, el conjunto S se dice que es linealmente separable si existe (w b) tal
que las in-ecuaciones
(
(w · z + b) ≥ 1, yi = 1
i = 1, · · · , l
(w · zi + b) ≤ −1 yi = −1
Sean válidas para todos los elementos del conjunto S . Para el caso linealmente separable de S, podemos encon-
trar un único hyperplano óptimo, para el cual, el margen entre las proyecciones de los puntos de entrenamiento
de dos diferentes clases es maximizado
Para tratar con datos que no son linealmente separables, el análisis previo puede ser generalizado introdu-
ciendo algunas variables no-negativas el problema del hyperplano óptimo es entonces re-denido como la solución
al problema
( l
)
1 X
min w·w+C ξi (2.2)
2 i=1
s.a yi (w · z + b) ≥ 1 − ξi , i = 1, · · · , l
ξi ≥ 0, i = 1, · · · , l
Donde C es una constante. El parámetro C puede ser denido como un parámetro de regularización. Este es
el único parámetro libre de ser ajustado en la formulación de la SVM. El ajuste de éste parámetro puede hacer
un balance entre la maximización del margen y la violación a la clasicación.
CAPÍTULO 2. MÁQUINAS DE SOPORTE VECTORIAL (SUPPORT VECTOR MACHINES, SVMS) 10
Buscando el hyperplano óptimo es un problema QP, que puede ser resuelto construyendo un Lagrangiano y
transformándolo en el dual.
l l l
X 1 XX
M ax W (a) = αi − αi αj yi yj zi · zj
i=1
2 i=1 j=1
l
X
s.a yi αi = 0, 0 ≤ αi ≤ C, i = 1, · · · , l
i=1
l
X
W = αi yi zi (2.3)
i=1
l
!
X
f (x) = singn (w · z + b) = singn αi yi zi · z + b (2.4)
i=1
Figura 2.4: Idea del uso de un kernel para transformación del espacio de los datos.
Las Funciones que satisfacen el teorema de Mercer pueden ser usadas como productos punto y por ende
pueden ser usadas como kernels. Podemos usar el kernel polinomial de grado d
d
K (xi , xj ) = (1 + xi · xj ) (2.5)
Para construir un clasicador SVM. Entonces el hyperplano no lineal de separación puede ser encontrado
como la solución de
l l
X 1 XX
M ax W (α) = αi − αi αj yi yj K (xi , xj) (2.6)
2 i=1 j=1
l
X
s.a yi αi = 0, 0 ≤ αi ≤ C, i = 1, · · · , l
i=1
l
!
X
f (x) = singn (w · z + b) = singn αi yi K (xi , xj ) + b
i=1
EJEMPLO DE APLICACIÓN
Capítulo 3
CLASIFICADOR BAYESIANO
Un clasicador de Bayes asume que la presencia o ausencia de una característica particular no está relacionada
con la presencia o ausencia de cualquier otra característica, dada la clase variable. Por ejemplo, una fruta puede
ser considerada como una manzana si es roja, redonda y de alrededor de 7 cm de diámetro. Un clasicador de
Bayes considera que cada una de estas características contribuye de manera independiente a la probabilidad de
que esta fruta sea una manzana, independientemente de la presencia o ausencia de las otras características. Una
ventaja del clasicador de Bayes es que solo se requiere una pequeña cantidad de datos de entrenamiento para
estimar los parámetros (las medias y las varianzas de las variables) necesarias para la clasicación. Como las
variables independientes se asumen, solo es necesario determinar las varianzas de las variables de cada clase y
no toda la matriz de covarianza
P (D | h) P (h)
P (h/D) = (3.1)
P (D)
Donde:
12
CAPÍTULO 3. CLASIFICADOR BAYESIANO 13
c. Se calculan los coecientes de las funciones discriminantes para cada una de las n clases:
l−1
1X
Wi = (3.2)
2 i
−l
X
Wi = µi
i
−l
1 tX 1 X
Wio = µi µi − ln + ln P (ϖi )
2 i
2 i
Los coecientes de las funciones discriminantes, son calculados para cada una de las n clases, con una base
de datos de entrenamiento, previamente denidas.
e. Los valores de características seleccionadas y pertenecientes a la base de datos de validación son evaluados
sobre cada una de las n funciones discriminantes de probabilidad generadas (Ecuación 8). Se supone que
la muestra evaluada, pertenece a aquella clase cuya función de probabilidad genera el máximo valor.
f. Los resultados obtenidos en el numeral anterior son comparados con una etiqueta previamente establecida,
la cual indica el valor real de la clase, a la que pertenece la muestra. Como resultado de la anterior
comparación se dene el porcentaje de aciertos y errores que el sistema proporciona en la identicación,
de las clases a las cuales pertenece la muestra.
CAPÍTULO 3. CLASIFICADOR BAYESIANO 14
¾Qué probabilidad hay de que sea un perro si el largo de su cuerpo es de 120 cm?
20
P (P erro) = = 0.5
40
1
P (L = 120/P erro) = = 0.05
20
CAPÍTULO 3. CLASIFICADOR BAYESIANO 15
Según el teorema de probabilidad de Bayes se multiplica la probabilidad de que sean perros por la proba-
bilidad de los datos que corresponden a 120 cm
20
P (Lobo) = = 0.5
40
2
P (L = 120/Lobo) = = 0.1
20
P (Lobo/L = 120) = 0.5 ∗ 0.1 = 0.05
En conclusión la probabilidad que sea un perro es de 2.5 % y de que sea un lobo de 5 %.
Figura 3.2: Gráca de mediciones en lobos y perros, tomando como alto el eje Y.
20
P (P erro) = = 0.5
40
Solo 5 de 20 datos corresponde a datos de perros en el histograma con 66 cm
5
P (A = 66/P erro) = = 0.25
20
Según el teorema de probabilidad de Bayes se multiplica la probabilidad de que sean perros por la proba-
bilidad de los datos que corresponden a 66 cm
20
P (Lobo) = = 0.5
40
3
P (A = 66/Lobo) = = 0.15
20
P (Lobo/A = 66) = 0.5 ∗ 0.15 = 0.075
En conclusión la probabilidad que sea un perro es de 12.5 % y de que sea un lobo de 7.5 %.
CAPÍTULO 3. CLASIFICADOR BAYESIANO 16
REDES NEURONALES
Las redes neuronales son más que otra forma de emular ciertas características propias de los humanos,
como la capacidad de memorizar y de asociar hechos. Si se examinan con atención aquellos problemas que no
pueden expresarse a través de un algoritmo, se observará que todos ellos tienen una característica en común: la
experiencia. El hombre es capaz de resolver estas situaciones acudiendo a la experiencia acumulada.
1949 - Donald Hebb. Fue el primero en explicar los procesos del aprendizaje (que es el elemento básico de
la inteligencia humana) desde un punto de vista Psicológico.
1950 - Karl Lashley. En sus series de ensayos, encontró que la información no era almacenada en forma
centralizada en el cerebro sino que era distribuida encima de él.
1956 - Congreso de Dartmouth. Este Congreso frecuentemente se menciona para indicar el nacimiento de
la inteligencia articial.
1957 - Frank Rosenblatt. Comenzó el desarrollo del Perceptron. Esta es la red neuronal más antigua;
utilizándose hoy en día para aplicación como identicador de patrones.
1960 - Bernard Widro/Marcian Ho. Desarrollaron la primer red neuronal aplicada (ADAptative LINear
Elements).
1969 - Marvin Minsky/Seymour Papert. Se produjo la muerte abrupta de las Redes Neuronales; probaron
matemáticamente que el Perceptron no era capaz de resolver problemas relativamente fáciles, tales como
el aprendizaje de una función no-lineal.
1985 - John Hopeld. Provocó el renacimiento de las redes neuronales con su libro: Computación neuronal
de decisiones en problemas de optimización.
Auto-organización. Una red neuronal puede crear su propia organización o representación de la información
que recibe mediante una etapa de aprendizaje.
Tolerancia a fallos. La destrucción parcial de una red conduce a una degradación de su estructura; sin
embargo, algunas capacidades de la red se pueden retener.
17
CAPÍTULO 4. REDES NEURONALES 18
Operación en tiempo real. Los cómputos neuronales pueden ser realizados en paralelo; para esto se diseñan
y fabrican máquinas con hardware especial para obtener esta capacidad.
Fácil inserción dentro de la tecnología existente. Se pueden obtener chips especializados para redes neuro-
nales que mejoran su capacidad en ciertas tareas.
Figura 4.2: Cuatro modelos matemáticos para ser interpretados por algoritmos
CAPÍTULO 4. REDES NEURONALES 19
S = x0 ω0 + x1 ω1 + · · · xn ωn + b
2. Se calcula la salida S
Pn
S= i=0 xi ωi + b
3. Se evalúa la salida S en la función umbral f
O = f (s)
4. Se estima el Error como la diferencia entre el valor esperado T la salida O. Si este es próximo a cero para
todas las salidas, entonces se toman estos pesos ωi y termina el calculo
E =T −O
5. Se determina el factor de ajuste A.
A=δ×E
6. Se reajustanωi lo pesos nuevamente y se vuelve a el paso 2.
ω0+ = ω0 + x0 × A0
ω1+ = ω1 + x1 × A1
.
.
.
ωn+ = ωn + xn × An
ÁRBOL DE DECISIONES
El árbol decisión es uno de los métodos más usados para llevar a cabo inferencias inductivas, por tanto son
utilizados en sistemas de clasicación donde se cuenta con una serie de juicios para obtener una sola respuesta,
tales como el diagnostico de casos médicos, o en sistemas de bancos que desarrollan la evaluación de clientes
solicitantes de préstamos, entre otros. Un árbol de decisión se compone de una raíz, nodos y ramas como se
muestra en la Figura5.1 . Las ramas se representan con líneas y descienden de los nodos, los cuales representan
una posible decisión, y la raíz es el nodo principal, por el cual se empieza a desplegar las ramas y los demás
nodos.
Para realizar una clasicación a través de un árbol de decisión, se emplea el algoritmo ID3, el cual construye
el árbol comenzando en la raíz y luego va desplegando nodos y ramas hacia abajo, para lo cual realiza una
evaluación estadística de cada atributo de entrenamiento, y así poder determinar cuál es el mejor candidato del
nodo a crear, proceso que se repite hasta tener todos los datos de entrenamiento dentro del árbol de decisión.
Dicha evaluación estadística consiste en la medición de la ganancia de información. Antes de explicar en que
consiste la ganancia de información, se debe denir que es la entropía, la cual caracteriza la impureza de una
colección arbitraria de datos y mide la cantidad de información que lleva una señal, su cálculo se realiza utilizando
la siguiente formula:
Donde:
Para entender como se calcula la entropía de una colección de datos, suponga que se desea calcular la entropía
de la colección de datos S, la cual posee 14 elementos, 9 de ellos positivos y 5 de ellos negativos, por consiguiente
se hacen los siguientes cálculos:
22
CAPÍTULO 5. ÁRBOL DE DECISIONES 23
9 9 5 5
entropia ([9+, 5−]) = − log2 − log2
14 14 14 14
Es importante reasaltar que el caso de entropia mencionado anteriormente es uno en donde la clasicación
es booleana, es decir con solo dos opciones (positivo y negativo), sin embargo puede existir una clasicación con
n numero de clases, en la cual la entropia esta denida de la siguiente manera
n
X
entropı́a (S) = −pi log2 pi (5.2)
i=1
Donde
Atributos
X
Gain (S) = entropı́a (S) − pi (Sv ) entropı́a (Sv ) (5.3)
i=1
Donde
S: Es el grupo principal.
Por ejemplo, se tiene una colección de datos S con 14 elementos, 9 de ellos positivos y 5 de ellos negativos. De
estos 14 elementos, suponga que 6 de los datos positivos y 2 de los datos negativos son de la clase `w', los demás
elementos de la colección pertenecen a la clase `T'. La ganancia de información debido a la división de los datos
en las clases `W' y `T', de la colección de datos S es calculada así.
S = [9+, 5−]
Sw ← [6+, 2−]
ST ← [3+, 3−]
Atributos
X
Gain (S) = entropı́a (S) − pi (Sv ) entropı́ai (Sv )
i=1
Gain (S) = entropı́a (S) − p (Sw ) entropı́aw (Sw ) − p (ST ) entropı́aT (ST )
Primero se debe calcular las entropías y luego ya calcular la ganancia de información:
9 9 5 5
entropı́a (S) = − log2 − log2 = 0, 94
14 14 14 14
6 6 2 2
entropı́a (W ) = − log2 − log2 = 0, 811
8 8 8 8
3 3 3 3
entropı́a (T ) = − log2 − log2 =1
6 6 6 6
8 6
Gain (S) = 0, 94 − (0, 811) − (1)
14 14
ATRIBUTO GANANCIA
Pronostico 0,2467
Temperatura 0,0292
Humedad 0,1518
Viento 0,0481
Como se puede ver en la Tabla5.6, donde se encuentra las ganancias de información de cada atributo, la
ganancia más alta equivale al atributo `pronostico', por tanto este atributo será el nodo raíz del árbol de decisión
y las ramas debajo de este serán sus posibles opciones, es decir, soleado, nublado y lluvioso, ver Figura5.3 .
De este modo, tenemos 3 nuevos nodos a analizar calculándoles las ganancias de información y así seguir
dividiendo el árbol. El primero que se le hallaran las ganancias será el nodo `soleado' de la siguiente manera:
1. Se hallará la entropía del nodo soleado como se muestra en la Tabla5.7 y luego se hallarán las ganancias
para cada atributo como se muestra en las Tablas
SOLEADO
SI NO TOTAL ENTROPÍA
2 3 5 0,9710
Cuadro 5.8: Calculo Ganancia de información para el atributo TEMPERATURA para el nodo soleado.
Cuadro 5.9: Calculo Ganancia de información para el atributo HUMEDAD para el nodo soleado.
Cuadro 5.10: Cálculo Ganancia de información para el atributo VIENTO para el nodo soleado.
ATRIBUTO GANANCIA
Temperatura 0,571
Humedad 0,971
Viento 0,02
Como se observa en la tabla 16, donde se encuentra las ganancias de información de cada atributo para el
nodo soleado, la ganancia más alta equivale al atributo `humedad', por tanto este atributo será el siguiente nodo
debajo del nodo soleado, y las ramas debajo de este serán sus posibles opciones, es decir, alta y normal, ver
Figura 5.4
CAPÍTULO 5. ÁRBOL DE DECISIONES 28
Si se mira el árbol de decisión de la Figura 5.4, se puede ver que la opción `normal' del nodo `humedad' solo
lleva a un solo resultado que es positivo, por ende su entropía en nula y por tanto ya no hay más división en esta
rama, esto ocurre igualmente para en la opción `alto' y para el nodo `nublado'. Analizados los nodos de `soleado'
y `nublado', se seguirá examinando el nodo llamado `lluvioso', y como se hizo con los anteriores, se empezará
por calcular la entropía de este (Tabla 5.12) y luego las ganancias para cada atributo (Tabla5.13 )
LLUVIOSO
SI NO TOTAL ENTROPÍA
3 2 5 0,9710
Cuadro 5.13: Calculo Ganancia de información para el atributo TEMPERATURA para el nodo lluvioso.
CAPÍTULO 5. ÁRBOL DE DECISIONES 29
Cuadro 5.14: . Calculo Ganancia de información para el atributo HUMEDAD para el nodo lluvioso
Cuadro 5.15: . Cálculo Ganancia de información para el atributo VIENTO para el nodo lluvioso.
ATRIBUTO GANANCIA
Temperatura 0,020
Humedad 0,020
Viento 0,971
Si se mira la Tabla 5.16, donde se encuentra las ganancias de información de cada atributo para el nodo
`lluvia', la ganancia más alta equivale al atributo `viento', por tanto este atributo será el siguiente nodo debajo
del nodo nombrado `lluvioso', y las ramas debajo de este serán sus posibles opciones, es decir, fuerte y débil, ver
Figura 5.5.
CAPÍTULO 5. ÁRBOL DE DECISIONES 30
Como se puede ver en la Figura 5.5, las opciones fuerte y débil del nodo `viento' solo conllevan a una sola
respuesta, por ende sus entropías son nulas y la división del árbol para. De este modo, el árbol de
entrenamiento queda listo para futuras predicción, como por ejemplo, en caso que se deseara saber si en las
mañanas de los días sábados con los pronósticos de tiempo estipulados en la
La evaluación de los clasicadores cumple un papel importante dentro de cualquier proceso de minería
de datos, pues permite demostrar de forma cuantitativa que tan eciente es la clasicación realizada por el
método elegido. La evaluación más usada es la prueba de validez, la cual permite medir el grado en que los
resultados de una prueba corresponden realmente a aquello que se está midiendo, y para la visualización de
estos resultados, se utiliza la matriz de confusión. Matriz de confusión: Esta matriz es también llamada matriz
de error o de contingencia (Figura6.1 ), y es una herramienta utilizada para mostrar el nivel de acierto entre las
clases asignadas por el clasicador con respecto a una muestra de prueba no entrada. La matriz de confusión
tiene un tamaño de NxN, donde N es el número de clases asignado al clasicador.
Para la construcción de esta matriz, se bebe tener en cuenta que es y cómo se calcula la especicidad, sensi-
bilidad y exactitud.
Sensibilidad (TPR): también llamada tasa de verdaderos positivos, es la proporción de casos positivos que
fueron clasicados correctamente como positivos, en ingles estos casos son llamados `true positive' (TP).Para
calcular la sensibilidad se utiliza la siguiente formula:
TP
TPR = (6.1)
TP + FN
Donde:
T P R: Tasa de verdaderos positivos, (true positive rate)
T P : Casos de verdaderos positivos, (true positive)
F N : Casos de falsos negativos, (false negative).
Especicidad (TNR): También denominada tasa de negativos positivos, es la proporción de casos negativos
31
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 32
que fueron clasicados correctamente como negativos, en ingles estos casos son llamados `true negative' (TN).
La especicidad se calcula de la siguiente manera:
TN
TNR = (6.2)
TN + FT
Donde:
T N R: Tasa de verdaderos negativoss, (true negative rate)
T N : Casos de negativos positivos, (negative positive)
F P : Casos de falsos positivos, (false positive)
Otras medidas que se pueden obtener a través de la matriz de confusión son, la tasa de los falsos negativos
y la tasa de los falsos positivos.
Tasa de los falsos negativos (FNR): Es la proporción de casos positivos que fueron clasicados incorrectamente
como negativos, estos casos en ingles son denominados como `false negative' (FN). La fórmula para hallar esta
tasa es:
FN
FNR = (6.3)
FN + TP
Donde:
F N R: Tasa de falsos negativos, (false negative rata)
T P : Casos de verdaderos positivos, (true positive)
F P : Casos de falsos positivos, (false positive)
Tasa de los falsos positivos (FPR): Es la proporción de casos negativos que fueron clasicados incorrectamente
como positivos, estos casos en ingles son denominados como `false positive' (FN). La fórmula para hallar esta
tasa es:
FP
FPR = (6.4)
FP + TN
Donde:
F P R: Tasa de falsos positivos, (false positive rata)
T N : Casos de negativos positivos, (negative positive)
F P : Casos de falsos positivos, (false positive)
TP + TN
AC = (6.5)
TP + TN + FP + FN
Donde:
AC : exactitud, (accuracy)
T N : Casos de negativos positivos, (negative positive)
F P : Casos de falsos positivos, (false positive)
T P : Casos de verdaderos positivos, (true positive)
F N : Casos de falsos negativos, (false negative).
Error: Es la proporción total de predicciones incorrectas Positivas y Negativas. Un valor pequeño (cercano a
0) indica un buen clasicador.
True Negative.
False Negative.
False Positive
True Positive
CAPÍTULO 6. EVALUACIÓN DEL CLASIFICADOR 34
Ahora, hallaremos la tase de verdaderos negativos, falsos negativos, falsos positivos y verdaderos positivos.
Con lo mencionado anteriormente, se puede concluir que al momento de elegir un clasicador, se debe tener
en cuenta que su curva ROC sea lo más cerca posible a la esquina izquierda superior de la gráca, pues si se
encuentra en este lugar es porque este clasicador cuenta con una alta sensibilidad y baja tasa de falsos positivos.