0% encontró este documento útil (0 votos)
3 vistas58 páginas

Técnicas de Análisis Discriminante

El documento aborda técnicas de análisis discriminante, enfocándose en la clasificación supervisada y no supervisada, utilizando métodos como la distancia de Mahalanobis y la función lineal discriminante de Fisher. Se presentan ejemplos prácticos en contextos como la esclerosis múltiple y el cáncer de mama, ilustrando cómo estas técnicas ayudan a clasificar individuos en grupos basados en variables observadas. Además, se discuten aplicaciones en diversas disciplinas, incluyendo medicina, ingeniería y economía.

Cargado por

perezparkerjulia
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
3 vistas58 páginas

Técnicas de Análisis Discriminante

El documento aborda técnicas de análisis discriminante, enfocándose en la clasificación supervisada y no supervisada, utilizando métodos como la distancia de Mahalanobis y la función lineal discriminante de Fisher. Se presentan ejemplos prácticos en contextos como la esclerosis múltiple y el cáncer de mama, ilustrando cómo estas técnicas ayudan a clasificar individuos en grupos basados en variables observadas. Además, se discuten aplicaciones en diversas disciplinas, incluyendo medicina, ingeniería y economía.

Cargado por

perezparkerjulia
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

TEMA 2:

TÉCNICAS DE ANALISIS
DISCRIMINANTE

Clasificación supervisada
Reconocimiento de patrones

A
Ana J t l
Justel
1
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

Formas de evaluar la clasificación

Reglas óptimas

Clasificación incorporando información previa

Clasificación incorporando el coste de equivocarse

Clasificación con más de dos grupos

2
El p
problema de clasificación/asignación/agrupación
/ g / g p

Se trata de clasificar en dos o más grupos a individuos en los que


hemos observado varias variables.

CLASIFICACIÓN SUPERVISADA
SUPERVISADA: observamos previamente las
mismas variables en un conjunto de individuos que sabemos que
están bien clasificados en dos o mas grupos. Es el caso en el que
disponemos de una muestra de entrenamiento
entrenamiento.. CLASIFICACIÓN
NO SUPERVISADA
SUPERVISADA:
identificar grupos
Utilizaremos
de individuos con
La distancia de Mahalanobis características
L regla
La l de
d discriminación
di i i ió li
lineall d
de Fi h
Fisher comunes a partir de
la observación de
varias variables en
Varios objetivos cada uno de ellos
Clasificación de nuevos individuos
Entender que diferencia a los individuos de distintos grupos
Entender qué tienen en común los individuos de un grupo

3
El p
problema de clasificación/asignación/agrupación
/ g / g p

ENFOQUE DE MAHALANOBIS:
MAHALANOBIS Se calcula la distancia de las
observaciones que queremos clasificar al centro de los
grupos conocidos y se clasifica en el grupo más cercano.

Clasificación de nuevos individuos

ENFOQUE DE FISHER:
FISHER SeS trata
t t ded encontrar
t una buena
b
función discriminante que sea una combinación lineal de las
variables originales. Cuando aplicamos la función a un dato
nuevo nos dice a que grupo pertenece.

Clasificación de nuevos individuos


Entender que diferencia a los individuos de distintos grupos
Entender qué tienen en común los individuos de un grupo

4
Ejemplo: Esclerosis múltiple ([Link])

Dos grupos
con muestra
de
entrenamiento
de 29+69
d d
individuos en
los que se
observan cinco
variables

5
Ejemplo: Lirios ([Link])

En un estudio del estadístico y genetista Sir Ronald A. Fisher se


utilizaron cuatro características de los sépalos y pétalos para
id tifi
identificar 150 lirios
li i d de las
l especies
i iris
i i setosa,
t i i versicolor
iris i l e
iris virginica.

En este problema encontramos que hay tres grupos, lo que dificulta


la utilización del método de Fisher. Tendremos qque combinar dos
reglas para clasificar la especie de nuevos ejemplares de lirios
6
Ejemplo: Cáncer mama

En este cuadro se resumen los resultados de punción en un estudio


sobre el cáncer de mama. No
V10 Media Desv. típ. ponderados Ponderados
Sana V1 2 9640
2,9640 1 67266
1,67266 444 444 000
444,000
V2 1,3063 ,85566 444 444,000
¿Cuántos grupos hay? V3 1,4144 ,95703 444 444,000
V4 1,3468 ,91709 444 444,000
V5 2,1081 ,87711 444 444,000

¿Cómo es la muestra de V6
V7
1 3468
1,3468
2,0833
1 17785
1,17785
1,06230
444
444
444 000
444,000
444,000
entrenamiento? V8 1,2613 ,95461 444 444,000
V9 1,0653 ,50974 444 444,000
Enferma V1 7,1883 2,43791 239 239,000

¿Cuántas variables se V2
V3
6,5774
6,5607
2,72424
2,56910
239
239
239,000
239,000
han medido? V4 5,5858 3,19663 239 239,000
V5 5,3264 2,44309 239 239,000
V6 7,6276 3,11668 239 239,000
¿Qué diferencia a las mujeres V7 5,9749 2,28242 239 239,000
V8 5,8577 3,34888 239 239,000
sanas de las enfermas? V9 2,6025 2,56449 239 239,000
Total V1 4,4422 2,82076 683 683,000
V2 3,1508 3,06514 683 683,000
¿Usando esta información V3 3,2152 2,98858 683 683,000
V4
corremos el riesgo de
2,8302 2,86456 683 683,000
V5 3,2343 2,22309 683 683,000
equivocarnos en el V6
V7
3,5447
3,4451
3,64386
2,44970
683
683
683,000
683,000
diagnóstico? V8 2,8697 3,05267 683 683,000
V9 1,6032 1,73267 683 683,000

7
Ejemplo: Cáncer mama

Pruebas de igualdad
g de las medias de los grupos
g p

Lambda
de Wilks F gl1 gl2 Sig.
V1 ,489 711,423 1 681 ,000
V2 ,326 1406,132 1 681 ,000
V3 ,324 1417,644 1 681 ,000
V4 ,501 677,878 1 681 ,000
V5 ,523 622,158 1 681 ,000
V6 ,323 1426,240 1 681 ,000
V7 ,425 921,010 1 681 ,000
V8 ,484 727,471 1 681 ,000
V9 ,821 148,788 1 681 ,000

En todos los casos se rechaza la igualdad de medias ya que el p-valor


del test F (que es el test ANOVA) es bajo

8
Las técnicas de análisis discriminante tienen numerosas aplicaciones
y se ha utilizan mucho para abordar problemas interesantes y
complejos tanto en la biología como en otras disciplinas

Medicina: Detección precoz del cáncer

Ingeniería:
ge e a Reconocimiento
eco oc e to de voz
o

Informática: Clasificación de correo spam

Economía: Adjudicación de créditos bancarios

Literatura: Autoría
í de manuscritos de autores desconocidos

9
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

10
NOTACIÓN: Para cuando tenemos dos grupos, G1 y G2

n1 Número de datos en el grupo n2

Vector
V t de
d medias
di calculado
l l d
G1 solo con los datos del grupo G2

Matriz de varianzas-
S1 covarianzas calculada solo S2
con los datos del grupo
g p

es un nuevo dato que no sabemos a que


grupo pertenece

11
ENFOQUE DE MAHALANOBIS:
MAHALANOBIS Se calcula la distancia de las
observaciones que queremos clasificar a al los
centro de los de
vectores
grupos
mediasconocidos y se clasifica
de los grupos conocidos enyel
segrupo másencercano.
clasifica el grupo
más cercano.
Gráficamente:

12
ENFOQUE DE MAHALANOBIS:
MAHALANOBIS Se calcula la distancia de
Mahalanobis de las observaciones que queremos clasificar a
los vectores de medias de los grupos conocidos y se
clasifica en el g
grupo
p más cercano.
Gráficamente:
dM(x,x1)=dM(x,x2)

50% 50%
75%
75%
95%
95%

99% 99%

13
REGLA DE CLASIFICACIÓN utilizando la DISTANCIA DE
MAHALANOBIS: Clasificar al nuevo individuo x0 en el grupo 1 si
MAHALANOBIS

Gráficamente:
G1 dM(x,x1)=dM(x,x2)

G2

14
Con la DISTANCIA DE MAHALANOBIS la regla de clasificación
no siempre es una recta

G2

G1

G2
G2

15
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

16
ENFOQUE DE FISHER:
FISHER Se trata de encontrar una buena función
discriminante que sea una combinación lineal de las variables
originales. Cuando aplicamos la función a un dato nuevo nos dice a
que grupo pertenece.

Geométricamente: Se busca
Geométricamente:
una buena dirección sobre la
que proyectar los datos de los
grupos conocidos y de los que
queremos clasificar. Se
clasifica en función de qué
grupo está más cerca en esa
dirección

Una buena dirección tiene que:


─ Separar bien las medias
─ Teniendo en cuenta la variabilidad
El nuevo dato se clasifica dentro del grupo con la media más próxima
en la proyección

17
ENFOQUE DE FISHER con DOS GRUPOS y matrices de covarianzas
IGUALES
G S en los
l d dos ((Σ1=Σ2):
)

Buscamos una dirección de proyección: a1x1+…+apxp


que será una COMBINACIÓN LINEAL DE LAS VARIABLES originales.
Sabemos que al proyectar los datos tiene que ocurrir que sea
Máxima
Má i l variabilidad
la i bilid d ENTRE GRUPOS y ( a′x2 − a′x1 ) 2
Mínima la variabilidad DENTRO de los GRUPOS a′S wa
( a′x2 − a ′x1 ) 2
Todo junto consiste en resolver el problema: max
a ′S wa
Este problema tiene infinitas soluciones, todas proporcionales a
elegir el vector:
wˆ = S w−1 ( x2 − x1 ) Dirección
discriminante

El SPSS elige el vector canónico discriminante ω (la varianza de


la proyección es 1) ˆ = (ω ′( x2 − x1 ))ω
1). La relación entre ambos es: w

18
ENFOQUE DE FISHER con DOS GRUPOS y matrices de covarianzas
IGUALES
G S en los
l d dos ((Σ1=Σ2):
)

REGLA DE CLASIFICACIÓN:
CLASIFICACIÓN Clasificar al nuevo individuo x0 en el
grupo 1 si:
⎛ x1 + x2 ⎞
wˆ ′x0 < wˆ ′⎜ ⎟,
⎝ 2 ⎠
donde wˆ = S w−1 ( x2 − x1 )
y Sw es el estimador de la matriz de covarianzas
n1 − 1 n2 − 1
Sw = S1 + S2
n1 + n2 − 2 n1 + n2 − 2

El SPSS llama a S w la matriz intra-grupos combinada


Llamamos PUNTUACIÓN DISCRIMINANTE de un dato x0 a w ˆ ′x0 ,
que es la proyección de x0 sobre la dirección discriminante

19
ENFOQUE DE FISHER con DOS GRUPOS y matrices de covarianzas
IGUALES
G S en los
l d dos ((Σ1=Σ2):
)

La Regla de Fisher
gráficamente:
G2
G1

x1 + x2
2

⎛x +x ⎞
wˆ ′⎜ 1 2 ⎟
wˆ ′x0 ⎝ 2 ⎠

En este caso, la regla de clasificación de FISHER y de la DISTANCIA
DE MAHALANOBIS dan la MISMA CLASIFICACIÓN Ó
20
Ejemplo: Esclerosis múltiple ([Link])

Los vectores de medias son:

SANO:

ENFERMO:

21
Ejemplo: Esclerosis múltiple ([Link])

Las matrices de covarianzas son:

SANO:

ENFERMO:

22
Ejemplo: Esclerosis múltiple ([Link])

Matriz de varianzas dentro de los grupos:

23
Ejemplo: Esclerosis múltiple ([Link])

Vector ŵ :
wˆ = S w−1 ( x2 − x1 ) =

No aparece explícitamente en el SPSS pero podemos utilizar los


coeficientes de las funciones canónicas discriminantes:

Recordamos que: wˆ = (ω ′( x2 − x1 ))ω

Este término es una constante de centralización que


incluye el SPSS y que hay que tener en cuenta para
clasificar nuevos datos
24
Ejemplo: Esclerosis múltiple ([Link])

Regla de clasificación: clasificamos al individuo x como sano si

′ ′⎛ x1 + x2 ⎞
w x0 < w ⎜
ˆ ˆ ⎟ = 23,23
⎝ 2 ⎠

Fallos de
diagnóstico
25
Utilizando la salida del SPSS clasificamos al individuo x evaluando la
función canónica discriminante y comparando el valor que sale con
los centroides. Se clasificará en el grupo del centroide más cercano.

Ej
Ejemplo:
l Esclerosis
E l i múltiple
últi l ([Link])
( l i )

-9.834 - 0.01 x 18 + 0.015 x 152 – 0.093 x


1.6 + 0.037 x 198.4 + 0.112 x 0 = -0.542
Puntuación Discriminante

|(-0.542)-(-0.668)|= 0.126

|(-0.542)-(1.589)|= 2.131
Funciones discriminantes canónicas no tipificadas
Clasificamos en el primer grupo: evaluadas en las medias de los g
grupos
p
PACIENTE=0 (SANO)
26
Los coeficientes de las funciones canónicas nos informan de qué
variables son más importantes para discriminar,
discriminar pero hay que tener
cuidado cuando se trabaja con variables que tienen magnitudes o
unidades de medida distintas, los valores de los pesos no son
comparables y lo único “aprovechable” podría llegar a ser el signo.

Ejemplo: Esclerosis múltiple ([Link])

Coeficientes estandarizados de las


funciones discriminantes canónicas

Los coeficientes estandarizados sí permiten


comparar variables medidas en distintas
escalas. Coeficientes grandes en valor absoluto
indican alto poder discriminante

27
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

Formas de evaluar la clasificación

28
¿CÓMO EVALUAMOS SI LA REGLA DE CLASIFICACIÓN
ES BUENA?

La clasificación será buena si:


1. Aplicamos una buena regla
2. Las variables son buenas, separan claramente a los
individuos de los distintos grupos

G1
24 individuos de la
muestra de
entrenamiento quedan
G2
mal clasificados

29
¿CÓMO EVALUAMOS SI LA REGLA DE CLASIFICACIÓN
ES BUENA?

Tasa de error aparente: Se aplica la regla para clasificar todos


los datos de la muestra de entrenamiento y se cuentan los casos
en los
l que la
l clasificación
l ifi ió es errónea.
ó

Estima un error por debajo del real, es “optimista”. Se usa el


mismo conjunto de datos para construir la regla y para evaluarla.

30
Ejemplo: Esclerosis múltiple ([Link])

Con la muestra de entrenamiento hemos construido la regla de


clasificación y ahora comprobamos cuantos datos de la muestra
de entrenamiento se clasifican mal.

El 95,7% de los SANOS (PACIENTE=0) se clasifica correctamente, 66 de 69

El 75,9% de los ENFERMOS (PACIENTE=1) se clasifican correctamente, 22 de 29

Tasa de error aparente = (3+7) / 98 = 10


10,2%
2%

31
¿CÓMO EVALUAMOS SI LA REGLA DE CLASIFICACIÓN
ES BUENA?

Tasa sobre la frecuencia relativa de error: Se divide la muestra


de entrenamiento en dos partes, una que se usara para construir la
regla de clasificación y con la otra se calcula la tasa de error como
la p
proporción
p de estos datos qque están mal clasificados.
Esta tasa no la calcula el SPSS

Tasa de error por validación cruzada: Se lleva al extremo la


idea de la tasa sobre frecuencia relativa de error.

Dato a dato:

1. Se excluye el dato,
2. Se construyey la regla
g con los restantes y
3. Se clasifica el que hemos dejado fuera

Se estima la probabilidad de error con la proporción de veces que el


dato excluido se clasifica mal.
32
Ejemplo: Esclerosis múltiple ([Link])

Tasa de error aparente = (3+7) / 98 = 10,2%

Tasa de error por validación cruzada = (5+8) / 98 = 13,26%


13 26%

33
Ejemplo: Cáncer mama

Resultados del análisis discriminante lineal de Fisher para los datos


de punción en un estudio sobre el cáncer de mama.

Coeficientes estandarizados de las


funciones discriminantes canónicas

Función
1 Puntuaciones Discriminantes
V1 ,361 V10 = Sana V10 = Enferma
V2 ,220
100 30
V3 ,153
V4 ,096 80
25

V5 ,093 20
V6 ,542 60

V7 ,177 15

40
V8 ,,227 10

V9 ,009 20
5

M M
S S
0 N 0 N

-3 -2 -1 0 1 2 3 4 0 2 4 6

34
Ejemplo: Cáncer mama

35
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

Formas de evaluar la clasificación

Reglas óptimas

36
¿CUÁNDO UNA REGLA ES ÓPTIMA?

El método de clasificación de FISHER será óptimo, en el sentido


de que clasifica cometiendo el menor número de errores
posibles, cuando:

1. Las matrices de covarianzas sean iguales en los dos grupos

2. La distribución de los datos sea NORMAL

37
TEST de BOX

¿Es aceptable la hipótesis Σ1 = Σ2?


Se utiliza
tili a el test M de Bo
Box para contrastar
contrastar:
H0: Σ1 = Σ2 frente a H1: Σ1 = Σ2
R h
Rechazamos H0 cuando
d nos sale
l un p-valor
l (Sig.
(Si en SPSS) pequeño
ñ

Ejemplo:
j p Cáncer mama
Resultados de la prueba
M de Box 3556,503
F Aprox. 77 793
77,793
gl1 45
gl2 817173,6
Sig. ,000
Contrasta la hipótesis nula de que las matrices
de covarianza poblacionales son iguales.

Sig.
g ppequeño
q
Se rechaza la hipótesis nula
38
TEST de BOX

Cuando se rechaza la hipótesis nula H0: Σ1 = Σ2, una alternativa es


calcular la misma dirección discriminante asumiendo matrices
iguales pero calculando la distancia estandarizada de la
iguales,
puntuación discriminante del dato que queremos clasificar a los
centroides (puntuaciones discriminantes de los centros de los
grupos). En este caso se proyectan todos los datos y se estima la
varianza de las puntuaciones discriminantes dentro de cada grupo.

En SPSS tenemos que elegir

39
Ejemplo: Cáncer mama

Clasificación con SPSS usando matrices de


covarianzas: INTRA
INTRA--GRUPOS
Resultados de la clasificaciónb,c

Grupo de pertenencia
pronosticado
p
V10 Sana Enferma Total
Original Recuento Sana 436 8 444
Enferma 17 222 239
% Sana 98 2
98,2 18
1,8 100 0
100,0
Enferma 7,1 92,9 100,0
Validación cruzadaa Recuento Sana 436 8 444
Enferma 18 221 239
% Sana 98,2 1,8 100,0
Enferma 7,5 92,5 100,0
a. La validación cruzada sólo se aplica a los casos del análisis. En la
validación cruzada
cruzada, cada caso se clasifica mediante las funciones
derivadas a partir del resto de los casos.
b. Clasificados correctamente el 96,3% de los casos agrupados originales.
c. Clasificados correctamente el 96,2%
, de los casos agrupados
g p validados
mediante validación cruzada.

40
Ejemplo: Cáncer mama

Clasificación con SPSS usando matrices de


covarianzas: GRUPOS
G OS S
SEPARADOS
OS
Resultados de la clasificacióna

Grupo de pertenencia
pronosticado
V10 Sana Enferma Total
Original Recuento Sana 431 13 444
Enferma 6 233 239
% Sana 97,1 2,9 100,0
Enferma 2,5 97,5 100,0
a. Clasificados correctamente el 97,2% de los casos agrupados
originales.

41
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

Formas de evaluar la clasificación

Reglas óptimas

Clasificación incorporando información previa

42
Clasificación con INFORMACIÓN PREVIA
Cuando tenemos información previa sobre a qué grupo es más
probable que pertenezca un nuevo individuo que queremos clasificar,
la podemos incorporar en la regla de decisión.
La probabilidad a priori es la que creemos que
puede tener un individuo de pertenecer a un grupo
π1 es la probabilidad a priori para el grupo 1
π2 es la probabilidad a priori para el grupo 2

ENFOQUE DE FISHER con DOS GRUPOS NORMALES, matrices


de covarianzas IGUALES en los dos (Σ1=Σ2) y probabilidades A
PRIORI π1 y π2

REGLA DE CLASIFICACIÓN:
CLASIFICACIÓN Clasificar al nuevo individuo x0 en el
grupo 1 si:
i
⎛ x1 + x2 ⎞ π2
wˆ ′x0 < wˆ ′⎜ ⎟ − Ln
⎝ 2 ⎠ π1
43
Clasificación con INFORMACIÓN PREVIA

Gráficamente:
π1 = π 2
π1 > π 2
G2
G2
G1
G1

w

⎛x +x ⎞
wˆ ′⎜ 1 2 ⎟
⎝ 2 ⎠ ⎛x +x ⎞ π
wˆ ′⎜ 1 2 ⎟ − Ln 2
⎝ 2 ⎠ π1

44
Clasificación con INFORMACIÓN PREVIA

Ejemplo:

π 1 = 0,75
π 1 = 0,5 π 2 = 0,25
π 2 = 0,5

45
Clasificación con INFORMACIÓN PREVIA

Las probabilidades a priori que más se usan son:


9 Misma
Mi probabilidad
b bilid d d
de pertenecer a cada
d grupo: π 1 = π 2 = 0,5
9 Mayor probabilidad de pertenecer al grupo más numeroso:

n1 n2
π1 = π2 =
n1 + n2 n1 + n2
En SPSS tenemos que elegir

46
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

Formas de evaluar la clasificación

Reglas óptimas

Clasificación incorporando información previa

Clasificación incorporando el coste de equivocarse

47
Clasificación con INFORMACIÓN PREVIA y COSTES
Cuando el coste de equivocarnos no es simétrico entre los dos grupos,
los podemos incorporar en la regla de decisión.

c(2|1) es el coste de clasificar erróneamente en


el Grupo 2 a un individuo del Grupo 1
c(1|2) es el coste de clasificar erróneamente en
el Grupo 1 a un individuo del Grupo 2

ENFOQUE DE FISHER con DOS GRUPOS NORMALES, matrices


de covarianzas IGUALES en los dos (Σ1=Σ2), probabilidades A
PRIORI π1 y π2 y COSTES c(1|2) y c(2|1)

REGLA DE CLASIFICACIÓN:
CLASIFICACIÓN Clasificar al nuevo individuo x0 en el
grupo 1 si:
i
⎛ x1 + x2 ⎞ c(1 | 2)π 2
wˆ ′x0 < wˆ ′⎜ ⎟ − Ln
⎝ 2 ⎠ c( 2 | 1)π 1
48
Clasificación con INFORMACIÓN PREVIA

Ejemplo: π 1 = π 2 = 0,5

c(1 | 2) = 25
c(1 | 2) = c( 2 | 1) c( 2 | 1) = 75

49
Ejemplo: Esclerosis múltiple ([Link])
Los errores de diagnóstico suponen un gasto de:
1.000 euros si el paciente esta SANO y se clasifica como ENFERMO
10.000 euros si el p
paciente esta ENFERMO y se clasifica como SANO
Regla de Clasificación: clasificamos al individuo x como sano si
⎛x +x ⎞ c(1 | 2)π 2 10.000
wˆ ′x0 < wˆ ′⎜ 1 2 ⎟ − Ln = 23,23 − Ln = 20.93
⎝ 2 ⎠ c( 2 | 1)π 1 1.000
Sin
costes

Fallos de
diagnóstico
50
Técnicas de análisis discriminante

Motivación del problema

Regla de clasificación con la distancia de Mahalanobis

Función lineal discriminante de Fisher

Formas de evaluar la clasificación

Reglas óptimas

Clasificación incorporando información previa

Clasificación incorporando el coste de equivocarse

Clasificación con más de dos grupos

51
La regla de FISHER con MÁS DE DOS GRUPOS
La regla de Fisher se extiende al caso en el que queramos clasificar un
nuevo dato y haya tres grupos o más. El resultado que se obtiene es:

1. Tantas funciones de discriminación como grupos menos uno


2 Tantos centroides como grupos
2.
3. Los centroides tienen tantas coordenadas como grupos
menos uno
4 Las puntuaciones discriminantes tienen tantas coordenadas
4.
como grupos menos uno
5. Clasificamos en el grupo con el centroide más próximo a la
puntuación discriminante del nuevo dato (usando distancia
euclidea)

52
Ejemplo: Lirios ([Link])
En este problema
bl h
hay tres grupos, asíí que tendremos
d que combinar
b
dos reglas discriminantes para clasificar por especies a los nuevos
ejemplares de lirios

53
Ejemplo: Lirios ([Link]) Coeficientes estandarizados de las
funciones discriminantes canónicas

Puntuaciones en las funciones discriminantes canónicas

Setosa
Versicolor
Virgínica

54
Ejemplo: Lirios ([Link])

55
La distancia de Mahalanobis con MÁS DE DOS GRUPOS

Cuando hay más de dos grupos se procede igual, calculando la


DISTANCIA DE MAHALANOBIS a todos los vectores de
medias y clasificando en el grupo que dé un valor menor

56
ENFOQUE DE FISHER y DE MAHALANOBIS : Coinciden cuando las
matrices de covarianzas son iguales en los grupos

ENFOQUE DE FISHER:
FISHER
Funciona bien en general, es “robusto” cuando los datos no son
normales
Da una regla de clasificación que es una combinación lineal de las
variables originales, sirve para explicar las diferencias entre grupos
Es el que hace el SPSS y la mayoría del software estadístico

ENFOQUE DE MAHALANOBIS:
MAHALANOBIS
Funciona
F i bi
bien sólo
ól cuando
d los
l datos
d son normales,
l o parecidos
id
Tiende a fallar cuando hay muchas variables
Nos da una regla de clasificación, pero no sirve para explicar las
diferencias entre grupos
Cuando las matrices de covarianzas son distintas la frontera que
separa los grupos no tiene porque ser una recta

57
Otros métodos de clasificación

Clasificación por vecinos más cercanos

Arboles de clasificación y regresión (CART)

Discriminación logística

Modelización de las probabilidades a posteriori como


f
funciones de regresión
ó (redes neuronales, MARS,
métodos projection pursuit)

Generalizaciones del análisis discriminante lineal (FDA,


PDA)

‘Support Vector Machines’, …

58

También podría gustarte