0% encontró este documento útil (0 votos)
0 vistas23 páginas

Disc Rile Bart

El análisis factorial discriminante es una técnica estadística utilizada para clasificar individuos en clases predefinidas basándose en variables numéricas o nominales. Este método, que se originó en los trabajos de Fisher y Mahalanobis, busca maximizar la varianza entre clases mientras minimiza la varianza dentro de las clases. Se aplica en diversos campos como el diagnóstico médico, el control de calidad y el reconocimiento de patrones.

Cargado por

lpardov
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
0 vistas23 páginas

Disc Rile Bart

El análisis factorial discriminante es una técnica estadística utilizada para clasificar individuos en clases predefinidas basándose en variables numéricas o nominales. Este método, que se originó en los trabajos de Fisher y Mahalanobis, busca maximizar la varianza entre clases mientras minimiza la varianza dentro de las clases. Se aplica en diversos campos como el diagnóstico médico, el control de calidad y el reconocimiento de patrones.

Cargado por

lpardov
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Lebart [Link]. Statisquique exploratoire multimensionnnelle.

(Traducción provisional) 3-1


3 Relación con los métodos explicativos usuales, métodos derivados.

Análisis factorial discriminante

Se designa bajo el nombre de análisis discriminante a una familia de técnicas destinadas a


clasificar (afectar a clases preexistentes) individuos caracterizados por un cierto número de
variables numéricas o nominales.
El origen de este método se remonta a los trabajos de Fisher (1936) o, de manera menos
directa, a aquella de Mahalanobis (1936). Esta es una de las técnicas de análisis
multidimensional más utilizadas en la práctica (puntajes de crédito, diagnóstico automático,
control de calidad, previsión de riegos, reconocimiento de formas).
El análisis factorial discriminante o análisis lineal discriminante, es un método tanto
descriptivo como predictivo, que está ligado, como los métodos factoriales presentados en el
capítulo 1, al cálculo de ejes principales. Se le puede considerar como una extensión de de
la regresión múltiple en el caso en que la variable a explicar es nominal y constituye la
variable de partición. Estas dos técnicas se constituyen además en casos particulares del
análisis canónico (cf. Sección 3.1).
No se presentan todas las técnicas del análisis discriminante que están ligadas a una literatura
tan extendida como la de la regresión y el modelo lineal. Se sugiere al lector consultar las
obras específicas sobre el tema, concretamente la obra de Tomassone et al. (1988) y las
obras editadas por Celeux (1990) (discriminación a partir de variables continuas) y Celeux y
Nakache (1994) (discriminación a partir de variables cualitativas)1.

3.3.1 Formulación del problema y notaciones


Se dispone de n individuos u observaciones descritas por un conjunto de p variables (x1,
x2,...,xp) y repartidos en q clases definidas a priori por una variable y nominal con q
categorías2.
En análisis discriminante se propone, en una primera instancia, separar lo mejor a las q clases
con la ayuda de las p variables explicativas. En una segunda instancia, busca resolver el
problema de afectación de individuos nuevos, caracterizados por las p variables, a ciertas
clases ya identificadas sobre la muestra de n individuos (llamada muestra de aprendizaje).

1
Señalamos en la literatura de lengua inglesa a la obra de síntesis (con más de 1200 referencias) de
McLachlan (1992) y los artículos, igualmente de síntesis, de Lachenbruch y Goldstein (1979), de
Gnanadesikan (1989); entre los manuales clásicos generalistas que tratan el análisis discriminante,
Anderson (1958, 2da Ed. 1984), Cacoullos (1973), Krishnaiah y Kanal (1982), entre los manuales más
especializados, Goldstein y Dillon (1978), Hand (1981). En el dominio de los métodos estadísticos de
reconocimiento de formas, de nuevo la obra precitada de McLachlan, las obras de base son Fukunaga (1972),
Duda y Hart (1973), Devijver y Kittler (1982). Agravala (1977) contienen las reimpreiones de referencias
histótocas.
2
En este capítulo el vector y tiene sus componentes enteros que corresponden a los números de las clases, y
Y designa a la tabla disyuntiva de oreden (n,q) correspondiente.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-2
3 Relación con los métodos explicativos usuales, métodos derivados.

Se distinguen, en consecuencia, dos procedimientos sucesivos, de orden descriptivo y luego


decisional:
- buscar las funciones lineales discriminantes sobre la muestra de aprendizaje de
tamaño n que son las combinaciones lineales de las variables explicativas (x1, x2,...,xp)
dando los valores que separan mejor a las q clases.
- Conocer la clase de afectación de n’ individuos nuevos descritos por las variables
explicativas (x1, x2,...,xp). Se trata aquí de un problema de asignación a las clases
preexistentes, en oposición al problema de clasificación (tratado en el capítulo 2) que
consiste en construir clases lo más homogéneas posible en una muestra.

x, x, x1, x2,...,xp
n observaciones 1
(muestra de Funciones 1
aprendizaje) X discriminantes k
q

n’observaciones
(suplementarias) afectación ?

Figura 3.3-1 Principio del análisis discriminante.

Para fijar ideas considérese una tabla de datos (200, 30) que contiene, para 200 enfermos,
los valores de p=30 variables resultados de análisis biológicos y de exámenes clínicos.
Adicionalmente existe una partición de estos 200 enfermos en q=3 categorías de
diagnósticos realizados a partir de intervenciones mucho más costosas que las 30 medidas
precedentes. Aparece la siguiente pregunta: teniendo datos para pacientes suplementarios
(cantidad n’) sobre los que se realizan los 30 análisis y exámenes, se pueden prever sus
categorías de diagnóstico?. La pregunta respondida aquí tiene una connotación paráctica1:
las numerosas medidas pero fáciles de tomar pueden contener una información sobre un
fenómeno o un estado más difícil de identificar?.
Sea la tabla de datos X con n filas (individuos u observaciones) y p columnas (variables), de
termino general xij. Los n individuos están particionados en q clases. Cada clase k caracteriza
a una subnube Ik de nk individuos i, con:
q

∑n
k =1
k =n

1
Los ejemplos más clásicos del análisis discriminante aparecen sin duda en el dominio médico (ayuda al
diagnóstico, ayuda a una decisión en materia de intervención) pero numerosas aplicaciones se desarrollan en
el dominio de puntaje bancario (previsión de un eventual incumplimiento de un deudor), en el control de
calidad (previsión de la calidad de un producto en agroindustria a partir de medidas externas) y sobre todo
del reconocimiento de formas (reconocimiento de caracteres manuscritos o de imágenes de radar, etc).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-3
3 Relación con los métodos explicativos usuales, métodos derivados.

Sea x kj la media de la variable xj en la clase k. Esta es la j-ésima coordenada del centro de


gravedad Gk de la subnube Ik. Esta es la j-ésima coordenada del centro de gravedad Gk de la
subnube Ik:
q
1
x kj =
nk
∑x
i∈I k
ij = G kj

I3 I1
G3 × G ×
× G1

G2
×

I2
Figura 3.3.2 Representación de la nube de individuos particionados.

La media de la variable xj sobre el conjunto de individuos que corresponden a la j-ésima


coordenada del centro de gravedad de los individuos y es:
q
1 n n
xj = ∑
n i =1
x ij = ∑ k x kj = G j
k =1 n

3.3.2 Funciones lineales discriminantes


El análisis factorial discrimínate consiste en buscar las combinaciones lineales de p variables
explicativas (x1, x2,...,xp), generalmente continuas, que permitirán separar lo mejor posible a
las q clases.
La primera combinación lineal será aquella en la cual la varianza entre las clases (inter-
clases) sea máxima, con el objeto de resaltar las diferencias entre las clases, y donde la
varianza al interior de las clases (intra-clases) sea mínima para que la extensión de las clases
esté delimitada. Luego, entre las combinaciones lineales no correlacionadas con la primera,
se buscará aquella que discrimine mejor las clases, etc. Estas combinaciones lineales serán
las funciones lineales discriminantes.
Designamos por a(i) el valor, para el individuo i, de una combinación lineal a de p variables
previamente centradas:

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-4
3 Relación con los métodos explicativos usuales, métodos derivados.

p
a (i ) = ∑ a j ( xij − x j )
j =1

La varianza var(a) de la nueva variable sintética a(i) será, ya que a(i) está centrada:
2
1 n  p 
var (a) = ∑ a (i ) = ∑ ∑ a j (xij − x j )
1 n 2
n i =1 n i =1  j =1 
Intercambiando las sumatorias y denominando:

∑ (xij − x j )(xij ' − x j ' ) = cov(x j , x j ' )


1 n
t jj ' =
n i =1
La varianza de la combinación lineal de las variables a se puede escribir:

var (a) = ∑ ∑ a j a j ' cov(x j , x j ' ) = a' Ta


p p

j =1 j ' =1

donde a designa al vector en donde las p componentes son a1, a2,..., ap y T la matriz de
covarianzas de las p variables, de término general tjj’.
Se va a mostrar que la varianza de a se descompone en varianza intra-clases y en varianza
inter-clases, que aquí corresponde a una descomposición análoga de la matriz de covarianzas
T.

a - Descomposición de la matriz de covarianzas


La covarianza total entre dos variables xj y xj’ se escribe:

cov(x j , x j ' ) = ∑ (xij − x j )(xij ' − x j ' ) = t jj'


1 n
n i =1
Al igual que en el análisis de varianza, se va a descomponer la cov(xj,xj’) en la suma de
covarianzas intra-clases (al interior de las clases) y covarianzas inter-clases (entre las
clases).
Para ello se parte de la identidad, para i,j,k:
(x ij − x j ) = (xij − x kj ) + (x kj − x j )

La suma entre paréntesis en la formula de covarianzas se descompone entonces en cuatro


términos, dos de los cuales son nulos. En efecto por definición de x kj :

∑ (x
i∈I k
ij − x kj )(x kj ' − x j ' ) = (x kj ' − x j ' )∑ (xij − x kj ) = 0
i∈I k

De manera análoga, la suma siguiente se anula:

∑ (x
i∈I k
kj − x j )(xij ' − x kj ' ) = 0

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-5
3 Relación con los métodos explicativos usuales, métodos derivados.

El resto de la fórmula, llamada fórmula de descomposición de Huygens (o ecuación del


análisis de varianza):
t jj ' = d jj ' + e jj '

con:

∑ ∑ (x ij − x kj )(xij ' − x kj ' )


1 q
d jj ' =
n k =1 i∈I k

∑ (x − x j )(x kj ' − x j´' )


q
nk
e jj ' = ∑ kj
k =1 n i∈I k

Estas p2 relaciones se notan en forma matricial1:


T = D+E [3.2-1]
Así, la varianza de una combinación lineal a de variables se descompone a partir de la
relación [3.3-1] en varianza interna y varianza externa:
a’Ta = a’Da + a’Ea [3.3-2]
Recordemos que, entre todas las combinaciones lineales de las variables, se deben buscar
aquellas que den una varianza intra-clases mínima y una varianza inter-clases máxima. En
proyección sobre el eje discriminante a, cada subnube debe estar, en la medida de lo posible,
tanto bien reagrupada como bien separada de las otras subnubes.
Se requiere entonces buscar a tal que el cociente a’Ea/aDa’ se máximo (o a’Da/a’Ea
mínimo).
Como consecuencia de la relación [3.3-2] es equivalente minimizar a’Ta/a’Ea o buscar el
máximo de f(a) tal que:
f(a) = a’Ea/aTa’

b - Cálculo de funciones lineales discriminantes


La función f(a) a maximizar es la relación de la varianza inter-clases a la varianza total. Esta
función es homogénea de grado 0 en a (invariante si se cambia a por ξa, donde ξ es un
escalar cualquiera), es equivalente buscar el máximo de la forma cuadrática a’Ea con la
restricción cuadrática a’Ta = 1.
Esto conduce a la relación1:

1
La matriz de covarianzas total T se descompone en una matriz de inercia intraclases D (en las clases) y en
una matriz de inter-clases E (entre clases).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-6
3 Relación con los métodos explicativos usuales, métodos derivados.

Ea = λTa [3-.3-3]
Como la matriz de covarianza T es invertible, se obtiene:
T-1E a = λa
- a es el vector propio de T-1E asociado al valor propio λ más grande.
Premultiplicando los dos miembros de [3.3-3] por el vector a’ se constata que a’Ea, el
máximo buscado, no es otro que λ.
El valor propio más grande λ, cociente de la varianza externa de la función discriminante
sobre la varianza total, es inferior a 1 según la relación [3.3-1]. Se llamará algunas veces
poder discriminante de la función a.
Notas:
Encontrar el máximo del cociente b’Eb/b’Db las combinaciones lineales discriminantes b
será entonces los vectores propios de la matriz D-1E donde la matriz D-1 define la métrica de
Mahalanobis. El valor propio µ correspondiente, solución de D-1Eb=µb está relacionado
con por la fórmula:
µ = λ/(1-λ)
Se tiene evidentemente µ ≥ λ, ya que la varianza interna es siempre inferior a la varianza
total.
El vector b es como a solución de la ecuación [3.3-3] pero debe respetar la restricción
b’Db=1.
Los vectores a y b están ligados por la relación2:
a= ( 1 − λ )b
c - Diagonalización de una matriz simétrica
La matriz T-1E no es simétrica. Pero es posible recurrir a la diagonalización de una matriz
(q,q) simétrica. (Recordemos que p es el número de variables y q el número de clases, que
cumplen en la mayoría de aplicaciones q < p).
En efecto la matriz E, de término general:

∑ (x − x j )(x kj ' − x j´' )


q
nk
e jj ' = ∑ kj
k =1 n i∈I k

1
Como en análisis general (sección 1.1) o en análisis canónico (sección 3.1), estas sumas conducen a anular
el vector de derivadas parciales del lagrangiano L =a’Ea-λ(a’Ta-1) con respecto a a, de donde resulta la
relación 2Ea – 2λTa = 0, de donde finalmente Ea = λTa.
2
Haciendo a = ξb, las dos relaciones a’Ea=λ y b’Eb =µ conducen a la relación ξ2b’Eb = λ, de donde:
ξ µ=λ y ξ=√(1-λ)
2

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-7
3 Relación con los métodos explicativos usuales, métodos derivados.

es el producto de una matriz C de p filas y q columnas por su transpuesta; esta matriz C


tiene por término general:

c jk =
nk
(x kj − x j )
n
Con la descomposición E = CC’, la relación [3.3-3] se escribe:
CC’a = λTa
Llegando a:
a = T-1Cw
esta relación se escribe entonces:
CC’T-1Cw = λCw
Es claro que todo vector propio w relativo a un valor propio (diferente de 0) de la matriz
simétrica CC’T-1C de orden (q,q) verifica igualmente [3-3-6].
El vector a y el escalar λ verifican entonces la relación [3.3-3]. En la practica se efectúa la
diagonalización de esta matriz simétrica1, después se deduce a a partir de la transformación
[3.3-5].

3.3.3 Caso de dos clases: equivalencia con la regresión múltiple

3.3.4 Relación con otros métodos


El análisis factorial discriminante es un caso particular del análisis canónico cuando uno de
los dos conjuntos de variables está formado por las indicadoras de una partición. Cuando
los dos conjuntos están formados de variables indicadoras, se llega al análisis de
correspondencias, que es un doble análisis discriminante (cf. también 3.1.3). También se
puede presentar el método como un análisis en ejes principales de la nube de puntos medios
en una métrica particular.

a - El análisis canónico
Como en el análisis de correspondencias múltiples, la variable nominal con q clases será
representada por un código disyuntivo completo. Se construye entonces una matriz Y con n
filas y q columnas de término general yik de valor 1 si el individuo i pertenece a la clase k y 0
si no. Dicho de otra forma se agregan a las variables iniciales X variables artificiales Y que
indican la pertenencia a las diversas clases.

1
Además esta matriz simétrica de orden (q,q) será en general notablemente más pequeña que la matriz no
simétrica T-1E de orden (p,p).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-8
3 Relación con los métodos explicativos usuales, métodos derivados.

p q
j k

X Y
n
xi1, xi2,……...,xip 00010

Figura 3.3 – 3 Tabla de datos [X,Y]


Las p columnas de las variables observadas de las subtablas X serán centradas y notadas X̂ .
Se tienen:
xˆ ij = x ij − x j

Nótese que a diferencia con el análisis canónico, las columnas de Y no están centradas: la
suma de los elementos de su k-ésima columna vale nk.
El análisis canónico de la tabla [ X̂ ,Y] conduce a buscar el vector propio a de la matriz N
(fórmula [3.1 – 4] de 3.1.2.a):
N = ( X̂ ´ X̂ )-1 X̂ Y(Y’Y)-1Y´ X̂
Explicitemos los diferentes elementos de la matriz N teniendo en cuenta la naturaleza
particular de las columnas de Y:
1 ˆ ˆ
- la matriz X' X es la matriz de covarianzas empíricas denominada antes como T.
n
- Las matriz D = Y’Y es diagonal y su k-ésimo elemento diagonal vale nk, frecuencia
de la k-ésima clase1.
- La matriz de p filas y q columnas H = X̂ ’Y tiene por termino general:

h jk = ∑ xˆ ij y ik = ∑ (x ij − x j )y ik = ∑ (xij − x j ) = n k (x kj − x j )
n n

i =1 i =1 i∈I k

En virtud de la relación [3.3-4], se puede escribir


h jk = nnk c jk

o sea:
ˆ ' Y = nC(Y' Y )1 / 2
H=X

n
1
En efecto se tiene la relación ∑y
i =1
ik y ik ' = δ kk ' n k cuando el individuo i pertenece a la clase k o a la clase
k’; δkk’=1 si k=k’ y vale 0 si no. Para k=k’, habrá términos no nulos en la suma de los individuos en la
clase k.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-9
3 Relación con los métodos explicativos usuales, métodos derivados.

Estos dos últimos hechos permiten escribir:


ˆ ' Y(Y' Y )−1 Y' X
X ˆ = nCC' = nE

Puesto que:

(Xˆ ' Xˆ )
−1
=
1 −1
n
T

La matriz N queda finalmente N = T-1E y el vector a buscado verifica bien la relación [3.3-
3]:
Ea = λTa
Se puede igualmente notar que se tienen para los dos tipos de análisis, la misma restricción
de normalización:
a’Ta = 1
Hay entonces coincidencia entre la variable canónica y la función discriminante. El análisis
discriminante aparece entonces como un caso particular del análisis canónico (sin centrado
previo de las variables indicadoras) cuando uno de los dos conjuntos está constituido de
vectores booleanos que describen la partición del conjunto de los individuos.

b - El análisis de correspondencias
Cuando la tabla subtabla X describe también una partición en p clases, los resultados del
parágrafo precedente muestran inmediatamente que el análisis de correspondencias es un
caso particular del análisis factorial discrimínante.
p q
k k'

X Y
n
01000 00010

Figura 3.3-4 Tabla de datos [X,Y]


Las dos subtablas X de orden (n,p) y Y de orden (n,q) de la matriz de datos [X,Y] están
formadas de las variables indicadoras y juegan papeles análogos. En este caso las matrices
X’X y Y’Y son diagonales y tienen en el k-ésimo elemento las frecuencias de la clase k de
cada una de las particiones; la matriz X’Y es la tabla de contingencia de orden (p,q) que
cruza las dos particiones Px y Py.
Conforme a las convenciones adoptadas en el análisis de correspondencias, se notará:1

1
n es aquí la frecuencia total que se ha denominado k en la sección 1.3.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-10
3 Relación con los métodos explicativos usuales, métodos derivados.

– f k., el k-ésimo elemento diagonal de la matriz 1/nX’X (=Dp), (k ≤ p)


– f.k’, el k-ésimo elemento diagonal de la matriz 1/nY’Y (=Dq), (k’ ≤ q)
– f kk’, elemento genérico de la matriz 1/nX’Y (=F), de orden (p,q)
Recordemos las fórmulas establecidas en el parágrafo 3.1.2 para las variables canónicas:
a = (X' X ) X' Yb y b = (Y' Y ) Y' Xa
−1 −1

Sus componentes se escriben:


q p
1 f kk ' 1 f kk '
ak =
λ
∑ k ' =1 f k⋅
bk ' y bk ' =
λ
∑ k =1 f k '⋅
ak

En esta forma se reconocen las relaciones baricéntricas el análisis de correspondencias [1.3 –


12] y [1.3 – 13] relativas a las coordenadas factoriales de las dos nubes de puntos sobre el
mismo eje factorial.
Esta identidad permite establecer que un análisis de correspondencias es un análisis canónico
particular en donde X y Y contienen las matrices indicadoras de dos particiones2.
Los subespacios VX y VY tienen ahora en común la primer bicectriz1 de Rn su ángulo más
pequeño es entonces nulo.
Sus cosenos (=1) es el primer valor propio trivial ya encontrado en análisis de
correspondencias cuando el análisis se efectúa con respecto al origen y no con respecto al
centro de gravedad.
Se tiene entonces λ =1, ai=1 y bi=1, para todo i y j en las relaciones escritas arriba. El
efecto de centrar la tabla X se manifiesta como la proyección de los puntos columna sobre el
subespacio perpendicular a la primera bisectriz.
Esta operación no modifica entonces a las variables canónicas no triviales.
El análisis de correspondencias aparece como un doble análisis discriminante donde cada
uno de los bloques en [X,Y] describe una partición sin que ninguna de las dos esté
privilegiada. Las funciones lineales discriminantes coinciden con los factores del análisis de
correspondencias2 de la tabla de contingencia de orden (p,q) que cruza las dos particiones.

2
La primera raíz canónica λ2 es homologada al primer valor propio notado λ precedentemente para el
análisis de correspondencias.
1
La suma de las columnas de X y la suma de las columnas de Y constituyen el vector que tiene todas las
componentes iguales a 1.
2
Esta presentación permite mostrar directamente que los valores propios del análisis de correspondencias,
que son los coeficientes de la correlación canónica (o de los poderes discriminantes) son inferiores o iguales
a 1. Se podrán interpretar los valores propios del análisis de correspondencias en termino del poder
discrimínate de los factores (ejes factoriales) con respecto las particiones estudiadas.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-11
3 Relación con los métodos explicativos usuales, métodos derivados.

c - Un análisis en ejes principales con una métrica particular


El análisis factorial discriminante se puede considerar como un análisis general de la nube de
q centros de gravedad de las clases k dotadas de masas nk/n y con la métrica T-1 o la métrica
D-1 denominada de Mahalanobis.
El número de ejes discriminantes es igual a q-1 en el caso de n>p>q.
Es suficiente en efecto volver al parágrafo 3.3.2.c precedente donde interviene por primera
vez la tabla C de medias centradas.
El análisis general de la tabla C con la métrica T-1, según los resultados del parágrafo 1.1.6.a
del capítulo 1 (análisis general con una métrica cualquiera: aquí X = C, M=T-1 y N=I)
conduce, para encontrar el eje factorial u, a la relación:
C’CT-1u = λu
Siendo T-1u = a, donde a es el factor (operador proyección) correspondiente al eje factorial
u:
C’Ca = λTa
-1
Del mismo modo con la métrica D , se obtiene:
C’Ca = λDa
Seleccionar la métrica D-1 para analizar la nube de puntos medios, es considerar como
equidistantes del centro j (por ejemplo) de zonas equiprobables (en el sentido de las
elipsoides de densidad) de la ecuación:
(x − x )' D (x − x ) = constante
j
−1
j

Gracias esta métrica, la distancia se interpreta en términos “semejanza de pertenencia”.


En la figura 3.5-5, se representan tres clases con las mismas elipsoides de densidad (ecuación
anterior, D es la métrica de covarianzas interna común a cada grupo), los puntos A y B son
equidistantes (según la métrica D-1) del centro de la clase G1.

B
A G3
×

I1 × I3
G1

G2
×

I2

Figura 3.3 – 5 Ilustración de la métrica D-1.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-12
3 Relación con los métodos explicativos usuales, métodos derivados.

Con la métrica euclidiana usual, B será afectada a la clase 3 en lugar de la clase 1. Se ve


entonces el interés de hacer intervenir esta métrica en el análisis de los centros1. Se
retomará este asunto en el parágrafo siguiente sobre las reglas de afectación.

3.3.5 Principios de las reglas de afectación (o de clasificación)


Una vez encontradas las funciones discriminantes que separan mejor a los individuos
repartidos en q clases, se debe encontrar la clase de afectación de un nuevo individuo, para
el que se conocen los valores de las variables (x1, x2,...,xp).
Una regla geométrica simple de afectación es seleccionar la clase cuyo centro de gravedad es
el más próximo al punto-individuo. La métrica que se utiliza generalmente en las
aplicaciones más corrientes es la global de Mahalanobis (D-1), o local (Dk-1, donde Dk es la
matriz de covarianzas interna del grupo Ik).
Este proceder puramente geométrico no tiene en cuenta las probabilidades a priori de las
diferentes clases, que pueden ser muy diferentes en ciertas aplicaciones (prevision de
quiebra, por ejemplo, o diagnóstico de un evento raro). El modelo bayesiano de afectación
permite enriquecer este punto de vista.

a - El modelo bayesiano de afectación


En el momento del aprendizaje, sabemos que el individuo i pertenece a un grupo Ik
(pertenencia codificada por el valor: yi=k) y calculamos una estimación de la probabilidad
P(xi | Ik), es decir la probabilidad de xi conociendo que se realiza Ik.
Al momento de la afectación de un individuo nuevo notado x, se pueden calcular los
diferentes P(x | Ik) para k=1,2,…,q. Parece razonable afectar x a la clase para la que P(x | Ik)
es máximo.
Sin embargo no son las probabilidades P(x | Ik) las que se conocen sino P(Ik |x) , es decir la
probabilidad del grupo Ik dado que se realiza x.
El teorema de Bayes1 permite invertir las probabilidades, expresando P(Ik |x) en función de
P(x | Ik) , P( Ik) y P(x ):
P( x I k ) P( I k )
P ( I k x) =
P(x )
P(Ik) es la probabilidad a-priori del grupo k. P(x ) se expresa en función de P(x | Ik) y de P(
Ik) ; obteniéndose la formulación clásica del teorema de Bayes:

1
Es claro que esta métrica tiene en cuenta una cierta anisotropia (orientación preferencial) de la densidad.
Solo tiene sentido entonces si los elipsoides de densidad son los mismos al interior de cada clase. Esto es
precisamente lo que caracteriza al análisis discriminante lineal, en oposición al análisis discriminante
cuadrático, que permite densidades de formas diferentes, y entonces métricas diferentes para cada clase.
1
Para una exposición del enfoque bayesiano que tiene un cuadro conceptual específico en la teoría de la
estimación y la decisión estadística, ver Robert (1992).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-13
3 Relación con los métodos explicativos usuales, métodos derivados.

P (x I k ) P ( I k )
P ( I k x) = q

∑ P (x I
k =1
k ) P( I k )

El denominador es el mismo para todas las clases. La clase de afectación de x será aquella
para la cual el producto P(x I k ) P( I k ) es máximo. Si las probabilidades a priori P( Ik) son
iguales para todos los valores de k, las clasificaciones según P(Ik |x) y P(x | Ik) son idénticas.
Para validar la eficacia de las reglas de afectación, se miden los errores de clasificación por
los métodos de remuestreo, específicamente mediante la validación cruzada o el bootstrap
(cf. §4.2.2). Al igual que en el caso del modelo lineal, la selección de variables explicativas
es una operación delicada. El estudio de la estabilidad de funciones discriminantes es difícil.
Las reglas de afectación así como la estimación de las tasas de error de clasificación
dependen a menudo del tamaño de la muestra de aprendizaje.

b - El modelo bayesiano en el caso normal


Notemos con fK(x) a la densidad de probabilidad de x conociendo Ik en el caso multinormal,
µk y Σk son la media y la matriz de covarianzas teóricas, respectivamente al interior del
grupo k:
1  1 
f k ( x) = p
exp− (x − µ k ) ′Σ k−1 (x − µ k )
(2π ) 2
Σk
1
2  2 

que preferimos escribir:


−p − 12  1 
f k ( x) = 2π ) 2
Σk exp− (x − µ k ) ′Σ k−1 (x − µ k )
 2 
La afectación se hará según la regla:
escoger k̂ tal que f kˆ (x ) P( I kˆ ) = max{ f k ( x) P( I k )}
k ≤q

que es equivalente a minimizar sobre k la función sc k (x) llamada puntaje discriminante (sc
= score discriminant):
sc k ( x) = ( x − µ k ) ′Σ k−1 (x − µ k ) + log Σ k − 2 log[P ( I k )] [3.3 – 7]

En el caso en que se suponga que las distribuciones en cada clase tengan la misma matriz de
covarianzas (caso ilustrado por la figura 3.3 – 5), la densidad se escribe:
−p − 12  1 
f k ( x) = 2π ) 2
Σ exp − (x − µ k ) ′Σ −1 ( x − µ k )
 2 

Es suficiente entonces tener como puntaje discriminante:

sc k (x) = (x − µ k ) ′Σ −1 ( x − µ k ) − 2 log[P( I k )] [3.3 – 8]

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-14
3 Relación con los métodos explicativos usuales, métodos derivados.

Si además las probabilidades a priori son iguales, el puntaje discriminante coincide con la
distancia de Mahalanobis:

sc k (x) = (x − µ k ) ′Σ −1 (x − µ k ) [3.3 – 9]

y la regla bayesiana de afectación se convierte en la búsqueda de los centros más próximos


según esta distancia.
El puntaje discriminante dado por la fórmula [3.3 – 7] corresponde al análisis discriminante
cuadrático. Las divisiones interclases dadas por la ecuación sc k ( x) = sc k ' (x), (k ≠ k '), son en
efecto hipercuadráticas.
Los puntajes discriminantes dados por las fórmulas [3.3 – 8] o [3.3 – 9] corresponden al
análisis discriminante lineal. En la ecuación sc k ( x) = sc k ' (x), (k ≠ k ') , los términos de
segundo grado en x desaparecen y las divisiones interclases son en este caso hiperplanos.
Estos hiperplanos son de la forma:
x' Σ −1 (µ k ' − µ k ) = constante
Notemos que el cálculo supone conocidos los parámetros teóricos µk y Σk.

En la práctica se sugiere sustituir estos parámetros por las estimaciones empíricas. Esta
sustitución es igualmente justificada por el enfoque descriptivo desarrollado antes de esta
sección, en la que la distancia de Mahalanobis aparece de manera natural, al buscar el
máximo del cociente de la varianza externa sobre la varianza interna, sin recurrir a la
hipótesis de normalidad.
Los puntajes discriminantes utilizados en la práctica, cuando la hipótesis de normalidad es
plausible, son entonces los presentados aquí con la utilización de los estimadores empíricos
de los parámetros.

c - Otras reglas de afectación

d - Calidad de las reglas de clasificación

La validación cruzada
La medida de la calidad de una discriminación se hace a partir de los porcentajes de bien
clasificados (o de mal clasificados) en cada clase y del porcentaje global de bien clasificados.
Esta medida puede incluir, en ciertas aplicaciones, los costos de mala clasificación.
Se puede calcular un porcentaje de bien clasificados sobre la muestra de aprendizaje, lo que
dará una idea optimista de la calidad de la discriminación. Este porcentaje de bien
clasificados aumenta con el número de parámetros del modelo, y puede ser excelente si el
número de parámetros es considerable, hecho que no asegura que el modelo permitirá

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-15
3 Relación con los métodos explicativos usuales, métodos derivados.

realizar un a predicción correcta. El porcentaje de mal clasificados en estas condiciones se


llama la tasa de error aparente y también la tasa de error por resustitución.
El método de muestras de prueba1 recomienda efectuar la discriminación sobre una parte de
la muestra de aprendizaje (digamos el 80%) y probar las reglas de discriminación sobre el
20% no utilizado.
Se puede mejorar el calculo de las tasas de error dividiendo la muestra de aprendizaje en m
partes iguales, calculando la regla sobre una muestra parcial formada por m-1 partes, y las
tasas de error sobre la parte restante, lo que se puede hacer de m maneras diferentes. Esto
permite calcular una tasa de error media sobre una muestra tan importante como la muestra
de aprendizaje.
Entre más próximo esté m de n, más se aproxima a la situación real de clasificación. La
validación cruzada2 corresponde al caso m=n, es decir, al caso en que se efectúan n
discriminaciones excluyendo cada vez una observación. Este método es evidentemente
costoso en cálculo pero se puede siempre tener algoritmos que evitan repetición de cálculos
complejos de funciones discriminantes3.
La minimización de tasas de error mediante validación cruzada se puede utilizar como
criterio para calcular los parámetros de ciertos modelos de discriminación.

3.3.6 Regularización en análisis discriminante

b – Análisis regularizado mediante ejes principales


Desde el punto de vista numérico, la diagonalización es una operación más segura que la
inversión de matrices. La teoría de la perturbación2 nos muestra que la estabilidad de los
vectores propios es una función creciente entre las diferencias de valores propios
consecutivos. En este contexto, es necesario eliminar las dimensiones correspondientes a los
valores propios nulos y se pueden también eliminar las dimensiones correspondientes a los
valores propios pequeños, que son muy sensibles a las perturbaciones de la tabla de datos1.

1
El origen de ésta práctica se puede deber a Higheyman (1962), pero probablemente fue utilizada
anteriormente, ya que sus principios gozan de buen sentido. Ha sido exaltada notablemente por Romeder
(1973).
2
Atribuida a Lachenbruch y Mickey, 1968, este método (cross-validation) se ha utilizado desde 1964 por los
investigadores rusos, según Toussaint (1974). Sus propiedades han sido estudiadas por Stone (1974) y
Geisser (1975). Hand (1986) realizó una revisión.
3
Cf.,por ejemplo, Celeux (1990) para el caso de funciones lineales discriminantes.
2
Cf. por ejemplo: Wilkinson (1965); Kato (1966) y los trabajos de Escofier y Leroux (1972) que utilizan los
resultados de estas teorías en análisis factorial.
1
Cf. los trabajos de Wold (1976). Benzécri (1977a) recomienda que los análisis discriminantes se realicen
sobre los ejes de un análisis factorial previo.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-16
3 Relación con los métodos explicativos usuales, métodos derivados.

3.3.7 Discriminación sobre variables nominales


El análisis factorial discriminante que acabamos de presentar se aplica a un conjunto de n
individuos repartidos en q clases definidas a priori mediante la variable nominal y, y descritas
por p (x1, x2,...,xp) variables continuas. Cuando las variables explicativas son nominales, el
cálculo de funciones lineales discriminantes no se puede aplicar debido a las singularidades
de la matriz X, pero la regularización utilizando ejes principales permitirá solucionar ésta
dificultades.

a – Análisis factorial discriminante cualitativo


Como para todo tratamiento de variables nominales, se utiliza el código disyuntivo completo
de las p variables explicativas. El análisis factorial discriminante cualitativo consiste entonces
en un análisis factorial discriminante clásico sobre las indicadoras de las variables
explicativas.
La matriz de variables explicativas X = [X1,X2,…,Xp] no es invertible porque existen p
relaciones lineales entre las columnas de la tabla disyuntiva completa. Se puede entonces,
como en análisis de varianza, suprimir una categoría de cada variable nominal lo que no
modifica el es espacio de las variables explicativas VX. Esto no es suficiente para asegurar
que la matriz reducida esté bien acondicionada.
La regularización mediante ejes principales permite en este caso realizar un análisis
discriminante clásico sobre los factores del análisis de correspondencias múltiples2.
Se procede entonces a efectuar:
- un análisis de correspondencias sobre la tabla disyuntiva completa; las p variables
nominales se reemplazan por h variables continuas que son los h factores del análisis
de correspondencias múltiples;
- un análisis discriminante sobre las h variables continuas cuyos valores son las
coordenadas sobre los ejes factoriales del análisis de correspondencias múltiples.
Teniendo en cuenta que el número de factores del análisis factorial múltiple es generalmente
grande, se retendrán los factores más discriminantes y que no figuran siempre entre los
primeros1.

b – Análisis discriminante baricéntrico


El análisis discriminante baricéntrico consiste simplemente en hacer el análisis de
correspondencias de la tabla que cruza la variable a explicar y con las variables explicativas

2
Encadenamiento conocido en particular con el nombre de método DISQUAL (Saporta 1977).
1
Lo que es aceptable para el análisis discriminante cualitativo y, como veremos, para el análisis discrimínate
baricéntrico, se aconseja a proceder previamente haciendo una primera selección de variables nominales
explicativas cruzando por ejemplo cada una de ellas con la partición a explicar y, y calculando las χ2
correspondiente, y guardando aquellas que correspondan a los χ2 más significativos.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-17
3 Relación con los métodos explicativos usuales, métodos derivados.

(x1, x2,...,xp) (apilamiento de tablas de contingencia): las filas son las categorías de y y las
columnas corresponden a la yuxtaposición de las categorías de (x1, x2,...,xp).
Se trata, en efecto, de la banda de la tabla de Burt que permite describir las relaciones
existentes entre la variable a explicar y el conjunto de variables explicatrivas (cf. §1.4.7.b;
Saporta 1975a; Leclerc 1976).
Colocando como elementos suplementarios a la nube de individuos caracterizados por las
variables explicativas, se realiza una reafectación similar a la del análisis discriminante (cf.
Nakache et al. 1977).
Cuando las variables son independientes dos a dos, el análisis discriminante baricéntrico es
equivalente al análisis factorial discriminante cualitativo (ya que el análisis de una banda de la
tabla de Buró es entonces equivalente al análisis de la tabla completa). En el caso general, el
es en teoría, menos apropiado porque, como se ha visto en §1.4.7.b, no tiene en cuenta las
relaciones entre las variables explicativas. Se utiliza, sin embargo, ampliamente en razón a su
simplicidad y robustez (cf. Carlier, en: Celeux y Nakache 1994).

c – Nota sobre el “scoring”


Frecuentemente utilizado por los organismos bancarios buscando prevenir la quiebra
eventual de un cliente (individuo o empresa), el método llamado de “scoring” permite una
puesta en forma simple de un análisis discriminante generalmente en dos grupos. El no es
propiamente hablando un método de discriminación sobre variables nominales, pero utiliza
los resultados de análisis discriminantes sobre variables nominales o continuas para construir
una función de puntaje1. Se dispone así de un instrumento accesible para afectar un
individuo en un grupo.
En el caso de dos grupos, se obtiene una sola función discriminante: la combinación lineal de
las variables que separa mejor a los dos grupos de individuos. Un individuo se afecta a uno
de los grupos si la función toma para el un valor superior a cierto umbral.
Esta función discriminante se transforma luego en un sistema equivalente de coeficientes
atribuidos a las categorías de las variables nominales o a las variables continuas
eventualmente (en general luego de una selección severa). Esta transformación produce la
función de puntaje donde los coeficientes constituyen las notas asignadas a las categorías o a
las variables.
Para cada individuo, se calcula el puntaje2 es decir la suma de las notas asociadas a sus
predictores. Se afectará entonces éste individuo a un grupo si el puntaje es superior a un
umbral determinado. La introducción de una tolerancia del error de clasificación permite
definir tres zonas de decisión sobre la función de puntaje: la zona de puntajes elevados, la de

1
Cf. en el caso de análisis aplicados a la detección de quiebras de empresas (a partir de la selección de
variables continuas): Bardos (1984, 1989).
2
Los encadenamientos para el cálculo del análisis discriminante cualitativo, la función de puntaje y el
análisis baricéntrico (construcción de una banda de la tabla de Burt) están previstos en el programa
SPAD.N.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-18
3 Relación con los métodos explicativos usuales, métodos derivados.

puntajes bajos y una zona de indecisión en la cual un individuo no se puede clasificar


automáticamente.

3.3.8 Discriminación y redes de neuronas


Este parágrafo solo constituye una breve nota bibliográfica destinada a orientar al lector
estadístico que desee abordar las técnicas neuronales de discriminación.
Los métodos neuronales (o redes neuronales o también redes neuro-miméticas),
desarrollados a mediados de los años ochenta, han renovado y estimulado la disciplina
conocida bajo el nombre de reconocimiento de formas que cubren muchas aplicaciones
industriales (sobretodo las aplicaciones en tiempo real) de los métodos de discriminación.
Estos métodos, fundamentados sobre analogías biológicas y sobre un esfuerzo de
modelización de los mecanismos de percepción visual y auditiva, han adquirido luego una
cierta autonomía. Las relaciones con la estadística han estado ocultas en razón de las
diferencias de aproximación y de vocabulario 3. Pero se han tendido puentes y en años
recientes han aparecido una serie de artículos de revisión o de síntesis1 que han probado la
complementariedad de los puntos de vista y el enriquecimiento mutuo a esperar de los
contactos e intercambios entre estadísticos y neuromiméticos.
Esquemáticamente, decimos que los estadístiscos pueden completar la panoplia de los
modelos que les son familiares con los modelos esencialmente no lineales y de umbrales que
son atacados con las redes de neuronas. La estructura de estas redes permiten de otra parte
los cálculos paralelos indispensables para una implementación material directa de estos
métodos y de las utilizaciones en tiempo real, dominio poco abordado por los estadísticos.
Inversamente, lo esencial de lo que concierne a la inferencia o la validación de los métodos y
de los resultados es puesto a crédito de las aproximaciones estadísticas. Estos aspectos son
reconocidos como indispensables para aquellos que se ocupan de comparar modelos, evaluar
los riegos, calcular las tasas de errores, preocupaciones características de una disciplina que
ha alcanzado su madurez.
En esta nota bibliográfica se evocará solamente el modelo neuronal más difundido en el
cuadro de la discriminación que es el perceptrón multicapa, luego se dirán algunas palabras
de los métodos no supervisados.

a - Esquema y modelo del perceptrón multicapas


El contexto es el mismo definido al comienzo de esta sección. Se dispone de una variable
cualitativa y con q modalidades (o categorías) que se va a predecir a partir de p variables (x1,
x2,…,xp) predictoras. Se dispone además de n individuos u observaciones (muestra de
aprendizaje) descritos por las p variables (x1, x2,…,xp) y para los cuales se conoce la clase de
afectación notada aquí yk (k≤q).

3
Son los informáticos industriales quienes han originado estos métodos.
1
Citamos en particular los artículos de síntesis de Ripley (1993, 1994) y de Cheng y Titterington (1994).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-19
3 Relación con los métodos explicativos usuales, métodos derivados.

x1 wjm
vmk
y1
x2

x3 y2

x4
y3
x5
Capa
oculta
Entrada Salida

Figura 3.3 - 8
Perceptrón con una capa oculta

La figura 3.3 - 8 se comenta de la siguiente forma utilizando el vocabulario y los conceptos


de la aproximación neuronal: la capa de entrada esta formada de p=5 entradas, a las que se
les aplicará los coeficientes denominados los pesos sinápticos wjm. La capa oculta
comprende c=3 neuronas cada una de las cuales se activará por una integración (en general
función monótona de la suma) de las p señales provenientes de la capa de entrada. La misma
operación está ligada por las q=3 elementos de la capa de salida poniendo en juego los
pesos sinápticos vmk .
En términos de modelo analítico se escribe:

 c  p
 
y k = Φ 0  a k + ∑ v mk Φ a m + ∑ w jm x j  
 m= 1  j =1   [3.3 - 17]

En esta fórmula la función Φ es en la mayoría de las aplicaciones la función logística que


será abordada en la sección 3.4. Ella se escribe:
exp{z}
Φ( z) =
1 + exp{z}

La función Φo puede ser, según los casos, lineal. logística o un umbral (por ejemplo Φo(z)=0
si z ≤ 0 y Φo(z) = 1 si z>0).
Se ve que la figura 3.3 - 8 es útil para visualizar el encadenamiento de las funciones
correspondientes a las etapas de tratamiento. La lectura de derecha a izquierda de la figura
corresponde naturalmente a una lectura de izquierda a derecha de la fórmula [3.3 - 17]. Hay
{c(p+1)+q(c+1)} parámetros a estimar.
La ecuación [3.3 - 17] corresponde a una observación (i). Se tienen en realidad n ecuaciones
de este tipo, cada una hace intervenir q valores yk(i) (valores 0 o 1 si se trata de la
pertenencia a una clase de una partición en q clases) y p valores xj(i).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-20
3 Relación con los métodos explicativos usuales, métodos derivados.

La estimación de los parámetros se hace minimizando una función de pérdida, que puede ser
simplemente la suma de cuadrados de las desviaciones entre los valores calculados y los
valores observados yk(i) en la muestra de aprendizaje1.
Notemos que para una salida binaria (dos clases posibles para y que puede entonces ser un
escalar que toma los valores 0 o 1) y un perceptrón sin capa oculta , se encuentra en el
cuadro del modelo de la regresión logística evocada en la sección 3.4.4.
La fórmula [3.3 - 17] se escribe entonces:
  p
 
y = Φ 0 Φ a m + ∑ w jm x j  
  j =1   [3.3 - 18]

Aquí la función Φo puede ser una función de umbral, que convierte la probabilidad dada por
el modelo logístico propiamente dicho (al interior de los corchetes) en uno de dos valores 0
o 1.
Si se reducen las dos funciones Φo y Φ a la función idéntica Φ(x)=x, se reencuentra la
regresión múltiple (cf. sección 3.2) y el análisis discriminante en dos grupos (cf. parágrafo
3.3.3) que son casos particulares.
Este ejemplo muy simple de un perceptrón multicapas muestra entonces que las
generalizaciones más evidentes con respecto a los modelos explicativos usuales de la
estadística conciernen con la presencia eventual de las funciones Φo y Φ y la existencia de
una o varias capas ocultas que autorizan las intervenciones no lineales de los parámetros1 .

b - Modelos no supervisados o auto-organizados


Asi como los modelos supervisados (para los que disponemos de una muestra de aprendizaje
que permite estimar los parámetros) corresponden enteramente al método de regresión y del
análisis discriminante, los modelos no supervisados o auto-organizados corresponden a los
métodos puramente exploratorios.
Retomemos el ejemplo del perceptrón multicapa, para el cual supondremos las funciones Φo
y Φ lineales o (sin perdida de generalidad en este caso) iguales a la función idéntica.
Supondremos en lo sucesivo que las variables son variables numéricas centradas y que los
términos constantes son nulos.
La fórmula [3.3 - 17] se escribe:

1
La estimación numérica se hace por un método de descenso del gradiente llamado de back-propagation.
(cf. Werbos, 1974, 1990; Rumelhart et al., 1986). Para un programa de calculo, cf. Proriol, o el
procedimiento NEURO del programa SPAD.N.
1
Notemos que en un modelo general como el de la fórmula [3.3 - 17], no es necesario retener todas las
flechas entre dos capas consecutivas (ciertos pesos sinapticos pueden ser nulos a priori, otros pueden tener
un valor fijo y así reducir el número de parámetros a estimar).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-21
3 Relación con los métodos explicativos usuales, métodos derivados.

 c  p   p  c 
y k = ∑ vmk  ∑ w jm x j   = ∑  ∑ vmk w jm  x j
 m=1  j =1   j =1  m=1  [3.3 - 19]

que se puede escribir bajo la forma:


y = VWx, o sea y(i) = VWx(i) para cada observación i
Podemos escribir A = VW. La matriz A es de orden (p,q), y el tamaño c de la capa oculta
introduce solamente la restricción sobre el rango de A, que es el valor más pequeño de los
tres números q, c, p.
En ausencia de la restricción sobre A, se cae en el cuadro de la regresión múltiple simultánea
soportando varias variables endógenas, que viene a ser varias regresiones múltiples (cf.
§3.6.2 b).
La solución se obtiene aquí haciendo mínima la suma sobre las n observaciones:

i
(
S = ∑ y ( i ) − Ax ( i ) ) ( y ( ) − Ax ( ) )
i i

En los modelos no supervisados llamados de auto-asociación, no se conoce nada (no hay


“profesor”) y se utiliza el artificio que consiste en reemplazar y por x (cf. Baldi y Hornik,
1989).
Esto parece una trivialidad, y es efectivamente una trivialidad si la capa oculta tiene el
mismo número de elementos que x (c=p) y si no hay restricciones sobre A (en cuyo caso se
tiene la solución A = I).
Pero si la capa oculta es notablemente más reducida que las capas de entrada y de salida , (c
<< p), ella forma un estrangulamiento y la red realiza una compresión de la señal de entrada.
Se buscará optimizar la cantidad S1:

i
(
S 1 = ∑ x ( i ) − VWx ( i ) ) (x ( ) − VWx ( ) )
i i

Se esfuerza entonces en reducir lo más posible la deformación media de x luego de la


intervención de la red, que aquí no es otra cosa que una proyección sobre un subespacio de
dimensión c inferior a p. La solución se encuentra mediante el análisis en componentes
principales de la tabla X (que es también una descomposición en valores singulares, ya que
se han supuesto las variables centradas) donde las n filas son los vectores x’i.
Asi, por ejemplo, con una sola neurona en la capa oculta . la matriz VW es de rango 1, y
conducirá al primer eje del análisis en componentes principales de X. Una demostración
completa , incluido el caso supervisado (regresiones múltiples simultáneas con restricción
de rango para la tabla de coeficientes) se encuentra en Baldi y Hornik (1989, [Link].).
La auto-organización, noción estudiada y formalizada por Kokonen (1989), que es uno de
los pioneros de la aproximación neuronal, se hace entonces posible por la estructura interna
de la red.

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-22
3 Relación con los métodos explicativos usuales, métodos derivados.

Hay otros trabajos relativos a los algoritmos con lectura directa, como el algoritmo de
diagonalización mediante aproximación estocática propuesto por Benzécri (1969 b), anterior
a las aproximaciones neuronales1.
Estos algoritmos se pueden, en efecto, interpretar en términos de aprendizaje y de auto-
organización: Un algoritmo idéntico con una normalización previa fue propuesto
independientemente por Oja y Karhunen (1981), luego mejorado sucesivamente por estos
autores y otros neuromimetistas. Este dominio, que tiene aplicaciones potenciales en la
compresión de imágen, se ha desarrollado mucho posteriomente. Sobre las relaciones entre
redes neuronales y análisis en componentes principales, cf. Oja (1982), Bourlard et Kamp
(1988), Sirat (1991), Oja(1992).
Otra aproximación no supervisada, más próxima de los métodos de clasificación, es la de las
cartas auto-organizadas (self organizing maps) de Kononen (Kohonen, 1989; Cottrell et
Fort, 1987). El algoritmos es muy similar al de los métodos de agregación alrededor de los
centros móviles (k-means) (arranque aleatorio, afectación a los centros de distancias
minimales, obtención de mínimos locales) pero conducen a una representación plana (cf.
Ritter et al., 1992).

c - Estadística y métodos neuronales


Se complementará este apartado con un resumen de la intervención de Tibshirani luego de
una discusión se la síntesis de Cheng y Titterington (1994). Esta intervención comienza por
una nota general sobre la estadística y las redes de neuronas:
“Los estadísticos tienen la tendencia de trabajar con modelos más interpretables
ya que, para ellos, medir el efecto de las variables es más importante que la
predicción”.
Tibshirani responde en seguida a dos preguntas:
− Qué puede aprender un estadístico de un especialista en redes neuronales?
1. “Deberá preocuparse menos de la optimalidad estadística que de encontrar los métodos
que funcionen, especialmente sobre los grandes conjuntos de datos.
2. Se deberá luego atacar los problemas reales a los que se consagran los especialstas en
redes: reconocimiento de la escritura y de la palabra, predicción de las estructuras del
ADN. Como lo dijo John Tukey: es mejor tener una solución aproximada de un problema
real que la solución exacta de un problema muy simplificado.
3. Los modelos con parámetros muy numerosos pueden ser útiles para la predicción,
especialmente para las grandes tablas de datos y los datos brutos.
4. Modelizar las combinaciones lineales de las variables de entrada es muy útil, entonces se
tendrá en cuenta los tratamientos estructurales y la reducción de la dimensión.

1
Se encuentra un estudio más numérico de la convergencia del algoritmo en Lebart (1974), y el programa
correspondiente en Lebart et al. (1977).

Campo Elías Pardo. Universidad Nacional de Colombia


Lebart [Link]. Statisquique exploratoire multimensionnnelle. (Traducción provisional) 3-23
3 Relación con los métodos explicativos usuales, métodos derivados.

5. Algoritmos iterativos como el descenso del gradiente (con tasas de errores) podrán evitar
ajustes muy complicados
6. Nosotros (los estadísticos) deveremos por lo menos vendernos…”

− Qué puede aprender un especialista en redes de un estadístico?


1. “El deberá interesarse más por la optimalidad estadística, o por lo menos, en las
propiedades estadísticas de los métodos.
2. El deberá dedicar más esfuerzo en comparar sus métodos con métodos estadísticos más
simples. El se sorprenderá al ver que la regresión hace frecuentemente lo mismo que un
perceptrón multicapas. El no deberá utilizar jamás un modelo complicado cuando un
modelo simple es suficiente.”

Estas notas no perdonan a los estadísticos, quienes tienen al frente una profusión de ideas
novedosas en una gran cantera abierta. De ellos los que se consagren al análisis exploratorio
de grandes tablas se sienten menos aludidos por las dos primeras críticas de Tibshirani.

Otras referencias
Además de los artículos de síntesis precitados, se mencionará, siempre para un lector de
estadística: la obra de base de Hertz et al (1991), el artículo más teórico de Amari (1990),
sobre los fundamentos matemáticos de los métodos. Mencionemos igualmente el artículo de
Hornik (1994), describiendo con la intención de los estadísticos, el perceptrón multicapa y
los algoritmos del análisis en componentes principales mediante aprendizaje, como dos
intersecciones importantes entre las dos disciplinas. En Francés se consultarán las obras
generalísticas de Bourret et al. (1991) y de Milgram (1993). Para las exposiciones hechas en
relación con la aproximación “análisis de datos”, Gallinari et al. (1988), Lelu (1991),
Chabanon y Dubuisson (1991).

Campo Elías Pardo. Universidad Nacional de Colombia

También podría gustarte