0% encontró este documento útil (0 votos)
5 vistas18 páginas

Análisis Factorial: Guía Completa

El documento presenta un análisis factorial, centrándose en el Análisis Factorial Exploratorio (AFE) y el Análisis de Componentes Principales (ACP) como métodos de reducción de datos. Se discuten conceptos clave como la extracción de factores, rotación y la importancia de la matriz de correlaciones, así como pruebas estadísticas como el test de esfericidad de Bartlett y el índice KMO para validar la adecuación del análisis. Finalmente, se analizan los resultados de un conjunto de datos de indicadores de países europeos, mostrando cómo se explica la varianza a través de factores extraídos.

Cargado por

nesjohguei
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
5 vistas18 páginas

Análisis Factorial: Guía Completa

El documento presenta un análisis factorial, centrándose en el Análisis Factorial Exploratorio (AFE) y el Análisis de Componentes Principales (ACP) como métodos de reducción de datos. Se discuten conceptos clave como la extracción de factores, rotación y la importancia de la matriz de correlaciones, así como pruebas estadísticas como el test de esfericidad de Bartlett y el índice KMO para validar la adecuación del análisis. Finalmente, se analizan los resultados de un conjunto de datos de indicadores de países europeos, mostrando cómo se explica la varianza a través de factores extraídos.

Cargado por

nesjohguei
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

ANÁLISIS FACTORIAL

1.- Introducción ............................................................................................................. 2


2.- Componentes principales ......................................................................................... 2
3.- Descriptivos e índices de adecuación ...................................................................... 3
4.- Extracción................................................................................................................. 6
5.- Rotación de factores ............................................................................................... 13
6.- Puntuaciones factoriales ......................................................................................... 17

Carlos Camacho
Universidad de Sevilla
ANÁLISIS FACTORIAL

1.- Introducción

El Análisis Factorial es un procedimiento descriptivo (no inferencial) de reducción de datos.


Básicamente consiste en explicar la variabilidad de un conjunto de variables mediante un número de
componentes o factores menor. Si utilizamos una analogía geométrica, que es donde se apoyan los
cálculos, diremos que la intención es proyectar las variables situadas en un espacio multidimensional
sobre un conjunto de ejes o dimensiones menor.

Lo que se verá aquí es el Análisis Factorial Exploratorio (AFE), donde no existe una suposición sobre
la estructural factorial de lo datos, sino que simplemente se explora o estudia la posible estructura
subyacente. Hay que distinguirlo del Análisis Factorial Confirmatorio (AFC), en los que sí hay
supuestos explícitos. Versiones anteriores de SPSS contemplaban esta posibilidad, pero no actualmente.
Hay que recurrir a paquetes externos tales como el LISREL, EQS o AMOS. El más utilizado es,
digamos, el LISREL, que era precisamente, el que tenía implementado el SPSS.

Habitualmente en Análisis Factorial parte de la matriz de correlaciones o de varianzas covarianzas,


donde se encuentre toda a información del conjunto de datos. A partir de ahí se detecta grupos o familias
de variables que correlacionan o covarían fuertemente entre ellas. Las distintas familias identifican
distintos patrones de variación, o en otros términos, factores, que pueden ser interpretados
geométricamente. Al final, en términos geométricos, la nube de puntos –variables- situadas en un
espacio complejo queda explicada por un número reducido de factores o dimensiones. Por último, se
procede a rotar la nube de puntos sobres los distintos ejes factoriales con la intención de optimizar las
proyecciones de las variables, máximas en unos ejes y mínimas en otros que simplifican y facilitan la
interpretación de los distintos factores. Así pues, a partir de la matriz de correlaciones o equivalentes,
dos pasos son los fundamentales en el Análisis Factorial: extracción de factores y rotación de los
mismos.

Trataremos en estas líneas el análisis de componentes principales y el análisis factorial, que aunque
conceptualmente son técnicas distintas, el SPSS trata a ambas erróneamente bajo el epígrafe de Análisis
Factorial.

2.- Componentes Principales

El Análisis de Componente Principales (ACP), aunque útil para reducir dimensionalidad, en realidad
matemáticamente no es más que un método de transformación de variables, con la particularidad de que
las variables transformadas –las componentes- que se van generando irán absorbiendo el máximo de
información de las variables originales. El resultado es que aunque el número de componentes obtenidos
iguala al de las variables transformadas, unos pocos de ellos, los primeros, retienen la casi totalidad de la
información del conjunto, si ésta es redundante en las variables de partida. En la práctica, estamos
reduciendo dimensionalidad.

2
Si tenemos p variables observadas: x1, x2, ...., xp y deseamos transformarlas en otras tantas componentes
yi, entonces:

y1 = u11 x1 + u12 x 2 + .... + u1 p x p


y 2 = u 21 x1 + u 22 x 2 + .... + u 21 p x p
................................................
y p = u p1 x1 + u p 2 x 2 + .... + u pp x p

De forma que la primera componente retiene el máximo de varianza, y así las restantes, en orden
decreciente:

Var ( y1 ) ≥ Var ( y 2 ) ≥ ...... ≥ Var ( y p )

Las componentes son ortogonales:

E ( yi , y j ) = 0 ∀ i ≠ j

Además, los coeficientes uij han de cumplir la restricción:


p

∑u
j =1
2
ij = 1 ; ∀ j = 1,2,  , p

En definitiva, dicho en términos más sencillos, el Análisis de Componentes Principales consiste


básicamente en lograr una combinación lineal de las variables de tal forma que la primera componente
principal sea la combinación que explique el máximo de variabilidad del conjunto de datos, la segunda
componente, la siguiente máxima varianza y que a su vez esté incorrelacionada con la primera, y así
sucesivamente hasta lograr tantas componentes como variables.

3.- Descriptivos e índices de adecuación

Trabajaremos con el fichero conocido [Link] que contiene una serie de indicadores de diferentes
países europeos.

3
Entraremos en Analizar/Reducción de dimensiones/Factor. Allí nos encontramos con el siguiente
cuadro de diálogo, en el que seleccionamos las variables sobre las que se va a proceder la reducción:

A continuación nos dirigimos a Descriptivos, y aquí, elegimos lo más relevante del mismo:

Con los siguientes resultados:

4
Matriz de correlacionesa

Ordenadores Energía
Esperanza Tasa de Renta per Gasto en Gasto en por 1000 per cápita
de vida fecundidad cápita educación % salud % habitantes en kilos
Correlación Esperanza de vida 1,000 ,221 ,809 -,032 ,426 ,698 ,654
Tasa de fecundidad ,221 1,000 ,509 ,612 ,266 ,575 ,518
Renta per cápita ,809 ,509 1,000 ,255 ,396 ,879 ,711
Gasto en educación % -,032 ,612 ,255 1,000 ,272 ,361 ,233
Gasto en salud % ,426 ,266 ,396 ,272 1,000 ,398 ,319
Ordenadores por 1000
,698 ,575 ,879 ,361 ,398 1,000 ,805
habitantes
Energía per cápita en
,654 ,518 ,711 ,233 ,319 ,805 1,000
kilos
Sig. (Unilateral) Esperanza de vida ,139 ,000 ,439 ,015 ,000 ,000
Tasa de fecundidad ,139 ,004 ,000 ,095 ,001 ,003
Renta per cápita ,000 ,004 ,104 ,023 ,000 ,000
Gasto en educación % ,439 ,000 ,104 ,089 ,035 ,126
Gasto en salud % ,015 ,095 ,023 ,089 ,022 ,056
Ordenadores por 1000
,000 ,001 ,000 ,035 ,022 ,000
habitantes
Energía per cápita en
,000 ,003 ,000 ,126 ,056 ,000
kilos
a. Determinante = 5,595E-03

La parte superior contiene la matriz de correlaciones y la inferior la significación de las mismas. Hay
correlaciones altas bastante repartidas, como se indica en la significación, muchas de ellas próximas a
cero. Por otro lado, el determinante de la matriz de correlaciones vale 0.00559, indicativo de una fuerte
dependencia entre las distintas variables. Pero necesitamos de una prueba estadística para decidir si ese

5
valor de determinante es suficientemente significativo. A este respecto, disponemos del test de
esfericidad de Barlett (TEB) y el test de Kaiser-Meyer-Olkin (KMO):

KMO y prueba de Bartlett

Medida de adecuación muestral de


Kaiser-Meyer-Olkin. ,762

Prueba de esfericidad Chi-cuadrado


113,226
de Bartlett aproximado
gl 21
Sig. ,000

La prueba de Barlett está basada, precisamente en el determinante de la matriz de correlaciones, y


contrasta la Hipótesis nula de la matriz de correlaciones como una matriz identidad, es decir,
ninguna variable correlaciona con ninguna otra (sólo con ella misma: diagonal de unos). Opera con
una transformación de dicho determinante, que sigue una ley de Chi-cuadrado. Como se sabe la Chi-
cuadrado es una medida de distancia respecto a los valores establecidos por la Hipótesis nula, aquí
113.226, cuya probabilidad asociada desde las expectativa de dicha hipótesis es un valor próximo a
cero. Así pues, no se trata de una matriz identidad, y cabe suponer que las variables están lo
suficientemente correlacionadas entre sí como para permitir un análisis factorial.

Por otro lado, si hay mucha información compartida, las correlaciones parciales entre las distintas
variables ha de ser pequeña. Hay mucho común y poco específico. En este sentido, el índice KMO,
utiliza tales correlaciones según la expresión:

KMO =
∑∑ r 2
ij

∑∑ r + ∑∑ a
2
ij
2
ij

Donde rij son las correlaciones simples entre las distintas variables, y aij las correlaciones parciales entre
las mismas variables. Está claro que si las correlaciones parciales son baja, KMO valdrá cerca de la
unidad. Cuanto más altas, menor el valor de KMO, de tal forma que por debajo de 0.5 no se considera
aceptable un análisis factorial. No es este al caso, con un valor de KMO igual a 0.762, valor más que
suficiente para proseguir el análisis.

4.- Extracción

Así pues, los datos son los adecuados. Veamos ahora los resultados que hemos solicitado al marcar
Solución inicial, que son las comunalidades, autovalores y porcentajes de varianza explicada. En
relación a las comunalidades:

6
Comunalidades

Inicial Extracción
Esperanza de vida 1,000 ,884
Tasa de fecundidad 1,000 ,785
Renta per cápita 1,000 ,873
Gasto en educación % 1,000 ,858
Gasto en salud % 1,000 ,300
Ordenadores por 1000
1,000 ,879
habitantes
Energía per cápita en
1,000 ,738
kilos
Método de extracción: Análisis de Componentes principales.

Tenemos dos columnas, la primera, la comunalidad inicial indica la varianza de cada variable antes de la
transformación. Como está en estandarizadas, toda ella se explica por sí misma y su valor es la unidad.
La segunda columna, la comunalidad que resta tras la extracción, nos indica la varianza que de cada una
de las variables queda explicada por los factores obtenidos. Como se verá han sido extraídos dos
factores, y por ejemplo, de la Esperanza de vida explican una varianza de 0.884. Como el total de la
variable es 1, este valor se puede tomar como una proporción; los factores explican el 88.4% de esta
variable. Como se observa de todas las variables se explica bastante, excepto del Gasto en Salud %, que
si hubiéramos añadido un tercer factor quedaría suficientemente explicada. Lo hemos dejado así por
razones de simplicidad.

A continuación presentamos los autovalores y los porcentajes de varianza explicados:

Varianza total explicada

Sumas de las saturaciones al cuadrado


Autovalores iniciales de la extracción
% de la % de la
Componente Total varianza % acumulado Total varianza % acumulado
1 3,988 56,965 56,965 3,988 56,965 56,965
2 1,330 19,002 75,966 1,330 19,002 75,966
3 ,798 11,400 87,366
4 ,343 4,903 92,270
5 ,292 4,174 96,444
6 ,173 2,465 98,909
7 7,640E-02 1,091 100,000
Método de extracción: Análisis de Componentes principales.

Los autovalores representan la varianzas asociadas a los diferentes factores, así el primer autovalor,
cuya cuantía es de 3.988 representa el 56.965% del total de las variables. Recuérdese que son 7 variables
con una varianza cada una de ellas de 1 punto lo que indica que la varianza total suma de ellas es de 7
puntos. Por tanto:

Porcentaje de varianza del primer factor = (3.988/7)*100 = 56.965

7
El segundo factor explica 1.33 puntos, que muestra una proporción de varianza de 19.002%, que unido a
lo que explica el anterior factor totaliza un 75.966%, que es lo que explican ambos factores retenidos, ya
que el autovalor del tercer factor es de 0.798, que no llega al valor de 1, que es que por defecto
considera el SPSS. Si queremos más factores, tan sólo tenemos que entrar en el subcuadro de diálogo
Extracción, y modificar la opción comentada por defecto que es:

Y sustituirla, si deseamos por ejemplo, tres factores, por esta otra:

8
En este caso, las comunalidades serían:

Comunalidades

Inicial Extracción
Esperanza de vida 1,000 ,887
Tasa de fecundidad 1,000 ,819
Renta per cápita 1,000 ,882
Gasto en educación % 1,000 ,865
Gasto en salud % 1,000 ,977
Ordenadores por 1000
1,000 ,898
habitantes
Energía per cápita en
1,000 ,788
kilos
Método de extracción: Análisis de Componentes principales.

Se observa que todos incluidas el Gasto en salud % es alto. Y los autovalores y porcentajes de varianza
asociada serán:

9
Varianza total explicada

Sumas de las saturaciones al cuadrado


Autovalores iniciales de la extracción
% de la % de la
Componente Total varianza % acumulado Total varianza % acumulado
1 3,988 56,965 56,965 3,988 56,965 56,965
2 1,330 19,002 75,966 1,330 19,002 75,966
3 ,798 11,400 87,366 ,798 11,400 87,366
4 ,343 4,903 92,270
5 ,292 4,174 96,444
6 ,173 2,465 98,909
7 7,640E-02 1,091 100,000
Método de extracción: Análisis de Componentes principales.

Aquí ya llegamos al 87.366% de varianza explicada por los tres factores. No obstante, por razones de
simplicidad seguiremos trabajando con dos factores extraídos.

Un gráfico que puede ayudar a tomar decisiones sobre el número de factores a retener es el gráfico de
sedimentación:

Por la pendiente asociada al número de componente –cuando ésta deja de ser acusada-, podemos
tomar la decisión de establecer el punto de corte. Es una decisión como otra cualquiera que salva la
convencional del autovalor de 1, y que nos ofrece una idea global de cuando los autovalores no son
muy significativos.

Luego tenemos la siguiente tabla, denominada matriz de componentes:

10
Aquí vienen reflejados las saturaciones o cargas de las variables en los factores. También puede
interpretarse como la correlación entre la variable y el factor. Si elegimos las filas, por ejemplo, la
Esperanza de vida, el primer factor explica 0.7762 = 0.6022, el 60.22% de la varianza de dicha
variable, y el segundo factor, -0.5312 = 0.2820, el 28.2% de su varianza. Entre ambos factores:

h 12 = 0.776 2 + (-0.531) 2 = 0.8842

Que es justamente la comunalidad, ya comentada de la primera variable. Si hacemos lo mismo con


las columnas, tendremos los autovalores. Tomando, el primer componente:

Autovalor1 = 0.7760 2 + 0.679 2 + 0.913 2 + 0.438 2 + 0.548 2 + 0.936 2 + 0.850 2 = 3.988

Luego tenemos las correlaciones reproducidas y sus residuales:

11
La diagonal está formada por las comunalidades, ya conocidas, y lo que resta son las correlaciones entre
las variables logradas con la información que nos suministra ambos factores. La parte de abajo son las
correlaciones residuales. El error que hemos cometido al estimar las correlaciones. Obviamente la suma
nos da la correlación real. Por ejemplo, Esperanza de vida y Tasa de fecundidad:

rreal = rrep + rres = 0,22504 − 0,00365 = 0,22139

Por otro lado, las correlaciones reproducidas pueden conseguirse mediante la siguiente fórmula:

k
rij = ∑ a fi a fj = a1i a1 j + a 2i a 2 j +  + a ki a kj
f =1

Donde:

k: número de factores extraídos


a fi : saturación de la variable i en el factor f

Por ejemplo, si deseamos conocer la correlación entre Esperanza de vida y Tasa de fecundidad (que son
X 1 y X 2 ), nos vamos a la matriz de componentes:

r12 = 0,9302 * 0,3593 + -0,1349 * 0,8097 = 0.22504

12
5.- Rotación

Hay que decir que la matriz de componentes obtenidas no es la única posible sino que existen infinitas
matrices alternativas. Hay una cierta indeterminación en la obtención de dicha matriz, cuya solución
pasa por establecer restricciones hasta lograr aquella que más nos interese, normalmente en aras de una
mayor facilidad de interpretación de la misma.

La rotación es un término amplio que se refiere a mecanismos que permite modificar las correlaciones
entre variables y factores más a gusto del investigador. Obviamente respetando las reglas; no se
modifica ni el número de factores, ni la varianza total explicada ni las comunalidades.

A grandes rasgos hay dos tipos básicos de rotaciones: aquellos cuyos factores no están correlacionados y
se conocen como ortogonales, y aquellos otros cuyos ejes sí están correlacionados y que se denominan
no ortogonales u oblicuos.

Dentro de los ortogonales hay básicamente tres procedimientos: Varimax, Quartimax y Equamax. El
Varimax es más utilizado y consiste en minimizar el número de variables que tienen cargas grandes en
un factor; esto es maximiza la varianza de las cargas factoriales por columna. El método Quartimax, por
el contrario, intenta minimizar el número de factores necesarios para explicar un conjunto de variables.
En este caso, se maximiza la varianza en la fila de la matriz de cargas factoriales.

En cuanto a lo métodos de rotación oblicuos, destacar dos: Promax y Oblimín [Link] primero es útil
para cuando trabajamos con una masa grande de datos. Podemos controlar el ángulo entre los factores
manejando el parámetro kappa, cuyo valor por defecto es 4. El método Oblimín directo trabaja con el
parámetro delta, cuyo valor por defecto es cero correspondiente a ejes muy correlacionados. Valores de
este parámetro por debajo de cero permiten factores menos correlacionados.

En el caso que nos concierne trabajaremos con la opción Varimax, que es la más usual. Vamos,, pues a
Rotación y seleccionamos Varimax. Además le indicamos que nos muestre la Solución rotada y los
Gráficos de saturaciones:

13
Los resultados:

Se observa ahora que las variables son más fáciles de interpretar, con saturaciones altas en un factor y
pequeñas en el otro. Podemos optimizar estos resultados marcando en el subcuadro de dialogo
Opciones, que ordenen por tamaño lo coeficientes y que suprima aquellos cuyos valores sean inferiores
a 0.2:

Entonces, la nueva matriz será:

14
Matriz de componentes rotadosa

Componente
1 2
Esperanza de vida ,930
Renta per cápita ,907 ,225
Ordenadores por 1000
,865 ,361
habitantes
Energía per cápita en
,819 ,259
kilos
Gasto en salud % ,484 ,257
Gasto en educación % ,926
Tasa de fecundidad ,359 ,810
Método de extracción: Análisis de componentes principales.

Método de rotación: Normalización Varimax con Kaiser.


a. La rotación ha convergido en 3 iteraciones.

Observamos que así se facilita la interpretación de los factores. El primero tiene un carácter
marcadamente económico y el segundo más en cuestiones culturales.

Más ilustrativo es disponer de una opción visual de la matriz de componentes. Para ello, en el
subcuadro de diálogo de Rotación marcamos Gráficos de saturaciones:

Y observaremos

15
6.- Puntuaciones factoriales

Como se indicaba al principio, los componentes son combinaciones lineales de las variables
observadas. Como se recordará, el modelo era:

y1 = u11 x1 + u12 x 2 + .... + u1 p x p


y 2 = u 21 x1 + u 22 x 2 + .... + u 21 p x p
................................................
y p = u p1 x1 + u p 2 x 2 + .... + u pp x p

Podemos determinar estos coeficientes u ij , y así calcular las puntuaciones de los sujetos en estas
nuevas variables- las componentes -. Para calcular estos coeficientes, entramos en el subcuadro de
diálogo de Puntuaciones factoriales y marcamos lo siguiente:

16
Obtendremos la siguiente matriz, además de habernos generados dos nuevas variables, que son las
puntuaciones de los sujetos en los dos componentes extraídos.

Como estas variables están guardadas, las podemos utilizar para lo que nos interese. Por ejemplo, si
deseamos visualizar a los distintos países en función de sus puntuaciones en los dos componentes,
vamos a la opción conocida Gráfico/Dispersión/Definir y le indicamos lo siguiente:

Logrando el siguiente gráfico:

17
Obsérvese como Moldavia satura mucho en el segundo eje y poco en el primero. Presenta una renta
per cápita bajísima, junto a un alto gasto en educación. España está como Irlanda en aspectos
económicos, pero no tanto en educativos.

18

También podría gustarte