AFC
AFC vs AFE: ideas generales
El AFE, visto hasta ahora, es una técnica que no se contrasta directamente con el modelo
teórico. No se requieren previsiones exactas sobre cuántos factores subyacen a las relaciones
entre variables (se decide usando por ej. análisis paralelo) ni tampoco se requiere saber los
pesos de las variables en cada factor o que factores correlaciones entre sí.
En cambio, en el AFC el investigador plantea hipótesis definidas a priori sobre:
1. El número de factores.
2. Si hay o no correlaciones entre los factores.
3. Cómo saturan las variables observadas en ellos.
4. Si existen correlaciones entre los términos de error o específicos.
Ventajas de AFC
El AFC tiene algunas ventajas con respecto al AFE, ya que permite:
→ Contrastar directamente el modelo teórico del investigador.
→ Estudiar modelos complejos (p. ej., estimar conjuntamente todos los pesos de un modelo
factorial jerárquico o introducir errores correlacionados entre las variables).
→ Establecer restricciones en los pesos (p. ej., que los pesos de dos ítems son iguales).
→ Reducir el número de parámetros a estimar. Al fijar qué variables no pesan en los factores,
se estima un menor número de parámetros.*
*En el AFE, con 20 variables y 4 factores independientes habría aproximadamente 80 (4×20)
pesos a estimar; en el AFC, si cada variable pesa en un solo factor, habría 20 pesos a estimar.
Esto tiene consecuencias importantes, ya que los modelos más complejos (con más
parámetros) requieren mayores tamaños muestrales para ser correctamente estimados.
Algunas consideraciones previas sobre AFC
+++Nota 1: en AFE se trabajaba usualmente con las puntuaciones Xj y Fm en escala típica,
mientras que en el AFC se trabaja con las puntuaciones Xj y Fm en escala diferencial (=en la
misma métrica de medida). Las puntuaciones y los pesos en AFC se pueden estandarizar para
una mejor interpretación. En las salidas de software suelen salir ambas, las estandarizadas
llevan siempre el asterisco*. Es importante tener en cuenta esto a la hora de interpretar (un
peso no estandarizado mayor puede no indicar una influencia mayor del factor, solo que la
escala de medida es mayor)
+++Nota 2: También importante es que en AFC se utilizan matrices de varianzas-covarianzas en
vez de matrices de correlaciones de Pearson. <- esto implica lo mismo, aunque representan la
misma información Pearson está "tipificado" y tiene una diagonal igual a 1 y valores entre 0 y
1. La matriz de varianza-covarianza tiene valores de la métrica de medida.
modelo de AFC con variables en escala típica.
+++Nota 3: los Residuos: como en los modelos de AFE, cada residuo es la diferencia entre un
elemento de la matriz de varianzas-covarianzas observada S y el elemento correspondiente de
la matriz de varianzas-covarianzas reproducida S*. <- este asterisco no tiene nada que ver con
estar tipificado, lo sé es confuso, S* denota la matriz varianza-covarianza reproducida por el
modelo.
PASOS DEL AFC
Paso 1. Realizar una representación gráfica del modelo. Path diagram
Se realiza una representación gráfica del modelo. Generalmente las variables observables se
representan con cuadrados y las latentes con círculos (esto incluye tanto errores como
factores). Las relaciones entre ellas con líneas/flechas.
Los factores pueden covariar o no y esto se representa con flecha bidireccional.
---- En ocasiones aquí se hace distinción entre variables endógenas (las que reciben flecha
direccional de alguna otra variable del modelo) y variables exógenas (las que no reciben
ninguna fecha direccional) ----
Paso 2. Estudiar si el modelo está identificado, si existe suficiente info. para estimar sus
parámetros.
Un modelo no está identificado cuando no es posible estimar sus parámetros. Esto ocurre
cuando existen distintos conjuntos de parámetros que dan lugar al mismo ajuste estadístico e
AFC esto no puede pasar, la solución factorial obtenida debe ser única.
Para considerar al modelo identificado:
①Fijar la métrica de las variables latentes: fijar la desviación típica de esas variables. Se puede
o bien fijar la varianza de los factores a 1 (se asume factores estandarizados) o bien se fija el
peso de una sola variable a uno. Al fijar la métrica de un factor se reduce el número de
incógnitas.
②Comprobar que el número de grados de libertad es positivo es decir que el modelo está
sobreidentificado. (es decir comprobar que el número de parámetros sea menor que el
número de datos disponibles, si es al revés, mal, no podremos estimar parámetros)
En el caso del modelo de un factor, se requieren 4 variables para que el modelo esté
sobreidentificado. En el caso de modelos de varios factores correlacionados, se requieren dos
variables por factor. Es recomendable el uso de un mínimo de tres variables por factor para
prevenir la aparición de un modelo empíricamente no identificado.
Paso 3. Estimar los parámetros del modelo. Se escoge un método que minimice las
discrepancias entre la matriz de varianzas-covarianzas reproducidas a partir del modelo (S*) y
la matriz de varianzas-covarianzas observadas (S).
¿Qué método elegir?
Mínimos Cuadrados no Ponderados (ULS): el método más sencillo y que no asume ningún
supuesto sobre la distribución de las variables observadas. Está implementado en la mayoría
de los programas de AFC. El uso de ULS es adecuado si se analizan las variables estandarizadas
sino, cuidado porque los resultados dependerán de la escala de medida.
Desventajas del ULS: no se conoce la distribución de los estimadores ni es posible obtener
índices de ajuste con distribución estadística conocida. Solo pueden obtenerse indicadores
como el SRMR para comprobar su ajuste.
Máxima verosimilitud (ML): busca aquellos parámetros que hacen más verosímiles las
respuestas de los sujetos, asumiendo que la distribución de las variables es multivariada
normal.
Ventajas del ML: si el supuesto distribucional se cumple, podemos obtener medidas
estadísticas de ajuste y realizar contrastes sobre la significación de los parámetros.
Cuando no se cumple, ML puede dar lugar a resultados imprecisos: el estadístico χ 2 para
contrastar el ajuste del modelo estará sobrestimado (se tiende a rechazar el modelo aunque
sea correcto) y los errores típicos estarán subestimados (aumentando la probabilidad de que
una relación inexistente sea estadísticamente significativa). -- > muy importante comprobar
normalidad!!! (el libro dice que normalidad multivariante = asimetría menor que 2 en valor
absoluto; apuntamiento menor que 7 en valor absoluto, Mardia menor a 5.)
Si no hay normalidad --> método ML Robusto o de media ajustada (MLM) que además no
requiere grandes muestras de sujetos (dependiendo de la complejidad del modelo, muestras
de entre 200 y 500 sujetos pueden resultar apropiadas)
¿Qué pasa con las variables categóricas?
Como siempre si tenemos 4 o menos categorías de respuesta, matriz de Pearson o de var-
covar. son métodos inadecuados. Problemas que surgen si hacemos un AFC tradicional con
esto:
- se incumple el supuesto de relacion lineal del AFC, se producen relaciones no lineales entre
factores e ítems (por efecto suelo o techo) que dan lugar a subestimación de parámetros y
aparición de factores sin significado sustantivo. Factores de dificultad en dicotómicos.
- al usar ML sin tener una distribución normal, acabamos obteniendo estadísticos de ajuste y
errores típicos incorrectos. <- necesitamos distribución normal para contrastar hipótesis
¿Qué hacer con las categóricas? Nada nuevo; estimar a partir de matriz de correlaciones
tetracóricas o policóricas.
- Si la matriz tetra/poli que obtenemos es "no definida positiva", se recomienda utilizar ULS.
- RWLS (mínimos cuadrados ponderados robusto) es otro buen método para utilizar y
adecuado incluso en muestras pequeñas. Optima para variables de dos/tres categorías.
- con datos dicotómicos, se puede aplicar un AF no lineal.
Resumiendo:
1. Si los ítems tienen 5 categorías o más y se cumple el supuesto de distribución multivariada
normal, puede utilizarse el método ML con la matriz de varianzas-covarianzas.
2. Si los ítems tienen 5 categorías o más y no se cumple el supuesto de distribución
multivariada normal, puede utilizarse MLM con la matriz de varianzas-covarianzas.
3. Si los ítems tienen 3 ó 4 categorías, puede utilizarse RWLS con la matriz de correlaciones
policóricas.
4. En el caso de ítems dicotómicos, puede utilizarse RWLS con la matriz de correlaciones
tetracóricas, puede realizarse el AF no lineal o aplicar un modelo multidimensional de TRI.
Paso 4. Obtener indicadores de ajuste del modelo. (el grado en que el modelo se ajusta a los
datos)
El número de índices de ajuste para modelos confirmatorios es inmenso. Vamos a hacer una
primera clasificación:
→ Índices inferenciales vs índices descriptivos.
Los índices inferenciales tienen una distribución estadística y nos permiten hacer inferencias
sobre lo que ocurre en la población (p. ej., si se mantiene la hipótesis nula de que los residuos
son cero en la población) mientras que los índices descriptivos no tienen distribución
estadística conocida y, por tanto, sólo nos permiten concluir sobre lo que ocurre en la muestra.
→ Índices de ajuste absoluto vs índices de ajuste comparativo.
Los índices de ajuste absoluto nos sirven para establecer en qué grado el modelo propuesto
reproduce los datos, mientras que en los índices de ajuste comparativo se sigue la estrategia
de determinar el grado en que el modelo propuesto es mejor que otro modelo alternativo.
Tabla con los más conocidos/populares/queridos:
En resumen:
1. TLI penaliza mejor que CFI los modelos complejos.
2. RMSEA y TLI pueden no resultar adecuados en muestras inferiores a 250 sujetos, ya que hay
una cierta tendencia a que se rechace el modelo verdadero.
3. TLI y CFI dependen del tamaño de las correlaciones entre las variables analizadas: si el
promedio de las correlaciones no es alto, TLI y CFI tampoco lo serán.
4. En cuanto a SRMR, se recomienda su uso combinado con otros indicadores (TLI > 0,95 y
SRMR < 0,09 o RMSEA < 0,06 y SRMR < 0,09).
A tener en cuenta con respecto al estudio del ajuste de un modelo:
- Ojo con Chi-cuadrado: gran dependencia del tamaño de la muestra. Hay que evaluar siempre
con cuidado el modelo si estamos utilizando Chi porque es muy fácil que a) chi encuentre
desajuste en muestras grandes y el modelo ajusta o b) que Chi encuentre ajuste en muestras
pequeñas que no ajustan.
- Los puntos de corte para los índices de ajuste tienen un cierto grado de arbitrariedad,
siempre se recomienda estudiar los desajustes locales del modelo (estudiar los residuos)
- Haciendo más complejo el modelo siempre se mejora su ajuste a los datos de una muestra
específica; sin embargo, es posible que estemos tratando un error de muestreo (que se
produce porque las correlaciones en la muestra diferirán de las correlaciones en la población
simplemente por variación muestral) como si fuera un error de aproximación (que se produce,
al trabajar en la población, si nuestro modelo no es correcto) y por tanto que las mejoras no se
repliquen en otras muestras. (Estamos mejorando/ajustando el modelo mucho a nuestra
muestra y haciéndolo perfecto solo para ella)
Por ello: importante considerar la parsimonia del modelo y penalizar en cierto grado su
complejidad. RMSEA, TLI y CFI son adecuados porque todos son función del error de
aproximación. En particular TLI y RMSEA incorporan una penalización adicional por la
complejidad del modelo.
ULTIMO PASO, Re-especificación del modelo (no siempre se hace/no se debería hacer tanto)
Es frecuente que los datos no se ajusten al modelo teórico que se propone, pueden pasar dos
cosas:
1. El modelo se ajusta pero algunos pesos no son sign. Es decir algunas relaciones que
establece el modelo no son correctas. - > Se podria obtener la 'razón crítica' de un parámetro
(dividiendo su estimación por su error típico) si el valor no es superior a 2.0 en valor absoluto,
quizás deberíamos fijar ese parámetro en 0 porque no es estadísticamente sig.
2. Existen parámetros que se han fijado a cero pero deberían ser estimados. Los programas
proporcionan indicadores (MI o índice de modificación) que nos indican cual sería la mejora en
el ajuste si ese parámetro fuese libremente estimado. Si el modelo no se ajusta, podemos
proceder a estimar libremente los parámetros con mayores MI (indices de modificacion).
Sin embargo, si actuamos de esta manera estaremos utilizando un modelo confirmatorio
de manera exploratoria. Si se realizan modificaciones en el modelo, lo correcto es contrastarlas
en una muestra distinta, para garantizar la replicabilidad de los resultados. En realidad, las
modificaciones sólo se deberían utilizar si desde el punto de vista teórico o racional son
defendibles.
Modelos confirmatorios multigrupo: INVARIANZAS
Algunos objetivos de investigación como la adaptación de una prueba a otra cultura o la
comparación de dos o más grupos, nos obligan a comprobar la invarianza de la estructura
factorial. En estos casos se puede aplicar un modelo de AFC multigrupo.
En términos de AFC multigrupo, el modelo se expresa como:
y estas variables siguen la siguiente distribución:
con las siguientes medias y var. de ítems
En estudios sobre evidencias de validez se analiza la invarianza de estos parámetros^^ a
través de los grupos. Se trata de comprobar que las puntuaciones en los ítems tienen el mismo
significado, es decir, que no están sesgadas (ausencia de DIF).
¡¡La invarianza es algo bueno, que queremos encontrar!!
Existen distintos grados de invarianza factorial:
1. Invarianza de la configuración. Se trata de contrastar que la estructura propuesta (qué
ítems miden qué rasgo) es similar en ambos grupos. Se comprueba inicialmente que el modelo
propuesto se ajusta por separado a ambos tipos de datos, aunque los pesos de los ítems en las
variables latentes puedan diferir. Para ello: indicadores descriptivos de ajuste (SRMR, RMSEA o
CFI) en cada una de las dos situaciones.
2. Invarianza métrica de las medidas. se estudia proponiendo diferentes modelos anidados:
1º se establece un modelo donde no se asume la invarianza a través de los dos conjuntos de
datos (modelo 1, que es el establecido en el estudio de invarianza de la configuración);
2º se establece un modelo, anidado al primero, en el que se asume la invarianza de los pesos
(modelo 2, para la detección del DIF no uniforme).
→ Si las diferencias entre χ2 de los modelos son no significativas, podemos concluir que los
pesos son iguales a través de los grupos (Λ1 = Λ2 = Λ). Se habla entonces de que se cumple la
invarianza métrica. En este caso, puede decirse que los factores significan lo mismo en los
grupos y que podemos comparar a los grupos en las varianzas (covarianzas) de los factores
latentes incluidos en el modelo.
3. Invarianza escalar de las medidas. Si queremos comprobar que las diferencias de medias
entre los grupos en las variables, se explican por las diferencias de medias en los factores
latentes → estudiamos el ajuste de un modelo en el que no hay diferencias en las
intersecciones (v1 = v2 = v) pero puede haberlas en las medias de los factores (α1 = α2). A este
modelo lo llamamos modelo 3. El modelo 3 se anida en el modelo 2 y sirve para la detección
del DIF uniforme.
Si no hay diferencias estadísticas entre ambos modelos, se hablaría de invarianza escalar y se
consideraría probada la invarianza de las medidas, en el sentido de no producirse DIF de
ningún tipo. Sólo después de estas comprobaciones sería apropiado comparar las medias de
los grupos en los factores.
4. Invarianza estricta. Si además, las varianzas únicas son iguales (Ψ1 = Ψ2 = Ψ), se habla de
invarianza estricta. Es el mayor grado de invarianza que se puede encontrar. Con varianzas
únicas iguales, puede incrementarse la potencia para detectar diferencias en las medias entre
los grupos.
Diferencias en las varianzas de los factores (Φ) y en las varianzas únicas (Ψ) implicarían
diferencias de precisión en las medidas a través de los grupos, lo que no resulta imprescindible
para poder compararlos.
Parámetros "fijos" Parámetros libres Modelo con el que se
(constrained compara
parameters)
Invarianza de Media de la variable Pesos factoriales +
configuración latente (=0) intersecciones de los ítems
+ varianzas residuales de
los ítems + varianza de la
variable latente
Invarianza métrica de las Pesos factoriales + intersecciones de los ítems ^Con el de
medias (invarianza de los Media de la variable + varianzas residuales de configuración
pesos o invarianza débil) latente (=0) los ítems + varianza de la
variable latente
Invarianza escalar de las Pesos factoriales + varianzas residuales de los ^Con el de métrica de
medidas (o invarianza intersecciones de los ítems + varianza de la las medias o invarianza
fuerte) ítems (v) variable latente + Media de débil
la variable latente *
Invarianza estricta Pesos factoriales + varianza de la variable ^Con el escalar de las
intersecciones de los latente + Media de la medidas o invarianza
ítems + varianzas variable latente * fuerte
residuales de los ítems
* fijada a 0 en el grupo 1 y estimada en los otros
1. Capitalización del azar. En un modelo confirmatorio debe establecerse a priori el modelo
teórico. En ocasiones, los datos en la muestra no se ajustan al modelo. En ese caso, el
investigador puede sentirse tentado de establecer las modificaciones necesarias (del modelo)
hasta que se obtenga un buen ajuste. Estas modificaciones ad hoc, que en cualquier caso
deberían ser siempre informadas, facilitan que se produzca un ajuste apropiado para los datos
muestrales concretos que se están analizando; se produce un fenómeno de “capitalización del
azar”. Al aplicar el modelo ad hoc a los datos de otra muestra, se obtendrán peores niveles de
ajuste. Por lo tanto, en ausencia de réplica con otros datos, las modificaciones llevarán a un
modelo, resultado de modificar el inicialmente propuesto, que aparentará ser mejor de lo que
es.
2. Los modelos de AFC pueden resultar excesivamente exigentes y llevar a conclusiones
equivocadas. Por ejemplo, en un test como el que hemos analizado en este capítulo (el test de
Cordialidad) puede resultar irrealista que cada ítem mida un único factor y sature exactamente
cero en los demás. Si recordamos los pesos estimados en el AFE (ver Tabla 10.3), aunque cada
ítem satura principalmente en un factor, también tiene pesos superiores a 0,1 en el otro
factor. A veces es difícil anticipar estos “pequeños efectos en un modelo de AFC (p. ej., en
nuestro caso resulta necesario incluir un peso del ítem 6 en el factor 1, aunque su relación con
el factor es bastante baja, ya que λ * 61 = 0,266).
3. Algunos de los requerimientos para una correcta aplicación de estos modelos no están bien
resueltos y son objeto de investigación en la actualidad. Por ejemplo, como hemos visto,
existen infinidad de indicadores de ajuste. Las conclusiones sobre el ajuste que se derivan de
cada indicador pueden ser distintas y, por tanto, existe riesgo de que cada investigador escoja
aquellos que más le convengan. Por ello conviene que se informe siempre de los mismos
indicadores (p. ej., RMSEA, SRMR, CFI y TLI). Además, los puntos de corte establecidos para
decidir un buen ajuste tienen limitaciones, pues surgen a partir de estudios de simulación
cuyas condiciones pueden no ser generalizables21. Por ello los indicadores de ajuste global
deberían siempre ser complementados con el análisis de la matriz de residuos, lo que puede
ayudar a descubrir desajustes locales.
Pregunta de examen 6: CFA vs EFA según Schmitts 2011
(Lo que Schmitts dice de esto, queda mejorarlo un poco como respuesta de examen)
Aunque es común considerar que el AFC debe ser utilizado para verificar o confirmar modelos
teóricos previamente establecidos, en la práctica se usa AFC de manera exploratoria. Es común
hacer uso de MI (índices de modificación) para modificar los modelos confirmatorios y cuando
hacemos esto, el análisis confirmatorio se convierte en un análisis de tipo exploratorio y esto
constituye un mal uso del análisis.
Schmitts considera razonable analizar mediante un AFE un modelo que no hemos conseguido
ajustar mediante un AFC. Según el autor, si la única manera de conseguir que un modelo de
AFC se ajuste es realizando una re-especificación del mismo en base a modificaciones que
pueden o no estar apoyadas en la teoría de la que partíamos, es mejor intentar aplicar un AFE.
Un AFE puede resultar más adecuado ya que nos permite que sigamos explorando el modelo y
llegar a una solución adecuada.
El AFE puede ser utilizado para explorar modelos confirmatorios que no ajustan bien, explorar
estructuras factoriales de las que aun no tenemos hipótesis sólidas y confirmar la estructura
factorial basada en hipótesis fuertes pero que no pueden ser analizadas por medio de un AFC
porque los datos no son adecuados para ello.
Desde el punto de vista de Schmitts, el EFA y CFA se diferencian básicamente en el hecho de
incluir cross loadings o no. No son solo confirmatorios o solo exploratorios en sí mismos. CFA
puede utilizarse como exploratorio mediante el uso de MI (índices de modificación) y EFA
puede utilizarse como confirmatorio si se definen hipótesis sobre sus cross loadings a priori.