Modelos Descriptivos y Predictivos I - Grado de Ciencia de Datos
Formulario
Tema 1: PCA
1.1. Escalado
𝑤𝑘: peso de escalado de la variable k; 𝑠𝑘: desviación estándar de la variable k; 𝑣𝑘: varianza
deseada para la variable k; 𝑚𝑏: número de variables por bloque; 𝑉: varianza del bloque
Re-Escalado No re-escalado Autoescalado Información Previa
𝑋'𝑘 = 𝑋𝑘𝑤𝑘 𝑤𝑘 = 1 1 1
𝑤𝑘 = 𝑠𝑘 𝑤𝑘 = 𝑣𝑘 𝑠𝑘
Escalado Bloques Autoescalado Pareto Mismo peso por bloque
Peso (𝑤𝑘) 1 1 1 1 1
𝑠𝑘 (1/4) 𝑠𝑘 (1/2) 𝑠𝑘
𝑚𝑏 𝑚𝑏
Varianza del bloque 𝑚𝑏 𝑚𝑏 1
(V)
1.2. Ecuación General del modelo PCA y características
Ecuación Correlación entre la % de variabilidad de la
componente a y la variable j componente a explicado por 𝑋𝑗
1.3. Detección de anómalos
Moderado Extremo
1.4. Coeficiente de determinación
% Variabilidad de 𝑋𝑗 explicada por el modelo % Variabilidad de X explicada por el modelo
Tema 2: Análisis Factorial de Correspondencias
2.1 AFC simple
- Matriz F (I x J) → Frecuencias relativas: fij = nij / n
- Frecuencias marginales de filas:
- Matriz R (I x J) → Frecuencias relativas condicionadas a filas: rij = fij / fi.
- Test de independencia χ2 → Estadístico del contraste χ2
- Distancia χ2 (al cuadrado) entre dos filas de la matriz R:
- Inercia total: Suma de las distancias χ2 de cada fila de la matriz R a su media (f.j),
ponderadas por su importancia fi.
- Se cumple que:
- Matriz transformada Y = Mf-1 F Mc-1/2:
- Matriz transformada Z = Mf-1/2 F Mc-1/2
- Los valores propios de ZZt y de ZtZ son los mismos, y los vectores propios asociados a
un mismo valor propio están relacionados: w = Zv, siendo v vector propio de ZtZ y w
vector propio de ZZt.
- Proyecciones de las filas y columnas de la tabla de contingncia en el nuevo espacio
de dimensión h obtenido a partir del AFC:
2.2 AFC múltiple
- Matriz X (n × q), donde cada variable j (j = 1,…,q) tiene pj categorías.
- Matriz disyuntiva completa Z (n × p), siendo
- Matriz de Burt:
Tema 3: Clustering
3.1 Medidas de distancia
- Distancia euclídea:
- Distancia de Manhattan:
- Distancia de Mahalanobis:
- Coeficientes de asociación para variables binarias:
- Posibles transformaciones de una medida de similitud sij a medida de distancia dij:
- Estadístico de Hopkins:
- xi: distancia entre cada una de las m observaciones seleccionadas al azar y su
observación más cercana en las n observaciones de la matriz de datos X.
- yi: distancia entre cada observación i de la matriz simulada Y (m x p) y su
observación más cercana en X.
3.2 Modelos jerárquicos
Métodos para calcular la distancia entre clústeres
- VECINO MÁS PRÓXIMO (UNIÓN SIMPLE, SINGLE LINKAGE):
d(C,AB) = min {d(C,A) ; d(C,B)}
- VECINO MÁS LEJANO (UNIÓN COMPLETA, COMPLETE LINKAGE)
d(C,AB) = max {d(C,A) ; d(C,B)}
- MEDIA (ponderada) DE CLUSTERS (AVERAGE LINKAGE)
- MEDIANA DE CLUSTERS: La distancia entre clusters se define como la mediana de las
distancias entre todas las parejas de elementos que los componen.
- CENTROIDE: Distancia entre los centroides. Se puede calcular como:
- MÉTODO DE WARD: El objetivo es crear los clusters de forma que se maximice la
homogeneidad intra-clusters.
- Fórmula de recurrencia de Lance y Williams:
3.3 Métodos de partición
- Algoritmo de k-medias. Criterio de optimalidad = criterio de la traza → Minimar:
- K-medoides o PAM (Partitioning Around Medoids).
Medoide: Elemento de un cluster para el que la suma de distancias entre él y
el resto de elementos del cluster es mínima.
3.4 Medidas de calidad del clustering
- Coeficiente de Silhouette (-1 ≤ Si ≤ 1):
- ai = Promedio de las distancias entre el elemento i y el resto de elementos en
su mismo clúster.
- bi = Distancia promedio del elemento i al clúster más próximo.
- Índice Dunn D = m/M
- m = Mínimo de las distancias entre las observaciones de un clúster y las
observaciones de los otros clústeres.
- M = Máximo de todas las distancias entre elementos de un mismo clúster.
- Conectividad C:
- Para cada elemento i, se seleccionan sus L vecinos más cercanos, siendo nni(j)
el j-ésimo vecino más cercano a i.
Tema 4: Reglas de Asociación
4.1 Medidas de calidad de las reglas
- Soporte: S(A ⇒ B) = P(A ⋂ B)
- Confianza: C(A ⇒ B) = P(B | A) = P(A ⋂ B)/P(A) = S(A ⇒ B) / S(A)
- Lift: L(A ⇒ B) = C(A ⇒ B)/P(B) = P(A ⋂ B)/(P(A)*P(B))
- Cobertura: Coverage(X ⇒ Y) = P(X)
- Índice de Gini: Valor entre 0 y 1, donde 0 indica que la regla no proporciona ninguna
información.
- Índice de Jaccard:
- Índice Kappa de Cohen: Valor entre -1 y 1, donde 0 indica que la regla no es mejor
que un clasificador aleatorio.
- Odds Ratio: Valor entre 0 y +∞, donde 1 indica que el consecuente no está asociado
con el antecedente.
- Coeficiente de correlación Phi: Valor entre -1 y 1
4.2 Propiedades / definiciones
- Propiedad antimonótona del soporte:
- La regla X ⇒ Y es redundante si existe X’ ⊂ X tal que C(X’ ⇒ Y) ≥ C(X ⇒ Y)
- Reglas maximales: Un conjunto de ítems es maximal si no existe otro conjunto de
ítems que lo contenga.
- Reglas de asociación secuenciales (Algoritmo AprioriAll):
a. Ordenación. ID-Cliente como clave primaria, ID-Tiempo como clave
secundaria. Secuencia de conjuntos de ítems por cliente.
b. Selección de conjuntos de ítems. Con un mínimo soporte. Asignar
identificador a cada conjunto de ítems frecuente.
c. Transformación y renombramiento. Transformar cada secuencia para que
contenga solo sus ítems frecuentes. Renombrar cada conjunto por su
identificador.
d. Construcción de secuencias frecuentes. Construir incrementalmente el
conjunto de secuencias que cumplan con el criterio de soporte.
e. Selección de secuencias máximas. Filtrar conjunto de secuencias frecuentes
partiendo desde las secuencias de mayor tamaño, de manera que no haya
subsecuencias .
Tema 5: Modelos supervisados y Análisis discriminante
5.1 Modelos supervisados
Medidas del error en modelos de regresión
- Error cuadrático medio:
- Error Absoluto Medio:
- RMSE normalizado:
- Coeficiente de Variación del RMSE:
- Coeficiente de determinación:
- Q2:
Medidas del error en modelos de clasificación
- Exactitud (Accuracy): A = (TP+TN)/n
- Error global (Overall Error Rate): ER = (FP+FN)/n = 1 - A
- Sensibilidad (TPR, Recall): SE = TP / P
- Especificidad (TNR): SP = TN / N
- Tasa de Falsos Descubrimientos (FDR): FDR = FP / P’
- Precisión (PPV, Positive Predicted Value): 1 – FDR = TP / P’
- NPV (Negative Predicted Value): TN / N’
- Índice de Youden: J = SE + SP – 1
- Tasa de Error Equilibrada (Balanced Error Rate): BER = 1 – (SE + SP)/2 = 1- Abalanceada
- F1 score (entre 0 y 1):
- Coeficiente de Correlación de Matthews (entre -1 y 1):
- Curvas ROC (1-SP frente SE) → AUC = Área bajo la curva
- Kappa de Cohen (entre -1 y 1):
5.2 Análisis Discriminante
J=2 clases
- Probabilidad a posteriori de pertenecer a la clase j:
- C(Πj|Πi) = Coste de clasificar a un individuo en la población Πj cuando realmente
pertenece a la población Πi.
- Coste esperado de la regla de decisión D2 (clasificar en la población Π2) para una
observación x: E(C(D2)|x) = C(Π2|Π1) P(Π1|x)
- Regla discriminante para D2:
- En poblaciones normales:
- En poblaciones normales, se cumple que la regla discriminante para D2 es
equivalente a:
- En ese caso, definiendo w = V-1(μ2-μ1), la regla discriminante para D2 queda:
- Puntuaciones discriminantes z = w’x
- w es el vector que maximiza el cociente entre la variabilidad entre grupos y la
variabilidad intra-grupos:
Tema 6: PLS y PLS-DA
6.1. PCR vs PLS
PCR PLS
6.2. Validación
6.2.1. 𝑉𝐼𝑃𝑘 (Variance Influence on Projection parameter)
6.2.2. Detección de anómalos
Se calculan de igual forma que en el PCA sobre el espacio X
6.2.3. Coeficiente de determinación
Se calcula igual que en PCA pero ahora en los dos espacios: X e Y