0% encontró este documento útil (0 votos)
2 vistas9 páginas

Formular I

El documento aborda temas fundamentales en Ciencia de Datos, incluyendo PCA, Análisis Factorial de Correspondencias, Clustering, Reglas de Asociación, y Modelos Supervisados. Se presentan conceptos clave como escalado, medidas de distancia, métodos de agrupamiento, y métricas de calidad de modelos. Además, se discuten técnicas de validación y detección de anómalos en contextos de regresión y clasificación.

Cargado por

angelaferreperez
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas9 páginas

Formular I

El documento aborda temas fundamentales en Ciencia de Datos, incluyendo PCA, Análisis Factorial de Correspondencias, Clustering, Reglas de Asociación, y Modelos Supervisados. Se presentan conceptos clave como escalado, medidas de distancia, métodos de agrupamiento, y métricas de calidad de modelos. Además, se discuten técnicas de validación y detección de anómalos en contextos de regresión y clasificación.

Cargado por

angelaferreperez
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Modelos Descriptivos y Predictivos I - Grado de Ciencia de Datos

Formulario
Tema 1: PCA
1.1. Escalado
𝑤𝑘: peso de escalado de la variable k; 𝑠𝑘: desviación estándar de la variable k; 𝑣𝑘: varianza
deseada para la variable k; 𝑚𝑏: número de variables por bloque; 𝑉: varianza del bloque

Re-Escalado No re-escalado Autoescalado Información Previa

𝑋'𝑘 = 𝑋𝑘𝑤𝑘 𝑤𝑘 = 1 1 1
𝑤𝑘 = 𝑠𝑘 𝑤𝑘 = 𝑣𝑘 𝑠𝑘

Escalado Bloques Autoescalado Pareto Mismo peso por bloque

Peso (𝑤𝑘) 1 1 1 1 1
𝑠𝑘 (1/4) 𝑠𝑘 (1/2) 𝑠𝑘
𝑚𝑏 𝑚𝑏

Varianza del bloque 𝑚𝑏 𝑚𝑏 1


(V)

1.2. Ecuación General del modelo PCA y características​ ​ ​


Ecuación Correlación entre la % de variabilidad de la
componente a y la variable j componente a explicado por 𝑋𝑗

1.3. Detección de anómalos


Moderado Extremo
1.4. Coeficiente de determinación
% Variabilidad de 𝑋𝑗 explicada por el modelo % Variabilidad de X explicada por el modelo

Tema 2: Análisis Factorial de Correspondencias

2.1​ AFC simple


-​ Matriz F (I x J) → Frecuencias relativas: fij = nij / n
-​ Frecuencias marginales de filas:

-​ Matriz R (I x J) → Frecuencias relativas condicionadas a filas: rij = fij / fi.

-​ Test de independencia χ2 → Estadístico del contraste χ2

-​ Distancia χ2 (al cuadrado) entre dos filas de la matriz R:

-​ Inercia total: Suma de las distancias χ2 de cada fila de la matriz R a su media (f.j),
ponderadas por su importancia fi.

-​ Se cumple que:

-​ Matriz transformada Y = Mf-1 F Mc-1/2:

-​ Matriz transformada Z = Mf-1/2 F Mc-1/2


-​ Los valores propios de ZZt y de ZtZ son los mismos, y los vectores propios asociados a
un mismo valor propio están relacionados: w = Zv, siendo v vector propio de ZtZ y w
vector propio de ZZt.
-​ Proyecciones de las filas y columnas de la tabla de contingncia en el nuevo espacio
de dimensión h obtenido a partir del AFC:

2.2​ AFC múltiple


-​ Matriz X (n × q), donde cada variable j (j = 1,…,q) tiene pj categorías.
-​ Matriz disyuntiva completa Z (n × p), siendo

-​ Matriz de Burt:

Tema 3: Clustering

3.1​ Medidas de distancia


-​ Distancia euclídea:

-​ Distancia de Manhattan:

-​ Distancia de Mahalanobis:

-​ Coeficientes de asociación para variables binarias:

-​ Posibles transformaciones de una medida de similitud sij a medida de distancia dij:


-​ Estadístico de Hopkins:

-​ xi: distancia entre cada una de las m observaciones seleccionadas al azar y su


observación más cercana en las n observaciones de la matriz de datos X.
-​ yi: distancia entre cada observación i de la matriz simulada Y (m x p) y su
observación más cercana en X.

3.2​ Modelos jerárquicos

Métodos para calcular la distancia entre clústeres


-​ VECINO MÁS PRÓXIMO (UNIÓN SIMPLE, SINGLE LINKAGE):
d(C,AB) = min {d(C,A) ; d(C,B)}
-​ VECINO MÁS LEJANO (UNIÓN COMPLETA, COMPLETE LINKAGE)
d(C,AB) = max {d(C,A) ; d(C,B)}
-​ MEDIA (ponderada) DE CLUSTERS (AVERAGE LINKAGE)

-​ MEDIANA DE CLUSTERS: La distancia entre clusters se define como la mediana de las


distancias entre todas las parejas de elementos que los componen.
-​ CENTROIDE: Distancia entre los centroides. Se puede calcular como:

-​ MÉTODO DE WARD: El objetivo es crear los clusters de forma que se maximice la


homogeneidad intra-clusters.

-​ Fórmula de recurrencia de Lance y Williams:


3.3​ Métodos de partición
-​ Algoritmo de k-medias. Criterio de optimalidad = criterio de la traza → Minimar:

-​ K-medoides o PAM (Partitioning Around Medoids).


Medoide: Elemento de un cluster para el que la suma de distancias entre él y
el resto de elementos del cluster es mínima.

3.4​ Medidas de calidad del clustering


-​ Coeficiente de Silhouette (-1 ≤ Si ≤ 1):

-​ ai = Promedio de las distancias entre el elemento i y el resto de elementos en


su mismo clúster.
-​ bi = Distancia promedio del elemento i al clúster más próximo.
-​ Índice Dunn D = m/M
-​ m = Mínimo de las distancias entre las observaciones de un clúster y las
observaciones de los otros clústeres.
-​ M = Máximo de todas las distancias entre elementos de un mismo clúster.
-​ Conectividad C:

-​ Para cada elemento i, se seleccionan sus L vecinos más cercanos, siendo nni(j)
el j-ésimo vecino más cercano a i.

Tema 4: Reglas de Asociación

4.1​ Medidas de calidad de las reglas


-​ Soporte: ​ S(A ⇒ B) = P(A ⋂ B)
-​ Confianza: ​ C(A ⇒ B) = P(B | A) = P(A ⋂ B)/P(A) = S(A ⇒ B) / S(A)
-​ Lift: ​ ​ L(A ⇒ B) = C(A ⇒ B)/P(B) = P(A ⋂ B)/(P(A)*P(B))
-​ Cobertura: ​ Coverage(X ⇒ Y) = P(X)
-​ Índice de Gini: Valor entre 0 y 1, donde 0 indica que la regla no proporciona ninguna
información.
-​ Índice de Jaccard:

-​ Índice Kappa de Cohen: Valor entre -1 y 1, donde 0 indica que la regla no es mejor
que un clasificador aleatorio.

-​ Odds Ratio: Valor entre 0 y +∞, donde 1 indica que el consecuente no está asociado
con el antecedente.

-​ Coeficiente de correlación Phi: Valor entre -1 y 1

4.2​ Propiedades / definiciones


-​ Propiedad antimonótona del soporte:

-​ La regla X ⇒ Y es redundante si existe X’ ⊂ X tal que C(X’ ⇒ Y) ≥ C(X ⇒ Y)


-​ Reglas maximales: Un conjunto de ítems es maximal si no existe otro conjunto de
ítems que lo contenga.
-​ Reglas de asociación secuenciales (Algoritmo AprioriAll):
a.​ Ordenación. ID-Cliente como clave primaria, ID-Tiempo como clave
secundaria. Secuencia de conjuntos de ítems por cliente.
b.​ Selección de conjuntos de ítems. Con un mínimo soporte. Asignar
identificador a cada conjunto de ítems frecuente.
c.​ Transformación y renombramiento. Transformar cada secuencia para que
contenga solo sus ítems frecuentes. Renombrar cada conjunto por su
identificador.
d.​ Construcción de secuencias frecuentes. Construir incrementalmente el
conjunto de secuencias que cumplan con el criterio de soporte.
e.​ Selección de secuencias máximas. Filtrar conjunto de secuencias frecuentes
partiendo desde las secuencias de mayor tamaño, de manera que no haya
subsecuencias .
Tema 5: Modelos supervisados y Análisis discriminante

5.1​ Modelos supervisados

Medidas del error en modelos de regresión


-​ Error cuadrático medio:

-​ Error Absoluto Medio:

-​ RMSE normalizado:

-​ Coeficiente de Variación del RMSE:

-​ Coeficiente de determinación:

-​ Q2:

Medidas del error en modelos de clasificación


-​ Exactitud (Accuracy): A = (TP+TN)/n
-​ Error global (Overall Error Rate): ER = (FP+FN)/n = 1 - A
-​ Sensibilidad (TPR, Recall): SE = TP / P
-​ Especificidad (TNR): SP = TN / N
-​ Tasa de Falsos Descubrimientos (FDR): FDR = FP / P’
-​ Precisión (PPV, Positive Predicted Value): 1 – FDR = TP / P’
-​ NPV (Negative Predicted Value): TN / N’
-​ Índice de Youden: J = SE + SP – 1
-​ Tasa de Error Equilibrada (Balanced Error Rate): BER = 1 – (SE + SP)/2 = 1- Abalanceada
-​ F1 score (entre 0 y 1):

-​ Coeficiente de Correlación de Matthews (entre -1 y 1):


-​ Curvas ROC (1-SP frente SE) → AUC = Área bajo la curva
-​ Kappa de Cohen (entre -1 y 1):

5.2​ Análisis Discriminante

J=2 clases
-​ Probabilidad a posteriori de pertenecer a la clase j:

-​ C(Πj|Πi) = Coste de clasificar a un individuo en la población Πj cuando realmente


pertenece a la población Πi.
-​ Coste esperado de la regla de decisión D2 (clasificar en la población Π2) para una
observación x: E(C(D2)|x) = C(Π2|Π1) P(Π1|x)
-​ Regla discriminante para D2:

-​ En poblaciones normales:

-​ En poblaciones normales, se cumple que la regla discriminante para D2 es


equivalente a:

-​ En ese caso, definiendo w = V-1(μ2-μ1), la regla discriminante para D2 queda:

-​ Puntuaciones discriminantes z = w’x


-​ w es el vector que maximiza el cociente entre la variabilidad entre grupos y la
variabilidad intra-grupos:
Tema 6: PLS y PLS-DA

6.1. PCR vs PLS


PCR PLS

6.2. Validación
6.2.1. 𝑉𝐼𝑃𝑘 (Variance Influence on Projection parameter)

6.2.2. Detección de anómalos


Se calculan de igual forma que en el PCA sobre el espacio X
6.2.3. Coeficiente de determinación
Se calcula igual que en PCA pero ahora en los dos espacios: X e Y

También podría gustarte