Data Mining
DM est un outil d’aide à la décision, qui peut être définis de plusieurs manières.
Définition : C’est un processus de découverte de règles, de relations, de
corrélations et / ou de procédures à travers une grande quantité de données grâce
à des méthodes statistiques, mathématiques et des reconnaissances de formes.
Analyse des Correspondances multiples (ACM)
⇒ Calculer un tableau disjonctif complet
⇒ La généralisation du tableau de contingence simple
⇒ tableau de Burt
⇒Tableau symétrique carré : ce sont à la fois les lignes et les colonnes qui
correspondent aux modalités de l’ensemble des variables X1, X2, ……, Xp.
Méthode des MCO (Moindres Carrés Ordinaires) :
Variable à expliquer = f (variable explicative ; terme aléatoire)
Hypothèses des MCO :
H1/ Le modèle est linéaire en Xt .
H2/ Les valeurs 𝐗𝐭 sont observées sans erreur (𝐗𝐭) non aléatoires.
H3/ E (𝜺𝒕) =0 : En moyenne, le modèle est bien spécifié.
H4/ E (𝜺𝒕^²)= 𝝈: la variance de l’erreur est constante
H5/ E (𝜺𝒕𝜺𝒕′) =0 , avec t ≠ t’ : les erreurs sont non corrélées ou indépendantes
H6/ Cov (Xt, 𝜺𝒕) =0 ; l’erreur est indépendante de la variable explicative.
Régression linéaire multiple :
Test de significativité individuelle des paramètres :
1 ère méthode : Test de Student
2 ème méthode : P-value (probabilité critique)
Test de significativité globale du modèle :
Techniques de classification :
Classification = segmentation = clustering
C’est la méthode la plus répandue des techniques descriptives de DM utilisée si on fait face à
un grand volume de données où on cherche à distinguer des sous-ensembles homogènes prêts
à l’analyse de données.