0% ont trouvé ce document utile (0 vote)
36 vues5 pages

Analyse des données et régression linéaire

Transféré par

mouhamed ali ounalli
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
36 vues5 pages

Analyse des données et régression linéaire

Transféré par

mouhamed ali ounalli
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Data Mining

DM est un outil d’aide à la décision, qui peut être définis de plusieurs manières.
Définition : C’est un processus de découverte de règles, de relations, de
corrélations et / ou de procédures à travers une grande quantité de données grâce
à des méthodes statistiques, mathématiques et des reconnaissances de formes.
Analyse des Correspondances multiples (ACM)
⇒ Calculer un tableau disjonctif complet
⇒ La généralisation du tableau de contingence simple
⇒ tableau de Burt
⇒Tableau symétrique carré : ce sont à la fois les lignes et les colonnes qui
correspondent aux modalités de l’ensemble des variables X1, X2, ……, Xp.
Méthode des MCO (Moindres Carrés Ordinaires) :

Variable à expliquer = f (variable explicative ; terme aléatoire)


Hypothèses des MCO :
H1/ Le modèle est linéaire en Xt .
H2/ Les valeurs 𝐗𝐭 sont observées sans erreur (𝐗𝐭) non aléatoires.
H3/ E (𝜺𝒕) =0 : En moyenne, le modèle est bien spécifié.
H4/ E (𝜺𝒕^²)= 𝝈: la variance de l’erreur est constante
H5/ E (𝜺𝒕𝜺𝒕′) =0 , avec t ≠ t’ : les erreurs sont non corrélées ou indépendantes
H6/ Cov (Xt, 𝜺𝒕) =0 ; l’erreur est indépendante de la variable explicative.
 Régression linéaire multiple :
Test de significativité individuelle des paramètres :
1 ère méthode : Test de Student

2 ème méthode : P-value (probabilité critique)

Test de significativité globale du modèle :


Techniques de classification :
Classification = segmentation = clustering
C’est la méthode la plus répandue des techniques descriptives de DM utilisée si on fait face à
un grand volume de données où on cherche à distinguer des sous-ensembles homogènes prêts
à l’analyse de données.

Vous aimerez peut-être aussi