0% ont trouvé ce document utile (0 vote)
21 vues4 pages

Examen Data Mining 2021-2022 ESISA

L'examen porte sur le data mining et contient 4 exercices. Le premier concerne l'analyse prédictive et descriptive, l'analyse discriminante linéaire et les arbres de décision. Le deuxième porte sur la construction d'un arbre de décision à partir d'un tableau de données. Le troisième concerne les k-means clustering sur le jeu de données Iris. Le quatrième applique l'analyse discriminante linéaire sur des données bancaires.

Transféré par

ayoub
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
21 vues4 pages

Examen Data Mining 2021-2022 ESISA

L'examen porte sur le data mining et contient 4 exercices. Le premier concerne l'analyse prédictive et descriptive, l'analyse discriminante linéaire et les arbres de décision. Le deuxième porte sur la construction d'un arbre de décision à partir d'un tableau de données. Le troisième concerne les k-means clustering sur le jeu de données Iris. Le quatrième applique l'analyse discriminante linéaire sur des données bancaires.

Transféré par

ayoub
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

ESISA

Ecole Supérieure d'Ingénierie en Sciences Appliquées

Examen de Data mining


Année universitaire 2021-2022
Le 26/05/2022
Durée : 3 h00
Exercice 1
1. Le Data mining est utilisé à la fois en analyse prédictive et descriptive, décrire
l’ensemble des données utilisé par chacun de ces types d’analyse.
2. Quel est l’objectif visé par une méthode d’analyse discriminante linéaire ?
3. Quelles sont les étapes de construction d’un arbre de décision ?
4. Que signifie un Lambda de Wilks global faible pour un classifieur basé sur les fonctions
discriminantes.

Exercice 2
Soit l’exemple du tableau suivant qui permet de prédire le type de maladie à partir des variables
explicatives Fièvre, Douleur et Toux. Déterminer la variable de segmentation à choisir à la
racine de l’arbre en utilisant le critère du gain entropique donné par :
Gain entropique donné par la variable explicative X : Gain(X) = I-Ires(X)
Quantité moyenne d’information ou entropie de Shannon :

𝑰 = − ∑ 𝒑(𝒄)𝒍𝒐𝒈𝟐 𝒑(𝒄)
𝒄

Entropie résiduelle pour une variable explicative :

𝑰𝒓𝒆𝒔 (𝑿) = − ∑ 𝒑(𝒎) ∑ 𝒑(𝒄⁄𝒎)𝒍𝒐𝒈𝟐 𝒑(𝒄⁄𝒎)


𝒎 𝒄

Avec m : les valeurs possibles de l’attribut X.


c les valeurs possibles de la variable discriminante Y.

Tableau 1 Ensemble d’apprentissage

1
Exercice 3
Le jeu de données Iris a été utilisé dans l'article classique de Fisher de 1936, 'The Use of
Multiple Measurements in Taxonomic Problems', comprend trois espèces d'iris avec 50
échantillons chacune ainsi que certaines propriétés de chaque fleur. Une espèce de fleur est
linéairement séparable des deux autres, mais les deux autres ne sont pas linéairement séparables
l'une de l'autre.
Les colonnes de cet ensemble de données sont :
- Identifiant
- Sépale Longueur
- Sépale Largeur
- Pétale Longueur
- Pétale largeur
- Espèces
1/ Décrire les étapes de la méthode de classification des Kmeans.
2/ Comment choisir de manière optimale le nombre de classes ?
3/ Comment sont représentés initialement les classes ?

L’application de l’opération de la caractérisation des classes obtenues a donné les résultats


suivants :

Cluster_KMeans_1=c_kmeans_3
Cluster_KMeans_1=c_kmeans_1
Cluster_KMeans_1=c_kmeans_2 Examples [ 35,3 %] 53
Examples [ 31,3 %] 47
Examples [ 33,3 %] 50 Test
Test Att - Desc Group Overral
Att - Desc Group Overral Test value
value Att - Desc Group Overral
value Continuous attributes : Mean
Continuous attributes : Mean (StdDev)
Continuous attributes : Mean (StdDev)
(StdDev)
3,42 3,05 4,37 3,76
6,78 5,84 sep_width 7,25 pet_length 3,13
sep_length 9,34 (0,38) (0,43) (0,56) (1,76)
(0,49) (0,83)
5,01 5,84 1,41 1,20
1,97 1,20 sep_length -8,73 pet_width 2,54
pet_width 8,36 (0,35) (0,83) (0,31) (0,76)
(0,33) (0,76)
- 0,24 1,20 5,80 5,84
5,51 3,76 pet_width sep_length -0,45
pet_length 8,19 10,80 (0,11) (0,76) (0,41) (0,83)
(0,64) (1,76)
- 1,46 3,76 2,67 3,05
3,10 3,05 pet_length sep_width -7,92
sep_width 0,79 11,23 (0,17) (1,76) (0,25) (0,43)
(0,26) (0,43)
Discrete attributes : [Recall] Accuracy Discrete attributes : [Recall]
Discrete attributes : [Recall] Accuracy
[ 100,0 Accuracy
[ 72,0 type=Iris-
type=Iris- 12,21 %] 100,0 33,3 % [ 78,0
7,57 %] 76,6 33,3 % setosa type=Iris-
virginica % 7,70 %] 73,6 33,3 %
% versicolor
[ 0,0 %
[ 22,0 type=Iris-
type=Iris- -6,10 %] 0,0 33,3 % [ 28,0
-1,74 %] 23,4 33,3 % versicolor type=Iris-
versicolor % -1,32 %] 26,4 33,3 %
% virginica
[ 0,0 %
[ 0,0 type=Iris-
type=Iris- -6,10 %] 0,0 33,3 % [ 0,0
-5,83 %] 0,0 33,3 % virginica type=Iris-
setosa % -6,38 %] 0,0 33,3 %
% setosa
%

4/ Quelle est le type des Iris le plus significatif pour la première classe ?
5/ Quels paramètres caractérisent la première classe ? Justifier votre réponse.
6/ Quels paramètres caractérisent la classe des Iris setosa ?

2
7/ Comment configurer le Define Status pour appliquer une méthode d’apprentissage
supervisé. Proposer la méthode que vous estimer la plus adéquate pour analyser cet ensemble
de données.
Exercice 4
Pour 889 de ses clients, une banque dispose des informations relatives aux 8 variables
explicatives et à la variable à expliquer ‘carte Visa premium’ décrites par la table suivante :

Attribut Categorie Informations


Age Continue -
Anciennete Continue -
MoyCred3 Continue -
aveparmo Continue -
endett Continue -
moySold3 Continue -
moyCred Continue -
mateparlo Continue -
CarteVisa Discrete 2 values
Variables explicatives et variable à expliquer caractérisant les clients d’une banque

Cet ensemble d’apprentissage est utilisé pour calculer, grâce à l’application de la méthode
d’analyse discriminante, la prédisposition des clients de la banque à posséder la carte VISA
premium.

L’objectif visé étant de mieux cibler les campagnes d’identification de clients potentiels (c'est
à dire ceux qui n'ont pas la carte, mais pour lesquels les informations dont on dispose incitent à
penser qu'ils devraient l'avoir).

L’application de la méthode d’analyse discriminante Matrice de confusion


linéaire permet d’obtenir les résultats suivants : "oui" "non" Sum
"oui" 163 154 317
Stat Value p-value "non" 60 512 572
Wilks' Lambda 0,7763 - Sum 223 666 889
Bartlett -- C(8) 223,5794 0,0000
Rao -- F(8, 880) 31,6961 0,0000

Evaluations statistiques
Attribute Wilks L. Partial L. F(1,880) p-value
Age 0,784487 0,989576 9,26974 0,002399
Anciennete 0,805931 0,963245 33,57859 0,000000
MoyCred3 0,809978 0,958433 38,16577 0,000000
aveparmo 0,781785 0,992996 6,20702 0,012908
endett 0,776335 0,999966 0,02965 0,863322
moySold3 0,779421 0,996007 3,52754 0,060688
moyCred 0,777320 0,998699 1,14616 0,284647
mateparlo 0,792452 0,979629 18,29899 0,000021

3
1. Est-ce que le classifieur obtenu est bon ? Justifier votre réponse.
2. Déterminer les paramètres pertinents du classifieur (justifier votre réponse).
Calculer le taux d’erreur de classification.
Calculer le taux de rappel des deux classes en présence.

TR1 =

TR2 =

Vous aimerez peut-être aussi