Examen-DEUX PAGES
A RENDRE PAR MAIL à [Link]@[Link]
Exercice 1
Nous allons travailler sur le dataset Pokemon joint au sujet et qui peut être téléchargé
[Link]
1. Décrire dataset
2. On veut maintenant visualiser ce dataset
(a) Créer un nouveau dataframe pokemon num où on garde uniquement les variables
numériques’
(b) Créer un dataframe pokemon type où le Type 1 de chaque pokemon est stocké.
En déduire la liste de toutes les valeurs que toutes la variable ’Type 1’ d’un
pokemon peut prendre
pokemon type[’Type 1’].unique().tolist()
(c) Visualiser le dataset en utilisant tout la PCA avec deux composantes
(d) Même chose avec t-SNE
(e) Peut-on distinguer facilement les différents types de pokemons?
Exercise 2
Le dataset [Link] est issu du UCI Machine Learning Repository. Dans ce dataset, 12
attribus sont utilisés pour décider de l’accord d’un prêt. Le but est de classer le candidat
au prêt en deux catégories, Y (yes) ou N (no), encodé dans la variable Loan Status qui
est la variable cible
1. Importer the dataset à l’aide la commande
df=[Link] csv(’/content/[Link]’)
2. Preprocessing
(a) Enlever les variables explicatives catégorielles et la variable LOAN Id
(b) Vérifier les missing values. Les enlever en utilisant la fonction dropna()
(c) Definir les features et les labels. Diviser en train et test en executant les com-
mandes suivantes
from [Link] selection import train test split
X train, X test, y train, y test = train test split(X, y, test size=0.2)
(d) Remplacer les valeurs N et Y de la variable cible par 0 et 1 à l’aide des com-
mandes
df[’Loan Status’].replace(’Y’, 1, inplace=True)
df[’Loan Status’].replace(’N’, 0, inplace=True)
3. Comparer les performances des Decision Trees et Random Forest sur la classification
des candidats au prêt en good ou bad
4. En utilisant une approche pertinente, donner l’importance de chaque variable ex-
plicative dans le random forest. Commenter
Université de Lorraine page 1 /2
Examen-DEUX PAGES
A RENDRE PAR MAIL à [Link]@[Link]
Exercise 3
Le dataset Prestige contient 102 obesrvations et 6 colonnes. Chaque ligne est une obser-
vation reliée à un métier.
1. Definir un modèle linéaire qui peret de prédire la variable income en fonction de
education
2. On veut maintenant améliorer la pr{ediction et prédire income en fonction de
women, prestige et education. Comparer les régressions OLS, Ridge et Lasso
regression. Commenter
Université de Lorraine page 2 /2