0% ont trouvé ce document utile (0 vote)
22 vues2 pages

Analyse de données et modélisation

Le document présente un examen en trois exercices portant sur l'analyse de données avec des datasets Pokémon, german.txt et Prestige. Les exercices incluent la description et la visualisation des données, le prétraitement pour la classification des prêts, et la modélisation linéaire pour prédire le revenu en fonction de l'éducation et d'autres variables. Les étudiants doivent appliquer des techniques de machine learning telles que PCA, t-SNE, Decision Trees, Random Forest, OLS, Ridge et Lasso regression.

Transféré par

Husam hr
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
22 vues2 pages

Analyse de données et modélisation

Le document présente un examen en trois exercices portant sur l'analyse de données avec des datasets Pokémon, german.txt et Prestige. Les exercices incluent la description et la visualisation des données, le prétraitement pour la classification des prêts, et la modélisation linéaire pour prédire le revenu en fonction de l'éducation et d'autres variables. Les étudiants doivent appliquer des techniques de machine learning telles que PCA, t-SNE, Decision Trees, Random Forest, OLS, Ridge et Lasso regression.

Transféré par

Husam hr
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Examen-DEUX PAGES

A RENDRE PAR MAIL à [Link]@[Link]


Exercice 1
Nous allons travailler sur le dataset Pokemon joint au sujet et qui peut être téléchargé
[Link]

1. Décrire dataset

2. On veut maintenant visualiser ce dataset

(a) Créer un nouveau dataframe pokemon num où on garde uniquement les variables
numériques’
(b) Créer un dataframe pokemon type où le Type 1 de chaque pokemon est stocké.
En déduire la liste de toutes les valeurs que toutes la variable ’Type 1’ d’un
pokemon peut prendre
pokemon type[’Type 1’].unique().tolist()
(c) Visualiser le dataset en utilisant tout la PCA avec deux composantes
(d) Même chose avec t-SNE
(e) Peut-on distinguer facilement les différents types de pokemons?

Exercise 2
Le dataset [Link] est issu du UCI Machine Learning Repository. Dans ce dataset, 12
attribus sont utilisés pour décider de l’accord d’un prêt. Le but est de classer le candidat
au prêt en deux catégories, Y (yes) ou N (no), encodé dans la variable Loan Status qui
est la variable cible

1. Importer the dataset à l’aide la commande


df=[Link] csv(’/content/[Link]’)

2. Preprocessing

(a) Enlever les variables explicatives catégorielles et la variable LOAN Id


(b) Vérifier les missing values. Les enlever en utilisant la fonction dropna()
(c) Definir les features et les labels. Diviser en train et test en executant les com-
mandes suivantes
from [Link] selection import train test split
X train, X test, y train, y test = train test split(X, y, test size=0.2)
(d) Remplacer les valeurs N et Y de la variable cible par 0 et 1 à l’aide des com-
mandes
df[’Loan Status’].replace(’Y’, 1, inplace=True)
df[’Loan Status’].replace(’N’, 0, inplace=True)

3. Comparer les performances des Decision Trees et Random Forest sur la classification
des candidats au prêt en good ou bad

4. En utilisant une approche pertinente, donner l’importance de chaque variable ex-


plicative dans le random forest. Commenter

Université de Lorraine page 1 /2


Examen-DEUX PAGES
A RENDRE PAR MAIL à [Link]@[Link]
Exercise 3
Le dataset Prestige contient 102 obesrvations et 6 colonnes. Chaque ligne est une obser-
vation reliée à un métier.

1. Definir un modèle linéaire qui peret de prédire la variable income en fonction de


education

2. On veut maintenant améliorer la pr{ediction et prédire income en fonction de


women, prestige et education. Comparer les régressions OLS, Ridge et Lasso
regression. Commenter

Université de Lorraine page 2 /2

Vous aimerez peut-être aussi