0% ont trouvé ce document utile (0 vote)
1 vues2 pages

Etape 2: Exploration (Eda) : ETAPE 3: Préparation Des Données

Le document décrit les étapes d'analyse de données, y compris l'affichage des premières observations, la recherche de valeurs manquantes et le comptage des doublons. Il aborde également l'exploration des données avec des statistiques descriptives et des visualisations, ainsi que la préparation des données pour l'apprentissage automatique en séparant les variables explicatives et cibles, et en utilisant une méthode de Train/Test Split pour évaluer le modèle. Enfin, il souligne l'importance de ne pas utiliser les mêmes données pour l'apprentissage et le test afin d'obtenir une évaluation précise du modèle.

Transféré par

hiba.aitraho
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
1 vues2 pages

Etape 2: Exploration (Eda) : ETAPE 3: Préparation Des Données

Le document décrit les étapes d'analyse de données, y compris l'affichage des premières observations, la recherche de valeurs manquantes et le comptage des doublons. Il aborde également l'exploration des données avec des statistiques descriptives et des visualisations, ainsi que la préparation des données pour l'apprentissage automatique en séparant les variables explicatives et cibles, et en utilisant une méthode de Train/Test Split pour évaluer le modèle. Enfin, il souligne l'importance de ne pas utiliser les mêmes données pour l'apprentissage et le test afin d'obtenir une évaluation précise du modèle.

Transféré par

hiba.aitraho
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

df.

head() : Afficher les 5 premières observations

[Link]().sum() : Chercher les valeurs manquantes.

[Link]().sum() : Compter les lignes identiques.(car Les doublons peuvent fausser


l'apprentissage)

ETAPE 2 : EXPLORATION (EDA)


[Link]() : Calculer automatiquement les statistiques.( pour savoir si les donnees sont logiques ou
pas ;

df['LST'].corr(df['T_air']) : Calculer la corrélation entre les deux variables.( a quel point elles evoluent
ensemble)

Visualisations
fig, axes = [Link](1,3,figsize=(15,4)) : Créer une figure contenant 3 graphiques.

axes[0].scatter(df["LST"],df["T_air"] : Créer un nuage de points.

Chaque point représente une observation.

axes[0].set_xlabel("LST (°C)") /axes[0].set_ylabel("T_air (°C)") : Nom de l'axe vertical et


horizontal

axes[1].hist(df["LST"],bins=15) : Créer un histogramme.

Il montre comment les valeurs de LST sont réparties.

plt.tight_layout() : Éviter que les graphiques se chevauchent.

[Link]("01_exploration.png",dpi=120) : Enregistrer les graphiques.

ETAPE 3 : Préparation des données


Séparer les variables explicatives et la variable cible

X = df[["LST"]].values : "Prends uniquement la colonne LST." : mais sous une forme spéciale (une
matrice)

y = df["T_air"].values : "Prends uniquement la colonne T_air." /Cette variable y contient ce que le


modèle doit apprendre à prédire.

Si on donne les 150 observations au modèle pour apprendre et qu'on les utilise aussi pour le
tester, ce n'est pas une bonne évaluation.

C'est comme un élève qui révise exactement les questions de l'examen avant de le passer.

Il peut avoir 20/20 simplement parce qu'il les connaît déjà.


On veut savoir s'il est capable de répondre à des questions qu'il n'a jamais vues.

C'est exactement le rôle du Train/Test Split.

Le principe

On coupe le jeu de données en deux parties.

Par exemple :

150 observations

105 observations (70%) -------> Train

Le modèle apprend avec ces données.

Puis

45 observations (30%) -------> Test

Le modèle ne les voit jamais pendant l'apprentissage.

Elles servent uniquement à vérifier si le modèle prédit correctement.

X_test :Les données que le modèle ne connaît pas.

y_test : les vraies reponses

X_train : Il contient les valeurs de LST utilisées pour apprendre.

Y train : valeur de T_air mesuree pour lst train

Vous aimerez peut-être aussi