df.
head() : Afficher les 5 premières observations
[Link]().sum() : Chercher les valeurs manquantes.
[Link]().sum() : Compter les lignes identiques.(car Les doublons peuvent fausser
l'apprentissage)
ETAPE 2 : EXPLORATION (EDA)
[Link]() : Calculer automatiquement les statistiques.( pour savoir si les donnees sont logiques ou
pas ;
df['LST'].corr(df['T_air']) : Calculer la corrélation entre les deux variables.( a quel point elles evoluent
ensemble)
Visualisations
fig, axes = [Link](1,3,figsize=(15,4)) : Créer une figure contenant 3 graphiques.
axes[0].scatter(df["LST"],df["T_air"] : Créer un nuage de points.
Chaque point représente une observation.
axes[0].set_xlabel("LST (°C)") /axes[0].set_ylabel("T_air (°C)") : Nom de l'axe vertical et
horizontal
axes[1].hist(df["LST"],bins=15) : Créer un histogramme.
Il montre comment les valeurs de LST sont réparties.
plt.tight_layout() : Éviter que les graphiques se chevauchent.
[Link]("01_exploration.png",dpi=120) : Enregistrer les graphiques.
ETAPE 3 : Préparation des données
Séparer les variables explicatives et la variable cible
X = df[["LST"]].values : "Prends uniquement la colonne LST." : mais sous une forme spéciale (une
matrice)
y = df["T_air"].values : "Prends uniquement la colonne T_air." /Cette variable y contient ce que le
modèle doit apprendre à prédire.
Si on donne les 150 observations au modèle pour apprendre et qu'on les utilise aussi pour le
tester, ce n'est pas une bonne évaluation.
C'est comme un élève qui révise exactement les questions de l'examen avant de le passer.
Il peut avoir 20/20 simplement parce qu'il les connaît déjà.
On veut savoir s'il est capable de répondre à des questions qu'il n'a jamais vues.
C'est exactement le rôle du Train/Test Split.
Le principe
On coupe le jeu de données en deux parties.
Par exemple :
150 observations
105 observations (70%) -------> Train
Le modèle apprend avec ces données.
Puis
45 observations (30%) -------> Test
Le modèle ne les voit jamais pendant l'apprentissage.
Elles servent uniquement à vérifier si le modèle prédit correctement.
X_test :Les données que le modèle ne connaît pas.
y_test : les vraies reponses
X_train : Il contient les valeurs de LST utilisées pour apprendre.
Y train : valeur de T_air mesuree pour lst train