MODULE 2 - MISE À NIVEAU
Intelligence Artificielle
Guide de Révision et Exercices Pratiques
Plateforme FORCE-N
Université Numérique Cheikh Hamidou Kane
Table des Matières
SÉQUENCE 1 : Notions de Base en Statistique .................. 3
SÉQUENCE 2 : Notions de Base en Algèbre ......................... 15
SÉQUENCE 3 : Programmation Python et Pandas ............ 28
Solutions des Exercices .................................................. 45
SÉQUENCE 1 : Notions de Base en Statistique
Durée : 2 heures | Objectifs : ML-ready
1.1 Représentation Graphique des Variables
Résumé des Concepts
Types de variables et leurs représentations :
Type de Variable Graphiques Appropriés Utilisation
Qualitative Nominale Diagramme en barres, Catégories sans ordre
Camembert (couleur, genre, ville)
Qualitative Ordinale Diagramme en barres Catégories avec ordre
ordonnées (niveau d'études,
satisfaction)
Quantitative Discrète Diagramme en bâtons, Valeurs numériques
Barres entières (nombre
d'enfants)
Quantitative Continue Histogramme, Boxplot, Valeurs numériques
Courbe réelles (taille, poids)
Points clés à retenir :
Le choix du graphique dépend du type de variable à représenter
L'histogramme divise les données continues en intervalles (bins)
Le boxplot montre la médiane, les quartiles et les valeurs aberrantes
Toujours étiqueter les axes et donner un titre explicite
1.2 Effectifs et Fréquences
Résumé des Concepts
Définitions fondamentales :
Effectif (nᵢ) : Nombre d'occurrences d'une modalité
Fréquence relative (fᵢ) : nᵢ / N, où N est l'effectif total
Fréquence cumulée : Somme des fréquences jusqu'à la modalité i
Pourcentage : fᵢ × 100
1.3 Relations entre Variables : Pairplot, Scatter Matrix, Heatmap
Nuage de points (Scatter Plot) :
Visualise la relation entre deux variables quantitatives. Permet d'identifier des tendances
linéaires, non-linéaires, ou l'absence de corrélation.
Pairplot (Matrice de nuages de points) :
Affiche les relations entre toutes les paires de variables d'un jeu de données. Sur la
diagonale, on trouve généralement des histogrammes ou des courbes de densité.
Heatmap (Carte de chaleur) :
Représentation matricielle utilisant des couleurs pour montrer l'intensité des corrélations.
Utile pour identifier rapidement les variables fortement corrélées.
Interprétation des corrélations :
Corrélation positive : Les deux variables augmentent ensemble (r proche de +1)
Corrélation négative : Quand l'une augmente, l'autre diminue (r proche de -1)
Pas de corrélation : Les variables sont indépendantes (r proche de 0)
Attention : Corrélation ≠ Causalité !
1.4 Indicateurs de Dispersion
Indicateur Formule Interprétation
Étendue (Range) Max - Min Différence entre la plus
grande et la plus petite
valeur
Variance σ² = Σ(xᵢ - μ)² / N Moyenne des carrés des
écarts à la moyenne
Écart-type σ = √variance Racine carrée de la
variance, dans la même
unité que les données
IQR Q3 - Q1 Écart interquartile, moins
sensible aux valeurs
extrêmes
1.5 Maximum de Vraisemblance (MLE)
Principe du MLE :
Le Maximum de Vraisemblance est une méthode d'estimation qui cherche les
paramètres θ d'un modèle qui maximisent la probabilité d'observer les données
observées.
Fonction de vraisemblance :
L(θ|x₁, x₂, ..., xₙ) = P(x₁, x₂, ..., xₙ|θ) = ∏ P(xᵢ|θ)
Log-vraisemblance :
ℓ(θ) = log L(θ) = Σ log P(xᵢ|θ)
On utilise le log car il transforme les produits en sommes, simplifiant les calculs.
Démarche :
1. Écrire la fonction de vraisemblance L(θ)
2. Passer au log : ℓ(θ) = log L(θ)
3. Dériver par rapport à θ : dℓ/dθ
4. Résoudre dℓ/dθ = 0 pour trouver θ̂
5. Vérifier que c'est un maximum (dérivée seconde < 0)
1.6 Cas Pratiques d'Estimation MLE
Loi de Bernoulli :
P(X = 1) = p, P(X = 0) = 1 - p
Estimateur MLE : p̂ = (nombre de succès) / n
Loi de Poisson :
P(X = k) = (λᵏ × e⁻λ) / k!
Estimateur MLE : λ̂ = moyenne des observations = x̄
Loi Normale (Gaussienne) :
Paramètres : μ (moyenne) et σ² (variance)
Estimateurs MLE : μ̂ = x̄ et σ̂² = Σ(xᵢ - x̄ )² / n
1.7 De MLE à MAP : Régularisation Bayésienne
Maximum A Posteriori (MAP) :
Le MAP intègre une connaissance a priori sur les paramètres à estimer.
Formule de Bayes :
P(θ|x) = [P(x|θ) × P(θ)] / P(x)
Où : P(θ|x) = a posteriori, P(x|θ) = vraisemblance, P(θ) = prior
Différence MLE vs MAP :
MLE : θ̂ = argmax L(θ|x) - ignore tout prior
MAP : θ̂ = argmax [L(θ|x) × P(θ)] - inclut le prior
Régularisation :
Le prior agit comme un régularisateur qui pénalise certaines valeurs de θ. C'est le lien
avec la régularisation L1 (Lasso) et L2 (Ridge) en machine learning.
EXERCICES - SÉQUENCE 1
Exercice 1.1 : Représentations Graphiques
Pour chacune des variables suivantes, indiquez le type (qualitative nominale/ordinale,
quantitative discrète/continue) et le graphique approprié :
6. Âge des étudiants d'une classe
7. Niveau de satisfaction (Très insatisfait, Insatisfait, Neutre, Satisfait, Très satisfait)
8. Marque de téléphone possédée
9. Nombre de frères et sœurs
10. Température moyenne journalière
Exercice 1.2 : Tableau de Fréquences
Un sondage auprès de 80 personnes sur leur mode de transport donne : Voiture (32),
Métro (28), Vélo (12), Marche (8).
Construisez un tableau complet avec les effectifs, fréquences, fréquences cumulées et
pourcentages.
Exercice 1.3 : Corrélation
Soit la matrice de corrélation suivante pour un dataset avec 4 variables (A, B, C, D):
Questions :
11. Quelles paires de variables sont fortement corrélées positivement ?
12. Quelles paires de variables sont fortement corrélées négativement ?
13. Quelles variables semblent indépendantes ?
14. Si vous deviez réduire la dimensionnalité, quelles variables pourriez-vous éliminer et
pourquoi ?
Exercice 1.4 : Indicateurs de Dispersion
Soit l'échantillon de données suivant : [12, 15, 18, 20, 22, 25, 28, 30, 35, 100]
Calculez :
15. La moyenne (μ)
16. La médiane
17. L'étendue (range)
18. La variance
19. L'écart-type
20. Les quartiles Q1, Q2, Q3 et l'IQR
21. Identifiez les valeurs aberrantes potentielles (outliers) en utilisant la règle IQR
22. [Link]
[Link]/docs/mlops/machine-learning/