0% ont trouvé ce document utile (0 vote)
4 vues6 pages

Module2 Guide Complet

Ce document est un guide de révision sur les notions de base en statistique, algèbre, et programmation Python, destiné à préparer les étudiants à l'intelligence artificielle. Il couvre des concepts tels que la représentation graphique des variables, les effectifs et fréquences, les relations entre variables, ainsi que des méthodes d'estimation comme le Maximum de Vraisemblance (MLE) et le Maximum A Posteriori (MAP). Des exercices pratiques sont également fournis pour renforcer l'apprentissage des concepts abordés.

Transféré par

shadrylaurey
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues6 pages

Module2 Guide Complet

Ce document est un guide de révision sur les notions de base en statistique, algèbre, et programmation Python, destiné à préparer les étudiants à l'intelligence artificielle. Il couvre des concepts tels que la représentation graphique des variables, les effectifs et fréquences, les relations entre variables, ainsi que des méthodes d'estimation comme le Maximum de Vraisemblance (MLE) et le Maximum A Posteriori (MAP). Des exercices pratiques sont également fournis pour renforcer l'apprentissage des concepts abordés.

Transféré par

shadrylaurey
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

MODULE 2 - MISE À NIVEAU

Intelligence Artificielle
Guide de Révision et Exercices Pratiques

Plateforme FORCE-N
Université Numérique Cheikh Hamidou Kane
Table des Matières
SÉQUENCE 1 : Notions de Base en Statistique .................. 3

SÉQUENCE 2 : Notions de Base en Algèbre ......................... 15

SÉQUENCE 3 : Programmation Python et Pandas ............ 28

Solutions des Exercices .................................................. 45


SÉQUENCE 1 : Notions de Base en Statistique
Durée : 2 heures | Objectifs : ML-ready

1.1 Représentation Graphique des Variables

Résumé des Concepts


Types de variables et leurs représentations :

Type de Variable Graphiques Appropriés Utilisation


Qualitative Nominale Diagramme en barres, Catégories sans ordre
Camembert (couleur, genre, ville)
Qualitative Ordinale Diagramme en barres Catégories avec ordre
ordonnées (niveau d'études,
satisfaction)
Quantitative Discrète Diagramme en bâtons, Valeurs numériques
Barres entières (nombre
d'enfants)
Quantitative Continue Histogramme, Boxplot, Valeurs numériques
Courbe réelles (taille, poids)

Points clés à retenir :

 Le choix du graphique dépend du type de variable à représenter


 L'histogramme divise les données continues en intervalles (bins)
 Le boxplot montre la médiane, les quartiles et les valeurs aberrantes
 Toujours étiqueter les axes et donner un titre explicite

1.2 Effectifs et Fréquences

Résumé des Concepts


Définitions fondamentales :

 Effectif (nᵢ) : Nombre d'occurrences d'une modalité


 Fréquence relative (fᵢ) : nᵢ / N, où N est l'effectif total
 Fréquence cumulée : Somme des fréquences jusqu'à la modalité i
 Pourcentage : fᵢ × 100

1.3 Relations entre Variables : Pairplot, Scatter Matrix, Heatmap


Nuage de points (Scatter Plot) :

Visualise la relation entre deux variables quantitatives. Permet d'identifier des tendances
linéaires, non-linéaires, ou l'absence de corrélation.
Pairplot (Matrice de nuages de points) :

Affiche les relations entre toutes les paires de variables d'un jeu de données. Sur la
diagonale, on trouve généralement des histogrammes ou des courbes de densité.

Heatmap (Carte de chaleur) :

Représentation matricielle utilisant des couleurs pour montrer l'intensité des corrélations.
Utile pour identifier rapidement les variables fortement corrélées.

Interprétation des corrélations :

 Corrélation positive : Les deux variables augmentent ensemble (r proche de +1)


 Corrélation négative : Quand l'une augmente, l'autre diminue (r proche de -1)
 Pas de corrélation : Les variables sont indépendantes (r proche de 0)
 Attention : Corrélation ≠ Causalité !

1.4 Indicateurs de Dispersion


Indicateur Formule Interprétation
Étendue (Range) Max - Min Différence entre la plus
grande et la plus petite
valeur
Variance σ² = Σ(xᵢ - μ)² / N Moyenne des carrés des
écarts à la moyenne
Écart-type σ = √variance Racine carrée de la
variance, dans la même
unité que les données
IQR Q3 - Q1 Écart interquartile, moins
sensible aux valeurs
extrêmes

1.5 Maximum de Vraisemblance (MLE)


Principe du MLE :

Le Maximum de Vraisemblance est une méthode d'estimation qui cherche les


paramètres θ d'un modèle qui maximisent la probabilité d'observer les données
observées.

Fonction de vraisemblance :

L(θ|x₁, x₂, ..., xₙ) = P(x₁, x₂, ..., xₙ|θ) = ∏ P(xᵢ|θ)

Log-vraisemblance :

ℓ(θ) = log L(θ) = Σ log P(xᵢ|θ)

On utilise le log car il transforme les produits en sommes, simplifiant les calculs.

Démarche :
1. Écrire la fonction de vraisemblance L(θ)
2. Passer au log : ℓ(θ) = log L(θ)
3. Dériver par rapport à θ : dℓ/dθ
4. Résoudre dℓ/dθ = 0 pour trouver θ̂
5. Vérifier que c'est un maximum (dérivée seconde < 0)

1.6 Cas Pratiques d'Estimation MLE


Loi de Bernoulli :

P(X = 1) = p, P(X = 0) = 1 - p

Estimateur MLE : p̂ = (nombre de succès) / n

Loi de Poisson :

P(X = k) = (λᵏ × e⁻λ) / k!

Estimateur MLE : λ̂ = moyenne des observations = x̄

Loi Normale (Gaussienne) :

Paramètres : μ (moyenne) et σ² (variance)

Estimateurs MLE : μ̂ = x̄ et σ̂² = Σ(xᵢ - x̄ )² / n

1.7 De MLE à MAP : Régularisation Bayésienne


Maximum A Posteriori (MAP) :

Le MAP intègre une connaissance a priori sur les paramètres à estimer.

Formule de Bayes :

P(θ|x) = [P(x|θ) × P(θ)] / P(x)

Où : P(θ|x) = a posteriori, P(x|θ) = vraisemblance, P(θ) = prior

Différence MLE vs MAP :

 MLE : θ̂ = argmax L(θ|x) - ignore tout prior


 MAP : θ̂ = argmax [L(θ|x) × P(θ)] - inclut le prior

Régularisation :

Le prior agit comme un régularisateur qui pénalise certaines valeurs de θ. C'est le lien
avec la régularisation L1 (Lasso) et L2 (Ridge) en machine learning.
EXERCICES - SÉQUENCE 1

Exercice 1.1 : Représentations Graphiques


Pour chacune des variables suivantes, indiquez le type (qualitative nominale/ordinale,
quantitative discrète/continue) et le graphique approprié :

6. Âge des étudiants d'une classe


7. Niveau de satisfaction (Très insatisfait, Insatisfait, Neutre, Satisfait, Très satisfait)
8. Marque de téléphone possédée
9. Nombre de frères et sœurs
10. Température moyenne journalière

Exercice 1.2 : Tableau de Fréquences


Un sondage auprès de 80 personnes sur leur mode de transport donne : Voiture (32),
Métro (28), Vélo (12), Marche (8).

Construisez un tableau complet avec les effectifs, fréquences, fréquences cumulées et


pourcentages.

Exercice 1.3 : Corrélation


Soit la matrice de corrélation suivante pour un dataset avec 4 variables (A, B, C, D):

Questions :

11. Quelles paires de variables sont fortement corrélées positivement ?


12. Quelles paires de variables sont fortement corrélées négativement ?
13. Quelles variables semblent indépendantes ?
14. Si vous deviez réduire la dimensionnalité, quelles variables pourriez-vous éliminer et
pourquoi ?

Exercice 1.4 : Indicateurs de Dispersion


Soit l'échantillon de données suivant : [12, 15, 18, 20, 22, 25, 28, 30, 35, 100]

Calculez :

15. La moyenne (μ)


16. La médiane
17. L'étendue (range)
18. La variance
19. L'écart-type
20. Les quartiles Q1, Q2, Q3 et l'IQR
21. Identifiez les valeurs aberrantes potentielles (outliers) en utilisant la règle IQR
22. [Link]
[Link]/docs/mlops/machine-learning/

Vous aimerez peut-être aussi