Dans le traitement des données, il est fréquent de se retrouver avec des bases
incomplètes. Les valeurs manquantes apparaissent pour plusieurs raisons : erreur de
saisie, panne d’appareil, refus de répondre lors d’un questionnaire, etc. Or, la plupart des
méthodes statistiques classiques ne fonctionnent correctement que lorsque toutes les
données sont présentes. Supprimer les observations incomplètes n’est pas toujours une
bonne solution car cela réduit la taille de l’échantillon et peut fausser les résultats.
C’est pour répondre à ce problème que l’algorithme EM, pour Expectation-
Maximisation, a été développé. Cet algorithme itératif permet d’estimer les paramètres
d’un modèle statistique même en présence de données manquantes. Il présente aussi
l’avantage de pouvoir être utilisé pour reconstituer ces valeurs manquantes.
L’objectif de ce travail est donc d’étudier l’algorithme EM. Nous allons d’abord
démontrer sa propriété fondamentale : à chaque itération, la vraisemblance augmente et
l’algorithme converge vers un point stationnaire. Dans un deuxième temps, nous
appliquerons l’algorithme EM pour estimer des paramètres sur un jeu de données
incomplet. Enfin, nous verrons comment il peut être utilisé comme méthode d’imputation
pour remplacer les valeurs manquantes.
Mots-clés : Algorithme EM, Données manquantes, Imputation, Estimation,
Vraisemblance.