Multi-Classification des Défauts de Roulements
Multi-Classification des Défauts de Roulements
Année : 2018
Faculté des Sciences de l’Ingénieur
Département d’Électronique
Mémoire
Présenté en vue de l’obtention du diplôme de Master
Présenté par :
Mlle. HAMIS Rabia
DEVANT Le JURY
A mon père, qui m’encouragé tout le long de mes études, et qui m’a fourni tous les
moyens nécessaires pour assurer la réussite dans mes études.
A mes cher frères, mes amis, pour leurs encouragements, leur amour, et leur soutien
lors des moments difficiles.
ﷲ ﺳﺑﺣﺎﻧﮫ و ﺗﻌﺎﻟﻰ
اﻟﺤﻤﺪ
D’abord, mes propres remerciements pour mon encadreur Dr. Arbaoui F. Maître
de conférences pour m’avoir accepté pour l’encadrement de ce sujet. Merci pour la
confiance qu’il m’a accordé pour le traiter et l’accomplir. En effet, ce travail m’intéresse
beaucoup, merci pour ses conseils précieux et la clarté de ses explications, et aussi pour
sa grande contribution. Je tiens à lui exprimer toute mon respect et ma gratitude.
Pour avoir accepté d’évaluer mon travail et pour avoir pris le temps de
soigneusement étudier ce manuscrit. Leurs conseils ne seront qu’enrichissant et
bénéfiques.
ﻣ ﺺ
اﻟﻌﻨﻮان :ﺗﺼ ﻴﻒ ﻋﻴﻮب اﳌﺪرﺟﺔ اﻟﻜﺮو ﺔ ﻟﻶﻟﺔ ﻏ اﳌ اﻣﻨﺔ ﺑﺎﺳﺘﻌﻤﺎل ﺗﺤﻠﻴﻞ اﳌﻜﻮﻧﺎت اﻟﺮﺋ ﺴﻴﺔ
وﻓﺎﺻﻞ اﻟ ﻮاﻣﺶ اﻟﻜﺒ
اﻟﺧﻠل اﻟﻧﺎﺗﺞ ﻋن اﻟﻌﯾوب ﻣﺛل ﺗﺂﻛل أو ﺗﻠف ﻓﻲ اﻟﻣدرﺟﺔ اﻟﻛروﯾﺔ ﻫو أﺣد اﻷﺳﺑﺎب اﻟرﺋﯾﺳﯾﺔ ﻟﺳوء اﻷداء ﻓﻲ
اﻵﻻت ﻏﯾر اﻟﻣﺗزاﻣﻧﺔ ،اﻟذي ﯾؤدي إﻟﻰ ﺧﺳﺎﺋر ﻣﺎدﯾﺔ ﻣﻌﺗﺑرة.
اﻟﻐرض ﻣن ﻫذﻩ اﻟﻣذﻛرة ﻫو اﻟﺗﺷﺧﯾص اﻵﻟﻲ ﻟﻌﯾوب اﻟﻣدرﺟﺔ اﻟﻛروﯾﺔ ﻋﻠﻰ أﺳﺎس اﻟﺗﺣﻠﯾل اﻻﻫﺗزازي.
اﻟﺷﻌﺎع اﻟﻣﻛون ﻣن اﻟﻣﻌﻠﻣﺎت )اﻟﺧﺻﺎﺋص أو اﻟﻣؤﺷرات( ،أو ﻣﺎ ﯾﺳﻣﻲ اﻟﺷﻌﺎع اﻟﺷﻛﻠﻲ ،ﺗﺳﺗﺧرج ﻣؤﺷراﺗﻪ
اﻹﺣﺻﺎﺋﯾﺔ واﻟطﯾﻔﯾﺔ ﻟﻧﺗﺎﺋﺞ أﻣﺛل ﻣن اﻹﺷﺎرات اﻻﻫﺗ اززﯾﺔ اﻷﺻﻠﯾﺔ وﻣن اﻹﺷﺎرات اﻻﻫﺗ اززﯾﺔ اﻟﺗﻲ ﺗم ﻣﻌﺎﻟﺟﺗﻬﺎ
ﺑﺎﺳﺗﺧدام ﺗﺣﻠﯾل اﻟﻣﻛوﻧﺎت اﻟرﺋﯾﺳﯾﺔ.
أﺟرﯾت اﻟدراﺳﺔ ﺑﺎﺳﺗﻌﻣﺎل ﻗﺎﻋدة ﺑﯾﺎﻧﺎت ﺟﺎﻣﻌﺔ ، Case Western Reserve University:ﺣﯾث ﺗم
اﻟﺣﺻول ﻋﻠﻰ اﻹﺷﺎرات اﻻﻫﺗ اززﯾﺔ ﻓﻲ أوﺿﺎع وظروف ﺗﺷﻐﯾل ﻣﺧﺗﻠﻔﺔ )ﻓﻲ اﻟﺣﺎﻟﺔ اﻟﺳﻠﯾﻣﺔ وﻓﻲ ﺣﺎﻟﺔ وﺟود
اﻟﻌﯾب ،ﺗﻐﯾﯾر ﻓﻲ اﻟﺳرﻋﺔ ،ﺗﻐﯾﯾر ﻓﻲ اﻟﺣﻣوﻟﺔ وﺗﻐﯾﯾر ﻓﻲ ﺷدة اﻟﻌﯾب(.
ﻋﻼوة ﻋﻠﻰ ذﻟك ﺗﻣت إﺟراء دراﺳﺔ ﻣﻘﺎرﻧﺔ ﻣﻊ ﻧوع آﺧر ﻣن اﻟﻣﺻﻧﻔﺎت :اﻟﺷﺑﻛﺔ اﻟﻌﺻﺑﯾﺔ اﻻﺻطﻧﺎﻋﯾﺔ.وﻗد
أﺛﺑﺗت اﻟطرﯾﻘﺔ اﻟﻣﻧﺗﻘﺎة أي ﻓﺎﺻل اﻟﻬواﻣش اﻟﻛﺑﯾر ﻣﺗﻌدد اﻷﺻﻧﺎف ،ﻓﻌﺎﻟﯾﺔ أﻓﺿل ﻣن ﺣﯾث وﻗت وﻣﻌدل
ﺗﺻﻧﯾف ﺑﺎﻟﻣﻘﺎرﻧﺔ.
ﻓﻲ ﻣرﺣﻠﻪ اﻟﺗﺻﻧﯾف ،ﺗم اﻻﺣﺗﻔﺎظ ﺑﻔﺎﺻل اﻟﻬواﻣش اﻟﻛﺑﯾر ﻣﺗﻌدد اﻷﺻﻧﺎف.
أﺟرﯾت ﻣﻘﺎرﻧﺔ اﻟﻧﺗﺎﺋﺞ ﺑﯾن اﻟﺗﺣﻠﯾل اﻟزﻣﻧﻲ ﻣﻊ وﺑدون اﺳﺗﺧدام ﺗﺣﻠﯾل اﻟﻣﻛوﻧﺎت اﻟرﺋﯾﺳﯾﺔ ،وأظﻬرت اﻟﻧﺗﺎﺋﺞ
ﻓﻌﺎﻟﯾﺔ ﻫذا اﻟﻧﻬﺞ.
اﻟﻛﻠﻣﺎت اﻟداﻟﺔ :ﻓﺎﺻل اﻟﻬواﻣش اﻟﻛﺑﯾر ،اﻟﻣﻌﻠﻣﺎت اﻹﺣﺻﺎﺋﯾﺔ ،ﺗﺣﻠﯾل اﻟﻣﻛوﻧﺎت اﻟرﺋﯾﺳﯾﺔ ،إﺷﺎرة اﻫﺗ اززﯾﺔ،
ﻋﯾوب اﻟﻣدرﺟﺔ اﻟﻛروﯾﺔ.
Résumé
Le défaut de roulement est l'une des causes dominantes de disfonctionnements dans les
machines asynchrones, entraînant une perte économique significative.
L’objectif de ce mémoire est le diagnostic automatisé des défauts de roulements basé sur
l’analyse vibratoire.
L’étude a été menée sur la base de données de la Case Western Reserve University, où les
signaux ont été acquis dans différents modes et conditions de fonctionnement (sain et avec
défauts, variations de vitesse, variation de charges et variation de la sévérité du défaut).
Dans la phase de classification, les séparateur à vaste marges (SVM) multi-classes ont été
retenus.
Une comparaison des résultats dans le domaine temporel avec et sans analyse en
composantes principales a été effectué, les résultats obtenus montrent l’efficacité de cette
approche.
Ensuite une étude comparative a été effectuée avec le classificateurs à base Réseaux de
Neurones Artificiels (RNA). On a constaté une meilleure efficacité en termes de temps et taux
de classification du multi-SVM par rapport aux RNA.
The rolling defect is one of the main causes of dysfunctions in induction machines, resulting
in a significant economic loss.
The main purpose of this study is an automated diagnosis of bearing defects based on
vibratory analysis.
The study was carried out on the Case Western Reserve University database, where the
signals were acquired in different modes and operating conditions (healthy and with defaults,
speed variations, load variation and variation in defect severity).
In the classification phase, the Multi-Class Support Vector Machine (SVM) was chosen.
A comparison of the results of the temporal domain with and without principal component
analysis was performed; the results obtained show the effectiveness of this approach.
Key words: Support Vector Machines (SVM), Statistical parameters, principal component
analysis (PCA), rolling failure, vibration signal.
Liste des figures
Chapitre 1
1.1 Constitution d’un roulement ……………………………………………………………… 4
1.3 Photos représentant les différents défauts de roulements. (a) Corrosion, (b) : Cratère bille,
(c) : Cratère bague intérieure, (d) : Cratère bague extérieure, (e) : mécanismes généraux
d’usure en présence de contaminant ……………………………………………………… 5
Chapitre 2
2.1 Représentation des étapes de la construction du modèle PCA…………………….... 15
2.2 Illustration graphique de l’effet du centrage et de réduction d’une distribution
bivariable, (a) Distribution d’origine,
Chapitre 3
3.1 Illustration d’une classification binaire linéaire SVM ...………………………….... 23
3.2 Illustration du choix de la marge avec un hyperplan optimal……………………...... 23
3.3 Schéma de changement des représentations non linéaires
vers un nouvel espace ………........................................................................................... 26
3.5 Classification SVM binaire avec le noyau poly 2ième degré de Kernel ………….... 27
Chapitre 4
4.1 Le Banc d’essai de la CWRU………………………………………………………... 34
4.13 Variation de quelques paramètres temporels et fréquentiels du signal avec défaut bague
externe……………………………………………………………………………………... 37
4.14 Schéma présentant les étapes de diagnostic…………………………………………. 38
Liste des tableaux
4.1. Données vibratoires des défauts avec une fréquence d’échantillonnage de 12K HZ /
CWRU…………………………….…………………….……………………......... 34
4.1. Composantes principales obtenues pour les deux cas................................................. 41
4.3 : Récapitulatif des résultats obtenus :…………………….……………………......... 42
Table des matières
Dédicaces
Remerciements
Résumé / Abstract / ﻣﻠﺨﺺ
Liste des figures
Introduction générale :………………………………………………………………………..... 1
Chapitre 1. Défauts Roulements et analyse vibratoires
1.1. Roulement : ……………………………………………………………………………...... 4
1.2. Types des défauts roulements :…………………………………………............................. 4
1.2.1. Écaillage :………………………………………………………………………........ 5
1.2.2. Grippage :.................................................................................................................... 5
1.2.4. Détérioration des cages:.............................................................................................. 5
1.3. Fréquences caractéristiques et défauts :…………………………………………….... 5
1.3.1. Les paramètres caractéristiques d’un roulement :………………………………...... 7
1.4. Définition d’une vibration :……………………………………………………………..... 7
1.4.1 Analyse vibratoire :………………………………………………………………... 8
Les machines industrielles automatisées sont composées de divers sous-systèmes, tels que
le système de commande électrique, unités de commande(API), les actionneurs (vérins, moteurs
asynchrones, distributeurs) ces composants sont impliqués dans l'exécution des opérations
désirées des machines.
Les composants structurels d'une machine tels que les roulements à billes, sont soumis à
l'usure au fil du temps, la surveillance de ces composants est donc nécessaire pour réduire
régulièrement le risque de défaillances et de pannes par un diagnostic anticipatif ou précoce des
défauts et assurer la disponibilité et l'utilisation efficace et optimale des machines qui sont les
facteurs clés de l'économie de l'entreprise manufacturière.
Le succès de cette méthode est justifié par les solides bases théoriques qui la soutiennent. Il
existe en effet un lien direct entre la théorie de l’apprentissage statistique et l’algorithme
d’apprentissage du SVM.
La méthode SVM est une technique de classification particulièrement bien adaptée pour la
reconnaissance des formes et traite des données très diversifiées ayant plusieurs dimensions
telles que les textes, les images, la voix, le diagnostiques médicales, la bio-informatique pour
la reconnaissance de gènes …etc. Le champ d’application des SVM est large et représente une
méthode de classification intéressante.
2
Chapitre
1.1. Roulement :
Le roulement assure la liaison mobile en rotation avec un minimum de frottement entre deux
éléments, tout en supportant des charges radiales ou axiales plus ou moins importantes [8].
De manière générale, les roulements sont constitués ; de deux bagues (externe et interne)
l’une fixe et l’autre tournante avec le rotor. Elles sont séparées par un ensemble d’éléments
roulants qui peuvent être des billes, des rouleaux ou des aguilles selon l’application envisagée,
une cage séparant à intervalles réguliers et guidant les éléments roulants.
Cage
Selon leurs applications, et la criticité des machines sur lesquelles ils sont montés, les
roulements nécessitent plus ou moins une surveillance et un entretien préventif. Pour cela le
suivi des niveaux de vibration et de température, sont les sources d’information les plus
utilisées.
Les aspects de ces détériorations se manifestant dans la plupart des cas par un arrachement
de matière plus ou moins important, comme par exemple :
Chapitre 1 Défauts Roulements & Analyse Vibratoire 5
1.2.1. Écaillage :
(a) (b)
Figure 1.2 : (a) Ecaillage d’une bague intérieure, (b) Criques de corrosion
1.2.2. Grippage :
Des traces brunes dues à l’échauffement, des déformations de corps roulants, et des micros
fusions peuvent apparaitre.
Se manifestant avec des traces visibles d’outils, et des ruptures des bagues.
(e)
(b) (a)
(c) (d)
Figure 1.3 : photos représentant les différents défauts de roulements. (a) Corrosion, (b) :
Cratère bille, (c) : Cratère bague intérieure, (d : Cratère bague extérieure, (e) : mécanismes
généraux d’usure en présence de contaminant.
La présence d’un défaut au niveau d’un roulement à un impact sur le spectre de son signal
vibratoire tel qu’une augmentation de l’amplitude de la vibration aux fréquences du roulement,
Chapitre 1 Défauts Roulements & Analyse Vibratoire 6
mais aussi la présence des vibrations aux harmoniques de ces fréquences ainsi qu’à des
fréquences de modulation, le spectre va faire apparaître un peigne de raie à la fréquence du
défaut et des bandes latérales à la fréquence de rotation de l’arbre (F0).
Figure 1.5 : Fréquence caractéristique d’un défaut de type écaillage affectant la bague
extérieure [3]
Différentes fréquences sont obtenues pour des défauts, les quatre fréquences caractéristiques
sont les suivantes [6]:
(Ball Frequency [BF]) : La fréquence de passage
d’un défaut de bille ;
(Ball Passing Frequency Outer Race [BPFO]) : La
fréquence de passage d’un élément roulant sur un
défaut de bague extérieure ;
(1.1) (Cage Frequency [CF]) : La fréquence de passage
d’un défaut de cage ;
la fréquence de rotation mécanique ;
(Ball Passing Frequency Inner Race [BPFI]) : La
fréquence de passage d’un élément roulant sur un
défaut de bague intérieure.
Chapitre 1 Défauts Roulements & Analyse Vibratoire 7
• Le nombre de billes,
• le diamètre de bille,
• l’angle de contact.
La vibration d'une machine soumise à une force périodique peut être décrite en termes de
déplacement, de vitesse ou d'accélération. La vitesse du mouvement vibratoire correspond à la
variation de son déplacement pour une unité de temps. L'accélération représente une variation
de la vitesse par unité de temps.
A ces grandeurs sont associées une période temporelle et une phase. Ainsi, dans le cas d’une
machine tournante, une vibration élémentaire peut se mettre sous la forme :
( ) = . sin(2 . . ) (1.2)
= = (1.3)
( )
Chapitre 1 Défauts Roulements & Analyse Vibratoire 8
La thermographie infrarouge
L’analyse des mesures ultrasonore
Les outils utilisés pour mesurer les vibrations se sont considérablement améliorés au cours
des dernières années. Le capteur de choix pour la plupart des données de vibration sur les
machines industrielles est un accéléromètre : c’est un capteur qui convertit le mouvement
mécanique en un signal électrique.
Les techniques du domaine temps-fréquence sont principalement utilisées pour traiter des
signaux vibratoires non stationnaires. On y distingue la transformée de Fourier courte, la
distribution de Wigner-Ville, l’analyse en ondelettes notamment la décomposition en paquets
d’ondelettes (Wavelet Packet Decomposition : WPD), la décomposition modale empirique et
la transformée de Hilbert-Huang.
L’une des Méthodes la plus efficace pour l’analyse des signaux non stationnaires est l’analyse
en composante principale (ACP ou PCA en anglais pour principal component analysis). C’est
une méthode de la famille de l'analyse des données et plus généralement de la statistique
multivariée, qui consiste à transformer des variables liées entre elles (dites « corrélées » en
statistique) en nouvelles variables décorrélées les unes des autres. Ces nouvelles variables sont
nommées « composantes principales », ou axes principaux. Elle permet de réduire le nombre
de variables et de rendre l'information moins redondante.
Les paramètres statistiques quantifient les informations sur la forme et l'énergie du signal,
elles peuvent refléter l’état de santé mécanique sous différents aspects et peuvent se compenser
mutuellement à différents niveaux de défaut.
Chapitre 1 Défauts Roulements & Analyse Vibratoire 9
Extraction des
caractéristiques
Après l'étape d'extraction des paramètres, l’étape de sélection est cruciale pour trouver quels
sont les paramètres les plus importants et les plus fiables pour la détection du défaut. En effet,
si les paramètres sont sélectionnés avec peu de pouvoir de discrimination, la conception
ultérieure d'un classificateur conduirait à de mauvaises performances.
D'autre part, si les paramètres avec des informations riches sont sélectionnés, la précision de
la classification augmente et le temps de calcul est réduit.
Les techniques de sélection d’indicateurs sont divisibles en trois catégories, selon la manière
dont elles interagissent avec le classificateur [11] :
Elles concernent le calcul des paramètres statistiques du signal. Elles sont utilisées en
classification, détection et diagnostic de défaillances où elles donnent des résultats acceptables.
x(n) (1.4)
Moyenne ∶ x =
N
∑ (x(n)_x ) (1.5)
Variance ∶ x =
N
∑ (x(n) − x ) (1.6)
Kurtosis x =
(N − 1)σ
x (1.7)
Clearance factor ∶ CLF =
1
∑ |x(n)|
N
∑ (x(n) − x ) (1.8)
Mean absolute deviation ∶ MAD =
N
Range ∶ x = |x −x | (1.9)
(1.10)
∑ (x(n) − x )
Standarddeviation ∶ STD =
N
x (1.11)
PeakmagnitudetoRMSratio: Crest factor =
RMS
Où x(n) / (n= 1, ..., N) est l'amplitude au point d'échantillonnage n et N est le nombre de
points d'échantillonnage. xm est le moyen de x, σ est l'écart type de x.
La fréquence moyenne :
∑ .
Mean Frequency ∶ f = ∑ (1.11)
Références Bibliographiques
[1] Guyon, I., & Elisseeff, A. (2003). An introduction to variable and feature selection. Journal
of machine learning research, 3(Mar), 1157-1182.
[2] Ilyes, KHELF. (2014) Diagnostic des machines tournantes par les techniques de
l’intelligence artificielle. Thèse de doctorat. Université de Badji Moktar Annaba.
[3] Ishak T. (2012) Extraction d’indicateurs robustes pour le diagnostic des défauts
mécaniques : Comparaison de L’EMD et des ondelettes (WT). Thèse de doctorat. Université
Ferhat Abbas de Sétif 1.
[4] Lin, S. W., Lee, Z. J., Chen, S. C., & Tseng, T. Y. (2008). Parameter determination of
support vector machine and feature selection using simulated annealing approach. Applied soft
computing, 8(4), 1505-1512.
[6] McInerny S.A. and Dai Y. (2003), Basic vibration signal processing for bearing fault
detection, IEEE Transactions On Education, Vol.46, No.1.
[7] Ming, Y., Chen, J., & Dong, G. (2011). Weak fault feature extraction of rolling bearing
based on cyclic Wiener filter and envelope spectrum. Mechanical Systems and Signal
Processing, 25(5), 1773-1785.
[8] Morel, J. (1992). Vibrations des machines et diagnostic de leur état mécanique. Collection
de la Direction des études et recherches d’électricité de France.
[9] Oskoei, M. A., & Hu, H. (2008). Support vector machine-based classification scheme for
myoelectric control applied to upper limb. IEEE transactions on biomedical
engineering, 55(8), 1956-1965.
[10] Samanta, B., Al-Balushi, K. R., & Al-Araimi, S. A. (2003). Artificial neural networks and
support vector machines with genetic algorithm for bearing fault detection. Engineering
Applications of Artificial Intelligence, 16(7), 657-665.
[11] Tang, D., Wei, F., Qin, B., Liu, T., & Zhou, M. (2014, August). Coooolll: A deep learning
system for twitter sentiment classification. In Proceedings of the 8th International Workshop
on Semantic Evaluation (SemEval 2014) (pp. 208-212).
[12] W. Yan, H. Qiu, and N. Iyer, (2008). Feature extraction for bearing prognostics and health
Chapitre
L’analyse en Composantes
Principales
Chapitre 2 L’analyse en Composantes Principales 14
2.1. Introduction :
L’analyse en composantes principales (ACP) est une méthode statistique d’analyse des
données multivariée qui fait la projection orthogonale linéaire, elle projette des observations
multidimensionnelles représentées dans un espace de dimension (où m étant le nombres
des variables observées) sur un sous espace de dimension inférieure (ℓ < ) tout en
minimisant la perte des informations, aussi en maximisant la variance des projections et la
minimisation de la distance quadratique moyenne entre les points de données et leurs
projections. On obtient, alors, un nouvel espace de variables appelées les composantes
principales d’une variance maximale et non corrélées entre eux, ces derniers sont en
combinaisons linéaires avec les variables originelles. Ces nouvelles variables sont ensuite
utilisées à des fins de modélisation, d’estimation d’état, de diagnostic de fonctionnement de
système.
Les différentes étapes pour la construction du modèle PCA sont hiérarchisées comme suit :
Chapitre 2 L’analyse en Composantes Principales 15
(a) (b)
×
= [ (1) , … , ( )] ∈ ℝ (2.1)
( ) = [ ( ) , … , ( )] ∈ ℝ (2.2)
= { ‖ − ‖ } = −
= ( − ̂ )( − ̂ ) = { − ̂ ̂} (2.5)
= { ( ) − ̂ ̂} = {Σ} − { ̂ ̂ }
= {Σ} − ( )
La minimisation du critère d’erreur d’estimation de PCA est équivalent à la maximisation
du , alors [1] :
= { ̂ ̂} = ∑ℓ = ∑ℓ = ∑ℓ (2.6)
D’après l’équation précédente, la maximisation du critère est équivalente à une maximisation
de la variance de la composante . Le problème d’optimisation est donc reformulé comme suit :
Chapitre 2 L’analyse en Composantes Principales 17
Soit ∈ ℝ la projection du vecteur de données le long d’une direction représentée par une
vecteur unitaire ∈ ℝ . La composante t est donné par = = , sous la contrainte
‖ ‖ = = 1. Elle représente une nouvelle variable ayant une moyenne et une variance
qui dépendent des propriétés statistiques de x comme suit :
{ } = { }= { }=0
{ } = {( − { }) } = { } (2.8)
{( )( )} = { }
= Σp
L’expression précédente est un problème d’optimisation sous contrainte qui admet une solution
par l’application de la méthode de multiplicateur de Lagrange, donc l’expression de la
résolution est formulée par la fonction de Lagrange suivante [1,2] :
ℒ( , ) = ( )− ( − 1) = − ( − 1) (2.9)
Où est le multiplicateur de Lagrange et le vecteur maximisant le critère d’optimisation ,
est solution du système d'équations suivant :
ℒ( , )⁄ = − =0
(2.10)
ℒ( , )⁄ = −1 =0
Un tel système d’équations admet des solutions réelles de la variable Par la résolution directe
de l’équation caractéristique [1,7] :
{Σ − λI } = 0 (2.11)
Ces solutions sont les valeurs propres de la matrice de covariance Σ et qui sont associées
au m vecteurs propres [1,2] :
( Σ − λ ) = 0 ⟹ Σ = (2.12)
Elle est donnée aussi sous forme matricielle comme suit [1,2] : ΣP = PΛ
×
Avec = [ ,…, ]∈ℝ : la matrice de projection des données, et
×
Λ = diag{λ , … , λ } ∈ ℝ : La matrice diagonale des valeurs propres de Σ.
Alors nous avons les propriétés suivantes :
la matrice de covariance Σ est symétrique,
les m valeurs propres sont réelles et les m vecteurs propres sont orthogonaux,
alors les vecteurs propres forment une base orthonormée [1,2] :
Chapitre 2 L’analyse en Composantes Principales 18
×
= = ∈ℝ (2.13)
Avec la matrice d’identité d’ordre .
Par conséquent :
Σp = Λ (2.14)
Cela montre que les éléments diagonaux de Λ sont arrangées dans l’ordre décroissant [1]
≥ , … , ≥
Le vecteur de données ( ) peut se transformer sans aucune perte d’informations en un vecteur
de composantes principales contenant de nouvelles variables non corrélées, qui sont des
combinaisons linéaires des variables originelles. Ce nouveau vecteur des variables (vecteur des
composantes principales) est exprimé par la relation suivante [1] :
( ) = [ ( ), … , ( )] = ( ) ℝ (2.15)
Avec ( = {1, … , } ) sont les composantes principales projeté dans le sous espace [1,7] :
( )= ( )= (2.16)
= = Σp = 0 ≠ (2.17)
Aussi on peut représenter la matrice des composantes sous forme matricielle suivante [1] :
×
= [ (1), … , ( )] = ℝ (2.18)
Le vecteur de données ( ) est défini par le vecteur de composantes principales associées avec
le vecteur [1] : ( )= ( )=∑ ( )
L’estimation ( ) du vecteur de données ( ) dans l’espace réduit qui est formé par les
premières valeurs propres est donnée par [1] :
( )= ̂( ) = ( )= ( ) (2.19)
Où ∈ ℝ × est la matrice qui caractérise le modèle PCA et dont la matrice optimale de
représentation est exprimée par [1] :
×ℓ
= [ ,.., ℓ] ℝ
Ainsi le vecteur des composantes est exprimé par [1] :
̂( ) = ( ) ∈ ℝℓ (2.20)
Les pertes des informations pendant la réduction peuvent être récupérées à partir du vecteur
résiduel comme suit [1] :
( )= ̃( ) = ( )= ( ) (2.21)
Chapitre 2 L’analyse en Composantes Principales 19
×( ℓ)
Avec =[ ℓ ,…, ] ℝ
×
Et = = − ℝ
La notion de la modélisation par PCA est divisée en deux parties, la réduction en un sous-espace
principale, et un sous-espace résiduel, donc la décomposition du vecteur de mesures est donné
par [1] : ( )= ( )+ ( ) (2.22)
Pour cela, il existe des nombreux critères permettent de la détermination optimale des nombres
des composantes retenues. Parmi ces critères, on peut citer la méthode du pourcentage cumulée
de la variance totale, la méthode validation cumulée (PRESS), la méthode de la variance de
l’erreur de reconstruction VER, et le Scree test [1,4].
Les valeurs propres de la matrice de corrélation représentent les variances des CPs. Par
conséquent, elles ont été utilisées pour définir un critère PCV dans le but est la détermination
de la structure optimale d'un modèle ACP. Ce critère représente le pourcentage de la variance
expliquée par les CPs retenues comme suit :
∑ℓ
(ℓ) = 100 % (2.23)
∑
Généralement, on essaie de retenir avec ce critère un nombre de CPs ayant un PCV compris
entre 90% et 95% ou 99% de la variance totale.
L'idée de la validation croisée est basée principalement sur la prédiction à travers un modèle
ACP d'une mesure xi(k) de la matrice de données X. Le nombre des CPs retenues est optimal
si la moyenne de la prédiction globale d'une telle mesure n'est plus significativement améliorée
par l'ajout de CPs supplémentaires.
Chapitre 2 L’analyse en Composantes Principales 20
L’approche de la validation cumulée présente un critère qui est appelé PRESS, et le principe
général de ce dernier est la minimisation de la somme des carrées des erreurs des prédictions,
et qui est donné par la formule suivante :
ℓ
( ℓ) = ∑ ∑ ( )− ( ) (2.24)
ℓ
Où ( ) est la prédiction de ( ), N étant la taille du jeu de validation.
Il existe un algorithme simplifié de ce critère qui permet de calculer les composantes principales
comme suit :
3. le Scree test :
Le Scree Test ou test du coude est une approche empirique proposée principalement pour la
sélection du nombre optimal des CPs. Elle est basée sur un test du coude de la courbe du
pourcentage de la variance résiduelle dont l'expression est la suivante :
∑ ℓ
(ℓ) = 100 % (2.25)
∑
Chapitre 2 L’analyse en Composantes Principales 21
Références Bibliographiques
[1] Baligh MNASSRI .2012. Surveillance des processus industriels par analyse en
composantes principales. Thèse de doctorat, Université d'Aix-Marseille.
[2] Chaouch Alima. 2013. Surveillance de l’état de fonctionnement d’un procédé biologique
de dépollution. Mémoire de magister, Université 20 Aout 1955 – Skikda
[3] Anissa Ben Aicha. . Détection et localisation de défauts par Analyse en Composantes
Principales certaine ou incertaine de type intervalle. Thèse de doctorat, l’Ecole Nationale
d’Ingénieurs de Monastir.
[4] Bergoug Aicha. 2016/2017. Détection et Localisation de Défauts par Analyse en
Composantes Principale (ACP). Mémoire Master
À partir de ce modèle qui a été construit avec les paramètres optimaux, il sera possible de
prédire la classe ou la catégorie d’un nouvel objet qui lui est soumis.
Les points les plus proches, qui seuls sont utilisés pour la détermination de l’hyperplan, sont
appelés vecteurs de support.
Chapitre 3 Multi classification par les séparateurs à vaste marges 24
Il est évident qu’il existe une multitude d’hyperplan valide mais la propriété remarquable
des SVM est que cet hyperplan doit être optimal : cela revient à chercher un hyperplan dont la
distance minimale aux exemples d’apprentissage est maximale.
On appelle cette distance « marge » entre l’hyperplan et les exemples. L’hyperplan séparateur
optimal est celui qui maximise la marge. Comme on cherche à maximiser cette marge, on
parlera de séparateurs à vaste marge
a b c
Figure 3.2 : Illustration du choix de la marge avec un hyperplan optimal
En général, la classification d’un nouvel exemple inconnu est donnée par sa position par rapport
à l'hyperplan optimal. Dans le schéma (c), le nouvel élément sera classé dans la catégorie des «
+ ».
Chapitre 3 Multi classification par les séparateurs à vaste marges 25
De façon similaire, dans un modèle linéaire (voir figure (3.1)), la distance entre un point et le
hyperplan séparateur qui a pour équation + = 0 est donnée par :
| |
( )= (3.2)
|| ||
L’hyperplan optimal est celui pour lequel la distance aux points les plus proches (Marge) est
maximale. L’équation générale de l’hyperplan est H : + = 0 où :
= +1 ; + ≥ 1
= −1 ; + ≤ 1 (3.3)
{ , } ; ( + ) ≥ 1
On peut donc en déduire que maximiser la marge revient à minimiser son inverse ||w||/2 sous la
contrainte ( . + ) ≥ +1.
|w| = (3.4)
On a (3.5)
( . + ) ≥ +1
Ce genre de problème d’optimisation peut être résolu en associant un multiplicateur de
Lagrange ≥ 0.
( , , )= − ∑ ( . + )+∑ (3.6)
Pour trouver la solution du problème primal, il faut minimiser le lagrangien par rapport à w et
le maximiser par rapport aux . Pour cette solution, les dérivées partielles du lagrangien
s’annulent, selon les conditions de Kuhn-Tucker, on obtient :
( , , ) ( , , )
= 0, = 0 ≥0 (3.7)
=∑ ∑ = 0 (3.8)
Et en les réinjectant dans le Lagrangien on obtient le Lagrangien dual qui doit être maximisé
( , , )=∑ − ∑ ∑ (3.9)
Si les ∗ sont solutions de ce problème c.à.d. les multiplicateurs optimaux correspondant aux
points les plus proches et sont non-nuls. Alors les points sont appelés vecteurs de supports.
∗ ∗ ∗
Et on a le optimal : =∑ (3.10)
( )= ∗
(∑ . + ) (3.12)
Pour surmonter les inconvénients des cas non linéairement séparable, l’idée des SVM est
d’utiliser des fonctions noyaux et de projeter les données de l’espace d’entrée (non linéairement
séparables) dans un espace de plus grande dimension, de façon à ce que les données deviennent
linéairement séparables.
Plus la dimension du nouvel espace est grande, plus la probabilité de pouvoir trouver un
hyperplan séparateur entre les classes est élevée, ceci est illustré dans la figure (3.3).
En pratique, il revient à l’utilisateur du SVM d’effectuer des tests pour déterminer la fonction
noyau qui convient le mieux pour son application.
Chapitre 3 Multi classification par les séparateurs à vaste marges 27
Figure 3.3 : Schéma de changement des représentations non linéaires vers un nouvel espace
Le noyau permet de projeter les données dans un espace transformé espace-φ de grande
dimension dans lequel s’opère plus facilement la séparation des classes.
Pour qu’il existe un espace-φ et une fonction φ correspondant à un noyau K, il suffit que K
soit un “noyau de Mercer”, K doit vérifier les propriétés suivantes :
K est une fonction continu, symétrique défini-positive qui associe à tout couple
d’observations (x, x’) une mesure de leur « influence réciproque » calculée à travers leur
corrélation (les noyaux projectifs) ou leur distance (les noyaux radiaux)
On peut citer les exemples de noyaux : polynomiale, gaussien, sigmoïde et Laplacien.
Les différentes fonctions du Noyau (Kernel) : Les différentes fonctions du noyau Kernel
sont les suivantes :
Chapitre 3 Multi classification par les séparateurs à vaste marges 28
Figure 3.5 : Classification SVM binaire avec le noyau poly 2ième degré de Kernel.
‖ ‖
Noyau Gaussien (Radial Basis Function, RBF) : ( , ) = (3.15)
On discute dans la suite deux méthodes utilisées dans les vecteurs de support traitant des
problèmes multi classes.
• un contre tous.
• un contre un.
Dans la méthode ”un contre tous”, un problème de classification de n classes est converti en
n classificateurs binaires et pour le classificateur ‘i’ binaire, la classe i est séparé des autres
classes.
Chapitre 3 Multi classification par les séparateurs à vaste marges 29
( ) ∅( ) (3.16)
( ) (3.17)
( ) =1
Le ième SVM est formé avec tous les exemples dans la ième classe avec des étiquettes positives
et tous les autres exemples avec des étiquettes négatives, ainsi, l’hyperplan Di (x) = 0 forme
l'hyperplan de séparation optimal avec Di (x) ≥ 1 pour la ième classe et ceux qui appartiennent
aux classes restantes satisfont Di (x) ≤ -1.
Chapitre 3 Multi classification par les séparateurs à vaste marges 30
Résultat
Figure 3.8 : Schéma des hyperplans linéaires pour la classification un contre tous
(One vs all) /n=4
Chapitre 3 Multi classification par les séparateurs à vaste marges 31
Résultat
Dans l’approche ”un contre un”, les fonctions de décision sont déterminées à partir des
combinaisons des deux classes. Pour déterminer une fonction de décision pour une classe paire,
nous utilisons les données d’apprentissage pour les deux classes correspondant. Ainsi, dans
chaque session d’apprentissage, le nombre de données d’apprentissages est considérablement
réduit par rapport à ”un contre tous”, qui utilisent tous les données d’apprentissage.
Mais le nombre de fonctions de décision est n(n−1) /2 comparativement avec n de ”un contre
tous”, où n est le nombre de classes.
( ) ∗ ∅( ) ∗ (3.18)
Références Bibliographiques
[1] De Souza, D. B., Chanussot, J., & Favre, A. C. (2014, May). On selecting relevant
intrinsic mode functions in empirical mode decomposition: An energy-based approach.
In Acoustics, Speech and Signal Processing (ICASSP), 2014 IEEE International Conference
on (pp. 325-329). IEEE.
[2] Guyon, I., & Elisseeff, A. (2003). An introduction to variable and feature selection. Journal
of machine learning research, 3(Mar), 1157-1182.
[3] Jean-Christophe Cexus, (2005) Analyse des signaux non-stationnaires par transformation
de Huang, Operateur deTeager-Kaiser, et Transformation de Huang-Teager (THT). Acoustics.
Université Rennes 1. French. <tel-00012141>.
[5] N.E. Huang, Z. Shen, S.R. Long, M.C. Wu, H.H. Shih, Q. Zheng, N.C. Yen, [Link] et
H.H. Liu, (1998): The empirical mode decomposition and the Hilbert spectrum forNonlinear
and non-stationary time series analysis. Proceedings of the Royal Society of London,
454:903–995.
Chapitre
Résultats de simulation
Chapitre 4 Résultats de simulations 33
Comme représenté sur la figure 4.1, le banc d'essai se compose principalement d'un moteur
(à gauche), d'un accouplement « transducteur/encodeur »
(au centre), d'un dynamomètre (à droite) et d’un module d'acquisition des données.
Les signaux ont été enregistrés à l’aide des accéléromètres, qui ont été fixés à la cage du
moteur par aiment. Pour différents couples résistants (donc différentes vitesses de rotations).
Les couples sont respectivement 0, 1, 2, 3 Hp dont des vitesses respectives sont 1797,1772,
1750, 1730 tr/min.
Les capteurs ont été placés à la position 12 heures verticale des deux côtés accouplement et
ventilateur de la cage du moteur en plus de deux autres capteurs à 6 et 3 heures.
Dans ce travail, les roulements que nous avons considérés, sont le roulement du coté
accouplement pour l’apprentissage et les tests. Les fréquences caractéristiques sont :
Chapitre 4 Résultats de simulations 34
Tableau 4.1 : Données vibratoires des défauts avec une fréquence d’échantillonnage de 12K
HZ / CWRU
0.3 0.46
F
CLF
mean
0.25
6
0.1 0.44
0.2 0.42
Figure 4.4 : Variation de quelques paramètres temporels et fréquentiels du signal sans défauts
(sain)
Chapitre 4 Résultats de simulations 36
Figure 4.7 : Variation de quelques paramètres temporels et fréquentiels du signal avec défaut
bille
Chapitre 4 Résultats de simulations 37
3.6 1.71
0.045
3.4 1.705
0.04
3.2 1.7
0.035 3 1.695
0 20 40 60 0 20 40 60 0 20 40 60
X130-Freq-bague e xterne
La méthode utilisée dans notre travail peut être résumée comme le montre la figure 4.12 :
L'origine de l'algorithme SVM est une classification binaire où la classe étiquettes peut
prendre deux valeurs : 1 et -1, mais en fait, les problèmes de classification comprennent plus
de deux classes. Par exemple, l’implémentation de l’algorithme SVM binaire pour le
diagnostic des défauts de roulement d’une machine asynchrone, où il y a le défaut de la bague
intérieure, le défaut de la bague extérieure, et le défaut de billes ne peut être utilisée. Par
conséquent, on adoptera la stratégie de classification par multi-classe SVM pour le diagnostic
de ces défauts de roulements multiples. Plus précisément, on choisit la multiclassification
SVM un contre tous (One Against All : OAA).
Chapitre 4 Résultats de simulations 40
Les caractéristiques statistiques originales choisies et calculées sont : kurtosis, skewness, valeur
moyenne, écart-type, variance, max, et rms. Le schéma de l'expérience est décrit comme suit :
extraire cinquante échantillons de chaque signal de défaut (y compris le cas sain) avec une
longueur d’échantillon égale à 12000 (donc sur une durée de 1seconde), puis égale à 1 200
points (à seulement 0,1 seconde). Par conséquent, on a obtenu 2000 échantillons au total. On a
Calculé les paramètres (attributs statistiques) pour chaque échantillon à l'aide des formules des
équations entre (1.4) et (1.15) pour réaliser enfin une matrice observée X. Cette la matrice
observée X est transformée selon les étapes de l'analyse en composantes principales.
∗
= (4.1)
Premièrement, la matrice X observés nécessite une normalisation selon la formule (4.1). Puis,
on calcule le coefficient de corrélation R ainsi que ses valeurs propres et vecteurs propres. Les
composantes principales sont présentées dans le tableau suivant :
Chapitre 4 Résultats de simulations 41
Selon le tableau précédent, on peut voir qu'il y a trois composantes principales qu’on nomme
P1, P2, et P3 (cas 1200 pts et 12000 pts). Le rapport de contribution cumulatif des composantes
principales a été 0,989(cas 12000 pts) et 0.991(cas 1200 pts) respectivement, pratiquement
contenait l'information des caractéristiques d'origine.
La dernière étape est le calcul du résultat final, la matrice de la composante principale Z, qui
contient un pourcentage de 98,8 et 99.1 des paramètres originels. Cette dernière a été calculée
par multiplication de matrice de chargement gauche L selon la formule suivante :
∗
=
Le diagnostic des défauts à l’aide de l’algorithme multi-classe SVM est basé sur la
sélection des caractéristiques de trois types de défauts de roulement et du cas sain, de plus la
méthode un contre tous (OAO), qui est une stratégie de l'algorithme SVM multi-classe a été
utilisée dans cette expérience d'identification. Dans ce cadre, quatre paramètres sélectionnés
par l'analyse en composantes principales, ont été utilisés pour la classe multi-SVM, et chaque
type défaut contenait 50 échantillons. Par conséquent, il y avait 200 échantillons utilisés lors de
l'étape de formation.
Chapitre 4 Résultats de simulations 42
La matrice Z était de 200×7, contient les informations pour l’apprentissage. Le tableau suivant
présente l'établissement de formation SVM pour l’entrainement.
Le résultat a montré que l'OAO multi-classe SVM était approprié pour le diagnostic du défaut
où les fonctions « Kernel » ou noyaux linéaire, quadratique et polynomiale ont donné les
meilleurs résultats contrairement à la fonction RBF.
Le réseau de neurones utilisé pour la classification (pour des fins de comparaison avec la
classification SVM) est un réseau multicouche possédant une couche cachée à 20 neurones et
trois sorties binaires (0 0 0 pour reconnaitre le cas sain, 1 0 0, 0 1 0 et 0 0 1 pour les défauts
bague interne, bague externe et défauts billes respectivement).
Néanmoins, l’utilisation d’un nombre de points élevé dans un échantillon donne un meilleur
taux de bonne classification au détriment d’un temps de classification plus lent. Donc, si on
veut se rapprocher du diagnostic temps réel il faut opter pour les petits échantillons à condition
de savoir bien choisir le vecteur de caractéristiques qui devrait comporter des détails temporels
et fréquentiels sur le signal vibratoire originel. Le prétraitement et la réduction de la taille de la
matrice d’observation devrait être aussi bien examiné dans le but d’avoir une espace de données
pouvant donner une bonne classification.
CONCLUSION GENERALE
Conclusion Générale
Les séparateurs vastes marges qui sont basés sur la théorie de l'apprentissage statistique sont
réputés pour l’utilisation d’un nombre d'échantillons réduit et ont une meilleure généralisation
que les réseaux de neurones artificiels (par exemple) et c’est l’utilisation de noyaux qui permet
cette généralisation. Cependant la précision d'une machine vectorielle de support est hautement
déterminée par la sélection des paramètres optimaux.
La plus grande différence entre le SVM et le RNA est dans la méthode d’optimisation des
paramètres du modèle, le RNA utilise la retro propagation du gradient qui ne garantit pas
l’obtention d’une solution optimale par contre l’implémentation du SVM trouvera les
paramètres optimaux.
Cependant, ils peuvent être complémentaire avec des combinaisons SVM et RNA. Par
exemple, on peut utiliser plusieurs couches RNA et avoir la dernière classification via SVM à
la couche de sortie.
L’algorithme développé dans cette étude peut être étendu à plusieurs types de défauts
(composants, actionneurs, capteurs, …etc.) sur les machines jusqu'à la conception d’un système
d'avertissement adapté dans lequel l'apparition des défauts est rapportée à l'utilisateur sur
l’écran de commande de la machine pour un diagnostic en temps réel.
Une autre idée est d’utiliser les informations existantes sur les machines et les exploiter avec
cet algorithme pour en tirer un diagnostic fiable, sans pour autant déployer un matériel
supplémentaire (capteurs et interfaces de calculs).
Comme perspectives, on voudrait explorer plusieurs méthodes de prétraitement en plus de
l’ACP et plus de méthodes de classification dans un but de comparaison en premier, puis
essayer de combiner celles ayant donné de meilleurs résultats jusqu’à obtenir une méthode
présentant un temps de classification temps réel proche du 100%.
45