1.
INTRODUCTION À LA HAUTE DISPONIBILITÉ
1.1 Définition
La Haute Disponibilite (HA) est un essemble de technique, de methodes et
d’architectures qui permettent a un systeme informatique de continuer a
fonctionner malgre des pannes.
Les trois types de pannes :
Type de panne Exemple
Materielle Disque dur defaillant, alimentation qui
grille, carte mere morte, RAM
corrompue
Logicielle Bug dans le systeme d’exploitation, crash
d’une application, mauvaise
configuration
Reseau Cable coupe, routeur en panne, Switch
defaillant, interface reseau HS
1.2 Les trois objectifs fondamentaux
Objectif 1 : Minimiser le temps d'arrêt (downtime)
Le downtime est la periode pendant la quelle le systeme est indisponible. En HA, on cherche a le
reduire au maximum, idealement a quelque seconde par an.
Objectif 2 : Garantir un taux de disponibilite eleve
le taux de disponibilite se mesure en « nombre de 9 ». plus il y a de 9, plus le systeme est
disponible.
Objectif 3 : eliminer les spof (Single point of failure)
Un SPOF est un composant unique dont la panne entraine l’arret complet du system.
Schéma sans SPOF (redondance) :
2. MESURE DE LA DISPONIBILITÉ
2.1 La formule
Disponibilité = (Temps de fonctionnement / Temps total) × 100
2.2 L'échelle des "9"
Voici la correspondance entre le pourcentage de disponibilité et le temps
d'indisponibilité maximal par an :
99% (2 neufs)
Temps d'arrêt par an : 3,65 jours
Exemple : Site web personnel, serveur de test
Indisponibilité visible
99,9% (3 neufs)
Temps d'arrêt par an : 8,76 heures
Exemple : Site web d'une petite entreprise
Indisponibilité remarquée
99,99% (4 neufs)
Temps d'arrêt par an : 52,6 minutes (environ 4,38 heures)
Exemple : Serveur de base de données d'une PME
Indisponibilité gênante mais rare
99,999% (5 neufs)
Temps d'arrêt par an : environ 5 minutes
Exemple : Transactions bancaires, e-commerce
Indisponibilité exceptionnelle
99,9999% (6 neufs)
Temps d'arrêt par an : environ 30 secondes
Exemple : Contrôle aérien, centrale nucléaire
Indisponibilité quasi inexistante
Représentation graphique :
99% ████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ 3,65 JOURS
99,9% ████████░░░░░░░░░░░░░░░░░░░░░░░░░ 8,76 HEURES
99,99% ████████████░░░░░░░░░░░░░░░░░░░░ 52 MINUTES
99,999% ██████████████████░░░░░░░░░░░░░░ 5 MINUTES
99,9999% ██████████████████████████░░░░░░ 30 SECONDES
2.3 Le coût de la disponibilité
Plus on monte dans les "9", plus le coût explose. Il faut trouver un équilibre entre :
Le coût d'une interruption (perte financière, image de marque, pénalités)
Le coût de la redondance (matériel, licences, maintenance, expertise)
Règle d'or : Un système n'est jamais "HA" parce qu'il a une seule fonction de
redondance. La HA est globale.
3. REDONDANCE MATÉRIELLE
3.1 Principe général
La redondance matérielle consiste à dupliquer les composants physiques critiques.
Composants à redonder :
Composant Solution de redondance
Alimentation électrique Double alimentation (2 PSU)
Disques durs RAID
Cartes réseau NIC Teaming / Bonding
Mémoire RAM ECC + Mirroring (sur certains serveurs)
Cartes mères Clusters de serveurs
Ventilateurs Ventilateurs redondants
3.2 Schéma d'une alimentation redondante
4. RAID - REDONDANCE DISQUES
4.1 Qu'est-ce que le RAID ?
RAID = Redundant Array of Independent Disks (Ensemble de redondant de disques
independants)
c’est une technologie qui permet de combiner plusieurs disques physiques pour
former un ou plusieurs volumes logiques.
Opposition au SLED : Single Large Expensive Disk (un seul gros disque cher)
4.2 Types de RAID
RAID logiciel :
Controler par le systeme d’exploitation
Gratuit (integre a l’OS)
utilise le CPU du server
Exemples : ndadm sous Linux, espaces de stockage sous Windows
RAID matériel :
Carte dediee avec processeur et memoire
Performant (decharge le CPU)
Remplacement a chaud possible
Baterie de secours pour la cache
Exemples : Cartes Dell PERC, LSI MegaRAID
4.3 Détail des niveaux de RAID
RAID 0 : Striping (Bandes)
Fonctionnement : Les donnees sont decoupees en blocs et reparties sur tous les
disques.
Schema visuel :
Caracteristiques :
✅Performance : TRÈS ÉLEVÉE (lecture/écriture parallèles)
❌ Sécurité : NULLE (1 disque mort = perte totale)
📊 Capacité : Somme de tous les disques
💰 Coût : Faible (pas de perte d'espace)
Utilisation : Données temporaires, cache, montage vidéo (rien de critique)
RAID 1 : Mirroring (Miroir)
Fonctionnement : Chaque disque contient exactement la meme copie des donnees.
Schema visuel :
Caractéristiques :
✅ Sécurité : EXCELLENTE (N-1 disques peuvent tomber)
✅ Lecture : Accélérée (peut lire sur les deux disques)
❌ Écriture : Normale
📊 Capacité : = capacité du plus petit disque (ex: 2×500Go = 500Go utile)
💰 Coût : ÉLEVÉ (50% de perte d'espace)
Utilisation : Systèmes critiques (OS, bases de données)
RAID 5 : Striping + Parite repartie
Fonctionnement : Les donnees sont strippes comme en RAID 0, mais un bloc de
parite est ajoute pour permettre la reconstruction en cas de panne.
Schéma visuel (4 disques) :
Comment la reconstruction fonctionne :
Si le Disque 2 tombe en panne, on peut retrouver le bloc B manquant :
B = A ⊕ C ⊕ Parité(A⊕B⊕C)
Où ⊕ = XOR (ou exclusif)
Caractéristiques :
🔧 Disques minimum : 3
✅ Tolérance : 1 disque peut tomber
✅ Performance lecture : Bonne
❌ Performance écriture : Médiocre (calcul de parité)
📊 Capacité : (N-1) × capacité du plus petit disque (ex: 4×500Go = 1,5To
utiles)
⚠️ Inconvénient : Reconstruction longue sur gros disques
Utilisation : Serveurs de fichiers, stockage général
RAID 10 (RAID 1+0)
Fonctionnement : Combinaison de RAID 1 (miroir) et RAID 0 (striping).
Schéma visuel :
Caractéristiques :
🔧 Disques minimum : 4
✅ Sécurité : EXCELLENTE (peut perdre plusieurs disques si pas dans le
même miroir)
✅ Performance : EXCELLENTE (striping + lecture parallèle)
✅ Reconstruction : RAPIDE (simple copie sur le miroir)
📊 Capacité : (N/2) × capacité du plus petit disque (50% de perte)
💰 Coût : TRÈS ÉLEVÉ
Utilisation : Serveurs critiques (bases de données, virtualisation, Exchange, ERP)
4.4 Tableau récapitulatif des RAID
Disques Capacité
RAID Sécurité Performance Coût Usage typique
min utile
0 2 Σ disques Nulle ⭐ Excellente
⭐⭐⭐⭐ Faible Cache, vidéo
⭐⭐⭐⭐ Lecture ⭐⭐⭐
Excellente OS, base de
1 2 Plus petit Élevé
données
5 3 (N-1)×min Bonne ⭐⭐⭐ Lecture ⭐⭐⭐ Moyen Serveur fichiers
Excellente Excellente Très Serveurs
10 4 (N/2)×min
⭐⭐⭐⭐ ⭐⭐⭐⭐ élevé critiques
5. NIC TEAMING - REDONDANCE CARTES RÉSEAU
5.1 Définition
NIC Teaming (ou Bonding sous Linux) est une technique qui permet de regrouper
plusieurs cartes réseau physiques en une seule interface logique.
Schéma général :
5.2 Les modes de fonctionnement
Mode 1 : Active/Backup (Failover)
Mode 2 : LACP 802.3ad (Aggrégation)
5.3 Les protocoles
Protocole Type Description
LACP Standard IEEE 802.3ad Open, multi-fournisseurs
PAgP Propriétaire Cisco Cisco uniquement
Balance XOR Standard Répartition selon adresses MAC
5.4 Avantages
Tolérance de panne : Si une carte ou un câble tombe, le trafic bascule
automatiquement
Agrégation de bande passante : 2 × 1 Gb/s = jusqu'à 2 Gb/s théoriques
Répartition de charge : Le trafic est réparti sur tous les liens actifs
Haute disponibilité : Pas d'interruption lors du remplacement d'une carte
6. REDONDANCE DE PARE-FEU (FIREWALL HA)
6.1 Pourquoi redonder un pare-feu ?
Un pare-feu unique est un SPOF majeur. S'il tombe en panne :
Plus de protection réseau
Plus d'accès Internet
Plus de connexions entrantes
6.2 Mode Actif/Passif
Schéma :
Fonctionnement :
[Link] A traite 100% du trafic
[Link] B est en veille, prêt à prendre le relais
[Link] heartbeat (signal de vie) est échangé entre les deux
[Link] A ne répond plus, B devient actif automatiquement
[Link] sessions TCP sont synchronisées (pas de coupure de connexion)
Temps de basculement : 1 à 10 secondes typiquement
6.3 Mode Actif/Actif
Schéma :
Avantages :
Meilleure utilisation des ressources
Plus grande capacité de traitement
Basculement plus rapide
Inconvénients :
Configuration plus complexe
Nécessite un équilibreur de charge
6.4 Solutions courantes
Solution Mode supporté Particularité
pfSense Actif/Passif (CARP) Open source, gratuit
Cisco ASA Actif/Passif, Actif/Actif Leader du marché
FortiGate Actif/Passif, Actif/Actif Très performant
Check Point ClusterXL Très riche en fonctionnalités
7. REDONDANCE RÉSEAU
7.1 Définition
La redondance reseau consiste a dipliquer les equipements (routeur, switches) et les
liaisons pour assurer la continuite de service.
7.2 Architecture redondée complète
Schéma d'un réseau d'entreprise redondé :
7.3 Niveaux de redondance
Niveau Équipements redondés Bénéfice
Double liaison vers switches de Un switch de distribution peut
Niveau 1 (Accès)
distribution tomber
Niveau 2
Double switch de distribution Panne d'un switch = redondance
(Distribution)
Double switch cœur + protocole de routage
Niveau 3 (Cœur) Résilience maximale
dynamique
Niveau 4 (WAN) Multiples FAI + routeurs Résilience Internet
8. PROBLÈMES ET SOLUTIONS
8.1 Le problème de la boucle réseau (Loop)
Description : Quand on connecte deux switches par deux câbles différents pour
créer de la redondance, on crée une boucle physique.
Schéma de la boucle :
Conséquence : Tempête broadcast
Une trame broadcast (ARP, DHCP, etc.) entre dans la boucle et tourne indéfiniment :
Étape 1 : Trame broadcast envoyée par un ordinateur sur Switch A
Étape 2 : Switch A envoie sur TOUS ses ports (y compris vers Switch B)
Étape 3 : Switch B reçoit et renvoie sur TOUS ses ports
Étape 4 : Switch A reçoit la même trame via l'autre liaison
Étape 5 : Switch A la renvoie à nouveau...
Étape N : En quelques secondes, le réseau est SATURÉ
Schéma de la tempête broadcast :
8.2 Solution : Spanning Tree Protocol (STP)
Principe : STP détecte les boucles et bloque LOGIQUEMENT certains ports pour
créer un arbre sans boucle.
Schéma STP actif :
Comment STP fonctionne :
1.Élection du Root Bridge : Tous les switches communiquent entre eux. Celui avec
la plus petite priorité (ou adresse MAC) devient la racine.
2.Détermination des chemins : Chaque switch détermine le chemin le plus court
vers la racine.
[Link] des ports redondants : Les ports qui ne sont pas sur le chemin le plus
court sont bloqués.
[Link] : Les switches continuent d'échanger des BPDU (Bridge Protocol
Data Units)
5.Réaction à une panne : Si un lien actif tombe, un port bloqué passe en état
forwarding.
Temps de convergence :
Protocole Temps de convergence
STP (classique) 30-50 secondes
RSTP (Rapid STP) < 10 secondes
MSTP (Multiple STP) < 10 secondes
SPB (Shortest Path) < 1 seconde
8.3 Autres solutions contre les tempêtes broadcast
Solution 1 : Segmentation VLAN
Solution 2 : Storm Control (commutateurs)
Configuration typique :
Si trafic broadcast > 10% du lien → Couper le port automatiquement
Solution 3 : SPB (Shortest Path Bridging)
Alternative moderne à STP
Utilise TOUS les liens (pas de ports bloqués)
Convergence quasi-instantanée
Utilisé dans les grands datacenters
9. REDONDANCE DES POINTS DE SORTIE WAN
9.1 Problème
Un seul lien Internet = SPOF. Si le FAI a une panne, plus d'accès extérieur.
9.2 Solution : Double connexion Internet
Schéma :
9.3 Routes statiques flottantes
Principe : On définit une route principale (métrique basse) et une route de secours
(métrique haute).
Configuration (exemple Cisco) :
ip route [Link] [Link] [Link] 10 ← Route FAI1 (prioritaire)
ip route [Link] [Link] [Link] 20 ← Route FAI2 (secondaire)
Fonctionnement :
SITUATION NORMALE :
[Routeur] → Métrique 10 (FAI1) → [INTERNET]
(FAI2 présent mais non utilisé)
PANNE FAI1 :
[Routeur] → Détection panne (IP SLA / tracking)
→ Route métrique 10 devient invalide
→ Route métrique 20 activée automatiquement
→ [FAI2] → [INTERNET]
RETOUR FAI1 :
[Routeur] → Route métrique 10 redevient disponible
→ Basculement automatique vers FAI1
9.4 Protocoles de routage dynamique
Pour les grandes infrastructures, on utilise des protocoles comme BGP (Border
Gateway Protocol) :
Annonce son propre bloc d'adresses IP via deux FAI
Basculement plus fin et plus rapide
Possibilité de répartition de charge (load balancing)
10. ARCHITECTURE HA COMPLÈTE
10.1 Schéma d'un serveur critique entièrement redondé
10.2 Checklist d'une architecture HA
Niveau Élément Solution Vérifié
Électricité Alimentation Double PSU + UPS + Groupe ☐
Stockage Disques RAID 10 + Hot spare ☐
Stockage Contrôleur RAID matériel avec batterie ☐
Réseau Cartes réseau NIC Teaming (LACP) ☐
Réseau Switches Redondance avec STP/RSTP ☐
Réseau Câblage Double chemin fibre/cuivre ☐
Sécurité Pare-feu Cluster Actif/Passif ☐
WAN Connectivité 2 FAI minimum ☐
Serveur Physical Cluster de serveurs ☐
Serveur Virtualisation Live migration ☐
Données Sauvegarde Backup distant + réplication ☐
Surveillance Monitoring Alertes automatiques ☐
11. CONCLUSION
11.1 Les 5 principes fondamentaux de la HA
Principe 1 : Éliminer les SPOF
Tout composant critique doit être dupliqué
Un SPOF est inacceptable dans une architecture HA
Principe 2 : Détection automatique des pannes
Heartbeat entre équipements redondants
Sondes réseau, keepalive
Détection en moins d'une seconde
Principe 3 : Basculement automatique (Failover)
Sans intervention humaine
Rapide (secondes ou moins)
Transparent pour les utilisateurs
Principe 4 : Synchronisation d'état
Sessions TCP maintenues
Configurations identiques
Données synchronisées en temps réel
Principe 5 : Équilibre coût / disponibilité
Plus de "9" = plus de coût
Analyser le coût réel d'une interruption
Choisir le niveau de HA adapté à son besoin
11.2 Résumé des technologies HA
Technologie Niveau Rôle
RAID 1, 5, 10 Stockage Protection contre panne disque
NIC Teaming Réseau Redondance cartes réseau
STP/RSTP Réseau Évite les boucles, permet la redondance
Cluster firewall Sécurité Redondance pare-feu
Routes flottantes WAN Redondance connexion Internet
Double PSU Électricité Redondance alimentation
Cluster serveurs Serveur Redondance serveur complet