0% ont trouvé ce document utile (0 vote)
2 vues24 pages

ARU (Lesson)

La Haute Disponibilité (HA) est un ensemble de techniques visant à maintenir le fonctionnement d'un système informatique malgré des pannes, en se concentrant sur la réduction du temps d'arrêt, l'augmentation du taux de disponibilité et l'élimination des points de défaillance uniques. La redondance matérielle, le RAID, le NIC Teaming et la redondance réseau sont des méthodes clés pour atteindre ces objectifs, tout en prenant en compte le coût associé à la disponibilité. Des solutions comme le Spanning Tree Protocol (STP) et les routes statiques flottantes sont également essentielles pour gérer les problèmes de boucle réseau et garantir une continuité de service.

Transféré par

joachinhasina
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues24 pages

ARU (Lesson)

La Haute Disponibilité (HA) est un ensemble de techniques visant à maintenir le fonctionnement d'un système informatique malgré des pannes, en se concentrant sur la réduction du temps d'arrêt, l'augmentation du taux de disponibilité et l'élimination des points de défaillance uniques. La redondance matérielle, le RAID, le NIC Teaming et la redondance réseau sont des méthodes clés pour atteindre ces objectifs, tout en prenant en compte le coût associé à la disponibilité. Des solutions comme le Spanning Tree Protocol (STP) et les routes statiques flottantes sont également essentielles pour gérer les problèmes de boucle réseau et garantir une continuité de service.

Transféré par

joachinhasina
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

1.

INTRODUCTION À LA HAUTE DISPONIBILITÉ


1.1 Définition
La Haute Disponibilite (HA) est un essemble de technique, de methodes et
d’architectures qui permettent a un systeme informatique de continuer a
fonctionner malgre des pannes.

Les trois types de pannes :

Type de panne Exemple


Materielle Disque dur defaillant, alimentation qui
grille, carte mere morte, RAM
corrompue
Logicielle Bug dans le systeme d’exploitation, crash
d’une application, mauvaise
configuration
Reseau Cable coupe, routeur en panne, Switch
defaillant, interface reseau HS

1.2 Les trois objectifs fondamentaux


Objectif 1 : Minimiser le temps d'arrêt (downtime)
Le downtime est la periode pendant la quelle le systeme est indisponible. En HA, on cherche a le
reduire au maximum, idealement a quelque seconde par an.
Objectif 2 : Garantir un taux de disponibilite eleve
le taux de disponibilite se mesure en « nombre de 9 ». plus il y a de 9, plus le systeme est
disponible.

Objectif 3 : eliminer les spof (Single point of failure)


Un SPOF est un composant unique dont la panne entraine l’arret complet du system.
Schéma sans SPOF (redondance) :

2. MESURE DE LA DISPONIBILITÉ
2.1 La formule
Disponibilité = (Temps de fonctionnement / Temps total) × 100

2.2 L'échelle des "9"


Voici la correspondance entre le pourcentage de disponibilité et le temps
d'indisponibilité maximal par an :
99% (2 neufs)

Temps d'arrêt par an : 3,65 jours


Exemple : Site web personnel, serveur de test
Indisponibilité visible

99,9% (3 neufs)

Temps d'arrêt par an : 8,76 heures


Exemple : Site web d'une petite entreprise
Indisponibilité remarquée

99,99% (4 neufs)

Temps d'arrêt par an : 52,6 minutes (environ 4,38 heures)


Exemple : Serveur de base de données d'une PME
Indisponibilité gênante mais rare

99,999% (5 neufs)

Temps d'arrêt par an : environ 5 minutes


Exemple : Transactions bancaires, e-commerce
Indisponibilité exceptionnelle

99,9999% (6 neufs)

Temps d'arrêt par an : environ 30 secondes


Exemple : Contrôle aérien, centrale nucléaire
Indisponibilité quasi inexistante

Représentation graphique :
99% ████░░░░░░░░░░░░░░░░░░░░░░░░░░░░░░ 3,65 JOURS
99,9% ████████░░░░░░░░░░░░░░░░░░░░░░░░░ 8,76 HEURES
99,99% ████████████░░░░░░░░░░░░░░░░░░░░ 52 MINUTES
99,999% ██████████████████░░░░░░░░░░░░░░ 5 MINUTES
99,9999% ██████████████████████████░░░░░░ 30 SECONDES

2.3 Le coût de la disponibilité


Plus on monte dans les "9", plus le coût explose. Il faut trouver un équilibre entre :

Le coût d'une interruption (perte financière, image de marque, pénalités)


Le coût de la redondance (matériel, licences, maintenance, expertise)

Règle d'or : Un système n'est jamais "HA" parce qu'il a une seule fonction de
redondance. La HA est globale.
3. REDONDANCE MATÉRIELLE
3.1 Principe général
La redondance matérielle consiste à dupliquer les composants physiques critiques.

Composants à redonder :

Composant Solution de redondance


Alimentation électrique Double alimentation (2 PSU)
Disques durs RAID
Cartes réseau NIC Teaming / Bonding
Mémoire RAM ECC + Mirroring (sur certains serveurs)
Cartes mères Clusters de serveurs
Ventilateurs Ventilateurs redondants

3.2 Schéma d'une alimentation redondante


4. RAID - REDONDANCE DISQUES
4.1 Qu'est-ce que le RAID ?
RAID = Redundant Array of Independent Disks (Ensemble de redondant de disques
independants)

c’est une technologie qui permet de combiner plusieurs disques physiques pour
former un ou plusieurs volumes logiques.

Opposition au SLED : Single Large Expensive Disk (un seul gros disque cher)

4.2 Types de RAID


RAID logiciel :
 Controler par le systeme d’exploitation
 Gratuit (integre a l’OS)
 utilise le CPU du server
 Exemples : ndadm sous Linux, espaces de stockage sous Windows

RAID matériel :
 Carte dediee avec processeur et memoire
 Performant (decharge le CPU)
 Remplacement a chaud possible
 Baterie de secours pour la cache
 Exemples : Cartes Dell PERC, LSI MegaRAID
4.3 Détail des niveaux de RAID
RAID 0 : Striping (Bandes)
Fonctionnement : Les donnees sont decoupees en blocs et reparties sur tous les
disques.

Schema visuel :

Caracteristiques :
 ✅Performance : TRÈS ÉLEVÉE (lecture/écriture parallèles)

 ❌ Sécurité : NULLE (1 disque mort = perte totale)


 📊 Capacité : Somme de tous les disques
 💰 Coût : Faible (pas de perte d'espace)
Utilisation : Données temporaires, cache, montage vidéo (rien de critique)
RAID 1 : Mirroring (Miroir)

Fonctionnement : Chaque disque contient exactement la meme copie des donnees.

Schema visuel :

Caractéristiques :

 ✅ Sécurité : EXCELLENTE (N-1 disques peuvent tomber)


 ✅ Lecture : Accélérée (peut lire sur les deux disques)
 ❌ Écriture : Normale
 📊 Capacité : = capacité du plus petit disque (ex: 2×500Go = 500Go utile)
 💰 Coût : ÉLEVÉ (50% de perte d'espace)
Utilisation : Systèmes critiques (OS, bases de données)
RAID 5 : Striping + Parite repartie

Fonctionnement : Les donnees sont strippes comme en RAID 0, mais un bloc de


parite est ajoute pour permettre la reconstruction en cas de panne.

Schéma visuel (4 disques) :

Comment la reconstruction fonctionne :


Si le Disque 2 tombe en panne, on peut retrouver le bloc B manquant :
B = A ⊕ C ⊕ Parité(A⊕B⊕C)
Où ⊕ = XOR (ou exclusif)

Caractéristiques :

 🔧 Disques minimum : 3
 ✅ Tolérance : 1 disque peut tomber
 ✅ Performance lecture : Bonne
 ❌ Performance écriture : Médiocre (calcul de parité)
 📊 Capacité : (N-1) × capacité du plus petit disque (ex: 4×500Go = 1,5To
utiles)
 ⚠️ Inconvénient : Reconstruction longue sur gros disques
Utilisation : Serveurs de fichiers, stockage général
RAID 10 (RAID 1+0)
Fonctionnement : Combinaison de RAID 1 (miroir) et RAID 0 (striping).
Schéma visuel :

Caractéristiques :

 🔧 Disques minimum : 4
 ✅ Sécurité : EXCELLENTE (peut perdre plusieurs disques si pas dans le
même miroir)
 ✅ Performance : EXCELLENTE (striping + lecture parallèle)
 ✅ Reconstruction : RAPIDE (simple copie sur le miroir)
 📊 Capacité : (N/2) × capacité du plus petit disque (50% de perte)
 💰 Coût : TRÈS ÉLEVÉ
Utilisation : Serveurs critiques (bases de données, virtualisation, Exchange, ERP)

4.4 Tableau récapitulatif des RAID

Disques Capacité
RAID Sécurité Performance Coût Usage typique
min utile

0 2 Σ disques Nulle ⭐ Excellente


⭐⭐⭐⭐ Faible Cache, vidéo

⭐⭐⭐⭐ Lecture ⭐⭐⭐


Excellente OS, base de
1 2 Plus petit Élevé
données
5 3 (N-1)×min Bonne ⭐⭐⭐ Lecture ⭐⭐⭐ Moyen Serveur fichiers
Excellente Excellente Très Serveurs
10 4 (N/2)×min
⭐⭐⭐⭐ ⭐⭐⭐⭐ élevé critiques

5. NIC TEAMING - REDONDANCE CARTES RÉSEAU


5.1 Définition
NIC Teaming (ou Bonding sous Linux) est une technique qui permet de regrouper
plusieurs cartes réseau physiques en une seule interface logique.

Schéma général :
5.2 Les modes de fonctionnement
Mode 1 : Active/Backup (Failover)
Mode 2 : LACP 802.3ad (Aggrégation)

5.3 Les protocoles

Protocole Type Description

LACP Standard IEEE 802.3ad Open, multi-fournisseurs

PAgP Propriétaire Cisco Cisco uniquement

Balance XOR Standard Répartition selon adresses MAC

5.4 Avantages
 Tolérance de panne : Si une carte ou un câble tombe, le trafic bascule
automatiquement
 Agrégation de bande passante : 2 × 1 Gb/s = jusqu'à 2 Gb/s théoriques
 Répartition de charge : Le trafic est réparti sur tous les liens actifs
 Haute disponibilité : Pas d'interruption lors du remplacement d'une carte
6. REDONDANCE DE PARE-FEU (FIREWALL HA)
6.1 Pourquoi redonder un pare-feu ?
Un pare-feu unique est un SPOF majeur. S'il tombe en panne :

 Plus de protection réseau


 Plus d'accès Internet
 Plus de connexions entrantes

6.2 Mode Actif/Passif


Schéma :

Fonctionnement :

[Link] A traite 100% du trafic


[Link] B est en veille, prêt à prendre le relais
[Link] heartbeat (signal de vie) est échangé entre les deux
[Link] A ne répond plus, B devient actif automatiquement
[Link] sessions TCP sont synchronisées (pas de coupure de connexion)

Temps de basculement : 1 à 10 secondes typiquement


6.3 Mode Actif/Actif
Schéma :

Avantages :

Meilleure utilisation des ressources


Plus grande capacité de traitement
Basculement plus rapide

Inconvénients :

Configuration plus complexe


Nécessite un équilibreur de charge
6.4 Solutions courantes

Solution Mode supporté Particularité

pfSense Actif/Passif (CARP) Open source, gratuit

Cisco ASA Actif/Passif, Actif/Actif Leader du marché

FortiGate Actif/Passif, Actif/Actif Très performant

Check Point ClusterXL Très riche en fonctionnalités

7. REDONDANCE RÉSEAU
7.1 Définition
La redondance reseau consiste a dipliquer les equipements (routeur, switches) et les
liaisons pour assurer la continuite de service.

7.2 Architecture redondée complète


Schéma d'un réseau d'entreprise redondé :
7.3 Niveaux de redondance

Niveau Équipements redondés Bénéfice

Double liaison vers switches de Un switch de distribution peut


Niveau 1 (Accès)
distribution tomber

Niveau 2
Double switch de distribution Panne d'un switch = redondance
(Distribution)

Double switch cœur + protocole de routage


Niveau 3 (Cœur) Résilience maximale
dynamique

Niveau 4 (WAN) Multiples FAI + routeurs Résilience Internet

8. PROBLÈMES ET SOLUTIONS
8.1 Le problème de la boucle réseau (Loop)
Description : Quand on connecte deux switches par deux câbles différents pour
créer de la redondance, on crée une boucle physique.

Schéma de la boucle :

Conséquence : Tempête broadcast

Une trame broadcast (ARP, DHCP, etc.) entre dans la boucle et tourne indéfiniment :
Étape 1 : Trame broadcast envoyée par un ordinateur sur Switch A
Étape 2 : Switch A envoie sur TOUS ses ports (y compris vers Switch B)
Étape 3 : Switch B reçoit et renvoie sur TOUS ses ports
Étape 4 : Switch A reçoit la même trame via l'autre liaison
Étape 5 : Switch A la renvoie à nouveau...
Étape N : En quelques secondes, le réseau est SATURÉ
Schéma de la tempête broadcast :
8.2 Solution : Spanning Tree Protocol (STP)
Principe : STP détecte les boucles et bloque LOGIQUEMENT certains ports pour
créer un arbre sans boucle.

Schéma STP actif :

Comment STP fonctionne :

1.Élection du Root Bridge : Tous les switches communiquent entre eux. Celui avec
la plus petite priorité (ou adresse MAC) devient la racine.
2.Détermination des chemins : Chaque switch détermine le chemin le plus court
vers la racine.
[Link] des ports redondants : Les ports qui ne sont pas sur le chemin le plus
court sont bloqués.
[Link] : Les switches continuent d'échanger des BPDU (Bridge Protocol
Data Units)
5.Réaction à une panne : Si un lien actif tombe, un port bloqué passe en état
forwarding.
Temps de convergence :
Protocole Temps de convergence

STP (classique) 30-50 secondes

RSTP (Rapid STP) < 10 secondes

MSTP (Multiple STP) < 10 secondes

SPB (Shortest Path) < 1 seconde

8.3 Autres solutions contre les tempêtes broadcast


Solution 1 : Segmentation VLAN

Solution 2 : Storm Control (commutateurs)

Configuration typique :
Si trafic broadcast > 10% du lien → Couper le port automatiquement

Solution 3 : SPB (Shortest Path Bridging)

 Alternative moderne à STP


 Utilise TOUS les liens (pas de ports bloqués)
 Convergence quasi-instantanée
 Utilisé dans les grands datacenters
9. REDONDANCE DES POINTS DE SORTIE WAN
9.1 Problème
Un seul lien Internet = SPOF. Si le FAI a une panne, plus d'accès extérieur.

9.2 Solution : Double connexion Internet


Schéma :

9.3 Routes statiques flottantes


Principe : On définit une route principale (métrique basse) et une route de secours
(métrique haute).

Configuration (exemple Cisco) :


ip route [Link] [Link] [Link] 10 ← Route FAI1 (prioritaire)
ip route [Link] [Link] [Link] 20 ← Route FAI2 (secondaire)

Fonctionnement :
SITUATION NORMALE :
[Routeur] → Métrique 10 (FAI1) → [INTERNET]
(FAI2 présent mais non utilisé)

PANNE FAI1 :

[Routeur] → Détection panne (IP SLA / tracking)


→ Route métrique 10 devient invalide
→ Route métrique 20 activée automatiquement
→ [FAI2] → [INTERNET]

RETOUR FAI1 :

[Routeur] → Route métrique 10 redevient disponible


→ Basculement automatique vers FAI1

9.4 Protocoles de routage dynamique


Pour les grandes infrastructures, on utilise des protocoles comme BGP (Border
Gateway Protocol) :

 Annonce son propre bloc d'adresses IP via deux FAI


 Basculement plus fin et plus rapide
 Possibilité de répartition de charge (load balancing)
10. ARCHITECTURE HA COMPLÈTE
10.1 Schéma d'un serveur critique entièrement redondé

10.2 Checklist d'une architecture HA


Niveau Élément Solution Vérifié

Électricité Alimentation Double PSU + UPS + Groupe ☐

Stockage Disques RAID 10 + Hot spare ☐

Stockage Contrôleur RAID matériel avec batterie ☐

Réseau Cartes réseau NIC Teaming (LACP) ☐

Réseau Switches Redondance avec STP/RSTP ☐

Réseau Câblage Double chemin fibre/cuivre ☐

Sécurité Pare-feu Cluster Actif/Passif ☐

WAN Connectivité 2 FAI minimum ☐

Serveur Physical Cluster de serveurs ☐

Serveur Virtualisation Live migration ☐

Données Sauvegarde Backup distant + réplication ☐

Surveillance Monitoring Alertes automatiques ☐


11. CONCLUSION
11.1 Les 5 principes fondamentaux de la HA
Principe 1 : Éliminer les SPOF

Tout composant critique doit être dupliqué


Un SPOF est inacceptable dans une architecture HA

Principe 2 : Détection automatique des pannes

Heartbeat entre équipements redondants


Sondes réseau, keepalive
Détection en moins d'une seconde

Principe 3 : Basculement automatique (Failover)

Sans intervention humaine


Rapide (secondes ou moins)
Transparent pour les utilisateurs

Principe 4 : Synchronisation d'état

Sessions TCP maintenues


Configurations identiques
Données synchronisées en temps réel

Principe 5 : Équilibre coût / disponibilité

Plus de "9" = plus de coût


Analyser le coût réel d'une interruption
Choisir le niveau de HA adapté à son besoin
11.2 Résumé des technologies HA

Technologie Niveau Rôle

RAID 1, 5, 10 Stockage Protection contre panne disque

NIC Teaming Réseau Redondance cartes réseau

STP/RSTP Réseau Évite les boucles, permet la redondance

Cluster firewall Sécurité Redondance pare-feu

Routes flottantes WAN Redondance connexion Internet

Double PSU Électricité Redondance alimentation

Cluster serveurs Serveur Redondance serveur complet

Vous aimerez peut-être aussi