Il 0% ha trovato utile questo documento (0 voti)
0 visualizzazioni50 pagine

Amazon CloudWatch

Il documento presenta un percorso formativo avanzato su Amazon CloudWatch, focalizzandosi sull'osservabilità unificata su AWS attraverso otto moduli che coprono fondamenti, metriche, log, allarmi, automazione, tracciamento, sicurezza e FinOps. Viene evidenziato il passaggio dal monitoraggio tradizionale all'osservabilità, con l'importanza di metriche, log e tracce per una diagnosi efficace. Inoltre, il documento discute la governance della telemetria e l'ecosistema di servizi AWS complementari a CloudWatch.

Caricato da

Samuel Motta
Copyright
© All Rights Reserved
Per noi i diritti sui contenuti sono una cosa seria. Se sospetti che questo contenuto sia tuo, rivendicalo qui.
Formati disponibili
Scarica in formato PDF, TXT o leggi online su Scribd
Il 0% ha trovato utile questo documento (0 voti)
0 visualizzazioni50 pagine

Amazon CloudWatch

Il documento presenta un percorso formativo avanzato su Amazon CloudWatch, focalizzandosi sull'osservabilità unificata su AWS attraverso otto moduli che coprono fondamenti, metriche, log, allarmi, automazione, tracciamento, sicurezza e FinOps. Viene evidenziato il passaggio dal monitoraggio tradizionale all'osservabilità, con l'importanza di metriche, log e tracce per una diagnosi efficace. Inoltre, il documento discute la governance della telemetria e l'ecosistema di servizi AWS complementari a CloudWatch.

Caricato da

Samuel Motta
Copyright
© All Rights Reserved
Per noi i diritti sui contenuti sono una cosa seria. Se sospetti che questo contenuto sia tuo, rivendicalo qui.
Formati disponibili
Scarica in formato PDF, TXT o leggi online su Scribd

OSSERVABILITA UNIFICATA SU AWS

Amazon CloudWatch
Percorso formativo avanzato in 50 slide per Cloud Architect, DevOps Engineer e
System Administrator

Metriche · Log · Tracce · Allarmi · Automazione · Sicurezza · FinOps


MODULO 0 · AGENDA

Agenda del percorso formativo


Otto moduli progressivi, dai fondamenti dell'osservabilita alle best practice enterprise.

1 · Fondamenti (1-7) 2 · Metrics (8-16)


Osservabilita nel cloud, ruolo di CloudWatch, tre pilastri, Anatomia delle metriche, custom metrics, Metric Math,
governance e ecosistema AWS. dashboard, cross-account, anomaly detection.

3 · Logs (17-24) 4 · Alarms (25-30)


Log group e stream, ingestion, Logs Insights, metric filter, Stati e valutazione, composite alarm, SNS, azioni automatiche,
data protection, archiviazione. Incident Manager e ChatOps.

5 · Automazione (31-36) 6 · Tracing (37-41)


EventBridge, regole e target, Synthetics, Application Signals, Distributed tracing, ServiceLens, X-Ray SDK e daemon,
OpsCenter. Service Map, OpenTelemetry.

7 · Sicurezza (42-45) 8 · FinOps (46-50)


IAM least privilege, cifratura KMS, tagging e ABAC, Modello di prezzo, ottimizzazione dei log, pattern
compliance con Config e CloudTrail. architetturali, IaC e checklist finale.

Amazon CloudWatch | Osservabilita unificata su AWS 02


MODULO 1 · FONDAMENTI

Dal monitoraggio tradizionale all'osservabilita


Il monitoraggio risponde a domande note; l'osservabilita permette di indagare l'ignoto.

Monitoraggio classico Osservabilita


Soglie predefinite su host e servizi noti, dashboard statiche, Capacita di inferire lo stato interno di un sistema dai segnali
guasti attesi e catalogati. che emette, senza rilasciare nuovo codice.

Cosa cambia nel cloud Known vs unknown unknowns


Risorse effimere, autoscaling, container e funzioni: l'host non Gli incidenti moderni derivano da combinazioni impreviste
e piu l'unita di analisi. di stati, non da singoli guasti.

Alta cardinalita Impatto organizzativo


Dimensioni come request id, tenant o versione del deploy L'osservabilita e prerequisito per SLO, error budget e
diventano essenziali per la root cause analysis. pratiche SRE mature.

Amazon CloudWatch | Osservabilita unificata su AWS 03


MODULO 1 · FONDAMENTI

Cos'e Amazon CloudWatch

Servizio gestito e nativo di monitoraggio e osservabilita per risorse AWS, applicazioni ibride e on-premise.

▪ Repository centrale di telemetria: raccoglie metriche, log, eventi e tracce in un unico piano dati regionale.
▪ Integrazione nativa: oltre 70 servizi AWS pubblicano metriche automaticamente, senza agenti aggiuntivi.
▪ Piano di azione: allarmi, notifiche e azioni automatiche trasformano i segnali in remediation.
▪ Visualizzazione unificata: dashboard, Logs Insights, ServiceLens e Application Signals sulla stessa base dati.
▪ Estensibilita: API PutMetricData, agent CloudWatch, EMF (Embedded Metric Format) e OpenTelemetry.
▪ Ruolo architetturale: fondamento operativo del pilastro Operational Excellence del Well-Architected
Framework.

Amazon CloudWatch | Osservabilita unificata su AWS 04


MODULO 1 · FONDAMENTI

I tre pilastri dell'osservabilita


Metriche, log e tracce rispondono a domande diverse e sono complementari.

Metriche · Cosa succede Logs · Perche succede


Serie temporali numeriche e aggregate: basso costo, alta Eventi testuali e strutturati con contesto ricco: diagnosi
ritenzione, ideali per allarmi e trend. puntuale, cardinalita illimitata.

Traces · Dove succede Correlazione


Percorso di una singola richiesta tra servizi: latenza per hop Trace ID e dimensioni comuni permettono il pivot da metrica
e dipendenze. ad allarme, log e traccia.

Quarto segnale Regola pratica


Gli eventi di cambiamento (deploy, scaling, configurazioni) Allarmi sulle metriche, diagnosi nei log, root cause nelle
spiegano la maggioranza degli incidenti. tracce: mai un solo pilastro.

Amazon CloudWatch | Osservabilita unificata su AWS 05


MODULO 1 · FONDAMENTI

Responsabilita condivisa e governance della telemetria

AWS garantisce la disponibilita del servizio; il cliente definisce cosa raccogliere e per quanto tempo.

▪ Responsabilita di AWS: infrastruttura, durabilita del piano dati, metriche di servizio pubblicate di default.
▪ Responsabilita del cliente: strumentazione dell'applicazione, retention, cifratura, permessi e qualita dei dati.
▪ Data ownership: log e metriche possono contenere dati personali o segreti; vanno classificati come qualsiasi
dato aziendale.
▪ Governance dei namespace: convenzioni di naming e di tagging condivise evitano frammentazione e costi
duplicati.
▪ Residenza dei dati: CloudWatch e regionale; l'aggregazione cross-region richiede scelte esplicite di replica.
▪ Ciclo di vita: definire retention, archiviazione e cancellazione in linea con le policy di compliance interne.

Amazon CloudWatch | Osservabilita unificata su AWS 06


MODULO 1 · FONDAMENTI

Ecosistema di osservabilita AWS


CloudWatch e il nucleo di una famiglia di servizi complementari.

Amazon CloudWatch AWS X-Ray


Metriche, log, allarmi, dashboard, Synthetics e Application Distributed tracing con segmenti, service map e analisi della
Signals: il piano operativo centrale. latenza end-to-end.

Amazon Managed Prometheus (AMP) Amazon Managed Grafana (AMG)


Ingestion compatibile Prometheus per workload Kubernetes Visualizzazione multi-sorgente: CloudWatch, AMP,
e metriche ad alta cardinalita. OpenSearch e origini di terze parti.

Amazon OpenSearch Service Criterio di scelta


Ricerca e analisi full-text su grandi volumi di log con CloudWatch come default nativo; gli altri servizi per scala,
retention prolungata. portabilita o standard aperti.

Amazon CloudWatch | Osservabilita unificata su AWS 07


MODULO 2 · METRICS

Anatomia di una metrica CloudWatch


Ogni punto dati e identificato univocamente da namespace, nome e insieme di dimensioni.

Namespace Metric Name


Contenitore logico (AWS/EC2, AWS/Lambda, o custom): Grandezza misurata: CPUUtilization, Duration, 5xxCount.
isola le metriche ed evita collisioni di nome. Deve essere stabile nel tempo.

Dimensions Timestamp e valore


Coppie chiave-valore (max 30) che qualificano la metrica: Fino a due settimane nel passato e due ore nel futuro;
InstanceId, FunctionName, Stage. valore singolo o statistic set.

Unita di misura Attenzione


Seconds, Bytes, Count, Percent: abilita conversioni e assi Ogni combinazione di dimensioni e una metrica distinta e
coerenti nelle dashboard. fatturata: governare la cardinalita.

Amazon CloudWatch | Osservabilita unificata su AWS 08


MODULO 2 · METRICS

Metriche standard e metriche custom

Le metriche native coprono l'infrastruttura; le custom metrics portano il contesto di business.

▪ Metriche standard: pubblicate automaticamente dai servizi AWS, gratuite e disponibili a 5 o 1 minuto.
▪ Limite intrinseco: la memoria e lo spazio disco delle istanze EC2 richiedono il CloudWatch Agent.
▪ API PutMetricData: invio diretto da SDK o CLI; supporta valori singoli, statistic set e valori con counts.
▪ Embedded Metric Format (EMF): si scrive un log JSON strutturato e CloudWatch ne estrae le metriche, senza
chiamate sincrone.
▪ Metriche di business: ordini processati, tasso di conversione, code di lavoro: fondamentali per allarmi
realmente significativi.
▪ Buone pratiche: batch delle chiamate PutMetricData, dimensioni a bassa cardinalita e naming coerente per
team.

Amazon CloudWatch | Osservabilita unificata su AWS 09


MODULO 2 · METRICS

Periodi, risoluzione e aggregazione


La risoluzione determina reattivita, costo e durata di conservazione dei dati.

Risoluzione standard Alta risoluzione


Granularita di 60 secondi: default per la maggior parte delle Fino a 1 secondo con StorageResolution=1: allarmi valutabili
metriche AWS e custom. ogni 10 o 30 secondi.

Detailed monitoring Statistiche


Su EC2 porta le metriche da 5 minuti a 1 minuto con costo Average, Sum, Minimum, Maximum, SampleCount e
aggiuntivo per istanza. percentili (p90, p99) per la latenza.

Rollup automatico Anti-pattern


1s per 3 ore, 60s per 15 giorni, 5 min per 63 giorni, 1 ora per Usare Average su metriche di latenza nasconde la coda:
15 mesi. preferire p95 o p99.

Amazon CloudWatch | Osservabilita unificata su AWS 10


MODULO 2 · METRICS

CloudWatch Metric Math

Espressioni calcolate in tempo reale su una o piu metriche, senza pubblicare nuovi dati.

▪ Operatori e funzioni: aritmetica, SUM, AVG, RATE, DIFF, FILL, IF e funzioni statistiche su array di metriche.
▪ Search expression: SEARCH() aggrega dinamicamente tutte le metriche che corrispondono a un pattern,
includendo risorse nuove.
▪ KPI derivati: tasso di errore come 100*(errori/richieste), saturazione delle code, costo per transazione.
▪ Allarmi su espressioni: un allarme puo valutare direttamente il risultato di una Metric Math expression.
▪ Gestione dei dati mancanti: FILL(m1, 0) o REPEAT evitano stati INSUFFICIENT_DATA su serie sporadiche.
▪ Vantaggio economico: si calcolano indicatori compositi senza generare metriche custom aggiuntive.

Amazon CloudWatch | Osservabilita unificata su AWS 11


MODULO 2 · METRICS

CloudWatch Dashboards
Plance di controllo condivise, versionabili e utilizzabili come strumento di incident response.

Widget disponibili Automatic Dashboards


Line, stacked area, number, gauge, log table, alarm status, Viste pre-costruite per servizio, disponibili senza
testo Markdown ed esplorazioni. configurazione e sempre aggiornate.

Definizione come codice Variabili e template


Il JSON della dashboard e gestibile con CloudFormation, Property variable per cambiare regione, account o risorsa
Terraform o CDK. con un selettore.

Condivisione Design efficace


Dashboard pubbliche o condivise con SSO per stakeholder Struttura a piramide: salute del servizio in alto, dettagli
senza console AWS. tecnici sotto.

Amazon CloudWatch | Osservabilita unificata su AWS 12


MODULO 2 · METRICS

CloudWatch Contributor Insights

Identifica in tempo reale i top-N contributori al traffico, agli errori o alla latenza.

▪ Regole su log group: definiscono i campi chiave (IP, tenant, URI, user agent) da aggregare.
▪ Output: classifiche dei contributori piu attivi e serie temporali dei valori aggregati.
▪ Casi d'uso tipici: individuare un client che genera throttling, un tenant rumoroso o un endpoint degradato.
▪ Integrazione DynamoDB: regole native per identificare le partition key piu sollecitate (hot key).
▪ Uso in dashboard e allarmi: i report possono essere aggiunti alle dashboard e usati come sorgente per
allarmi.
▪ Valore operativo: riduce il tempo di isolamento del problema quando la metrica aggregata resta nella norma.

Amazon CloudWatch | Osservabilita unificata su AWS 13


MODULO 2 · METRICS

CloudWatch Cross-Account Observability


Un unico monitoring account osserva metriche, log e tracce di piu source account.

01 Si designa un monitoring account centrale, tipicamente nell'account Operations o Shared Services.

I source account creano un sink link autorizzando la condivisione di metriche, log, tracce e Application
02 Signals.

L'integrazione con AWS Organizations consente il collegamento massivo per OU, senza configurazioni
03 manuali.

04 Le risorse condivise restano read-only nel monitoring account: nessun trasferimento o duplicazione dei dati.

Le query di Logs Insights e le dashboard funzionano trasversalmente, con etichettatura dell'account di


05 origine.

Risultato: un solo punto di osservazione per l'intera landing zone, con costi e permessi separati per
06 account.

Amazon CloudWatch | Osservabilita unificata su AWS 14


MODULO 2 · METRICS

Monitoraggio di EC2, RDS, Lambda ed EKS


Ogni servizio ha un proprio insieme di segnali critici da presidiare.

Amazon EC2 Amazon RDS / Aurora


CPUUtilization, StatusCheckFailed, NetworkIn/Out; memoria CPU, DatabaseConnections, ReadLatency, FreeableMemory,
e disco solo via CloudWatch Agent. ReplicaLag; Performance Insights per le query.

AWS Lambda Amazon EKS


Invocations, Errors, Duration, Throttles, ConcurrentExecutions Container Insights per nodi, pod e namespace; metriche di
e IteratorAge per gli stream. control plane e Kubernetes events.

Load balancer Approccio USE/RED


TargetResponseTime, HTTPCode_ELB_5XX, Utilization-Saturation-Errors per le risorse, Rate-Errors-
UnHealthyHostCount e conteggio richieste per target group. Duration per i servizi.

Amazon CloudWatch | Osservabilita unificata su AWS 15


MODULO 2 · METRICS

Anomaly Detection: machine learning sulle metriche

Un modello statistico apprende il comportamento atteso e genera una banda di normalita dinamica.

▪ Apprendimento automatico: il modello analizza fino a due settimane di storico e riconosce stagionalita
oraria, giornaliera e settimanale.
▪ Banda di confidenza: la soglia non e un valore fisso ma un intervallo che si adatta al ciclo del carico.
▪ Allarmi su anomalia: si genera un allarme quando la metrica esce dalla banda, con sensibilita configurabile.
▪ Esclusione di periodi: e possibile escludere dal training finestre di eventi eccezionali come test di carico o
incidenti.
▪ Casi d'uso ideali: traffico applicativo, latenza, throughput, code di lavoro con andamento ciclico noto.
▪ Limiti: metriche molto rumorose o con cambi di regime frequenti richiedono comunque soglie statiche di
sicurezza.

Amazon CloudWatch | Osservabilita unificata su AWS 16


MODULO 3 · LOGS

Architettura di CloudWatch Logs


Una gerarchia semplice che determina retention, permessi e costi.

Log Group Log Stream


Unita logica per applicazione o servizio: contiene retention, Sequenza di eventi da una singola sorgente (istanza,
cifratura KMS e metric filter. container, esecuzione Lambda), ordinata nel tempo.

Log Event Retention Policy


Record con timestamp e messaggio; il formato JSON abilita Da 1 giorno a 10 anni o infinita: il default 'Never expire' e la
query strutturate efficienti. principale causa di spesa inattesa.

Log class Naming


Standard per l'analisi in tempo reale, Infrequent Access per Convenzione /azienda/ambiente/servizio per abilitare
log raramente consultati a costo ridotto. policy IAM e automazioni per prefisso.

Amazon CloudWatch | Osservabilita unificata su AWS 17


MODULO 3 · LOGS

Ingestion dei log


Piu percorsi di raccolta, da scegliere in base al tipo di workload.

CloudWatch Agent Fluent Bit


Unico agente per log e metriche di sistema su EC2, on- Standard per container su EKS ed ECS: leggero, con routing
premise e ibrido; configurabile via SSM Parameter Store. e filtri verso CloudWatch, S3 o OpenSearch.

Lambda Extensions Integrazioni native


Telemetry API per inviare i log direttamente dalla funzione, API Gateway, VPC Flow Logs, Route 53, WAF e RDS scrivono
riducendo latenza e dipendenze. su CloudWatch Logs senza agenti.

SDK e EMF Best practice


Log JSON strutturati che veicolano contemporaneamente Emettere JSON strutturato con request id, tenant e versione:
contesto e metriche. abilita query e correlazione.

Amazon CloudWatch | Osservabilita unificata su AWS 18


MODULO 3 · LOGS

CloudWatch Logs Insights

Linguaggio di query interattivo per analizzare gigabyte di log in pochi secondi.

▪ Comandi principali: fields, filter, stats, sort, limit, parse, dedup e display, componibili in pipeline.
▪ Campi automatici: @timestamp, @message, @logStream e @ingestionTime sempre disponibili senza
configurazione.
▪ Parsing dinamico: parse con pattern glob o regex estrae campi da log non strutturati al momento della query.
▪ Aggregazioni: stats count() by campo, avg(), percentile() e bin() per l'analisi temporale delle distribuzioni.
▪ Query cross log group e cross account: analisi trasversale su piu servizi e piu account nella stessa esecuzione.
▪ Assistenza in linguaggio naturale e query salvate: accelerano il troubleshooting e standardizzano i runbook
di team.

Amazon CloudWatch | Osservabilita unificata su AWS 19


MODULO 3 · LOGS

Metric Filters: dalle stringhe alle metriche


Trasformare pattern testuali ricorrenti in serie temporali numeriche allarmabili.

01 Si definisce un filter pattern sul log group: termini letterali, espressioni JSON o pattern su log delimitati.

Ogni evento corrispondente incrementa una metrica custom nel namespace scelto, con valore fisso o
02 estratto dal log.

03 Si possono aggiungere dimensioni dai campi del log (per esempio codice di errore o nome del servizio).

04 Il default value evita stati INSUFFICIENT_DATA quando non ci sono corrispondenze nel periodo.

05 Sulla metrica risultante si costruiscono allarmi, dashboard e Metric Math come su qualsiasi altra metrica.

06 Rispetto a Logs Insights, i metric filter costano meno per il monitoraggio continuo di pattern noti.

Amazon CloudWatch | Osservabilita unificata su AWS 20


MODULO 3 · LOGS

Log Anomaly Detection e Live Tail


Due funzionalita complementari per il rilevamento e il troubleshooting in tempo reale.

Log Anomaly Detection Rilevamento


Un modello ML apprende i pattern ricorrenti del log group e Segnala nuovi messaggi di errore, variazioni di frequenza e
ne estrae una baseline automatica. pattern mai osservati prima.

Suppression Live Tail


Le anomalie note o attese possono essere soppresse per Streaming interattivo degli eventi in arrivo, con filtri e
periodo o in modo permanente. evidenziazione dei termini chiave.

Uso tipico Attenzione ai costi


Verifica immediata di un deploy o di un fix senza attendere il Live Tail e fatturato al minuto di sessione: usarlo in modo
refresh delle query. mirato durante gli incidenti.

Amazon CloudWatch | Osservabilita unificata su AWS 21


MODULO 3 · LOGS

Logs Data Protection: mascheramento dei dati sensibili

Rilevare e mascherare automaticamente i dati personali (PII) prima che diventino consultabili.

▪ Data identifier gestiti: oltre 100 tipi predefiniti (carte di credito, codici fiscali, email, chiavi di accesso, dati
sanitari).
▪ Data identifier custom: espressioni regolari proprietarie per identificatori interni e formati aziendali.
▪ Mascheramento in lettura: i valori sensibili appaiono offuscati; solo chi possiede il permesso Unmask puo
vederli in chiaro.
▪ Audit findings: le rilevazioni possono essere inviate a S3, Firehose o a un altro log group per la revisione di
compliance.
▪ Cifratura at rest: log group cifrati con chiavi KMS gestite dal cliente, con policy di accesso dedicata.
▪ Cifratura in transito: endpoint TLS e VPC endpoint per evitare il transito su rete pubblica.

Amazon CloudWatch | Osservabilita unificata su AWS 22


MODULO 3 · LOGS

Esportazione e archiviazione a lungo termine


Separare i log operativi caldi dall'archivio storico riduce i costi in modo strutturale.

Export task verso S3 Subscription filter


Esportazione batch di un intervallo temporale, adatta ad Streaming near real-time verso Firehose, Lambda o
archiviazione e audit periodici. OpenSearch, con filtro sul contenuto.

Amazon Data Firehose S3 storage tier


Buffering, conversione in Parquet e compressione prima Transizione a Glacier Instant o Deep Archive tramite
della scrittura su S3. lifecycle policy per la retention pluriennale.

Query sull'archivio OpenSearch Service


Amazon Athena interroga i log archiviati su S3 senza Ricerca full-text e dashboard avanzate su finestre di
reidratazione. retention prolungate.

Amazon CloudWatch | Osservabilita unificata su AWS 23


MODULO 3 · LOGS

Integrazione dei log di sicurezza


I log di sicurezza completano il quadro operativo con la dimensione di audit.

AWS CloudTrail CloudTrail su CloudWatch


Registra ogni chiamata API: chi ha fatto cosa, quando e da Inviando il trail a un log group si abilitano metric filter e
quale IP. Base di ogni indagine. allarmi su eventi critici.

Allarmi tipici VPC Flow Logs


Uso delle credenziali root, modifiche a security group, Metadati del traffico accettato e rifiutato a livello di ENI,
disattivazione di trail o chiavi KMS. subnet o VPC.

Analisi di rete Correlazione


Logs Insights sui flow log per individuare flussi anomali ed Integrazione con GuardDuty e Security Hub per unire
esfiltrazione di dati. segnali operativi e di sicurezza.

Amazon CloudWatch | Osservabilita unificata su AWS 24


MODULO 4 · ALARMS

Anatomia di un CloudWatch Alarm


Un allarme valuta periodicamente una metrica rispetto a una soglia e cambia stato.

OK ALARM
La metrica e entro la soglia definita per il numero di periodi La condizione e stata violata per M periodi su N valutati:
richiesto. scattano le azioni configurate.

INSUFFICIENT_DATA Periodo e valutazione


Dati assenti o incompleti: tipico di risorse appena create o Period definisce la granularita; Evaluation Periods e
metriche sporadiche. Datapoints to Alarm la persistenza richiesta.

Trattamento dei dati mancanti Stato e azioni


missing, notBreaching, breaching o ignore: scelta critica per Ogni transizione di stato puo attivare azioni distinte, incluso
evitare falsi allarmi. il ritorno in OK.

Amazon CloudWatch | Osservabilita unificata su AWS 25


MODULO 4 · ALARMS

Creazione di allarmi: metriche, formule e anomalie

Tre modalita di definizione, con crescente capacita di adattamento al contesto.

▪ Allarme su metrica singola: soglia statica su una metrica e una statistica, il caso piu comune e piu semplice
da spiegare.
▪ Allarme su Metric Math: valuta un'espressione, per esempio il tasso di errore percentuale o il rapporto tra
due metriche.
▪ Allarme su anomaly detection: la soglia e la banda appresa dal modello, con sensibilita espressa in deviazioni
standard.
▪ Scelta della statistica: p95 o p99 per la latenza, Sum per i conteggi, Average solo per le metriche di utilizzo.
▪ M out of N: richiedere piu datapoint riduce il rumore ma allunga il tempo di rilevazione: e un compromesso
esplicito.
▪ Documentazione: descrizione dell'allarme e link al runbook direttamente nel campo description o nel
messaggio SNS.

Amazon CloudWatch | Osservabilita unificata su AWS 26


MODULO 4 · ALARMS

Composite Alarms e riduzione dell'alert fatigue

Combinano piu allarmi con logica booleana per notificare solo cio che conta davvero.

▪ Espressioni booleane: ALARM(a) AND ALARM(b), OR, NOT e parentesi per modellare condizioni complesse.
▪ Riduzione del rumore: si notifica il sintomo di business solo quando piu segnali tecnici concordano.
▪ Soppressione con actions suppressor: un allarme di manutenzione o di dipendenza a monte silenzia gli
allarmi derivati.
▪ Gerarchia degli allarmi: allarmi tecnici come sensori, composite alarm come unico punto di notifica per l'on-
call.
▪ Simboli di salute del servizio: un composite alarm per servizio diventa l'indicatore sintetico nelle dashboard.
▪ Effetto organizzativo: meno pagine notturne, maggiore fiducia nel sistema di allerta e MTTR piu basso.

Amazon CloudWatch | Osservabilita unificata su AWS 27


MODULO 4 · ALARMS

Integrazione con Amazon SNS


SNS e il fan-out delle notifiche verso persone e sistemi.

01 L'allarme pubblica un messaggio JSON su un topic SNS alla transizione di stato configurata.

02 Il topic distribuisce a piu subscription: email, SMS, HTTPS webhook, SQS, Lambda o mobile push.

03 Una Lambda subscriber puo arricchire e formattare il messaggio prima di inoltrarlo a sistemi esterni.

L'integrazione con PagerDuty, Opsgenie o ServiceNow avviene tramite endpoint HTTPS o connettori
04 dedicati.

Le policy del topic e la cifratura KMS proteggono i contenuti delle notifiche, che possono includere dati
05 sensibili.

06 Separare i topic per severita (P1, P2, informativo) evita che gli avvisi critici si perdano nel rumore.

Amazon CloudWatch | Osservabilita unificata su AWS 28


MODULO 4 · ALARMS

Action Integrations: remediation automatica


L'allarme non si limita a notificare: puo ripristinare il servizio autonomamente.

EC2 Recover EC2 Stop / Terminate


Migra l'istanza su hardware sano mantenendo id, IP privato e Spegne istanze inattive o compromesse, utile per controllo
volumi EBS. costi e contenimento.

Auto Scaling Systems Manager


Scaling policy target tracking, step o simple guidate Esecuzione di runbook Automation per riavvii, pulizia disco
direttamente dalle metriche. o rotazione di risorse.

Lambda via SNS Cautela


Remediation custom: invalidare cache, drenare un target Ogni azione automatica va idempotente, limitata in
group, aprire un ticket. frequenza e tracciata in audit.

Amazon CloudWatch | Osservabilita unificata su AWS 29


MODULO 4 · ALARMS

Incident Manager e ChatOps aziendale

Dal singolo allarme al processo strutturato di gestione dell'incidente.

▪ AWS Systems Manager Incident Manager: crea automaticamente l'incidente a partire da un CloudWatch
Alarm o da EventBridge.
▪ Response plan: definisce severita, contatti, escalation, canali di engagement e runbook da eseguire.
▪ Timeline automatica: eventi, azioni e decisioni sono registrati per l'analisi post-incidente e la post-mortem.
▪ AWS Chatbot in Slack e Microsoft Teams: notifiche formattate nei canali, con grafici delle metriche in linea.
▪ Comandi da chat: esecuzione di comandi AWS approvati direttamente dal canale, con permessi IAM
controllati.
▪ Metriche di processo: MTTA e MTTR misurabili diventano la base per il miglioramento continuo delle
operations.

Amazon CloudWatch | Osservabilita unificata su AWS 30


MODULO 5 · AUTOMAZIONE

Amazon EventBridge: architettura event-driven


Evoluzione di CloudWatch Events: un bus di eventi serverless per l'intera organizzazione.

Event bus Struttura dell'evento


Default bus per gli eventi AWS, bus custom per le JSON con source, detail-type, account, region e detail:
applicazioni, partner bus per i SaaS. contratto stabile tra produttori e consumatori.

Disaccoppiamento Consegna
I produttori non conoscono i consumatori: si aggiungono At-least-once con retry configurabili e dead letter queue per
nuovi target senza modificare il codice. gli eventi non consegnati.

Schema Registry Scheduler


Scoperta automatica degli schemi e generazione di binding EventBridge Scheduler per job pianificati con cron o rate, a
tipizzati per gli sviluppatori. scala di milioni di schedule.

Amazon CloudWatch | Osservabilita unificata su AWS 31


MODULO 5 · AUTOMAZIONE

Regole ed event pattern di EventBridge

Le regole filtrano gli eventi e li instradano verso i target appropriati.

▪ Event pattern: struttura JSON che deve corrispondere all'evento; il matching e su sottoinsieme dei campi.
▪ Content filtering: operatori prefix, suffix, anything-but, numeric, exists e wildcard per pattern selettivi.
▪ Eventi di cambio stato: EC2 Instance State-change, ECS Task State Change, AWS Health, Auto Scaling e
CloudWatch Alarm State Change.
▪ Eventi da CloudTrail: qualsiasi chiamata API diventa un trigger, abilitando controlli di governance in tempo
reale.
▪ Input transformer: rimodella il payload prima della consegna, adattandolo al contratto atteso dal target.
▪ Regole schedulate: espressioni cron o rate per attivita ricorrenti come report, backup e pulizie.

Amazon CloudWatch | Osservabilita unificata su AWS 32


MODULO 5 · AUTOMAZIONE

Target di automazione: Lambda, SQS e Step Functions


Piu di venti tipi di target, da scegliere in base a durata e complessita della risposta.

AWS Lambda Amazon SQS


Remediation rapida e sincrona: taggare risorse, revocare Buffer che assorbe i picchi e protegge i consumatori a valle,
regole, arricchire notifiche. con DLQ per gli errori.

AWS Step Functions Systems Manager


Orchestrazione di workflow multi-step con attese, retry, Esecuzione di documenti Automation per operazioni
branching e approvazioni umane. standardizzate sulla flotta.

API Destinations Affidabilita


Chiamate HTTPS verso sistemi esterni con gestione Retry policy, DLQ obbligatoria e idempotenza dei target
centralizzata delle credenziali. sono requisiti di produzione.

Amazon CloudWatch | Osservabilita unificata su AWS 33


MODULO 5 · AUTOMAZIONE

CloudWatch Synthetics: monitoraggio proattivo

I canary verificano endpoint e user journey prima che siano gli utenti a segnalare il problema.

▪ Script canary: [Link] con Puppeteer o Python con Selenium, eseguiti su pianificazione da AWS.
▪ Blueprint pronti: heartbeat, API canary, broken link checker, GUI workflow e canary sul contenuto della
pagina.
▪ User journey completi: login, ricerca, aggiunta al carrello e checkout eseguiti end-to-end come un utente
reale.
▪ Artefatti raccolti: screenshot, file HAR e log per ogni esecuzione, archiviati su S3 per l'analisi.
▪ Metriche generate: SuccessPercent, Duration e 2xx/4xx/5xx, utilizzabili per allarmi e per il calcolo degli SLO.
▪ Copertura globale: eseguire canary da piu regioni per distinguere problemi locali da guasti reali del servizio.

Amazon CloudWatch | Osservabilita unificata su AWS 34


MODULO 5 · AUTOMAZIONE

CloudWatch Application Signals


APM gestito, incentrato sui servizi applicativi anziche sull'infrastruttura.

Scoperta automatica Golden signals


Individua servizi, operazioni e dipendenze con Latenza, tasso di errore e volume per servizio e per
strumentazione OpenTelemetry a basso attrito. operazione, senza dashboard da costruire.

SLO gestiti Mappa delle dipendenze


Definizione di obiettivi di servizio con tracciamento Visualizza le chiamate verso database, code e servizi a valle,
automatico dell'error budget residuo. con relativa salute.

Correlazione Runtime supportati


Pivot immediato da servizio degradato a tracce, log e Java, Python, .NET e [Link] su EC2, ECS, EKS e Lambda.
metriche correlate.

Amazon CloudWatch | Osservabilita unificata su AWS 35


MODULO 5 · AUTOMAZIONE

Systems Manager OpsCenter e OpsItems


Un unico inventario dei problemi operativi, alimentato dalla telemetria.

01 Un CloudWatch Alarm o una regola EventBridge crea automaticamente un OpsItem in OpsCenter.

02 L'OpsItem raccoglie contesto: risorsa coinvolta, metriche rilevanti, log correlati e stack CloudFormation.

03 Le runbook associate propongono la remediation standard, eseguibile direttamente dall'interfaccia.

04 Regole di deduplicazione evitano la proliferazione di OpsItem per lo stesso problema ricorrente.

05 Gli OpsItem sono assegnabili, categorizzabili e prioritizzabili, con integrazione verso i sistemi ITSM.

06 L'analisi aggregata rivela i problemi cronici, orientando gli investimenti di affidabilita.

Amazon CloudWatch | Osservabilita unificata su AWS 36


MODULO 6 · TRACING

Perche serve il distributed tracing

In un'architettura a microservizi la latenza non appartiene a un solo componente.

▪ Frammentazione della richiesta: una singola chiamata utente attraversa decine di servizi, code e database.
▪ Limite dei log per servizio: mostrano cosa e successo localmente, non il percorso complessivo della richiesta.
▪ Latenza cumulativa: ritardi minimi su molti hop producono un p99 inaccettabile per l'utente finale.
▪ Serverless e asincronia: le catene event-driven rendono impossibile ricostruire il flusso manualmente.
▪ Correlazione tramite trace id: propagato negli header, lega insieme tracce, log e metriche.
▪ Beneficio misurabile: riduzione netta del tempo di isolamento del guasto durante gli incidenti complessi.

Amazon CloudWatch | Osservabilita unificata su AWS 37


MODULO 6 · TRACING

CloudWatch ServiceLens
Vista unificata che collega metriche, log e tracce nello stesso contesto.

Service map arricchita Correlazione automatica


Nodi con salute, latenza e tasso di errore aggregati per Da un nodo si accede a tracce, log e metriche senza
servizio. cambiare console.

Analisi dei colli di bottiglia Contesto infrastrutturale


Distribuzione della latenza per identificare l'hop responsabile Collega il servizio alle risorse sottostanti: container, funzioni
del degrado. e istanze.

Integrazione allarmi Uso operativo


Gli allarmi attivi appaiono direttamente sulla mappa, con Punto di partenza ideale del triage nei primi minuti di un
impatto visibile. incidente.

Amazon CloudWatch | Osservabilita unificata su AWS 38


MODULO 6 · TRACING

AWS X-Ray: SDK, daemon e strumentazione


Come catturare i dati di traccia dal codice applicativo.

Segmenti Sotto-segmenti
Unita di lavoro di un servizio: nome, tempi, annotazioni, Chiamate a valle: query SQL, richieste HTTP, accessi a S3 o
metadati ed eventuali eccezioni. DynamoDB con timing dedicato.

X-Ray SDK / ADOT X-Ray daemon


Auto-instrumentation per client AWS, HTTP e database; Processo che bufferizza i segmenti UDP e li invia in batch
ADOT e la via consigliata oggi. all'API, riducendo l'overhead.

Sampling Annotazioni
Regole configurabili: 1 richiesta al secondo piu una Campi indicizzati e ricercabili (tenant, versione, endpoint)
percentuale, per controllare costi e volume. contro metadati non indicizzati.

Amazon CloudWatch | Osservabilita unificata su AWS 39


MODULO 6 · TRACING

Analisi delle Service Map

La mappa dei servizi rende visibile la topologia reale dell'applicazione in produzione.

▪ Nodi e archi: ogni nodo e un servizio o una risorsa, ogni arco una dipendenza osservata realmente nel
traffico.
▪ Codifica visiva: dimensione proporzionale al traffico, colore in base alla percentuale di errori e throttling.
▪ Latenza end-to-end: istogrammi di distribuzione per individuare code lunghe che l'average nasconde.
▪ Trace analytics: filtri per gruppo, codice di risposta, annotazione o utente per isolare le tracce rilevanti.
▪ Confronto tra deploy: annotare la versione permette di attribuire una regressione a un rilascio specifico.
▪ Dipendenze inattese: la mappa rivela spesso chiamate non documentate verso servizi legacy o esterni.

Amazon CloudWatch | Osservabilita unificata su AWS 40


MODULO 6 · TRACING

OpenTelemetry e CloudWatch
Uno standard aperto per raccogliere metriche, log e tracce senza lock-in.

Standard CNCF ADOT


API, SDK e protocollo OTLP comuni a tutti i linguaggi e a tutti AWS Distro for OpenTelemetry: distribuzione supportata da
i backend. AWS, pre-configurata per i servizi AWS.

Collector Modalita di deploy


Pipeline di receiver, processor ed exporter per filtrare, Sidecar, DaemonSet, gateway o Lambda layer a seconda
arricchire e instradare la telemetria. del workload.

Multi-destinazione Migrazione
Stessa telemetria verso CloudWatch, AMP e backend di Percorso graduale: iniziare dalle tracce, poi metriche e infine
terze parti contemporaneamente. log.

Amazon CloudWatch | Osservabilita unificata su AWS 41


MODULO 7 · SICUREZZA

Modello di permessi IAM per CloudWatch


Least privilege applicato separando scrittura, lettura e amministrazione.

Scrittura metriche Scrittura log


cloudwatch:PutMetricData, limitabile per namespace con la logs:CreateLogStream e logs:PutLogEvents ristretti all'ARN
condizione cloudwatch:namespace. del log group specifico.

Lettura e analisi Gestione allarmi


GetMetricData, logs:StartQuery e GetQueryResults per i PutMetricAlarm e DeleteAlarms riservati a pipeline IaC, non
team di sviluppo e supporto. agli utenti interattivi.

Ruoli per servizio Guardrail


Ogni workload usa un ruolo dedicato: mai chiavi statiche o SCP e permission boundary impediscono la cancellazione di
ruoli condivisi tra applicazioni. log group e trail di audit.

Amazon CloudWatch | Osservabilita unificata su AWS 42


MODULO 7 · SICUREZZA

Cifratura con AWS KMS

Protezione dei dati a riposo con chiavi gestite dal cliente e controllo esplicito degli accessi.

▪ Cifratura di default: i log sono sempre cifrati lato server con chiavi gestite da AWS, senza costi aggiuntivi.
▪ Customer Managed Key (CMK): consente rotazione controllata, audit dell'uso e revoca immediata
dell'accesso.
▪ Associazione al log group: la chiave si applica con AssociateKmsKey e vale per i dati scritti successivamente.
▪ Key policy: deve autorizzare esplicitamente il principal logs.<region>.[Link] con le condizioni
corrette.
▪ Effetto della revoca: disabilitando la chiave i log restano cifrati ma diventano illeggibili, anche agli
amministratori.
▪ Copertura estesa: applicare la stessa logica ai topic SNS, ai bucket S3 di archivio e agli snapshot correlati.

Amazon CloudWatch | Osservabilita unificata su AWS 43


MODULO 7 · SICUREZZA

Tagging, ABAC e FinOps


I tag governano contemporaneamente accessi e attribuzione dei costi.

Tag obbligatori ABAC


Environment, Application, Owner, CostCenter, Le policy IAM confrontano i tag del principal con quelli della
DataClassification su ogni risorsa osservabile. risorsa: nessuna policy per team.

Scalabilita Cost allocation tag


Un nuovo team o ambiente non richiede nuove policy, solo i Attivati in Billing, abilitano la ripartizione dei costi di
tag corretti. osservabilita per prodotto.

Enforcement Automazione
Tag policy di Organizations e AWS Config verificano la Il tagging va imposto nel codice IaC, non applicato
conformita in modo continuo. manualmente a posteriori.

Amazon CloudWatch | Osservabilita unificata su AWS 44


MODULO 7 · SICUREZZA

Conformita e audit dell'osservabilita

Anche il sistema di monitoraggio deve essere verificabile e conforme.

▪ AWS Config rules: verificano che i log group abbiano retention definita, cifratura KMS e che i trail siano attivi.
▪ Conformance pack: insiemi di regole allineati a CIS, PCI DSS, HIPAA e ISO 27001, distribuibili per l'intera
organizzazione.
▪ Auto-remediation: le regole non conformi attivano documenti SSM Automation che ripristinano la
configurazione attesa.
▪ CloudTrail come audit dell'audit: registra chi modifica allarmi, retention o subscription filter.
▪ Log immutability: bucket di archivio con Object Lock e MFA delete per garantire l'integrita delle evidenze.
▪ Evidenza per gli auditor: dashboard e report di conformita esportabili riducono drasticamente l'effort di
certificazione.

Amazon CloudWatch | Osservabilita unificata su AWS 45


MODULO 8 · FINOPS

Modello di prezzo di Amazon CloudWatch


Capire le voci di costo e il prerequisito per ottimizzarle senza perdere visibilita.

Metriche custom Chiamate API


Costo per metrica al mese: ogni combinazione di dimensioni PutMetricData e GetMetricData sono fatturate per richiesta:
conta come metrica distinta. conviene aggregare in batch.

Log ingestion Log storage


Voce tipicamente dominante, fatturata per GB ingeriti: e la Costo per GB al mese compresso, proporzionale al periodo di
leva di risparmio principale. retention configurato.

Logs Insights Dashboard e allarmi


Costo per GB scansionati da ogni query: filtri temporali Prezzo per dashboard, per allarme e per canary o sessione
stretti riducono la spesa. Live Tail.

Amazon CloudWatch | Osservabilita unificata su AWS 46


MODULO 8 · FINOPS

Strategie di ottimizzazione dei costi dei log


Interventi in ordine di impatto, dal piu efficace al piu specifico.

Impostare una retention esplicita su ogni log group: e l'intervento singolo con il maggior ritorno
01 immediato.

02 Ridurre il verbosity level in produzione: eliminare i log di debug abbassa direttamente i GB ingeriti.

Applicare campionamento ai log ad alto volume e a basso valore diagnostico, mantenendo il 100% degli
03 errori.

04 Adottare la log class Infrequent Access per i log di compliance consultati raramente.

05 Spostare l'archivio storico su S3 con lifecycle e interrogarlo con Athena quando serve.

06 Monitorare i costi con Cost Explorer per log group e allarmi di budget sulla spesa di osservabilita.

Amazon CloudWatch | Osservabilita unificata su AWS 47


MODULO 8 · FINOPS

Pattern architetturali per grandi volumi


Non tutta la telemetria merita lo stesso trattamento: differenziare per valore.

Modello a tre livelli CloudWatch


Hot in CloudWatch, warm in OpenSearch, cold su S3: costi Ideale per operativita e allarmi su finestre brevi, con
allineati alla frequenza d'uso. integrazione nativa e zero gestione.

OpenSearch Service S3 e Athena


Ricerca full-text e analisi su settimane o mesi, con cluster da Archiviazione piu economica con query on demand: perfetto
dimensionare e gestire. per audit e analisi forensi.

Routing selettivo Metriche ad alta cardinalita


Subscription filter e Firehose instradano ogni classe di log alla Valutare AMP quando le dimensioni renderebbero proibitive
destinazione corretta. le custom metric.

Amazon CloudWatch | Osservabilita unificata su AWS 48


MODULO 8 · FINOPS

Osservabilita come codice

Allarmi e dashboard sono infrastruttura critica: vanno versionati e revisionati come il codice applicativo.

▪ AWS CloudFormation: risorse native per allarmi, log group, dashboard e regole EventBridge, con StackSet
multi-account.
▪ Terraform: modulo di osservabilita riutilizzabile che accompagna ogni servizio applicativo con i suoi allarmi
standard.
▪ AWS CDK: costrutti di alto livello che generano automaticamente allarmi e dashboard coerenti per ogni
componente.
▪ Golden signals by default: ogni nuovo servizio nasce con latenza, errori, saturazione e traffico gia presidiati.
▪ Revisione in pull request: le modifiche alle soglie sono discusse, tracciate e reversibili come ogni altro
cambiamento.
▪ Testing degli allarmi: game day e fault injection verificano che gli allarmi scattino davvero quando serve.

Amazon CloudWatch | Osservabilita unificata su AWS 49


MODULO 8 · FINOPS

Checklist finale: osservabilita production-ready


Sei aree da verificare prima di dichiarare un servizio pronto per la produzione.

Copertura Qualita degli allarmi


Golden signals su ogni servizio, retention definita su ogni Composite alarm sui sintomi, runbook collegato, ogni
log group, tracing attivo end-to-end. notifica azionabile e nessun allarme ignorato.

Correlazione Sicurezza
Log strutturati con trace id e request id; pivot immediato tra Least privilege, cifratura KMS, data protection sui PII e audit
metriche, log e tracce. CloudTrail sempre attivo.

Costi Automazione
Retention e verbosity governate, tag di cost allocation attivi, Tutto definito in IaC, cross-account observability attiva, SLO
spesa monitorata con budget. ed error budget tracciati.

Amazon CloudWatch | Osservabilita unificata su AWS 50

Potrebbero piacerti anche