OSSERVABILITA UNIFICATA SU AWS
Amazon CloudWatch
Percorso formativo avanzato in 50 slide per Cloud Architect, DevOps Engineer e
System Administrator
Metriche · Log · Tracce · Allarmi · Automazione · Sicurezza · FinOps
MODULO 0 · AGENDA
Agenda del percorso formativo
Otto moduli progressivi, dai fondamenti dell'osservabilita alle best practice enterprise.
1 · Fondamenti (1-7) 2 · Metrics (8-16)
Osservabilita nel cloud, ruolo di CloudWatch, tre pilastri, Anatomia delle metriche, custom metrics, Metric Math,
governance e ecosistema AWS. dashboard, cross-account, anomaly detection.
3 · Logs (17-24) 4 · Alarms (25-30)
Log group e stream, ingestion, Logs Insights, metric filter, Stati e valutazione, composite alarm, SNS, azioni automatiche,
data protection, archiviazione. Incident Manager e ChatOps.
5 · Automazione (31-36) 6 · Tracing (37-41)
EventBridge, regole e target, Synthetics, Application Signals, Distributed tracing, ServiceLens, X-Ray SDK e daemon,
OpsCenter. Service Map, OpenTelemetry.
7 · Sicurezza (42-45) 8 · FinOps (46-50)
IAM least privilege, cifratura KMS, tagging e ABAC, Modello di prezzo, ottimizzazione dei log, pattern
compliance con Config e CloudTrail. architetturali, IaC e checklist finale.
Amazon CloudWatch | Osservabilita unificata su AWS 02
MODULO 1 · FONDAMENTI
Dal monitoraggio tradizionale all'osservabilita
Il monitoraggio risponde a domande note; l'osservabilita permette di indagare l'ignoto.
Monitoraggio classico Osservabilita
Soglie predefinite su host e servizi noti, dashboard statiche, Capacita di inferire lo stato interno di un sistema dai segnali
guasti attesi e catalogati. che emette, senza rilasciare nuovo codice.
Cosa cambia nel cloud Known vs unknown unknowns
Risorse effimere, autoscaling, container e funzioni: l'host non Gli incidenti moderni derivano da combinazioni impreviste
e piu l'unita di analisi. di stati, non da singoli guasti.
Alta cardinalita Impatto organizzativo
Dimensioni come request id, tenant o versione del deploy L'osservabilita e prerequisito per SLO, error budget e
diventano essenziali per la root cause analysis. pratiche SRE mature.
Amazon CloudWatch | Osservabilita unificata su AWS 03
MODULO 1 · FONDAMENTI
Cos'e Amazon CloudWatch
Servizio gestito e nativo di monitoraggio e osservabilita per risorse AWS, applicazioni ibride e on-premise.
▪ Repository centrale di telemetria: raccoglie metriche, log, eventi e tracce in un unico piano dati regionale.
▪ Integrazione nativa: oltre 70 servizi AWS pubblicano metriche automaticamente, senza agenti aggiuntivi.
▪ Piano di azione: allarmi, notifiche e azioni automatiche trasformano i segnali in remediation.
▪ Visualizzazione unificata: dashboard, Logs Insights, ServiceLens e Application Signals sulla stessa base dati.
▪ Estensibilita: API PutMetricData, agent CloudWatch, EMF (Embedded Metric Format) e OpenTelemetry.
▪ Ruolo architetturale: fondamento operativo del pilastro Operational Excellence del Well-Architected
Framework.
Amazon CloudWatch | Osservabilita unificata su AWS 04
MODULO 1 · FONDAMENTI
I tre pilastri dell'osservabilita
Metriche, log e tracce rispondono a domande diverse e sono complementari.
Metriche · Cosa succede Logs · Perche succede
Serie temporali numeriche e aggregate: basso costo, alta Eventi testuali e strutturati con contesto ricco: diagnosi
ritenzione, ideali per allarmi e trend. puntuale, cardinalita illimitata.
Traces · Dove succede Correlazione
Percorso di una singola richiesta tra servizi: latenza per hop Trace ID e dimensioni comuni permettono il pivot da metrica
e dipendenze. ad allarme, log e traccia.
Quarto segnale Regola pratica
Gli eventi di cambiamento (deploy, scaling, configurazioni) Allarmi sulle metriche, diagnosi nei log, root cause nelle
spiegano la maggioranza degli incidenti. tracce: mai un solo pilastro.
Amazon CloudWatch | Osservabilita unificata su AWS 05
MODULO 1 · FONDAMENTI
Responsabilita condivisa e governance della telemetria
AWS garantisce la disponibilita del servizio; il cliente definisce cosa raccogliere e per quanto tempo.
▪ Responsabilita di AWS: infrastruttura, durabilita del piano dati, metriche di servizio pubblicate di default.
▪ Responsabilita del cliente: strumentazione dell'applicazione, retention, cifratura, permessi e qualita dei dati.
▪ Data ownership: log e metriche possono contenere dati personali o segreti; vanno classificati come qualsiasi
dato aziendale.
▪ Governance dei namespace: convenzioni di naming e di tagging condivise evitano frammentazione e costi
duplicati.
▪ Residenza dei dati: CloudWatch e regionale; l'aggregazione cross-region richiede scelte esplicite di replica.
▪ Ciclo di vita: definire retention, archiviazione e cancellazione in linea con le policy di compliance interne.
Amazon CloudWatch | Osservabilita unificata su AWS 06
MODULO 1 · FONDAMENTI
Ecosistema di osservabilita AWS
CloudWatch e il nucleo di una famiglia di servizi complementari.
Amazon CloudWatch AWS X-Ray
Metriche, log, allarmi, dashboard, Synthetics e Application Distributed tracing con segmenti, service map e analisi della
Signals: il piano operativo centrale. latenza end-to-end.
Amazon Managed Prometheus (AMP) Amazon Managed Grafana (AMG)
Ingestion compatibile Prometheus per workload Kubernetes Visualizzazione multi-sorgente: CloudWatch, AMP,
e metriche ad alta cardinalita. OpenSearch e origini di terze parti.
Amazon OpenSearch Service Criterio di scelta
Ricerca e analisi full-text su grandi volumi di log con CloudWatch come default nativo; gli altri servizi per scala,
retention prolungata. portabilita o standard aperti.
Amazon CloudWatch | Osservabilita unificata su AWS 07
MODULO 2 · METRICS
Anatomia di una metrica CloudWatch
Ogni punto dati e identificato univocamente da namespace, nome e insieme di dimensioni.
Namespace Metric Name
Contenitore logico (AWS/EC2, AWS/Lambda, o custom): Grandezza misurata: CPUUtilization, Duration, 5xxCount.
isola le metriche ed evita collisioni di nome. Deve essere stabile nel tempo.
Dimensions Timestamp e valore
Coppie chiave-valore (max 30) che qualificano la metrica: Fino a due settimane nel passato e due ore nel futuro;
InstanceId, FunctionName, Stage. valore singolo o statistic set.
Unita di misura Attenzione
Seconds, Bytes, Count, Percent: abilita conversioni e assi Ogni combinazione di dimensioni e una metrica distinta e
coerenti nelle dashboard. fatturata: governare la cardinalita.
Amazon CloudWatch | Osservabilita unificata su AWS 08
MODULO 2 · METRICS
Metriche standard e metriche custom
Le metriche native coprono l'infrastruttura; le custom metrics portano il contesto di business.
▪ Metriche standard: pubblicate automaticamente dai servizi AWS, gratuite e disponibili a 5 o 1 minuto.
▪ Limite intrinseco: la memoria e lo spazio disco delle istanze EC2 richiedono il CloudWatch Agent.
▪ API PutMetricData: invio diretto da SDK o CLI; supporta valori singoli, statistic set e valori con counts.
▪ Embedded Metric Format (EMF): si scrive un log JSON strutturato e CloudWatch ne estrae le metriche, senza
chiamate sincrone.
▪ Metriche di business: ordini processati, tasso di conversione, code di lavoro: fondamentali per allarmi
realmente significativi.
▪ Buone pratiche: batch delle chiamate PutMetricData, dimensioni a bassa cardinalita e naming coerente per
team.
Amazon CloudWatch | Osservabilita unificata su AWS 09
MODULO 2 · METRICS
Periodi, risoluzione e aggregazione
La risoluzione determina reattivita, costo e durata di conservazione dei dati.
Risoluzione standard Alta risoluzione
Granularita di 60 secondi: default per la maggior parte delle Fino a 1 secondo con StorageResolution=1: allarmi valutabili
metriche AWS e custom. ogni 10 o 30 secondi.
Detailed monitoring Statistiche
Su EC2 porta le metriche da 5 minuti a 1 minuto con costo Average, Sum, Minimum, Maximum, SampleCount e
aggiuntivo per istanza. percentili (p90, p99) per la latenza.
Rollup automatico Anti-pattern
1s per 3 ore, 60s per 15 giorni, 5 min per 63 giorni, 1 ora per Usare Average su metriche di latenza nasconde la coda:
15 mesi. preferire p95 o p99.
Amazon CloudWatch | Osservabilita unificata su AWS 10
MODULO 2 · METRICS
CloudWatch Metric Math
Espressioni calcolate in tempo reale su una o piu metriche, senza pubblicare nuovi dati.
▪ Operatori e funzioni: aritmetica, SUM, AVG, RATE, DIFF, FILL, IF e funzioni statistiche su array di metriche.
▪ Search expression: SEARCH() aggrega dinamicamente tutte le metriche che corrispondono a un pattern,
includendo risorse nuove.
▪ KPI derivati: tasso di errore come 100*(errori/richieste), saturazione delle code, costo per transazione.
▪ Allarmi su espressioni: un allarme puo valutare direttamente il risultato di una Metric Math expression.
▪ Gestione dei dati mancanti: FILL(m1, 0) o REPEAT evitano stati INSUFFICIENT_DATA su serie sporadiche.
▪ Vantaggio economico: si calcolano indicatori compositi senza generare metriche custom aggiuntive.
Amazon CloudWatch | Osservabilita unificata su AWS 11
MODULO 2 · METRICS
CloudWatch Dashboards
Plance di controllo condivise, versionabili e utilizzabili come strumento di incident response.
Widget disponibili Automatic Dashboards
Line, stacked area, number, gauge, log table, alarm status, Viste pre-costruite per servizio, disponibili senza
testo Markdown ed esplorazioni. configurazione e sempre aggiornate.
Definizione come codice Variabili e template
Il JSON della dashboard e gestibile con CloudFormation, Property variable per cambiare regione, account o risorsa
Terraform o CDK. con un selettore.
Condivisione Design efficace
Dashboard pubbliche o condivise con SSO per stakeholder Struttura a piramide: salute del servizio in alto, dettagli
senza console AWS. tecnici sotto.
Amazon CloudWatch | Osservabilita unificata su AWS 12
MODULO 2 · METRICS
CloudWatch Contributor Insights
Identifica in tempo reale i top-N contributori al traffico, agli errori o alla latenza.
▪ Regole su log group: definiscono i campi chiave (IP, tenant, URI, user agent) da aggregare.
▪ Output: classifiche dei contributori piu attivi e serie temporali dei valori aggregati.
▪ Casi d'uso tipici: individuare un client che genera throttling, un tenant rumoroso o un endpoint degradato.
▪ Integrazione DynamoDB: regole native per identificare le partition key piu sollecitate (hot key).
▪ Uso in dashboard e allarmi: i report possono essere aggiunti alle dashboard e usati come sorgente per
allarmi.
▪ Valore operativo: riduce il tempo di isolamento del problema quando la metrica aggregata resta nella norma.
Amazon CloudWatch | Osservabilita unificata su AWS 13
MODULO 2 · METRICS
CloudWatch Cross-Account Observability
Un unico monitoring account osserva metriche, log e tracce di piu source account.
01 Si designa un monitoring account centrale, tipicamente nell'account Operations o Shared Services.
I source account creano un sink link autorizzando la condivisione di metriche, log, tracce e Application
02 Signals.
L'integrazione con AWS Organizations consente il collegamento massivo per OU, senza configurazioni
03 manuali.
04 Le risorse condivise restano read-only nel monitoring account: nessun trasferimento o duplicazione dei dati.
Le query di Logs Insights e le dashboard funzionano trasversalmente, con etichettatura dell'account di
05 origine.
Risultato: un solo punto di osservazione per l'intera landing zone, con costi e permessi separati per
06 account.
Amazon CloudWatch | Osservabilita unificata su AWS 14
MODULO 2 · METRICS
Monitoraggio di EC2, RDS, Lambda ed EKS
Ogni servizio ha un proprio insieme di segnali critici da presidiare.
Amazon EC2 Amazon RDS / Aurora
CPUUtilization, StatusCheckFailed, NetworkIn/Out; memoria CPU, DatabaseConnections, ReadLatency, FreeableMemory,
e disco solo via CloudWatch Agent. ReplicaLag; Performance Insights per le query.
AWS Lambda Amazon EKS
Invocations, Errors, Duration, Throttles, ConcurrentExecutions Container Insights per nodi, pod e namespace; metriche di
e IteratorAge per gli stream. control plane e Kubernetes events.
Load balancer Approccio USE/RED
TargetResponseTime, HTTPCode_ELB_5XX, Utilization-Saturation-Errors per le risorse, Rate-Errors-
UnHealthyHostCount e conteggio richieste per target group. Duration per i servizi.
Amazon CloudWatch | Osservabilita unificata su AWS 15
MODULO 2 · METRICS
Anomaly Detection: machine learning sulle metriche
Un modello statistico apprende il comportamento atteso e genera una banda di normalita dinamica.
▪ Apprendimento automatico: il modello analizza fino a due settimane di storico e riconosce stagionalita
oraria, giornaliera e settimanale.
▪ Banda di confidenza: la soglia non e un valore fisso ma un intervallo che si adatta al ciclo del carico.
▪ Allarmi su anomalia: si genera un allarme quando la metrica esce dalla banda, con sensibilita configurabile.
▪ Esclusione di periodi: e possibile escludere dal training finestre di eventi eccezionali come test di carico o
incidenti.
▪ Casi d'uso ideali: traffico applicativo, latenza, throughput, code di lavoro con andamento ciclico noto.
▪ Limiti: metriche molto rumorose o con cambi di regime frequenti richiedono comunque soglie statiche di
sicurezza.
Amazon CloudWatch | Osservabilita unificata su AWS 16
MODULO 3 · LOGS
Architettura di CloudWatch Logs
Una gerarchia semplice che determina retention, permessi e costi.
Log Group Log Stream
Unita logica per applicazione o servizio: contiene retention, Sequenza di eventi da una singola sorgente (istanza,
cifratura KMS e metric filter. container, esecuzione Lambda), ordinata nel tempo.
Log Event Retention Policy
Record con timestamp e messaggio; il formato JSON abilita Da 1 giorno a 10 anni o infinita: il default 'Never expire' e la
query strutturate efficienti. principale causa di spesa inattesa.
Log class Naming
Standard per l'analisi in tempo reale, Infrequent Access per Convenzione /azienda/ambiente/servizio per abilitare
log raramente consultati a costo ridotto. policy IAM e automazioni per prefisso.
Amazon CloudWatch | Osservabilita unificata su AWS 17
MODULO 3 · LOGS
Ingestion dei log
Piu percorsi di raccolta, da scegliere in base al tipo di workload.
CloudWatch Agent Fluent Bit
Unico agente per log e metriche di sistema su EC2, on- Standard per container su EKS ed ECS: leggero, con routing
premise e ibrido; configurabile via SSM Parameter Store. e filtri verso CloudWatch, S3 o OpenSearch.
Lambda Extensions Integrazioni native
Telemetry API per inviare i log direttamente dalla funzione, API Gateway, VPC Flow Logs, Route 53, WAF e RDS scrivono
riducendo latenza e dipendenze. su CloudWatch Logs senza agenti.
SDK e EMF Best practice
Log JSON strutturati che veicolano contemporaneamente Emettere JSON strutturato con request id, tenant e versione:
contesto e metriche. abilita query e correlazione.
Amazon CloudWatch | Osservabilita unificata su AWS 18
MODULO 3 · LOGS
CloudWatch Logs Insights
Linguaggio di query interattivo per analizzare gigabyte di log in pochi secondi.
▪ Comandi principali: fields, filter, stats, sort, limit, parse, dedup e display, componibili in pipeline.
▪ Campi automatici: @timestamp, @message, @logStream e @ingestionTime sempre disponibili senza
configurazione.
▪ Parsing dinamico: parse con pattern glob o regex estrae campi da log non strutturati al momento della query.
▪ Aggregazioni: stats count() by campo, avg(), percentile() e bin() per l'analisi temporale delle distribuzioni.
▪ Query cross log group e cross account: analisi trasversale su piu servizi e piu account nella stessa esecuzione.
▪ Assistenza in linguaggio naturale e query salvate: accelerano il troubleshooting e standardizzano i runbook
di team.
Amazon CloudWatch | Osservabilita unificata su AWS 19
MODULO 3 · LOGS
Metric Filters: dalle stringhe alle metriche
Trasformare pattern testuali ricorrenti in serie temporali numeriche allarmabili.
01 Si definisce un filter pattern sul log group: termini letterali, espressioni JSON o pattern su log delimitati.
Ogni evento corrispondente incrementa una metrica custom nel namespace scelto, con valore fisso o
02 estratto dal log.
03 Si possono aggiungere dimensioni dai campi del log (per esempio codice di errore o nome del servizio).
04 Il default value evita stati INSUFFICIENT_DATA quando non ci sono corrispondenze nel periodo.
05 Sulla metrica risultante si costruiscono allarmi, dashboard e Metric Math come su qualsiasi altra metrica.
06 Rispetto a Logs Insights, i metric filter costano meno per il monitoraggio continuo di pattern noti.
Amazon CloudWatch | Osservabilita unificata su AWS 20
MODULO 3 · LOGS
Log Anomaly Detection e Live Tail
Due funzionalita complementari per il rilevamento e il troubleshooting in tempo reale.
Log Anomaly Detection Rilevamento
Un modello ML apprende i pattern ricorrenti del log group e Segnala nuovi messaggi di errore, variazioni di frequenza e
ne estrae una baseline automatica. pattern mai osservati prima.
Suppression Live Tail
Le anomalie note o attese possono essere soppresse per Streaming interattivo degli eventi in arrivo, con filtri e
periodo o in modo permanente. evidenziazione dei termini chiave.
Uso tipico Attenzione ai costi
Verifica immediata di un deploy o di un fix senza attendere il Live Tail e fatturato al minuto di sessione: usarlo in modo
refresh delle query. mirato durante gli incidenti.
Amazon CloudWatch | Osservabilita unificata su AWS 21
MODULO 3 · LOGS
Logs Data Protection: mascheramento dei dati sensibili
Rilevare e mascherare automaticamente i dati personali (PII) prima che diventino consultabili.
▪ Data identifier gestiti: oltre 100 tipi predefiniti (carte di credito, codici fiscali, email, chiavi di accesso, dati
sanitari).
▪ Data identifier custom: espressioni regolari proprietarie per identificatori interni e formati aziendali.
▪ Mascheramento in lettura: i valori sensibili appaiono offuscati; solo chi possiede il permesso Unmask puo
vederli in chiaro.
▪ Audit findings: le rilevazioni possono essere inviate a S3, Firehose o a un altro log group per la revisione di
compliance.
▪ Cifratura at rest: log group cifrati con chiavi KMS gestite dal cliente, con policy di accesso dedicata.
▪ Cifratura in transito: endpoint TLS e VPC endpoint per evitare il transito su rete pubblica.
Amazon CloudWatch | Osservabilita unificata su AWS 22
MODULO 3 · LOGS
Esportazione e archiviazione a lungo termine
Separare i log operativi caldi dall'archivio storico riduce i costi in modo strutturale.
Export task verso S3 Subscription filter
Esportazione batch di un intervallo temporale, adatta ad Streaming near real-time verso Firehose, Lambda o
archiviazione e audit periodici. OpenSearch, con filtro sul contenuto.
Amazon Data Firehose S3 storage tier
Buffering, conversione in Parquet e compressione prima Transizione a Glacier Instant o Deep Archive tramite
della scrittura su S3. lifecycle policy per la retention pluriennale.
Query sull'archivio OpenSearch Service
Amazon Athena interroga i log archiviati su S3 senza Ricerca full-text e dashboard avanzate su finestre di
reidratazione. retention prolungate.
Amazon CloudWatch | Osservabilita unificata su AWS 23
MODULO 3 · LOGS
Integrazione dei log di sicurezza
I log di sicurezza completano il quadro operativo con la dimensione di audit.
AWS CloudTrail CloudTrail su CloudWatch
Registra ogni chiamata API: chi ha fatto cosa, quando e da Inviando il trail a un log group si abilitano metric filter e
quale IP. Base di ogni indagine. allarmi su eventi critici.
Allarmi tipici VPC Flow Logs
Uso delle credenziali root, modifiche a security group, Metadati del traffico accettato e rifiutato a livello di ENI,
disattivazione di trail o chiavi KMS. subnet o VPC.
Analisi di rete Correlazione
Logs Insights sui flow log per individuare flussi anomali ed Integrazione con GuardDuty e Security Hub per unire
esfiltrazione di dati. segnali operativi e di sicurezza.
Amazon CloudWatch | Osservabilita unificata su AWS 24
MODULO 4 · ALARMS
Anatomia di un CloudWatch Alarm
Un allarme valuta periodicamente una metrica rispetto a una soglia e cambia stato.
OK ALARM
La metrica e entro la soglia definita per il numero di periodi La condizione e stata violata per M periodi su N valutati:
richiesto. scattano le azioni configurate.
INSUFFICIENT_DATA Periodo e valutazione
Dati assenti o incompleti: tipico di risorse appena create o Period definisce la granularita; Evaluation Periods e
metriche sporadiche. Datapoints to Alarm la persistenza richiesta.
Trattamento dei dati mancanti Stato e azioni
missing, notBreaching, breaching o ignore: scelta critica per Ogni transizione di stato puo attivare azioni distinte, incluso
evitare falsi allarmi. il ritorno in OK.
Amazon CloudWatch | Osservabilita unificata su AWS 25
MODULO 4 · ALARMS
Creazione di allarmi: metriche, formule e anomalie
Tre modalita di definizione, con crescente capacita di adattamento al contesto.
▪ Allarme su metrica singola: soglia statica su una metrica e una statistica, il caso piu comune e piu semplice
da spiegare.
▪ Allarme su Metric Math: valuta un'espressione, per esempio il tasso di errore percentuale o il rapporto tra
due metriche.
▪ Allarme su anomaly detection: la soglia e la banda appresa dal modello, con sensibilita espressa in deviazioni
standard.
▪ Scelta della statistica: p95 o p99 per la latenza, Sum per i conteggi, Average solo per le metriche di utilizzo.
▪ M out of N: richiedere piu datapoint riduce il rumore ma allunga il tempo di rilevazione: e un compromesso
esplicito.
▪ Documentazione: descrizione dell'allarme e link al runbook direttamente nel campo description o nel
messaggio SNS.
Amazon CloudWatch | Osservabilita unificata su AWS 26
MODULO 4 · ALARMS
Composite Alarms e riduzione dell'alert fatigue
Combinano piu allarmi con logica booleana per notificare solo cio che conta davvero.
▪ Espressioni booleane: ALARM(a) AND ALARM(b), OR, NOT e parentesi per modellare condizioni complesse.
▪ Riduzione del rumore: si notifica il sintomo di business solo quando piu segnali tecnici concordano.
▪ Soppressione con actions suppressor: un allarme di manutenzione o di dipendenza a monte silenzia gli
allarmi derivati.
▪ Gerarchia degli allarmi: allarmi tecnici come sensori, composite alarm come unico punto di notifica per l'on-
call.
▪ Simboli di salute del servizio: un composite alarm per servizio diventa l'indicatore sintetico nelle dashboard.
▪ Effetto organizzativo: meno pagine notturne, maggiore fiducia nel sistema di allerta e MTTR piu basso.
Amazon CloudWatch | Osservabilita unificata su AWS 27
MODULO 4 · ALARMS
Integrazione con Amazon SNS
SNS e il fan-out delle notifiche verso persone e sistemi.
01 L'allarme pubblica un messaggio JSON su un topic SNS alla transizione di stato configurata.
02 Il topic distribuisce a piu subscription: email, SMS, HTTPS webhook, SQS, Lambda o mobile push.
03 Una Lambda subscriber puo arricchire e formattare il messaggio prima di inoltrarlo a sistemi esterni.
L'integrazione con PagerDuty, Opsgenie o ServiceNow avviene tramite endpoint HTTPS o connettori
04 dedicati.
Le policy del topic e la cifratura KMS proteggono i contenuti delle notifiche, che possono includere dati
05 sensibili.
06 Separare i topic per severita (P1, P2, informativo) evita che gli avvisi critici si perdano nel rumore.
Amazon CloudWatch | Osservabilita unificata su AWS 28
MODULO 4 · ALARMS
Action Integrations: remediation automatica
L'allarme non si limita a notificare: puo ripristinare il servizio autonomamente.
EC2 Recover EC2 Stop / Terminate
Migra l'istanza su hardware sano mantenendo id, IP privato e Spegne istanze inattive o compromesse, utile per controllo
volumi EBS. costi e contenimento.
Auto Scaling Systems Manager
Scaling policy target tracking, step o simple guidate Esecuzione di runbook Automation per riavvii, pulizia disco
direttamente dalle metriche. o rotazione di risorse.
Lambda via SNS Cautela
Remediation custom: invalidare cache, drenare un target Ogni azione automatica va idempotente, limitata in
group, aprire un ticket. frequenza e tracciata in audit.
Amazon CloudWatch | Osservabilita unificata su AWS 29
MODULO 4 · ALARMS
Incident Manager e ChatOps aziendale
Dal singolo allarme al processo strutturato di gestione dell'incidente.
▪ AWS Systems Manager Incident Manager: crea automaticamente l'incidente a partire da un CloudWatch
Alarm o da EventBridge.
▪ Response plan: definisce severita, contatti, escalation, canali di engagement e runbook da eseguire.
▪ Timeline automatica: eventi, azioni e decisioni sono registrati per l'analisi post-incidente e la post-mortem.
▪ AWS Chatbot in Slack e Microsoft Teams: notifiche formattate nei canali, con grafici delle metriche in linea.
▪ Comandi da chat: esecuzione di comandi AWS approvati direttamente dal canale, con permessi IAM
controllati.
▪ Metriche di processo: MTTA e MTTR misurabili diventano la base per il miglioramento continuo delle
operations.
Amazon CloudWatch | Osservabilita unificata su AWS 30
MODULO 5 · AUTOMAZIONE
Amazon EventBridge: architettura event-driven
Evoluzione di CloudWatch Events: un bus di eventi serverless per l'intera organizzazione.
Event bus Struttura dell'evento
Default bus per gli eventi AWS, bus custom per le JSON con source, detail-type, account, region e detail:
applicazioni, partner bus per i SaaS. contratto stabile tra produttori e consumatori.
Disaccoppiamento Consegna
I produttori non conoscono i consumatori: si aggiungono At-least-once con retry configurabili e dead letter queue per
nuovi target senza modificare il codice. gli eventi non consegnati.
Schema Registry Scheduler
Scoperta automatica degli schemi e generazione di binding EventBridge Scheduler per job pianificati con cron o rate, a
tipizzati per gli sviluppatori. scala di milioni di schedule.
Amazon CloudWatch | Osservabilita unificata su AWS 31
MODULO 5 · AUTOMAZIONE
Regole ed event pattern di EventBridge
Le regole filtrano gli eventi e li instradano verso i target appropriati.
▪ Event pattern: struttura JSON che deve corrispondere all'evento; il matching e su sottoinsieme dei campi.
▪ Content filtering: operatori prefix, suffix, anything-but, numeric, exists e wildcard per pattern selettivi.
▪ Eventi di cambio stato: EC2 Instance State-change, ECS Task State Change, AWS Health, Auto Scaling e
CloudWatch Alarm State Change.
▪ Eventi da CloudTrail: qualsiasi chiamata API diventa un trigger, abilitando controlli di governance in tempo
reale.
▪ Input transformer: rimodella il payload prima della consegna, adattandolo al contratto atteso dal target.
▪ Regole schedulate: espressioni cron o rate per attivita ricorrenti come report, backup e pulizie.
Amazon CloudWatch | Osservabilita unificata su AWS 32
MODULO 5 · AUTOMAZIONE
Target di automazione: Lambda, SQS e Step Functions
Piu di venti tipi di target, da scegliere in base a durata e complessita della risposta.
AWS Lambda Amazon SQS
Remediation rapida e sincrona: taggare risorse, revocare Buffer che assorbe i picchi e protegge i consumatori a valle,
regole, arricchire notifiche. con DLQ per gli errori.
AWS Step Functions Systems Manager
Orchestrazione di workflow multi-step con attese, retry, Esecuzione di documenti Automation per operazioni
branching e approvazioni umane. standardizzate sulla flotta.
API Destinations Affidabilita
Chiamate HTTPS verso sistemi esterni con gestione Retry policy, DLQ obbligatoria e idempotenza dei target
centralizzata delle credenziali. sono requisiti di produzione.
Amazon CloudWatch | Osservabilita unificata su AWS 33
MODULO 5 · AUTOMAZIONE
CloudWatch Synthetics: monitoraggio proattivo
I canary verificano endpoint e user journey prima che siano gli utenti a segnalare il problema.
▪ Script canary: [Link] con Puppeteer o Python con Selenium, eseguiti su pianificazione da AWS.
▪ Blueprint pronti: heartbeat, API canary, broken link checker, GUI workflow e canary sul contenuto della
pagina.
▪ User journey completi: login, ricerca, aggiunta al carrello e checkout eseguiti end-to-end come un utente
reale.
▪ Artefatti raccolti: screenshot, file HAR e log per ogni esecuzione, archiviati su S3 per l'analisi.
▪ Metriche generate: SuccessPercent, Duration e 2xx/4xx/5xx, utilizzabili per allarmi e per il calcolo degli SLO.
▪ Copertura globale: eseguire canary da piu regioni per distinguere problemi locali da guasti reali del servizio.
Amazon CloudWatch | Osservabilita unificata su AWS 34
MODULO 5 · AUTOMAZIONE
CloudWatch Application Signals
APM gestito, incentrato sui servizi applicativi anziche sull'infrastruttura.
Scoperta automatica Golden signals
Individua servizi, operazioni e dipendenze con Latenza, tasso di errore e volume per servizio e per
strumentazione OpenTelemetry a basso attrito. operazione, senza dashboard da costruire.
SLO gestiti Mappa delle dipendenze
Definizione di obiettivi di servizio con tracciamento Visualizza le chiamate verso database, code e servizi a valle,
automatico dell'error budget residuo. con relativa salute.
Correlazione Runtime supportati
Pivot immediato da servizio degradato a tracce, log e Java, Python, .NET e [Link] su EC2, ECS, EKS e Lambda.
metriche correlate.
Amazon CloudWatch | Osservabilita unificata su AWS 35
MODULO 5 · AUTOMAZIONE
Systems Manager OpsCenter e OpsItems
Un unico inventario dei problemi operativi, alimentato dalla telemetria.
01 Un CloudWatch Alarm o una regola EventBridge crea automaticamente un OpsItem in OpsCenter.
02 L'OpsItem raccoglie contesto: risorsa coinvolta, metriche rilevanti, log correlati e stack CloudFormation.
03 Le runbook associate propongono la remediation standard, eseguibile direttamente dall'interfaccia.
04 Regole di deduplicazione evitano la proliferazione di OpsItem per lo stesso problema ricorrente.
05 Gli OpsItem sono assegnabili, categorizzabili e prioritizzabili, con integrazione verso i sistemi ITSM.
06 L'analisi aggregata rivela i problemi cronici, orientando gli investimenti di affidabilita.
Amazon CloudWatch | Osservabilita unificata su AWS 36
MODULO 6 · TRACING
Perche serve il distributed tracing
In un'architettura a microservizi la latenza non appartiene a un solo componente.
▪ Frammentazione della richiesta: una singola chiamata utente attraversa decine di servizi, code e database.
▪ Limite dei log per servizio: mostrano cosa e successo localmente, non il percorso complessivo della richiesta.
▪ Latenza cumulativa: ritardi minimi su molti hop producono un p99 inaccettabile per l'utente finale.
▪ Serverless e asincronia: le catene event-driven rendono impossibile ricostruire il flusso manualmente.
▪ Correlazione tramite trace id: propagato negli header, lega insieme tracce, log e metriche.
▪ Beneficio misurabile: riduzione netta del tempo di isolamento del guasto durante gli incidenti complessi.
Amazon CloudWatch | Osservabilita unificata su AWS 37
MODULO 6 · TRACING
CloudWatch ServiceLens
Vista unificata che collega metriche, log e tracce nello stesso contesto.
Service map arricchita Correlazione automatica
Nodi con salute, latenza e tasso di errore aggregati per Da un nodo si accede a tracce, log e metriche senza
servizio. cambiare console.
Analisi dei colli di bottiglia Contesto infrastrutturale
Distribuzione della latenza per identificare l'hop responsabile Collega il servizio alle risorse sottostanti: container, funzioni
del degrado. e istanze.
Integrazione allarmi Uso operativo
Gli allarmi attivi appaiono direttamente sulla mappa, con Punto di partenza ideale del triage nei primi minuti di un
impatto visibile. incidente.
Amazon CloudWatch | Osservabilita unificata su AWS 38
MODULO 6 · TRACING
AWS X-Ray: SDK, daemon e strumentazione
Come catturare i dati di traccia dal codice applicativo.
Segmenti Sotto-segmenti
Unita di lavoro di un servizio: nome, tempi, annotazioni, Chiamate a valle: query SQL, richieste HTTP, accessi a S3 o
metadati ed eventuali eccezioni. DynamoDB con timing dedicato.
X-Ray SDK / ADOT X-Ray daemon
Auto-instrumentation per client AWS, HTTP e database; Processo che bufferizza i segmenti UDP e li invia in batch
ADOT e la via consigliata oggi. all'API, riducendo l'overhead.
Sampling Annotazioni
Regole configurabili: 1 richiesta al secondo piu una Campi indicizzati e ricercabili (tenant, versione, endpoint)
percentuale, per controllare costi e volume. contro metadati non indicizzati.
Amazon CloudWatch | Osservabilita unificata su AWS 39
MODULO 6 · TRACING
Analisi delle Service Map
La mappa dei servizi rende visibile la topologia reale dell'applicazione in produzione.
▪ Nodi e archi: ogni nodo e un servizio o una risorsa, ogni arco una dipendenza osservata realmente nel
traffico.
▪ Codifica visiva: dimensione proporzionale al traffico, colore in base alla percentuale di errori e throttling.
▪ Latenza end-to-end: istogrammi di distribuzione per individuare code lunghe che l'average nasconde.
▪ Trace analytics: filtri per gruppo, codice di risposta, annotazione o utente per isolare le tracce rilevanti.
▪ Confronto tra deploy: annotare la versione permette di attribuire una regressione a un rilascio specifico.
▪ Dipendenze inattese: la mappa rivela spesso chiamate non documentate verso servizi legacy o esterni.
Amazon CloudWatch | Osservabilita unificata su AWS 40
MODULO 6 · TRACING
OpenTelemetry e CloudWatch
Uno standard aperto per raccogliere metriche, log e tracce senza lock-in.
Standard CNCF ADOT
API, SDK e protocollo OTLP comuni a tutti i linguaggi e a tutti AWS Distro for OpenTelemetry: distribuzione supportata da
i backend. AWS, pre-configurata per i servizi AWS.
Collector Modalita di deploy
Pipeline di receiver, processor ed exporter per filtrare, Sidecar, DaemonSet, gateway o Lambda layer a seconda
arricchire e instradare la telemetria. del workload.
Multi-destinazione Migrazione
Stessa telemetria verso CloudWatch, AMP e backend di Percorso graduale: iniziare dalle tracce, poi metriche e infine
terze parti contemporaneamente. log.
Amazon CloudWatch | Osservabilita unificata su AWS 41
MODULO 7 · SICUREZZA
Modello di permessi IAM per CloudWatch
Least privilege applicato separando scrittura, lettura e amministrazione.
Scrittura metriche Scrittura log
cloudwatch:PutMetricData, limitabile per namespace con la logs:CreateLogStream e logs:PutLogEvents ristretti all'ARN
condizione cloudwatch:namespace. del log group specifico.
Lettura e analisi Gestione allarmi
GetMetricData, logs:StartQuery e GetQueryResults per i PutMetricAlarm e DeleteAlarms riservati a pipeline IaC, non
team di sviluppo e supporto. agli utenti interattivi.
Ruoli per servizio Guardrail
Ogni workload usa un ruolo dedicato: mai chiavi statiche o SCP e permission boundary impediscono la cancellazione di
ruoli condivisi tra applicazioni. log group e trail di audit.
Amazon CloudWatch | Osservabilita unificata su AWS 42
MODULO 7 · SICUREZZA
Cifratura con AWS KMS
Protezione dei dati a riposo con chiavi gestite dal cliente e controllo esplicito degli accessi.
▪ Cifratura di default: i log sono sempre cifrati lato server con chiavi gestite da AWS, senza costi aggiuntivi.
▪ Customer Managed Key (CMK): consente rotazione controllata, audit dell'uso e revoca immediata
dell'accesso.
▪ Associazione al log group: la chiave si applica con AssociateKmsKey e vale per i dati scritti successivamente.
▪ Key policy: deve autorizzare esplicitamente il principal logs.<region>.[Link] con le condizioni
corrette.
▪ Effetto della revoca: disabilitando la chiave i log restano cifrati ma diventano illeggibili, anche agli
amministratori.
▪ Copertura estesa: applicare la stessa logica ai topic SNS, ai bucket S3 di archivio e agli snapshot correlati.
Amazon CloudWatch | Osservabilita unificata su AWS 43
MODULO 7 · SICUREZZA
Tagging, ABAC e FinOps
I tag governano contemporaneamente accessi e attribuzione dei costi.
Tag obbligatori ABAC
Environment, Application, Owner, CostCenter, Le policy IAM confrontano i tag del principal con quelli della
DataClassification su ogni risorsa osservabile. risorsa: nessuna policy per team.
Scalabilita Cost allocation tag
Un nuovo team o ambiente non richiede nuove policy, solo i Attivati in Billing, abilitano la ripartizione dei costi di
tag corretti. osservabilita per prodotto.
Enforcement Automazione
Tag policy di Organizations e AWS Config verificano la Il tagging va imposto nel codice IaC, non applicato
conformita in modo continuo. manualmente a posteriori.
Amazon CloudWatch | Osservabilita unificata su AWS 44
MODULO 7 · SICUREZZA
Conformita e audit dell'osservabilita
Anche il sistema di monitoraggio deve essere verificabile e conforme.
▪ AWS Config rules: verificano che i log group abbiano retention definita, cifratura KMS e che i trail siano attivi.
▪ Conformance pack: insiemi di regole allineati a CIS, PCI DSS, HIPAA e ISO 27001, distribuibili per l'intera
organizzazione.
▪ Auto-remediation: le regole non conformi attivano documenti SSM Automation che ripristinano la
configurazione attesa.
▪ CloudTrail come audit dell'audit: registra chi modifica allarmi, retention o subscription filter.
▪ Log immutability: bucket di archivio con Object Lock e MFA delete per garantire l'integrita delle evidenze.
▪ Evidenza per gli auditor: dashboard e report di conformita esportabili riducono drasticamente l'effort di
certificazione.
Amazon CloudWatch | Osservabilita unificata su AWS 45
MODULO 8 · FINOPS
Modello di prezzo di Amazon CloudWatch
Capire le voci di costo e il prerequisito per ottimizzarle senza perdere visibilita.
Metriche custom Chiamate API
Costo per metrica al mese: ogni combinazione di dimensioni PutMetricData e GetMetricData sono fatturate per richiesta:
conta come metrica distinta. conviene aggregare in batch.
Log ingestion Log storage
Voce tipicamente dominante, fatturata per GB ingeriti: e la Costo per GB al mese compresso, proporzionale al periodo di
leva di risparmio principale. retention configurato.
Logs Insights Dashboard e allarmi
Costo per GB scansionati da ogni query: filtri temporali Prezzo per dashboard, per allarme e per canary o sessione
stretti riducono la spesa. Live Tail.
Amazon CloudWatch | Osservabilita unificata su AWS 46
MODULO 8 · FINOPS
Strategie di ottimizzazione dei costi dei log
Interventi in ordine di impatto, dal piu efficace al piu specifico.
Impostare una retention esplicita su ogni log group: e l'intervento singolo con il maggior ritorno
01 immediato.
02 Ridurre il verbosity level in produzione: eliminare i log di debug abbassa direttamente i GB ingeriti.
Applicare campionamento ai log ad alto volume e a basso valore diagnostico, mantenendo il 100% degli
03 errori.
04 Adottare la log class Infrequent Access per i log di compliance consultati raramente.
05 Spostare l'archivio storico su S3 con lifecycle e interrogarlo con Athena quando serve.
06 Monitorare i costi con Cost Explorer per log group e allarmi di budget sulla spesa di osservabilita.
Amazon CloudWatch | Osservabilita unificata su AWS 47
MODULO 8 · FINOPS
Pattern architetturali per grandi volumi
Non tutta la telemetria merita lo stesso trattamento: differenziare per valore.
Modello a tre livelli CloudWatch
Hot in CloudWatch, warm in OpenSearch, cold su S3: costi Ideale per operativita e allarmi su finestre brevi, con
allineati alla frequenza d'uso. integrazione nativa e zero gestione.
OpenSearch Service S3 e Athena
Ricerca full-text e analisi su settimane o mesi, con cluster da Archiviazione piu economica con query on demand: perfetto
dimensionare e gestire. per audit e analisi forensi.
Routing selettivo Metriche ad alta cardinalita
Subscription filter e Firehose instradano ogni classe di log alla Valutare AMP quando le dimensioni renderebbero proibitive
destinazione corretta. le custom metric.
Amazon CloudWatch | Osservabilita unificata su AWS 48
MODULO 8 · FINOPS
Osservabilita come codice
Allarmi e dashboard sono infrastruttura critica: vanno versionati e revisionati come il codice applicativo.
▪ AWS CloudFormation: risorse native per allarmi, log group, dashboard e regole EventBridge, con StackSet
multi-account.
▪ Terraform: modulo di osservabilita riutilizzabile che accompagna ogni servizio applicativo con i suoi allarmi
standard.
▪ AWS CDK: costrutti di alto livello che generano automaticamente allarmi e dashboard coerenti per ogni
componente.
▪ Golden signals by default: ogni nuovo servizio nasce con latenza, errori, saturazione e traffico gia presidiati.
▪ Revisione in pull request: le modifiche alle soglie sono discusse, tracciate e reversibili come ogni altro
cambiamento.
▪ Testing degli allarmi: game day e fault injection verificano che gli allarmi scattino davvero quando serve.
Amazon CloudWatch | Osservabilita unificata su AWS 49
MODULO 8 · FINOPS
Checklist finale: osservabilita production-ready
Sei aree da verificare prima di dichiarare un servizio pronto per la produzione.
Copertura Qualita degli allarmi
Golden signals su ogni servizio, retention definita su ogni Composite alarm sui sintomi, runbook collegato, ogni
log group, tracing attivo end-to-end. notifica azionabile e nessun allarme ignorato.
Correlazione Sicurezza
Log strutturati con trace id e request id; pivot immediato tra Least privilege, cifratura KMS, data protection sui PII e audit
metriche, log e tracce. CloudTrail sempre attivo.
Costi Automazione
Retention e verbosity governate, tag di cost allocation attivi, Tutto definito in IaC, cross-account observability attiva, SLO
spesa monitorata con budget. ed error budget tracciati.
Amazon CloudWatch | Osservabilita unificata su AWS 50