Loading
Logs, metrics, traces, alerts, triage, mitigation, and post-incident learning.
A practical production-ownership track covering observability foundations, correlation IDs, structured logs, dependency telemetry, OpenTelemetry, health checks, sampling, incident triage, slow API diagnosis, post-release failures, downstream dependency incidents, missing logs, queue backlogs, auth failures, SLO alerts, dashboards, release correlation, mitigation choices, post-incident reviews, runbooks, and capacity/backpressure signals.
Recommended start
Logs, metrics, traces, correlation IDs, dependency telemetry, OpenTelemetry, health checks, and telemetry cost control.
4 active sections / 27 drills