Portfolio Project · Surya Mutreja

Autonomous SRE & Incident Response Platform

A self-operating site-reliability platform: six lab services, a simulated 120-incident history, measured chaos experiments, and an auto-remediator that cuts MTTD/MTTR by >80%.

System Overview

Counts computed at query time from SQLite
Services
 
Incidents
 
Chaos Events
 
Telemetry Points
 

Service Health

LAB  six Docker-backed microservices
ServiceStatusp50p95p99Error RateThroughputCPUMemory
Loading services…

MTTD / MTTR Comparison

Manual vs. automated remediation
Chaos Experiment — Measured
MEASURED
Loading MTTD/MTTR…

Telemetry Charts

SIMULATED  time-series over recent window
p95 Latency
milliseconds, one line per service
Error Rate
fraction of requests erroring, per service

Recent Incidents

SIMULATED  latest 20 from history
SeverityIDTypeAffected ServicesDetectedMTTDMTTRTotalMethod
Loading incidents…

Chaos Experiment Results

MEASURED  10 scenarios × manual/automated
ScenarioTargetMethodInjectedDetectedRemediatedMTTDMTTRImpact
Loading chaos events…

Postmortems

Auto-generated incident retrospectives
Loading postmortems…