SRE Engineer
1 point system
Interview: Face-to-face required
Qualifications
- Strong experience supporting production systems hosted on AWS (EC2, VPC, ALB/NLB, RDS, Lambda, EKS)
- Hands-on experience with incident management and 24/7 production support models
- Proficiency with monitoring/observability tools (CloudWatch, Dynatrace, Quantum Metric)
- Experience building/maintaining monitoring dashboards
- Strong troubleshooting skills across infrastructure, networking, and application layers
- Working knowledge of CI/CD pipelines and AWS deployment processes
- Experience with databases and Unix/Linux environments
Key Responsibilities
- Provide Level 1 & Level 2 support for production incidents across AWS-hosted applications/infrastructure
- Triage incidents, identify root causes, restore service within SLAs
- Escalate code-level defects with diagnostics/logs/impact assessments
- Participate in on-call rotations, incident bridges, post-incident reviews
- Investigate application defects, configuration issues, infrastructure anomalies
- Perform regular health checks across applications/infrastructure/AWS services
- Monitor system health using CloudWatch, Dynatrace, Quantum Metric, Thousand Eyes
- Respond proactively to resource utilization, latency, errors, availability issues
- Maintain/improve monitoring & observability dashboards
Skills
- Mandatory: CloudWatch, Dynatrace, Git, Observability, Reliability Patterns
- Good to Have: Chaos Testing, Shell Scripting
Vacancy posted more than 2 months ago
Do you want to receive more vacancies?
Subscribe and receive similar vacancies to SRE Engineer. Be the first to apply!
Related searches
- site reliability engineer remote Atlanta, GA
- site reliability engineer sre Atlanta, GA
- site reliability engineer Atlanta, GA
- site reliability engineer remote
- site reliability engineer sre
- site reliability engineering manager
- site reliability engineer
- lead site reliability engineer
- junior site reliability engineer
