Tasks:
- * Analyze system bottlenecks and deficiencies
- * Improve operational processes and automation
- * Maintain service availability and reliability
- * Manage system capacity and monitoring
- * Optimize reliability and cost efficiency
- * Participate in 24/7 on-call rotation
- * Provision and manage infrastructure resources
- * Respond to production incidents
- * Review architecture and identify reliability risks
Perks/Benefits:
Skills/Tech stack required:
[Alibaba Cloud] [Amazon Web Services] [Automation] [Availability Architecture] [Capacity Management] [Cloud Computing] [Cloud Platforms] [Computer Networking] [Disaster Recovery] [Disaster recovery architecture] [Go] [High Availability] [High-Availability Architecture] [Hybrid Cloud] [Incident Response] [Linux] [Load Balancing] [Microsoft Azure] [Monitoring] [Multi-cloud] [Multi-Cloud Platforms] [Python] [Recovery architecture] [Reliability Engineering] [Resource provisioning] [Shell Scripting] [Systems reliability] [Systems Reliability Engineering] [Web Services]
Educational requirements:
[Bachelor's Degree]
Role(s):
[Engineer] [Reliability Engineer] [Site Reliability Engineer]