Tasks:
- * Automate infrastructure operations
- * Conduct incident reviews and root cause analysis
- * Create operational SOPs
- * Design highly available infrastructure and middleware
- * Develop failure drills and emergency response plans
- * Ensure service reliability and availability
- * Optimize system performance and capacity
- * Participate in on-call rotations
- * Standardize and platformize operational best practices
- * Troubleshoot production incidents and lead emergency response
Perks/Benefits:
Skills/Tech stack required:
[Availability Architecture] [Capacity Planning] [Cloud Native] [Cloud-native infrastructure] [Concurrency systems] [Disaster Recovery] [Distributed Systems] [Elasticsearch] [Go] [High Availability] [High-Availability Architecture] [High concurrency] [High-concurrency systems] [Incident Management] [Kafka] [Kubernetes] [Linux] [Microservices] [Multi-region] [Multi-region deployment] [Networking] [Nginx] [Operations automation] [Performance optimization] [Python] [Redis] [Region deployment] [RocketMQ] [SLA SLO] [SLA/SLO/SLI] [SLO/SLI] [SRE practices]
Educational requirements:
[Bachelor's Degree]
Role(s):
[Engineer] [Platform] [Platform Engineer] [Reliability Engineer] [Site Reliability Engineer]