Estamos contratando: SRE – Site Reliability Engineer
Buscamos uma pessoa SRE que goste de resolver problemas de verdade, transforme tarefas manuais em automação e mantenha a calma quando o incidente aperta.
Medir, automatizar e evoluir ambientes críticos para que nossos clientes possam crescer com segurança.
- O que você vai fazer
- Definir e acompanhar SLIs, SLOs e error budgets junto aos times
- Evoluir a observabilidade: métricas, logs, traces e alertas que realmente importam
- Atuar na gestão de incidentes, conduzindo post-mortems sem culpados e com ações que evitam recorrência
- Automatizar rotinas e reduzir trabalho repetitivo
- Apoiar pipelines de CI/CD com deploys seguros e rollback rápido
- Trabalhar em conjunto com desenvolvimento e operação para tornar as arquiteturas mais resilientes
- O que buscamos
- Experiência sólida com Linux, redes e troubleshooting
- Programação para automação (Python, Go ou Bash)
- Containers e Kubernetes em produção
- Experiência com nuvem (AWS, Azure ou GCP)
- Ferramentas de observabilidade (Prometheus, Grafana, Datadog, Dynatrace ou similares)
- Infraestrutura como código (Terraform, Ansible)
- Diferenciais
- Alta disponibilidade, disaster recovery e testes de carga
- Experiência com bancos de dados e middleware
- Vivência em ambientes com plantão (on-call)
- Pensamento analítico, comunicação clara com áreas técnicas e de negócio, senso de dono e vontade de melhorar continuamente o que já funciona.