Descrição da vaga:
Estamos selecionando um(a) profissional para atuar como Analista Linux Pleno, integrando nossa equipe de Site Reliability Engineering (SRE). O(a) profissional será responsável por garantir a estabilidade, disponibilidade e a melhoria contínua de nossos ambientes, prestando suporte à nossa infraestrutura tecnológica, incluindo sistemas voltados para Inteligência Artificial.
Responsabilidades e atribuições:
- Monitoramento e gestão da fila de chamados operacionais (incidentes, requisições e Requisições de Mudança - RDM), assegurando o cumprimento dos prazos (SLAs) estabelecidos.
- Realização de troubleshooting via SSH para o diagnóstico e resolução de incidentes em servidores Linux, atuando em cenários como indisponibilidade de serviços (systemd), sistemas de arquivos em read-only e esgotamento de espaço em disco.
- Execução de rotinas administrativas e de provisionamento, incluindo reconhecimento e expansão de discos e volumes (LVM).
- Gerenciamento de pacotes e serviços utilizando ferramentas padrão do sistema (yum/dnf).
- Execução de atualizações de Sistema Operacional, bem como a checagem de vulnerabilidades (CVEs) e a proposição de soluções de mitigação.
- Acompanhamento e análise de dashboards e métricas na ferramenta Grafana, visando a identificação proativa de anomalias e o diagnóstico de causa raiz.
- Desenvolvimento e manutenção de scripts (Bash, Shell) visando a automação de tarefas operacionais e a prevenção de incidentes recorrentes.
- Atendimento e suporte técnico consultivo aos clientes internos, fornecendo orientações e soluções para garantir a estabilidade das aplicações.
Requisitos e qualificações:
- Sólida experiência em administração, suporte e troubleshooting de sistemas operacionais Linux.
- Domínio em gerenciamento de processos, serviços (systemd), permissões de arquivos e configuração básica de rede.
- Experiência prática na gestão de armazenamento e particionamento (especialmente LVM).
- Vivência com gerenciadores de pacotes (yum/dnf) e ciclos de atualização (patching).
- Capacidade de desenvolver rotinas de automação e scripts utilizando Bash/Shell Script.
- Experiência na utilização de ferramentas de monitoramento e observabilidade, com ênfase em Grafana.
- Perfil analítico para resolução de problemas e boa comunicação para o alinhamento com áreas de negócios e desenvolvimento.
Requisitos desejáveis:
- Conhecimento em orquestração de contêineres, com ênfase em Kubernetes (K8s).
- Interesse ou experiência no suporte a infraestruturas voltadas para Inteligência Artificial ou aplicações de IA em operações corporativas.
- Conhecimentos básicos em Python ou outras linguagens de programação voltadas para infraestrutura.
- Noções de ferramentas de automação e gerência de configuração (ex.: Ansible).
- Familiaridade com frameworks de melhores práticas de gestão de serviços de TI (como ITIL).