Tasks:
- * Assess model resource utilization and allocate costs
- * Automate FinOps metrics, reporting, and data collection
- * Monitor compute cluster resources
- * Optimize Kubernetes training-job scheduling and resource management
- * Profile training performance and improve GPU utilization
Perks/Benefits:
Skills/Tech stack required:
[CUDA] [Distributed Training] [Docker] [FinOps] [GPU resource monitoring] [Grafana] [Kubernetes] [Linux] [NCCL] [NVIDIA Nsight] [Prometheus] [Python] [PyTorch] [PyTorch Profiler] [Resource monitoring] [Shell Scripting] [Volcano]
Educational requirements:
[Bachelor's Degree]
Role(s):
[AI Infrastructure Engineer] [Engineer] [Infrastructure] [Infrastructure Engineer] [Infrastructure/Operations Engineer] [Operations Engineer]