Tasks:
- * Build and operate large-scale Kubernetes GPU clusters
- * Develop GPU capabilities and adapt domestic GPUs
- * Develop topology-aware and gang scheduling
- * Implement GPU fault recovery and observability
- * Optimize GPU pooling, virtualization, and utilization
Perks/Benefits:
Skills/Tech stack required:
[C++] [Cluster management] [Cluster observability] [CUDA] [Fault Recovery] [Gang Scheduling] [Go] [GPU Cluster] [GPU Cluster Management] [GPU Computing] [GPU fault recovery] [GPU Inference] [GPU inference optimization] [GPU memory] [GPU Memory Optimization] [GPU resource pooling] [GPU scheduling] [GPU Training] [GPU Training Optimization] [GPU virtualization] [Inference Optimization] [Kubernetes] [Megatron] [Memory Optimization] [Mixed Precision] [Mixed Precision Computing] [Model Quantization] [Precision computing] [Python] [PyTorch] [Resource pooling] [SGLang] [Topology Aware Scheduling] [Training Optimization] [Volcano]
Educational requirements:
[Bachelor's Degree]
Role(s):
[AI Compute Engineer] [AI Infrastructure Engineer] [Compute Engineer] [Engineer] [Infrastructure Engineer]