Tasks:
- * Build GPU capabilities and adapt domestic accelerators
- * Develop topology-aware and gang scheduling
- * Implement GPU fault recovery and observability
- * Operate large-scale Kubernetes GPU clusters
- * Optimize GPU pooling, virtualization, and utilization
- * Support large-model training and inference
Perks/Benefits:
Skills/Tech stack required:
[C++] [Cluster management] [CUDA] [Fault Recovery] [Gang Scheduling] [Go] [GPU Cluster] [GPU Cluster Management] [GPU Computing] [GPU fault recovery] [GPU memory] [GPU Memory Optimization] [GPU observability] [GPU pooling] [GPU scheduling] [GPU virtualization] [Inference Optimization] [Kubernetes] [Large model] [Large model training] [Megatron] [Memory Optimization] [Mixed Precision] [Mixed Precision Computing] [Model Quantization] [Model Training] [Precision computing] [Python] [PyTorch] [SGLang] [Topology Aware Scheduling] [Training inference] [Training-inference colocation] [Volcano]
Educational requirements:
[Bachelor's Degree]
Role(s):
[AI Infrastructure Engineer] [Computing Engineer] [Engineer] [GPU Computing Engineer] [Infrastructure Engineer]