Tasks:
- * Build training observability and fault recovery systems
- * Design and build large-scale model training platforms
- * Implement CI/CD, access control, and multi-tenant isolation
- * Improve training reliability and resource efficiency
- * Manage experiments and versions
- * Optimize data pipelines and storage to reduce I/O bottlenecks
- * Orchestrate and elastically schedule distributed training jobs
- * Profile training performance and improve GPU utilization
Perks/Benefits:
Skills/Tech stack required:
[Anomaly Detection] [Caching] [Checkpointing] [CI/CD] [Cluster scheduling] [Communication optimization] [Data loading] [Data loading optimization] [Data prefetching] [DDP] [Disaster Recovery] [Distributed file systems] [Distributed Systems] [File systems] [FSDP] [Go] [GPU scheduling] [GPU Utilization] [GPU Utilization Optimization] [Kubernetes] [Loading Optimization] [Logs] [Megatron] [Metrics] [Networking] [NUMA] [Object storage] [Operating Systems] [Performance Profiling] [Ray] [Slurm] [Traces] [Utilization Optimization] [Zero]
Educational requirements:
N/A
Role(s):
[Engineer] [Machine Learning Platform Engineer] [Platform Engineer] [Training Platform Engineer]