Tasks:
- * Analyze training trajectories, rewards, and data distributions
- * Build and optimize RL training infrastructure
- * Design and iterate reinforcement learning algorithms
- * Design training datasets and evaluation systems
- * Reproduce research in reinforcement learning and autonomous agents
- * Train agentic coding and long-horizon agents
Perks/Benefits:
Skills/Tech stack required:
[Agentic RL] [Agent learning] [Agent training] [Data Design] [Data Distribution] [Data distribution analysis] [Distributed Training] [Distribution analysis] [Embodied AI] [Evaluation Design] [Experiment design] [LLM post training] [Long-Horizon Agent Learning] [Model Training] [Model Training Debugging] [Post-training] [Python] [PyTorch] [Reinforcement Learning] [Reward Signal] [Reward Signal Analysis] [RLHF] [RL training] [RL Training Infrastructure] [Self Evolving] [Self-Evolving Systems] [Signal analysis] [Training data] [Training Data Design] [Training Debugging] [Training Infrastructure] [Training Trajectory Analysis] [Trajectory analysis]
Educational requirements:
N/A
Role(s):
[AI Research Intern] [Intern] [Reinforcement Learning Research Intern] [Research Intern]