Tasks:
- * Design agent training tasks and verifiable reward signals
- * Diagnose reward hacking and training instability
- * Improve multi-turn and long-horizon RL algorithms
- * Reproduce agent RL research and validate it in training frameworks
- * Research LLM reinforcement learning post-training for agentic tasks
- * Run ablation experiments and analyze training metrics and rollout trajectories
- * Write technical reports
Perks/Benefits:
Skills/Tech stack required:
[Ablation Studies] [Advantage Estimation] [Credit Assignment] [Data Construction] [Experiment analysis] [Exploration] [GRPO] [LLM post training] [Off Policy] [Off Policy Learning] [OPD] [Policy Gradient] [Policy learning] [Post-training] [PPO] [Python] [PyTorch] [Reinforcement Learning] [Reward Design] [RLHF] [RLVR] [SFT] [Transformer]
Educational requirements:
[Master's Degree]
Role(s):
[Intern] [LLM Agent Research Intern] [Reinforcement Learning Research Intern] [Research Intern]