Tasks:
- * Analyze model behavior and failure modes
- * Build agent evaluation systems
- * Create data synthesis and filtering pipelines
- * Design reward signals and graders
- * Develop agentic reinforcement learning algorithms
- * Explore self-improvement and continual learning
- * Improve agent generalization and reliability
- * Improve credit assignment for long-horizon tasks
- * Scale and stabilize agent RL training
Perks/Benefits:
Skills/Tech stack required:
[Agentic RL] [AI Agents] [Code generation] [Credit Assignment] [Data Filtering] [Data Synthesis] [Experimental Design] [Grader Design] [LLM post training] [Long Horizon Planning] [Model Evaluation] [Post-training] [Python] [PyTorch] [Reinforcement Learning] [Reward Design] [Search] [Tool use]
Educational requirements:
[Master's Degree] [PhD]
Role(s):
[Agent Researcher] [AI Research Scientist] [Reinforcement Learning Researcher] [Researcher] [Research Scientist] [Scientist]