Tasks:
- * Analyze confidence, trajectory quality, success rates, and policy stability
- * Build and maintain VLA training and evaluation pipelines
- * Conduct ablation and failure-case analyses
- * Design dynamic reward construction and self-evolution experiments
- * Implement trajectory quality scoring and pseudo-expert selection
- * Maintain expert pools and compute trajectory similarity
- * Present research progress and findings
- * Review and synthesize research papers
- * Run cross-architecture, cross-task, and cross-benchmark experiments
- * Run policy rollouts and collect trajectories in robot simulators
Perks/Benefits:
Skills/Tech stack required:
[Action models] [Decision Processes] [Deep learning] [Experimental reproducibility] [Git] [Isaac Sim] [Libero] [Linux] [Machine Learning] [ManiSkill] [Markov Decision Processes] [Online Policy Optimization] [Policy gradients] [Policy Optimization] [Policy Rollouts] [PPO] [Probability and statistics] [Python] [PyTorch] [Reinforcement Learning] [Robosuite] [Robot simulation] [RoboTwin] [Self-Rewarding Learning] [Self-supervised] [Self-Supervised Learning] [Supervised Learning] [Test Time] [Test-Time Reinforcement Learning] [Test-Time Training] [Trajectory Evaluation] [Value Functions] [VLA] [World-Action Models]
Educational requirements:
[Master's Degree]
Role(s):
[AI Research Intern] [Embodied AI Research Intern] [Intern] [Machine Learning Research Intern] [Research Intern]