Careers
Post-training
岗位职责
- 设计面向机器人操作的 SFT 数据管道,研究指令格式与多任务配比策略。
- 构建 Reward Model,融合任务完成度、物理合理性与语言指令对齐信号。
- 基于 PPO / GRPO / DPO 等算法实现 on-policy RL fine-tuning,支持仿真与真机双路径。
- 研究 RLVR 在具体推理中的应用,提升模型对长流程任务的规划能力。
- 建立标准化评测体系,覆盖操作精度、泛化性、安全性等维度。
- 与 Pre-training / 硬件 / 数据团队紧密协作,打通从数据到部署的完整链路。
任职要求
- 相关方向硕 / 博士,有 CoRL / RSS / NeurIPS / ICLR 等顶会论文优先。
- 深入理解 RLHF、PPO、DPO 等算法原理,有完整 post-training pipeline 经验。
- 熟悉 VLA(如 OpenVLA、π0、RoboFlamingo)或 LLM post-training 工作。
- 有仿真平台(Isaac / Mujoco)RL 训练经验,了解 sim-to-real 挑战。