Awomo 西湖数智 | Concept World Model (世界模型)· Physical AI(物理AI)
← 返回招聘列表
Careers

Post-training

岗位职责

  • 设计面向机器人操作的 SFT 数据管道,研究指令格式与多任务配比策略。
  • 构建 Reward Model,融合任务完成度、物理合理性与语言指令对齐信号。
  • 基于 PPO / GRPO / DPO 等算法实现 on-policy RL fine-tuning,支持仿真与真机双路径。
  • 研究 RLVR 在具体推理中的应用,提升模型对长流程任务的规划能力。
  • 建立标准化评测体系,覆盖操作精度、泛化性、安全性等维度。
  • 与 Pre-training / 硬件 / 数据团队紧密协作,打通从数据到部署的完整链路。

任职要求

  • 相关方向硕 / 博士,有 CoRL / RSS / NeurIPS / ICLR 等顶会论文优先。
  • 深入理解 RLHF、PPO、DPO 等算法原理,有完整 post-training pipeline 经验。
  • 熟悉 VLA(如 OpenVLA、π0、RoboFlamingo)或 LLM post-training 工作。
  • 有仿真平台(Isaac / Mujoco)RL 训练经验,了解 sim-to-real 挑战。

坐标杭州。简历投递至 joinus@westlakedi.com,邮件标题建议为"姓名 + 岗位"(点击投递按钮会自动带上岗位名,替换"姓名"即可)。