Awomo 西湖数智 | Concept World Model (世界模型)· Physical AI(物理AI)
← 返回招聘列表
Careers

Infra 加速

岗位职责

  • 负责支撑 LLM 与 World Model 训练的大规模 GPU 集群基础设施,保障高可用与稳定性。
  • 优化分布式训练框架(数据 / 模型 / 流水线并行),识别并解决通信、显存、IO 等性能瓶颈。
  • 构建高吞吐、低延迟推理服务,覆盖量化、KV Cache 优化、Continuous Batching 等核心技术。
  • 与算法团队协作,支持训练 / 推理实验迭代,评估并引入新型硬件与软件栈。

任职要求

  • 5 年以上基础设施或系统工程经验,有大规模分布式训练 / 推理实际落地经验优先。
  • 深入理解 GPU 体系结构,熟悉 CUDA、NCCL 及性能 profiling 工具链。
  • 熟练掌握至少一种主流训练框架(Megatron-LM、DeepSpeed、PyTorch FSDP)的源码级调优。
  • 熟悉推理优化方法:PagedAttention、Speculative Decoding、Continuous Batching 等。
  • 具备 Kubernetes、容器化部署及 InfiniBand / RoCE 高速网络配置经验。
  • 扎实的 Python / C++ 编程能力,能独立阅读并修改框架底层代码。

加分项

  • 有 World Model(视频生成 / 物理模拟)训练或推理系统建设经验。
  • 深度参与过 vLLM、TensorRT-LLM、SGLang 等开源推理框架开发。
  • 在 MLSys、OSDI、SOSP、SC 等顶会发表过论文。

坐标杭州。简历投递至 joinus@westlakedi.com,邮件标题建议为"姓名 + 岗位"(点击投递按钮会自动带上岗位名,替换"姓名"即可)。