一、多模态物理感知:先获得真实世界的信息

物理环境中的信息来源十分复杂。摄像头能够提供颜色、纹理和空间线索,点云可以描述三维结构,声音、触觉、力传感器和设备状态则补充接触、受力与运行情况。物理AI首先要把这些来源不同、频率不同、精度不同的信息进行对齐。
感知并不等于简单识别物体。系统还需要判断物体之间的位置关系、运动状态、可操作区域以及环境中正在发生的变化。只有将多模态信息转化为与任务相关的状态,后续的预测和规划才有可靠基础。

二、世界建模:形成可推演的内部表征

获得感知信息后,系统需要建立一个能够描述环境的内部模型。这个模型可以包含物体、空间、状态、动作、目标及其关系,也可以在隐空间中压缩复杂的视觉和传感器信息。
高质量的内部表征不必复制现实中的每一个像素,而应保留对行动真正重要的信息。例如,在抓取任务中,杯子的纹理可能不是最关键的,但位置、开口方向、重量、接触点和周围障碍物会直接影响动作是否成功。

三、预测与规划:在行动前推演可能结果

物理AI需要根据当前状态和候选动作,预测环境接下来可能如何变化。机器人向左移动还是向右移动、机械臂采用哪个抓取点、车辆是否需要提前减速,都可以在行动前进行一定程度的结果评估。
预测结果需要与任务目标结合。系统不仅要判断动作能不能完成,还要综合考虑成功率、时间、能耗、安全边界和设备约束。面对较长任务时,还需要把目标拆解为多个步骤,并根据执行反馈动态调整计划。

四、控制与执行:让模型能力进入真实设备

从模型输出到真实设备动作之间,还需要控制系统、通信系统和安全机制。真实设备存在延迟、误差、磨损和执行精度差异,实验环境中有效的策略并不一定可以直接部署。
因此,物理AI系统需要关注实时推理、端侧资源、动作频率和异常处理。对高风险场景,还要设置安全边界、人工接管和降级策略,让模型能力在可控条件下进入真实业务。

五、自我进化闭环:从失败中补数据、改模型

真实部署会不断暴露训练阶段没有覆盖的问题。系统可以记录失败场景,分析错误来自感知、建模、预测还是控制,并针对问题补充真实数据或仿真数据。修正后的模型再回到验证和部署环节,形成持续迭代。
西湖数智提出的技术体系同样强调多模态物理感知、隐式物理空间、概念空间建模、预测与行动控制以及自我进化闭环。其目标是让物理AI不只完成一次动作,而是逐步形成可迁移、可复用、可持续提升的物理智能能力。