一、物理一致性:结果是否符合真实规律
物理一致性关注模型是否理解重力、碰撞、接触、材料、遮挡和运动连续性等基本规律。一段视频可以视觉上非常流畅,但物体的速度、受力或碰撞结果可能并不合理。
对于世界模型和物理视频模型而言,物理一致性评测能够观察模型是否学到了环境变化的关键因素。不过,离线生成指标只能证明某一类能力,不能直接等同于机器人已经具备可靠行动能力。
二、任务成功率:模型能否完成真实目标
物理AI最终要完成具体任务,例如抓取、放置、导航、避障、装配或风险预测。任务成功率需要明确成功条件,并统计不同环境、不同物体和多次重复执行下的结果。
除了最终是否成功,还应记录完成时间、动作次数、轨迹长度、能耗和失败类型。只有把失败拆解到感知、预测、规划和控制等环节,评测结果才能真正指导模型改进。
三、泛化与鲁棒性:换环境后还能不能用
一个模型在训练场景中表现良好,并不代表它能够应对新的物体、新的光照、新的设备或新的任务。泛化评测需要主动改变环境条件,测试系统面对遮挡、噪声、传感器偏差和任务变化时的稳定性。
跨本体迁移也是重要方向。同一种物理规律能否在机械臂、移动机器人和其他智能硬件之间复用,需要区分通用表征能力与具体硬件控制适配,不能只用单一结果概括。
四、实时性与资源效率:模型能否在设备上运行
真实设备通常需要在有限时间内完成感知和决策。评测不仅要看模型精度,还要考虑推理延迟、内存占用、能耗、硬件成本和通信稳定性。
部分任务可以依赖云端计算,部分任务则必须在端侧完成。技术方案需要根据安全要求、网络条件和动作频率进行选择。一个指标更高但无法满足实时控制的模型,并不一定更适合实际部署。
五、安全性与恢复能力:失败之后会发生什么
物理AI系统可能直接影响人员、设备和环境,因此还要评测异常检测、风险预警、动作中止、人工接管和失败恢复能力。对高风险任务,应设置明确的安全边界和分级验证流程。
较完整的评测通常包括离线数据测试、闭环仿真、受控真实环境和长期运行四个阶段。西湖数智已公开围绕Physics-IQ Verified benchmark开展物理视频生成能力的早期验证。未来,模型能力仍需与具体任务、真实设备和闭环运行结果结合评价,才能形成更完整的物理AI能力判断。