Awomo 不以生成下一帧画面为主要目标,而是在隐空间中学习物体、空间、状态、动作和因果关系。模型关心的不是画面看起来像不像,而是事情会不会发生、行动是否可靠。这一路径让机器人、车辆与智能硬件能够以更低成本完成物理推演和实时控制。
真实世界不只由词语和像素组成。真实世界有重力、摩擦、碰撞、遮挡、约束和失败。机器想真正行动,就必须理解这些规律。
会说概念,不等于理解物理约束。模型可以描述杯子,却未必知道杯子被推后会如何移动。
像素连续不等于物理规律。生成一段看起来真实的视频,未必能实时指导机器人行动。
手写规则覆盖有限,现实世界长尾复杂,迁移成本高,需要从真实交互和失败反馈里学习。
不盲目堆像素,而是学习更关键的物理概念和因果结构。
减少高清视频级生成开销,更适合实时控制与端侧部署。
同一套物理智能中枢,跨任务与硬件本体迁移复用。