真实世界不只由语言和像素组成。一个能够进入真实设备、真实任务和真实环境的智能系统,需要理解空间、物体、运动、约束和因果变化。对 Physical AI 而言,视频生成不只是"生成一段看起来真实的画面",更重要的是让模型在动态视觉序列中学习物理世界如何演化:物体如何移动,动作如何产生后果,遮挡、碰撞、接触、重力和失败如何在时间中发生。
Awomo 西湖数智致力于构建面向物理世界的概念世界模型,让 AI 理解物理世界、可靠行动、持续进化。沿着这一主线,我们认为物理视频生成基础模型是 Physical AI 的关键底座之一。它连接了感知、推理与行动:一方面能够从大规模真实和仿真数据中学习物理规律,另一方面也可以为机器人、自动驾驶、工业制造和智能硬件提供高质量的场景理解、风险预测、数据生成与策略验证能力。
当前领域的核心问题并不是单纯提升视觉真实感,而是让模型在复杂场景中保持物理一致性、时间一致性和因果一致性。一个视频看起来连续,并不意味着它真正理解了动作后果;一个画面足够清晰,也不意味着它可以支撑真实世界中的可靠决策。因此,我们更关注模型是否能够捕捉物体关系、状态变化、动作约束和长尾场景中的物理规律,并将这些能力逐步转化为可评测、可迭代、可迁移的 Physical AI 基础能力。
Observations on Physics-IQ Verified Benchmark
近期,我们在 Physics-IQ Verified benchmark 上做了一些面向物理视频生成能力的早期验证。Physics-IQ Verified 是一个面向生成式视频模型物理理解能力的评测集合,覆盖碰撞、流体、重力、材料属性、光影、磁性等多类物理现象。相比只评估画面质量或文本对齐度的指标,它更关注生成视频是否遵循真实物理规律。
这与 Awomo 的长期方向高度一致。我们并不把视频生成模型仅仅视为内容生成工具,而是把它看作理解物理世界的一种基础能力验证方式。一个模型如果能够稳定地生成符合物理规律的动态过程,通常也意味着它在空间、物体、运动和因果关系的表征上具备更强潜力。Physics-IQ Verified 提供了一个较好的外部参照,使我们能够用可度量的方式观察这一方向的进展。
我们基于 Awomo 对 Concept World Model 的理解,做了若干探索,包括将复杂物理过程拆解为更明确的概念单元;强化物体、状态、动作和结果之间的关系;关注场景中真正影响物理演化的关键因素。我们观察到,经过上述方向的调整后,Awomo-v0.1 在 Physics-IQ Verified 上取得了明显的指标提升。下表列出 Physics-IQ Verified leaderboard 中的公开结果,并加入我们的 Awomo-v0.1 初步结果进行对比。Awomo-v0.1 相较于最新的 SOTA(Cosmos3-Super-Image2Video),分数提升了约 5.6%。注意表格中公开 baseline 数据取自 Physics-IQ benchmark。
Physics-IQ Verified 结果对比
Input Type: 12V
| RANK | MODEL | PHYSICS-IQ VERIFIED |
|---|---|---|
| 1 | Awomo-v0.1 (Ours) | 45.1 ± 0.6 |
| 2 | Cosmos3-Super-Image2Video | 39.5 ± 0.8 |
| 3 | Grok Imagine Video | 34.8 ± 0.6 |
| 4 | Magi-1 24B + GeoPhys (BoN) | 33.7 ± 1.4 |
| 5 | Hunyuan Video 1.5 | 33.4 ± 0.8 |
| 6 | Wan 2.2 | 32.2 ± 0.6 |
| 7 | Kandinsky-WM 1.0 | 30.8 ± 0.9 |
| 8 | Cosmos3-Nano | 30.3 ± 0.6 |
| 9 | Magi-1 24B | 30.2 ± 1.1 |
| 10 | Sora 2 | 26.5 ± 0.8 |
| 11 | P-Video | 25.3 ± 1.8 |
Input Type: multiframe (v2v)
| RANK | MODEL | PHYSICS-IQ VERIFIED |
|---|---|---|
| 1 | Magi-1 24B + GeoPhys (BoN) | 58.2 ± 1.8 |
| 2 | Magi-1 24B | 48.4 ± 1.1 |
Awomo-v0.1 的结果是一个早期验证:当模型生成过程更关注概念拆解、关键物理因素和因果关系时,物理视频生成能力可以获得可观察的提升。这也支持了 Awomo 一直坚持的方向:Physical AI 的核心不只是生成下一帧,而是在隐空间中理解真实世界的结构与变化。
Toward PhysicalAI Foundation Models
Awomo-v0.1 在 Physics-IQ Verified 上的结果只是一个起点。未来,我们将继续沿着 Concept World Model 的方向,构建能够理解空间、物体、运动和因果变化的物理视频生成基础模型,让 AI 从屏幕中的生成能力,逐步走向真实世界中的理解、判断和行动。