导言
世界模型(World Models)作为迈向通用人工智能与高级具身智能的核心基础设施,正经历从理论构想到工程落地的深刻蜕变。其本质在于构建一个能够映射物理世界状态转移规律的预测性动态系统,使智能体能够在接收当前状态与候选动作后,推演未来的环境演变1。随着模型架构从扩散模型、自回归架构向联合嵌入预测架构(JEPA)等潜空间范式的演进,世界模型的能力边界已大幅扩张。然而,能力的跃升必然对评测体系提出更为严苛的要求。早期的评测框架往往将世界模型降维等效为视频生成模型,过度关注帧级别的视觉保真度与时序平滑性3。这种重表观、轻机理的评测导向,掩盖了模型在物理客观性、因果一致性以及长序交互决策中的致命缺陷。
当模型被部署于自动驾驶或机器人闭环控制等严肃场景时,纯粹的视觉欺骗性往往导致灾难性的决策失效。基于对2018年至2026年间发布的102个代表性基准测试的系统性调查,当前学术界已将世界模型的评测重构为一个四维分类法:评测目标、评测协议、评测指标与评测数据2。评测目标的重心正不可逆转地从视觉与时间质量,向空间状态一致性、长时距记忆、物理常识合理性、因果反事实推理以及下游功能效用转移2。本报告将全景式剥析世界模型的评测维度、底层机理、核心指标以及在垂直领域的演进逻辑,旨在为下一代智能体的基准测试提供严谨的方法论参考。
物理规律与因果交互:评测维度的深度解构
世界模型的评测已从单一的视觉质量扩展为一个多维度的嵌套体系。除了基础的时空连贯性,模型必须经受物理定律遵从性与因果干预响应的严苛审计。
物理常识与定律遵从的严苛审计
物理常识的缺失是当前生成式世界模型的最大软肋。模型往往能够生成极具视觉冲击力的画面,却在基础力学定律面前破绽百出。前沿物理评测基准通过构建严密的物理法则分类法,对模型进行诊断级别的解剖。以VideoPhy-2基准为例,该框架涵盖了4000个多样化的物理动作提示词,通过细粒度的人类评估,量化模型对语义遵循与物理规则的双重内化程度5。数据表明,即使是当前参数量庞大的前沿模型(如Wan2.1-14B),在处理具有复杂物理法则约束的硬核子集时,其语义与物理规则的联合达标率仅为22%6。模型在质量守恒、动量守恒等基础物理定律上的表现尤为薄弱,经常出现物体凭空消失或运动轨迹违背惯性的现象6。
在流体动力学、固体力学等细分领域,PhyGround基准提出了基于标准的细粒度分类法,涵盖13项具体物理定律,通过可观测的子问题将宏观物理现象拆解为具体的因果关联9。PhysicalRealismBench-U则进一步引入了合成违规数据集,通过程序化地在场景中植入自发冲量(Spontaneous Impulse)、穿透(Pass-Through)、自发形变(Shape Change)与重力异常等六类确定的物理违规现象,构建了绝对精确的底层标签10。这种机制彻底消除了标注歧义,实现了对模型物理认知缺陷的精准归因。摩擦力缺失与重力异常是模型最常犯的错误,物体在粗糙表面的异常滑行或无支撑物的非自然悬浮,暴露出扩散模型在模拟经典力学时的内生瓶颈8。
评测基准名称 | 核心评估维度与物理法则 | 数据集规模与特征 | 核心发现与模型表现 |
VideoPhy-2 | 质量/动量守恒、重力、浮力、弹性、摩擦力 | 4000个真实世界复杂动作提示词 | 前沿模型在硬核子集联合达标率仅22%,极度缺乏守恒定律认知 |
PhyGround | 13项具体定律(固体力学、流体力学、光学) | 250个精选提示与预期物理结果 | 克服VLM裁判偏见,证实模型无法独立满足多项约束条件 |
PhysicalRealismBench-U | 自发冲量、穿透、自发显隐、重力/支撑异常 | 1300个合成配对视频,程序化物理违规 | VLM物理理解F1分数仅0.14-0.60,提供基于单一变量的确切归因 |
PhyWorldBench | 基础运动、能量守恒、刚体交互、生物运动 | 1050个涵盖多层级物理现象的提示 | 传统FVD/IS指标无法反映动作合理性,需结合上下文感知评估 |
交互响应与因果干预的闭环验证
世界模型的本质特征在于其可被动作条件化,即必须检验环境对外部输入的响应是否符合因果律,而非仅仅是对训练数据的统计插值。WBench基准将交互式世界模型解构为五个子系统:渲染器、导演(环境初始化)、控制器、记忆引擎与交互引擎,重点评估模型在多轮交互中的场景遵循与主体身份保持能力11。在第一人称与第三人称视角的切换中,模型经常发生空间拓扑关系的坍塌,证明视角一致性与渲染质量是两种完全独立的底层能力。
WorldExam基准进一步将评测扩展至环境反应性(World Reactivity)。这一层级超越了输入指令的显式描述,要求模型根据场景状态推演出连带的因果反馈。例如,当主体踏上阶梯时,其运动学特征必须适应地形;当进入另一智能体的空间时,需引发合理的社会性避让12。评测揭示了不同控制范式的能力割裂:相机驱动模型擅长视角平滑过渡但缺乏动态交互;动作驱动模型控制精准却往往导致环境僵化;语言驱动模型交互丰富但对复杂控制的忠诚度极低。此外,CRONOS基准引入了反事实物理一致性测试,通过干预场景上下文、视角或物体材质,观察物理事件的演变是否符合因果逻辑,从而筛查出依赖数据拟合而非物理规律内化的模型13。
具身智能与机器人操作:功能效用的系统跃迁
在机器人控制领域,世界模型承担着心理模拟器与环境代理的双重角色。具身世界模型评测体系正经历从单一视觉预测到多模态、跨平台、在线闭环的系统性重构。WorldArena 1.0通过EWMScore整合了16项视觉感知指标,并首次将模型作为合成数据引擎、策略评估器与动作规划器进行功能性验收,证实了具备更强物理一致性的模型能够实质性提升下游机器人的操作成功率1。
然而,面对真实物理世界的复杂性,纯视觉与开环评估已触及天花板。WorldArena 2.0在此基础上实现了三个维度的跨越式扩展。首先是模态扩张,将评测从纯视觉拓展至视触觉融合。在接触丰富的机械臂操作中,视觉无法精准反馈作用力、滑动趋势与材质形变。通过注入标准化触觉信号管道,模型必须展现出对接触力学的深度预测能力16。其次是功能转化,将世界模型从静态视频生成器升级为在线强化学习(Online RL)环境。评测框架不再仅依赖冻结策略进行评分,而是让策略网络与世界模型在潜空间进行数千次的交互演练,以此检验模型在长时距 rollout 下的状态流转是否符合奖励机制,并具备抵御复合误差(Compounding Errors)的鲁棒性16。
最关键的突破在于跨越仿真到现实(Sim-to-Real)的验证闭环。WorldArena 2.0不仅依赖RoboTwin 2.0或LIBERO等虚拟域,更将模型直接部署于AgileX分体式ALOHA物理机器人平台,执行倒水、擦桌子等长序列任务16。测试结果表明,仿真域得分极高的模型在面对真实世界的材质噪声与动态摩擦时,往往遭遇断崖式性能衰减,深刻揭示了泛化能力在跨具身(Cross-embodiment)迁移中的脆弱性。
评测演进维度 | WorldArena 1.0 (离线视觉为主) | WorldArena 2.0 (全链路具身效用) | 演进意义与底层机理 |
感知模态 | 纯视觉预测 (单模态) | 视触觉融合 (Visuo-Tactile) | 引入对接触、力反馈、滑动与材质交互的物理预测,贴合真实机械臂作业需求 |
交互功能 | 离线任务评分、策略评估、数据引擎 | 在线强化学习环境、闭环交互优化 | 验证模型在长时距策略更新中的抗误差累积能力,确立奖励感知的状态转换 |
部署平台 | 纯仿真器 (虚拟环境限制) | 跨平台物理机器人 (AgileX ALOHA等) | 直面Sim-to-Real的分布外挑战,压测域随机化与真实环境噪声的适应性 |
自动驾驶域:4D空间占用与端到端规划的深度耦合
自动驾驶是世界模型规模化落地的另一核心场景。该领域的容错率极低,评测核心不仅在于未来画面的像素级重构,更在于4D时空几何的精确推演与极端场景下的安全性决策验证19。传统的2D图像或BEV(鸟瞰图)世界模型由于缺乏高度信息与精细的动态掩码,难以应对复杂城市路况。
以Drive-OccWorld为代表的视觉中心4D预测框架重塑了评测标尺。评测体系重点考核模型对4D占用网络(Occupancy)及动态元素的向心流(Centripetal Flow)的预测精度。模型需通过记忆队列累积多视角几何特征,预测三维空间内体素化状态的时间演化21。这一维度的指标(如mIoU与VPQ)要求模型在三维坐标系下精确标注出可行驶区域、静态障碍物以及动态交通参与者的边界与速度矢量21。进一步,评测系统将世界模型接入端到端规划模块,通过输入不同的自车候选动作,要求模型推演多种平行的未来分支。基于全面占用代价函数的轨迹规划安全性评估,使世界模型从被动的环境预测器跃升为主动的安全规划引擎22。
与此同时,以Vista和GAIA-1为代表的模型将评测重点推向了跨域泛化能力与多模态动作可控性。现有的大多数驾驶世界模型局限于低帧率与低分辨率,导致远距离微小障碍物的关键细节丢失,这在自动驾驶评测中属于致命缺陷24。新型基准严格审计模型在高分辨率条件下的动力学现实感,并要求模型支持从转向角、速度到自然语言的多模态复杂动作条件输入,以确保未来生成的每一帧不仅在视觉上连贯,更在物理机理上严格受控于自我意图24。
代表性自动驾驶模型 | 发布时间 | 最高生成分辨率 | 核心技术范式与评测侧重点 |
Drive-OccWorld | 2024 | - (聚焦三维体素) | 4D占用与向心流预测,基于占用代价函数的端到端安全轨迹规划验证 |
GAIA-1 | 2023 | 256×448 | 自回归Transformer,融合过去图像、文本与动作特征的生成式模拟 |
Vista | 2024 | 576×1024 | 解决低分辨率细节丢失,强调跨域泛化、高保真动态先验与多模态动作控制 |
DriveDreamer | 2023 | 80×160 | 早期图像基础驾驶世界生成,受限于极低分辨率,无法支撑复杂物理规划 |
潜空间动力学与JEPA架构的评测革新
以联合嵌入预测架构(JEPA)为代表的潜空间世界模型,彻底颠覆了基于像素重构的传统评估范式。在扩散模型或掩码自编码器(VideoMAE)的逻辑中,模型消耗大量算力用于拟合复杂的纹理与光影,而这些细节对智能体的物理决策往往毫无意义。潜空间评测的核心,在于验证模型能否过滤像素噪声,提取出驱动环境演变的因果状态变量25。
在V-JEPA架构的评测中,像素级指标(如PSNR)与动作相关的动态结构特征呈现出明显的解耦。研究表明,追求极致高保真重构的扩散模型(如SDXL VAE)在捕捉动作因果信息时彻底失效,而采用特征级潜预测的V-JEPA则在视觉质量与控制效用之间占据了帕累托最优边界26。通过在世界模型的冻结表征上附加逆动力学探测器,评测系统计算模型从连续两帧潜状态中反推所执行动作的准确率。数据揭示,最难恢复的动力学信息(如末端执行器的精确旋转角度)主要储存于V-JEPA的中段网络层(约第14层),这证明了预测架构迫使模型内化了物理连续性,而非单纯进行表象记忆26。
此外,潜空间模型最易陷入表征坍缩陷阱,即编码器将所有输入映射为高度相似的常量向量,导致时序预测失去意义。LeWorldModel(LeWM)等前沿架构通过引入显式的嵌入分布对齐目标,摒弃了传统的停止梯度或指数移动平均(EMA)目标网络,从根本上解决了端到端训练的稳定性问题27。在评测此类模型时,WorldModelGym引入了决策保真度标尺,剥离了视觉渲染需求。模型仅作为纯粹的环境模拟器更新内部状态并预估奖励,通过在给定动作菜单下执行中立的贪婪搜索规则,衡量模型推演未来与现实物理世界的一致性28。
架构流派 | 核心目标与表征空间 | 评测侧重点与模型优势 | 物理决策效用评估 |
像素保真模型 (扩散/VAE) | 重构图像的每一寸像素纹理 | 倾向于静态场景的视觉极高逼真度,分配过多算力于高频噪声 | 动作捕捉能力极弱,难以理解帧间物理因果与动力学旋转特征 |
自监督重构模型 (VideoMAE) | 掩码像素重构 | 依赖自然视频的时间上下文提取语义,但因重构像素引入干扰 | 具备一定的控制信息,但受限于解码开销,规划效率受限 |
潜空间预测模型 (V-JEPA) | 预测抽象的潜特征向量 | 防止表征坍缩,专注于捕捉导致状态改变的因果特征与动作相关结构 | 统治视觉与控制的帕累托边界,深度支持动作恢复与长时距模拟规划 |
评测方法论的底层反思与破局
尽管世界模型评测体系在广度与深度上均取得了长足进展,但受限于底层技术的认知瓶颈,依然面临着严峻的结构性挑战。最大的隐患来源于自动化评估体系的认知偏见。当前多模态大模型在充当自动化裁判时,极其容易被高帧率、光影顺滑的生成伪像所蒙蔽。在Physion-Eval基准的测试中,人类专家仔细筛查出的物理逻辑漏洞,有高达83.3%被VLM裁判漏判29。这种系统性的误判导致排行榜经常奖励那些擅长产生幻觉而非遵循物理约束的模型。因此,重拾受控的人类专家评估,要求标注者针对特定物理定律提供诊断级反馈,是建立无偏见真实标签的必要回溯9。
另一方面,将涵盖流体力学、刚体动力学、光学属性等多个独立维度的物理得分进行算术平均的做法,严重掩饰了模型在特定定律上的灾难性失效。一个在流体模拟上得分极高的模型,可能完全无法理解刚体的不穿透性。因此,未来的基准测试必须摒弃宏观综合打分,建立树状的归因评测图谱,使每次失效都能被精确追踪到最基础的物理定律或几何拓扑断裂点。
此外,潜空间模型带来的可解释性困境亟待解决。在JEPA架构中,未来预测发生在高维潜空间,现有的探针或解码器重构方法在将潜变量映射回可观测指标时,不可避免地会引入解码器自身的先验偏差。未来的评测体系需要确立标准化的纯潜空间对齐度量方法,通过信息论中的互信息与微分几何工具,直接量化潜流形与真实物理状态空间在拓扑结构上的同态一致性。
世界模型的崛起标志着人工智能正从静态的模式识别跨入动态的物理因果推演时代。从纯粹的像素重构到视触觉的多模态感知,从开环的时序外推到闭环的策略优化,评测维度的每一次扩容,都在倒逼世界模型向真正理解物理定律的通用模拟器进化。只有那些经受住严苛物理规律质询、在闭环交互中展现出深层因果韧性,并能切实转化为下游具身决策红利的模型,方能成为承载通用人工智能的基础设施。构建一个兼具医学级诊断精度与工业级功能验证的评测体系,将为机器深刻理解物理宇宙奠定不可替代的基石。
引用的著作
WorldArena: A Unified Benchmark for Evaluating Perception and, https://arxiv.org/html/2602.08971v2
A Survey of World Model Benchmarks - Preprints.org, https://www.preprints.org/manuscript/202609.0665
A Unified Benchmark Suite for Interactive Video World Models, https://arxiv.org/html/2604.21686
A Survey of World Model Benchmarks - Preprints.org, https://www.preprints.org/frontend/manuscript/52aad92ecf4ba9ab6be930b40803daca/download_pub
VideoPhy-2: A Challenging Action-Centric Physical Commonsense, https://openreview.net/forum?id=HA8KSQW7SO
VideoPhy-2: A Challenging Action-Centric Physical Commonsense, https://arxiv.org/html/2503.06800v1
A Challenging Action-Centric Physical Commonsense Evaluation in, https://www.researchgate.net/publication/389714415_VideoPhy-2_A_Challenging_Action-Centric_Physical_Commonsense_Evaluation_in_Video_Generation
VideoPhy-2: A Challenging Action-Centric Physical Commonsense, https://www.alphaxiv.org/abs/2503.06800
PhyGround: Benchmarking Physical Reasoning in Generative World, https://arxiv.org/html/2605.10806v1
Attributable Physical Realism Evaluation for Video World Models, https://reka.ai/news/physicalrealismbench-attributable-physical-realism-evaluation-for-video-world-models
WBench: A Comprehensive Multi-turn Benchmark for Interactive, https://arxiv.org/html/2605.25874v1
WorldExam: Benchmarking World Models from Apparent ... - arXiv, https://arxiv.org/pdf/2608.02603
Benchmarking Counterfactual Physical Consistency in Video Models, https://arxiv.org/html/2605.23699v1
Daily Papers - Hugging Face, https://huggingface.co/papers?q=WorldArena
WorldArena: A Unified Benchmark for Evaluating Perception and, https://world-arena.ai/
WorldArena 2.0: Extending Embodied World Model Benchmarking, https://v2.world-arena.ai/
WorldArena 2.0: Extending Embodied World Model Benchmarking, https://arxiv.org/html/2605.17912v1
WorldArena 2.0 Leaderboard - Hugging Face, https://huggingface.co/spaces/WorldArena/WorldArena2.0
A Survey of World Models for Autonomous Driving - arXiv, https://arxiv.org/html/2501.11260v4
A Survey of World Models for Autonomous Driving - arXiv, https://arxiv.org/html/2501.11260v3
Vision-Centric 4D Occupancy Forecasting and Planning via World, https://arxiv.org/html/2408.14197v1
Vision-Centric 4D Occupancy Forecasting and Planning via World, https://april.zju.edu.cn/wp-content/papercite-data/pdf/yang2025dow.pdf
(PDF) Driving in the Occupancy World: Vision-Centric 4D, https://www.researchgate.net/publication/383428973_Driving_in_the_Occupancy_World_Vision-Centric_4D_Occupancy_Forecasting_and_Planning_via_World_Models_for_Autonomous_Driving
Vista: A Generalizable Driving World Model with High Fidelity and, https://www.cvlibs.net/publications/Gao2024NEURIPS.pdf
ACT-JEPA: Novel Joint-Embedding Predictive Architecture ... - arXiv, https://arxiv.org/html/2501.14622v4
What Makes Video World Model Latents Action-Relevant: Prediction, https://www.alphaxiv.org/abs/2606.07687
LeWorldModel and the Case for Stable Latent World Models - Medium, https://medium.com/@adnanmasood/leworldmodel-and-the-case-for-stable-latent-world-models-0e4c33ca0f3c
WorldModelGym: a decision-based fidelity benchmark for world, https://reka.ai/news/worldmodelgym
Does Generated Video Obey Physics? | Pebblous, https://blog.pebblous.ai/report/world-model-physics-verification/en/