Apple-π:面向法律约束物理智能的视频推理基准测试
摘要
Apple-π基准通过物理定律锚定视频模型评估,发现当前视频模型在物理推理上远非可靠,最佳模型得分仅0.473。
核心要点
- Orchard数据集包含400个视频,覆盖10个经典力学任务,包括单定律和多定律任务。
- 基准协议采用三阶段科学推理:感知、公式化和演绎,使用链式帧提示。
- 评估套件结合多模态大模型主观评分与物理定律客观度量。
- 11个模型测试中,最佳视频模型得分仅0.473。
- 分析揭示感知到公式化到演绎的瓶颈、多定律状态转移弱以及模拟到现实差距。
AI 洞察
该基准将视频模型评估从输出层面推进到推理过程,揭示了模型在物理理解上的根本缺陷,可能推动视频生成模型从视觉质量竞赛转向物理一致性竞赛,对具身智能和物理模拟领域具有重要影响。