Signal YCurated AI News
更新于 8/20 09:5261 个信源

Apple-π:面向法律约束物理智能的视频推理基准测试

AI 研究7/17 04:00HuggingFace Daily Papers查看原文 ↗
摘要

Apple-π基准通过物理定律锚定视频模型评估,发现当前视频模型在物理推理上远非可靠,最佳模型得分仅0.473。

核心要点
  • Orchard数据集包含400个视频,覆盖10个经典力学任务,包括单定律和多定律任务。
  • 基准协议采用三阶段科学推理:感知、公式化和演绎,使用链式帧提示。
  • 评估套件结合多模态大模型主观评分与物理定律客观度量。
  • 11个模型测试中,最佳视频模型得分仅0.473。
  • 分析揭示感知到公式化到演绎的瓶颈、多定律状态转移弱以及模拟到现实差距。
AI 洞察
该基准将视频模型评估从输出层面推进到推理过程,揭示了模型在物理理解上的根本缺陷,可能推动视频生成模型从视觉质量竞赛转向物理一致性竞赛,对具身智能和物理模拟领域具有重要影响。