Signal YCurated AI News
更新于 8/20 09:5261 个信源

VIABench:面向视障人士辅助的视频基准测试集

AI 研究7/16 04:00HuggingFace Daily Papers查看原文 ↗
摘要

VIABench是一个专门用于评估多模态大语言模型在视障辅助场景中表现的视频基准测试集,包含主动提醒、视觉问答和视觉引导交互三大任务。实验表明,当前MLLM在主动提醒任务中表现不佳,难以提供全面支持。

核心要点
  • VIABench使用盲人自己录制或分享的第一视角视频构建。
  • 三大任务:主动提醒(预测并描述导航关键事件)、视觉问答(回答环境问题)、视觉引导交互(上下文感知交互)。
  • 评估支持在线(实时)和离线两种设置。
  • 实验显示MLLM在主动提醒任务中表现最差,缺乏准确预测和实时响应能力。
  • 该基准旨在推动面向真实辅助场景的定制化MLLM研究。
AI 洞察
该基准揭示了MLLM在具身智能与实时交互场景中的短板,为无障碍技术发展提供了关键评估工具。