Signal YCurated AI News
更新于 8/20 09:5261 个信源

TimeLens2:基于多模态大语言模型的通用视频时间定位

AI 研究7/19 04:00HuggingFace Daily Papers查看原文 ↗
摘要

TimeLens2提出将视频时间定位视为区间集预测,通过构建多跨度标注数据集和设计时间Wasserstein奖励,显著提升模型在多个基准上的性能。

核心要点
  • TimeLens2-93K数据集通过字幕提案、独立定位、跨模型共识、语义验证和边界精炼构建可靠的多跨度标注。
  • 时间Wasserstein奖励计算合并区间支撑集上均匀分布的一维W1距离,提供稠密、无匹配的反馈,处理不等基数和等价碎片化。
  • 在7个基准上,TimeLens2-2B超越所有同规模基线,4B和8B变体达到SOTA,超越参数高达397B的开源模型。
  • 2B、4B和8B变体相比Qwen3-VL骨干分别提升14.2、13.0和18.1 mIoU点。
  • 现有训练策略与集合值任务不匹配:长视频标签依赖脆弱的一遍标注,强化学习奖励无法区分非重叠预测或需脆弱片段匹配。
AI 洞察
TimeLens2将视频时间定位从片段预测提升为区间集预测,解决了多跨度标注和奖励设计的关键难题,可能推动视频理解从“是什么”向“何时发生”的精细化发展。其超越超大模型的表现表明,优化训练策略和数据质量比单纯扩大参数规模更有效,为多模态大模型在时间敏感应用(如视频编辑、监控分析)中的落地提供了新路径。