Signal YCurated AI News
更新于 8/20 09:5261 个信源

RxBrain:具身认知基础模型,融合语言-视觉推理与想象

AI 研究7/15 04:00HuggingFace Daily Papers查看原文 ↗
摘要

RxBrain是一个具身认知基础模型,通过语言和视觉想象的互补作用,将具身规划表示为单一规划序列。语言提供抽象结构(任务分解、约束等),视觉想象通过世界状态预测和子目标规划将其具体化。模型采用统一的多模态混合Transformer架构,并构建了自动流水线从具身视频中生成联合文本-视觉监督。实验表明,RxBrain能生成耦合文本推理和世界状态预测的规划。

核心要点
  • RxBrain将具身规划表示为单一序列,语言和视觉想象互补。
  • 模型采用统一的多模态混合Transformer架构,支持多模态理解与生成。
  • 自动流水线将具身视频分解为规划步骤,并与视觉状态转换对齐。
  • 引入RxBrain-Bench评估联合文本与视觉的规划能力。
  • 实验显示RxBrain保持具身理解与生成能力,并实现耦合规划。
AI 洞察
该工作将语言的高层抽象与视觉的物理细节结合,为具身智能的规划提供了新范式,可能推动机器人任务执行和交互的进步。