空货架还是丢失钥匙?召回是参数化事实性的瓶颈
摘要
谷歌研究提出知识剖析框架,证明前沿LLM的事实错误多为召回失败而非编码失败,并发布WikiProfile基准。
核心要点
- 知识剖析将分析单元从问题转向事实,将事实分为编码失败、召回失败、直接召回、思考后召回、无编码推理五种剖面。
- WikiProfile包含2,150条维基百科事实,每条事实配10个问题(2个编码、4个知识、4个多选题),自动化构建并人工验证。
- 评估了13个LLM,每个模型在有/无思考模式下采样8次,共产生约450万条响应。
- 编码失败需要通过扩大模型或数据覆盖解决,召回失败可通过后训练和推理时方法改善。
- 研究发现前沿LLM编码了几乎所有事实,但许多事实难以召回,说明瓶颈在可访问性而非存储。
原文佐证
- frontier LLMs encode nearly all facts, yet struggle to recall many of them.
AI 洞察
这意味着提升LLM事实性的关键可能不在参数规模或数据覆盖,而在于如何增强模型对已编码信息的检索与利用能力。未来或许会催生更多针对模型内部存取机制的研究,以及通过后训练、思考提示等手段改善召回的技术路径。