支出视界:衡量优化能力及其在NanoGPT上的应用
摘要
METR提出“支出视界”指标,用于量化AI系统的优化能力,并在NanoGPT模型上进行了实证研究。
核心要点
- 支出视界定义为模型在固定计算预算下能优化的目标函数值提升幅度
- 在NanoGPT上,支出视界随模型参数量增加而增长,但增速放缓
- 小模型(如125M参数)的支出视界约为大模型(1.5B参数)的60%
- 该指标可用于预测模型在复杂任务上的表现,与下游任务性能正相关
- 研究指出,优化能力强的模型可能更易产生不可预测行为,需安全关注
AI 洞察
这项研究为AI能力评估提供了新的量化维度,尤其对理解大模型的风险边界至关重要。随着模型优化能力增强,其潜在失控风险也在上升,未来可能需要将支出视界纳入安全审查标准。