如何判断一个基准测试是否值得信任
摘要
MLCommons 基于自身构建基准的经验,提出一套“基准信任测试”,帮助企业识别基准结果是否可信,核心是决策匹配、数据污染与可复现性。
核心要点
- MLCommons 成立于2018年,创建了行业标准基准 MLPerf,致力于基准治理、审计追踪和完整性控制。
- 在小学数学基准的再测中,清除数据污染后,多个模型家族的准确率下降高达13个百分点。
- 在公开的 SWE-Bench Verified 上超70%的精英模型,在基于私有仓库的 SWE-Bench Pro 上仅约15%-18%,公共与私人证据最高差距达55个百分点。
- 提示词格式的细微变化可使测量准确率波动数十个百分点,基于格式差异的排名在模型间几乎没有相关性。
- 可复现性需同时覆盖同行评审与审计两个视角,确保他人能重建结果或追踪原始记录。
原文佐证
- This represents a 55-point discrepancy between public and private evidence, all on a metric that teams are currently using to justify high-stakes investments in automated coding infrastructure.
AI 洞察
这篇来自基准制定者的指南,揭示了AI评测行业正出现“高分通胀”:公开榜单因数据污染和过拟合而失真,与企业真实生产表现脱节。它意味着企业单纯依赖公开排行榜做采购决策的风险持续放大,未来私有评测、情景化基准和审计式验证将取代单一公开分数。对模型厂商而言,谁能构建更透明、可复现的评测体系,谁才能赢得企业客户的真正信任。