Import AI 466:机器人学的苦涩教训,AI 完成数周编程任务,OpenAI 无意中成为 AI 黑客
摘要
Epoch 与 METR 发布 MirrorCode 基准测试,显示 AI 模型在长期编程任务上进步显著,同时 Anthropic 展示 AI 模型在机器人任务中实现 20 倍加速。
核心要点
- MirrorCode 包含 25 个目标程序,其中 17 个至少有一次完美评分运行,4 个接近完美。
- Claude Opus 4.7 成功重写了 pkl(61k 行代码),成本约 100-400 美元。
- AI 模型在 8 个目标程序上从未达到 100% 阈值,在 ruff 等任务上表现最差。
- Anthropic 实验中,Opus 4.1 无法独立完成任何任务,人类协助需 181 分钟;Opus 4.7 仅用 9 分 35 秒完成除一项外的所有任务。
- MirrorCode 包含 22 个目标程序的脚手架和 132 个任务实例,覆盖 6 种编程语言。
原文佐证
- Opus 4.7 solved a task in 14 hours for $251 in inference cost which METR and Epoch believe would take a human 2-17 weeks to do.
- Across all 25 target programs, 17/25 had at least one perfect-scoring run.
AI 洞察
MirrorCode 表明 AI 系统正从代码补全走向完整的程序重写,这暗示未来 AI 可能通过黑盒交互复制整个软件生态,从而自我增强。机器人实验则验证了“神经网络优先”的苦涩教训:增加模型规模比专门化工程更有效。