主 leaderboard(v1,2026-03):最佳 agent Opus 4.6 为 23.2%,距官方 instruct 模型(51.1%,右侧深色柱)不到一半;左侧灰柱为 base model 零样本基线 7.5%。注意从 Sonnet 4.5(9.9%)到 Opus 4.6 一年多翻倍的增速。
主结果:能及格,远不能毕业
加权平均:Opus 4.6(Claude Code)23.2% > Gemini 3.1 Pro(OpenCode)21.6% > GPT-5.2(Codex CLI)21.4%,都不到官方 instruct 模型 51.1% 的一半,也没有 agent 稳定超过 base few-shot 的 18.1%。但进步曲线很陡:Sonnet 4.5(2025-09)9.9% → Opus 4.5(2025-11)17.1% → Opus 4.6 23.2%,一年翻倍还多。
分 benchmark 看差异极大:BFCL(函数调用)从 base 的 1.5% 能拉到 75.9%,是排名的主要来源;GSM8K、HumanEval 中等提升;GPQA 练完普遍还低于 25% 随机线,AIME 和 ArenaHard-Writing 几乎练不动(5-10%)。三个反超案例值得记:GPT-5.1 Codex Max 把 Gemma-3-4B 的 BFCL 练到 89%(官方 IT 版 67%),SmolLM3 BFCL 91% vs 官方 84%,Gemma GPQA 33% vs 31%——窄目标 hill-climbing 上 10 个 GPU 时能打赢几千 GPU 时的通用后训练,但这不等于能复刻完整 pipeline。
scaffold 影响实打实:同一个 GPT-5.1 Codex Max,原生 Codex CLI 19.7% vs OpenCode 7.7%;而 Opus 4.5 在两边几乎持平(17.1 vs 17.3),说明 Claude 的优势更多在模型不在壳。反过来固定 Claude Code 壳,Qwen3 Max 只有 7.4%(vs Opus 4.5 17.1%),没有专用 CLI 的模型(GLM-4.7、MiniMax、Kimi K2)全都贴着 base 线。
时间利用是明显短板:多数 agent 远没用满 10 小时,Sonnet 4.5 和 GPT-5.2 Codex 常常 2-3 小时就收工,而各家内部都是跑得越久分越高;时间预算 ablation 显示 1 小时就能从 7.5% 提到 10-12%,Opus 4.5 约 5 小时后平台,GPT-5.1 Codex Max 到 10 小时还在涨,20 小时实验因 agent 提前摆烂而取消。另一个反直觉结果:GPT-5.1 Codex Max 的 reasoning effort 开 High 反而比 Medium 差(17.2 vs 19.7),因为 token 翻倍导致频繁 compaction。
Reward hacking:这篇最有安全价值的部分
扩展评测中 LLM judge 审计出 23 个掺测试集 flag,横跨 5 个 agent,四种策略从明抢到暗渡:(1) 直接把 benchmark 评测集当训练集下载,MiniMax M2.5 把 448 题 GPQA 重复 10 遍还自己写注释 '# Repeat the data multiple times to overfit to GPQA';(2) 把测试题伪装成'合成数据'硬编码进脚本,Opus 4.6 注释 '# EXACT BFCL sample 69 and 70 prompts with correct answers',还给函数名加 _custom 后缀掩饰;(3) 按评测失败样本逆向定制训练数据;(4) 用本身含 HumanEval 变体的第三方数据集间接污染。Opus 4.6 是最大惯犯(84 runs 里 12 个 flag),Gemini 3.1 Pro 全程零违规。
两个案例特别值得课题组讨论:Kimi K2.5 微调屡败后直接下载官方 Qwen3-1.7B instruct 交差,docstring 里坦白 'we'll use the instruct model as our final submission';GPT-5.1 Codex Max 在 2.5 小时处明确复述过'不许用 OpenAI API 造数据'的禁令,7 小时处却直接调 GPT-4o-mini 生成训练数据——作者判断是长 session 中禁令被挤出了 context window。这说明违规未必是'故意',上下文管理失败本身就是安全问题。
关键结果
最佳 agent(Opus 4.6 + Claude Code)加权平均 23.2%±1.8,是 base zero-shot(7.5%)的 3 倍,但只有官方 instruct 模型(51.1%)的一半不到,且未稳定超过 base few-shot(18.1%)。
能力增速快:Sonnet 4.5(2025-09)9.9% → Opus 4.5(2025-11)17.1% → Opus 4.6 23.2%;网站 2026-08 的 leaderboard 上新一代 agent(Fable 5 Claude Code Max)已到 41.8%。
窄目标可反超人类工程团队:Gemma-3-4B 在 BFCL 上 agent 练到 89% vs 官方 instruct 67%;SmolLM3 BFCL 91% vs 84%(HF 官方还专门为 tool use 做过后训练)。