论文
自提升极限分析
Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models
生成-验证差距:LLM 自提升能力的系统测量
Yuda Song, Hanlin Zhang, Carson Eisenach, Sham Kakade, Dean Foster, Udaya Ghai · CMU · ICLR 2025 · 2024-12
一句话CMU/Harvard/Amazon 团队把 self-improvement 形式化为『生成-验证差距』(GV-Gap),在 GSM8K/MATH/NQ/Sudoku 上横跨 Qwen/Llama 等多个模型家族测量:relative GV-Gap 随预训练 flops 单调上升(但仅限特定 verification 方法),迭代自提升 2-3 轮内 gap 归零,有效多样性(pass@k)随迭代坍缩。ICLR 2025,引用约 104 次,无代码发布。
这是什么
Self-improvement 的标准流程是:模型生成多个候选回答 → 用同一模型给回答打分(自验证)→ 按分数过滤/重加权后蒸馏回模型。STaR、Self-Rewarding 等一批工作报告了效果,但『提升到底来自哪、能持续多久』一直没有干净的答案——以往用 update 前后的 accuracy 差来度量,里面混着 answer format 对齐等混淆因素。
这篇论文给出一个模块化的数学框架,把过程拆成 generation、verification、model update 三个环节,并定义核心量 GV-Gap:gap(f,g) = J(f[w(pu_g)]) − J(f),即『按 g 的验证分数重加权 f 的生成分布后,期望 utility 提升了多少』。这个量在 update 之前就能测,把『验证信号有多少料』和『蒸馏做得好不好』解耦。再除以到满分的剩余空间就得到 relative GV-Gap,用于跨模型比较。
作者用这套框架系统回答了三个问题:GV-Gap 如何随模型规模变化(scaling)、哪些任务根本不可自提升、迭代自提升何时饱和。它是目前判断『自提升能不能持续』最常被引用的分析框架,也是 RSI 方向讨论 verification bottleneck 时的标准参照。
迭代自提升的核心结果(Qwen-1.5 在 MATH 上):左图 accuracy 每轮递增但增幅迅速变小,右图 GV-Gap 从约 2.5% 在 3-4 轮内单调降到 0——无新信息注入时自提升必然饱和,且 7B/14B/32B 饱和速度几乎相同,与模型大小无关。机制与做法
框架:三个环节与 GV-Gap
Generation:模型 f 对 prompt 采样多个回答(温度采样,greedy 则无可提升空间)。Verification:用 proxy utility pu_g(x,y) 给回答打分。Update:把重加权分布 f[w(pu)] 投影回模型类,两种实例——rejection sampling(w 为阈值指示函数,过滤后 SFT)和 KL 正则 RL(w(s)=exp(s/β))。
自提升成立需要三个条件同时满足:生成有 variability、验证信号有信息量(gap>0)、update 蒸馏误差小。论文证明 J(f_{t+1}) − J(f_t) ≥ gap(f_t,g) − ε_update,所以 GV-Gap 是提升量的干净上界来源。作者还专门指出:实验里观察到 J(f_1) 有时超过 J(f_0[w])——这不是能力提升,是 finetune 后答案格式对齐带来的『假提升』,以往工作的度量方式会把它算进 self-improvement。
instruct/chat 模型的 relative GV-Gap 对 log(flops) 散点(附录版本)。可以直观看到 scaling 结论的真实成色:CoT-S(绿星)大致平缓向上,MC(蓝点)剧烈波动、在 Qwen-1.5 大模型处甚至为负;中间 Llama-2-Chat 面板的趋势线只由 3 个点支撑。三种 verification 机制
MC(Multiple Choice):让模型对回答输出单 token 的 Correct/Incorrect,用两个 token 的 logits 归一化得到分数;CoT-Score/CoT-Binary:让模型先写验证推理链再给 1-10 分或 0/1 分,取期望;Tournament:成对比较淘汰赛,2^r 个候选打到剩 1 个。
结论是 CoT 验证明显比 MC 稳定:MC 在 Qwen-1.5 14B/32B、Llama-3 8B 这类中型模型上都可能给出负 gap,而 CoT 对中大型模型 gap 始终为正。不同 verification 方法选中的样本重叠度不高,ensemble 多种验证可以进一步增大 gap。
实验设计:scaling、不可提升任务、迭代
Scaling:在 GSM8K(1320 题)和 MATH(5000 题)上测 Qwen-1.5/2、Llama-2/3 等家族从 0.5B 到 72B 的 gap,对 pre-training flops 作图;另做 cross-verification(固定 generator 换 verifier、或反之),发现 gap 随 verifier flops 单调升、随 generator flops 单调降——越强的模型的错误越难被(弱)验证器抓住。
任务边界:Natural Questions 上所有模型 gap <1% 甚至为负——事实型任务验证不比生成容易,不可自提升;4x4 Sudoku(验证是 P、生成 NP-hard)上只有 72B 级模型有非平凡 gap(Qwen-2 72B gap 16.99%,accuracy 相对提升约 200%),0.5B-7B 全部失败——说明『验证在计算复杂度上更容易』不够,还需要模型预训练中获得的推理能力达到门槛。
迭代:对 Qwen-1.5 7B/14B/32B/72B 反复做 rejection-sampling/RL 自提升。gap 在 2-3 轮内降到近零,饱和速度与模型大小无关;pass@k 在小 k 上随迭代上升、大 k 上下降,即模型在收敛到部分错误答案、有效多样性坍缩——作者认为这是饱和的机制性原因。
关键结果
- relative GV-Gap 随 log(pre-training flops) 单调上升,作者 conjecture 呈线性——但仅在『稳定的 verification 方法』(主要是 CoT-Score)下成立,MC 无此规律。
- 小模型(Qwen 0.5B、Llama-2 7B、Pythia、OPT 家族)在几乎所有 verification 下 gap 非正:自提升有能力门槛,不是任何模型都能做。
- Cross-verification:gap 随 verifier 算力单调升、随 generator 算力单调降;weak-to-strong(小模型验证大模型)不保证正 gap。
- Natural Questions 上所有规模的模型 gap <1% 或为负——事实检索类任务不可自提升;Sudoku 上只有 ~70B 级模型 gap 非平凡(Qwen-2 72B:accuracy 8.82%,gap 16.99%)。
- 迭代自提升 2-3 轮内 gap 归零,饱和速度与模型容量无关;Qwen-1.5 7B 在 MATH 上从约 16% 提到 23% 后停滞。
- 饱和伴随 pass@k(大 k)下降:模型无法验证罕见但正确的答案,迭代中收敛到错误答案,生成多样性坍缩。
- 以往用『update 前后 accuracy 差』度量自提升会被 answer format 对齐污染:7B/14B 第一轮的 accuracy 增量超过了 gap 能解释的范围,多出的部分纯粹来自格式对齐。
实证核查
有水分框架本身干净、负结果(饱和、任务边界)与先前工作互相印证,是靠谱的分析;但标题级的 scaling 结论比传播中的版本弱得多——只在挑过的 verification 方法和部分模型家族上成立,且全文无代码发布,数字无法复现核对。
『relative GV-Gap 随预训练 flops 单调 scaling』(题图与摘要中的核心卖点,常被引用为“自提升会随规模持续变好”)。
论文自己限定了『with certain verification methods (such as CoT-Score)』。对照其附录图(本地 figures/fig02_scale_instruct_relative.png,instruct/chat 模型版本):散点明显不单调,MC 在最大 flops 处甚至跌到 -17% 左右,Llama-2-Chat 面板的虚线趋势只由 3 个点支撑;每个家族只有 4-8 个模型点,『线性于 log flops』是作者明说的 conjecture 而非拟合律。scale.tex 中也承认各家族斜率不同、绝对 gap 无此趋势。
迭代自提升在 2-3 轮内饱和,原因是有效多样性下降。
与本地图 fig15_iterative_math.png 一致(7B/14B/32B 的 gap 都在 3-4 轮内归零),且作者引 Self-Rewarding (yuan2024self)、liang2024sheep 等独立工作观察到同样的饱和——这条负结果是全文最可信的部分,后续多篇工作沿用。
『comprehensive, modular and controlled study』,横跨多模型家族、多任务的大规模对照实验。
全文未发布任何代码或评测脚本:catalog 中 code_url 为空,serper 搜『论文名 + github』找不到官方仓库,tex 源码里也无仓库链接;所有表格数字只能信作者。顺带一提,arXiv 源码里还留着未删的内部批注(introduction.tex L6/L14 的 \hl{...} 合作者评论),上传较随意。引用约 104 次(Google Scholar 摘录,2026-08),但未检索到第三方复现报告。
GV-Gap > 0 意味着存在可利用的自提升信号(『verification 比 generation 容易』)。
论文自己的 NQ/Sudoku 实验已经划出边界(事实任务 gap≈0,Sudoku 仅 72B 级可行);2026 年的 self-improvement survey(arXiv 2603.25681)更设专节 'Illusory Generation-Verification Gap' 质疑该前提在 self-refinement 场景普遍不成立。也就是说这个框架的适用范围(数学等验证被预训练覆盖的任务)比标题暗示的窄。
与我们方向的关系
对 RSI 方向,这篇是『自提升能不能无限持续』问题的基准答案:不能——没有新信息注入时,gap 2-3 轮归零,且瓶颈机制(无法验证罕见正确答案 → 多样性坍缩)被明确指认。任何声称多轮持续自提升的系统,都应该对照这里的饱和曲线解释自己的新信息来源(工具、环境反馈、更强验证器)在哪。
可直接借鉴的方法论:用 GV-Gap(update 之前的重加权提升)替代『训练前后 accuracy 差』来度量自提升能力,可剥离格式对齐等混淆;评估自提升系统时先测任务的 gap 是否为正、verification 方法是否稳定(CoT 优于 MC logit)。cross-verification 的单调性也给『用什么模型当 judge』提供了定量依据。
阅读笔记
arXiv v3 (2026 更新) 与 ICLR 2025 camera-ready 内容一致。读附录时注意:主图 scale_relgap 是 base 模型,figures/ 里抓到的 fig02/fig03 是 instruct 模型的附录版本,趋势更噪。tex 源码里留有作者互相的 \hl 批注,可当八卦。
材料清单
TeX 源码已存档:Raw/mind-the-gap/source/
同类条目